Хранилища и форматы данных
Apache Iceberg
Открытый табличный формат для надёжных таблиц в data lake и Lakehouse.
Что это такое
Apache Iceberg — это открытый табличный формат для огромных аналитических таблиц поверх объектного хранилища (S3, GCS и т. п.). Он добавляет к файлам в data lake то, чего им не хватало: транзакции, эволюцию схемы, «путешествие во времени» и снимки версий. По сути Iceberg превращает набор файлов в надёжную таблицу, с которой работают разные движки — Spark, Trino, ClickHouse, DuckDB.
Где применяется и для чего
Применяю Iceberg при построении Lakehouse, когда нужно держать данные в открытом формате и работать с ними разными движками без дублирования. Формат снимает vendor lock-in и упрощает управление большими историческими данными в хранилище.
Аналоги
Плюсы и минусы
Плюсы
- ACID-транзакции и снимки версий поверх data lake
- Эволюция схемы и партиций без переписывания данных
- Открытый формат — работает с разными движками
- Нет привязки к одному вендору
Минусы
- – Нужен движок запросов и каталог поверх формата
- – Сложнее в эксплуатации, чем готовое DWH
- – Избыточен для небольших объёмов данных
- – Экосистема ещё активно развивается




