irus.tech
EN
Все технологии
Apache Iceberg

Хранилища и форматы данных

Apache Iceberg

Открытый табличный формат для надёжных таблиц в data lake и Lakehouse.

Что это такое

Apache Iceberg — это открытый табличный формат для огромных аналитических таблиц поверх объектного хранилища (S3, GCS и т. п.). Он добавляет к файлам в data lake то, чего им не хватало: транзакции, эволюцию схемы, «путешествие во времени» и снимки версий. По сути Iceberg превращает набор файлов в надёжную таблицу, с которой работают разные движки — Spark, Trino, ClickHouse, DuckDB.

Где применяется и для чего

Применяю Iceberg при построении Lakehouse, когда нужно держать данные в открытом формате и работать с ними разными движками без дублирования. Формат снимает vendor lock-in и упрощает управление большими историческими данными в хранилище.

Аналоги

Delta LakeApache HudiКлассический DWH без data lake

Плюсы и минусы

Плюсы

  • ACID-транзакции и снимки версий поверх data lake
  • Эволюция схемы и партиций без переписывания данных
  • Открытый формат — работает с разными движками
  • Нет привязки к одному вендору

Минусы

  • Нужен движок запросов и каталог поверх формата
  • Сложнее в эксплуатации, чем готовое DWH
  • Избыточен для небольших объёмов данных
  • Экосистема ещё активно развивается

Обсудим вашу задачу по данным?

Оставить заявку

Расскажите о задаче — отвечу в течение рабочего дня.