BI Consult Desktop Logo BI Consult Mobile Logo
  • Russian BI Исследование российских bi
  • Перейти на Fine BI
  • Контакты
  • +7 812 334-08-01
    +7 499 608-13-06
  • Отправить сообщение
  • Главная
  • Продукты Эксперт-BI
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Сельское хозяйство
    • Энергетика
    • FMCG
    • Девелоперы
    • Маркетплейсы
    • Пищевая промышленность
    • Фармацевтика
    • Построение Data Platform
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и FP&A
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • IBP
    • ИТ (CIO)
    • Закупки
  • Платформы
    • Системы бизнес-анализа (BI)
    • Интегрированное бизнес-планирование (IBP)
    • Хранилища данных (DWH / Lakehouse)
    • Каталоги данных (Data Catalog)
    • Системы ETL и ELT
    • AI / Исскуственный интеллект
    • Шина данных (ESB)
    • Система управления мастер-данными (MDM)
    • Семантический слой
  • Услуги
    • Переход на отечественные BI и DWH системы
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений и DWH
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Курсы
    • Учебный курс Информационная грамотность (Data Literacy)
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Greenplum
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt (Data Build Tool)
  • Компания
    • Руководство
    • Новости
    • Клиенты
    • Карьера
    • Скачать
    • Контакты

BI

  • FineBI
  • FineReport
  • FineDataLink
  • FineChatBI (FineAI)
  • Коннекторы данных из 1С в BI
  • Airflow / Nifi
  • Visiology
  • PIX BI
  • Modus BI
  • Yandex.DataLens
  • Open-source BI: Superset/Metabase
  • Luxms BI
  • AW BI + Alpha BI
  • FlyBI + Форсайт. Аналитическая Платформа
  • Loginom
  • Триафлай
  • AI / Исскуственный интеллект
  • Optimacros
  • Навигатор BI
  • Семантический слой

СУБД

  • Arenadata
  • ClickHouse
  • Greenplum
  • Postgres Professional
  • TData

Другое

  • Построение Data Platform
    • Аналитическое хранилище данных
    • Data Lake и Data Engineering
    • Подробнее про Data Lake
    • Внедрение Lakehouse
      • Apache Doris
      • StarRocks
      • Trino
    • Миграция витрин из пропиетарных DWH на новый стек
    • Учебный курс "Современная архитектура хранилища данных"
Главная » Курсы по системам бизнес-анализа и методологии » Учебный курс Современная архитектура хранилища данных » Что такое Apache Iceberg? Ключевые характеристики и основные преимущества

Что такое Apache Iceberg? Ключевые характеристики и основные преимущества

Формат таблиц Apache Iceberg

Apache Iceberg  - это новый формат таблиц, разработанный для управления данными в Data Lake. Iceberg предоставляет своим пользователям широкие возможности организации совместной работы нескольких приложений, а также информирует их о состоянии наборов данных по мере их развития.

Формат таблиц Iceberg обладает тем же функционалом, что и таблицы SQL в традиционных базах данных, однако стоит заметить, что это полностью open-source решение, позволяющее нескольким движкам (Dremio, Spark и т. д.) работать с одним и тем же набором данных. Iceberg предоставляет своим пользователям множество возможностей, в частности:

  • Транзакционная согласованность между несколькими приложениями, при которой можно добавлять, удалять или изменять файлы, при этом операции чтения и записи изолированы друг от друга;
  • Отслеживание изменений в таблице с течением времени;
  • Time travel для запроса исторических данных и проверки изменений между обновлениями
  • Изменение разделов, позволяющее обновлять схемы разделов по мере изменения запросов и объемов данных без необходимости использования скрытых разделов или физических каталогов;
  • Откат к предыдущим версиям для быстрого устранения проблем и возвращения таблиц в исправное состояние;
  • Расширенные возможности планирования и фильтрации для повышения производительности при работе с Big Data.

 

Все это обусловлено использованием файлов метаданных, отслеживаемых по моментальным снимкам. Каждый снимок содержит полное описание схемы таблицы и информацию о ней. Кроме того, Iceberg эффективно организует метаданные моментальных снимков в иерархическую структуру. Это позволяет быстро и эффективно вносить изменения в таблицы без необходимости реорганизации всех файлов набора данных, что обеспечивает оптимальную производительность системы при работе в Data Lake.

В Iceberg история изменения файлов хранится в формате таблиц Iceberg и не зависит от системы хранения, что использовать открытую архитектуру данных и гибко менять системы без ущерба для пользователей и существующих рабочих нагрузок. Поскольку история изменений прослеживается четко, пользователи могут запрашивать предыдущие состояния системы на любом снимке Iceberg.

Поскольку Iceberg является проектом Apache, это 100% open-source решение, которое не зависит от каких-либо инструментов или движков Data Lake. Он был создан такими гигантами, как Netflix и Apple, а также развернут и проверен крупнейшими технологическими компаниями. Iceberg поддерживает самые распространенные форматы файлов, такие как Parquet, ORC и Avro, а также я основные движки Data Lake, включая Dremio, Spark, Hive и Presto.

 

 

Предыстория организации хранения данных в Data Lake

Data Lake – это большой репозиторий, в котором можно хранить как структурированные, так и неструктурированные данные. Они используются для упрощения управления данными путем их централизации и обеспечения взаимодействия всех приложений организации с общим хранилищем данных что значительно улучшает традиционные типы архитектур данных, основанных на многочисленных изолированных и разрозненных системах.

Традиционно, Data Lake ассоциировали с  Apache Hadoop Distributed File System (HDFS). Однако сегодня организации все чаще используют другие системы хранения данных, такие как Amazon S3 или Microsoft Azure Data Lake Storage (ADLS). Эти облачные озера данных  предоставляют организациям дополнительные возможности хранения данных для упрощения управления данными за счет повсеместного доступа ко всем приложениям по мере необходимости.

Отдельные наборы данных в Data Lake часто организованы в виде набора файлов в структурах каталогов, причем часто несколько файлов в одном каталоге представляют собой одну таблицу. Преимущества такого подхода заключаются в высокой доступности к данным и гибкости их хранения. Однако ряд функций, предоставляемый традиционными базами данных и хранилищами данных, невозможно решить исключительно с помощью каталогов файлов:

  • Какова схема набора данных;
  • Какие файлы входят в набор данных и как они организованы (например, разделы);
  • Как различные приложения координируют изменения в наборе данных.

 

Для решения этих задач организации используют сразу несколько стандартных систем для организации данных в рамках Data Lake.

 

Как метаданные помогают организовать данные в рамках Data Lake

Для наиболее оптимальной организации данных в Data Lake организации используют каталоги метаданных. Благодаря им все приложения, используемые корпоративной системой данных, имеют общее представление о данных, хранящихся в Data Lake, что способствует эффективной обработке информации получению желаемых результатов.

Каталоги используются для определения:

  • Наборов данных, хранящихся в Data Lake;
  • Где в Data Lake находятся эти наборы данных;
  • Как наборы данных структурированы с точки зрения столбцов, наименований, типов данных и т.д.

 

Hive Metastore (HMS) и AWS Glue Data Catalog - самые популярные каталоги метаданных Data Lake, которые широко используются для организации хранения данных. И Hive, и AWS Glue содержат в себе схему, структуру таблиц и информацию о расположении наборов данных в Data. Каталоги обеспечивают структуру, аналогичную структуре реляционных БД, что обеспечивает согласованность результатов работы различных приложений и упрощает управление данными.

 

Почему одних только каталогов недостаточно

Несмотря на то, что каталоги метаданных обеспечивают общее определение структуры набора данных в Data Lake, они все же не могут координировать процессы изменения данных или развитие схем данных.

Рассмотрим большой набор данных, состоящий из сотен тысяч файлов. Такие каталоги, как Hive и AWS Glue, содержат структуру набора данных, включая имена столбцов и типы данных, а также разделы, организованные в каталоги. Однако они не в состоянии определить, какие файлы данных являются частью набора данных. В результате приложениям приходится полагаться на чтение метаданных для того,  чтобы определить, какие файлы являются частью интересующего нас набора данных.

Пока набор данных не меняется, различные приложения могут работать с согласованным представлением набора данных. Однако, как только какое-либо приложение изменяет набор данных, и эти изменения необходимо координировать с другими приложениями, возникают определенные проблемы. Например, если процесс ETL  обновляет набор данных, добавляя и удаляя несколько файлов, другое приложение, читающее этот набор данных, обработает лишь частичное или непоследовательное представление набора данных и выдаст неверный результат.

Без автоматической координации изменений данных между приложениями в Data Lake организациям приходится создавать сложные конвейеры обработки данных или зоны ожидания (staging areas), которыми необходимо управлять вручную.

 

В чем заключается отличие Iceberg от традиционных каталогов или БД

Между Iceberg и каталогами данных Data Lake, такими как Hive Metastore, а также реляционными БД и КХД есть существенные различия. В отличие от Hive Metastore в Iceberg все приложения являются равноправными участниками процесса, сразу несколько инструментов могут напрямую и одновременно обновлять таблицы. Кроме того, Iceberg описывает полную историю таблиц, включая изменения схемы и данных. Hive Metastore описывает только текущую схему набора данных, не предоставляя информацию об изменениях данных с течением времени.

Реляционные БД и КХД используют закрытые, вертикально интегрированные и проприетарные системы, в которых весь доступ к данным предоставляется через базу данных и обрабатываться ею же. Организация доступа к данным через единую систему упрощает управление обновлениями данных, но при этом сильно ограничивает гибкость системы. Iceberg, напротив, позволяет всем приложениям работать с таблицами напрямую. Это не только снижает стоимость за счет использования всех преимуществ архитектуры Data Lake, но и значительно повышает гибкость и оперативность системы, поскольку все приложения могут работать с наборами данных напрямую, не реорганизовывая  данные между несколькими отдельными и закрытыми системами.

 

Преимущества использования Iceberg

Использование Iceberg для решения задач, касающихся организации данных в Data Lake обладает рядом весомых преимуществ:

  • Несколько независимых приложений могут обрабатывать один и тот же набор данных одновременно;
  • Эффективная обработка обновлений очень больших таблиц в масштабах Data Lake;
  • ETL конвейеры обработки данных значительно упрощают работу с данными, находящимися в Data Lake. Благодаря этому можно свободно перемещать данные между несколькими независимыми системами, в результате чего конвейеры обработки данных становятся более надежными;
  • Более эффективное управление данными, поскольку наборы данных меняются не сразу, а развиваются с течением времени;
  • Повышение надежности данных, оперативное выявление и решение проблем в случае их возникновения.

 

Использование Iceberg дает возможность организациям реализовать весь потенциал хранения данных в Data Lake. Дата-инженеры могут оптимизировать конвейеры данных с целью обеспечения более широкого и санкционированного доступа к данным.

 

Главные альтернативы Iceberg

Существуют несколько вполне достойных альтернатив Iceberg, которые предлагают в некоторой степени схожие возможности и преимущества. Наиболее популярным проектом является Delta Lake, разработанный компанией Databricks.

 

Hive ACID Tables

Delta Lake

Apache Iceberg

Компания-основатель

Hive

Databricks

Netflix, Apple  т.д.

Форматы данных

ORC

Parquet

Parquet, ORC, Avro

Транзакционные

Да

Да

Да

Зависимость от конкретного движка

Да (обновлять может только  Hive)

Да (обновлять может только  Spark)

Нет

100  % open-source проект

Да

Нет (поддержка облачных вычислений не является OSS)

Да

 

С технической точки зрения у Delta Lake и Iceberg есть несколько общих функций, но между ними есть и  существенные различия. В отличие от Iceberg, который является независимым проектом Apache, в развитии которого участвует множество компаний, Delta Lake спонсируется и контролируется исключительно Databricks. Кроме того, Delta Lake не является полностью open-source проектом; операции записи доступны только через Spark,. Более того, над развитием Iceberg трудится большое число сообществ разработчиков, включая Netflix, Apple, Airbnb, Stripe, Expedia и Dremio.

В отличие от Delta Lake ACID-таблицы Hive являются полностью open-source решением. Однако операции обновления Hive могут выполняться только через один движок Data Lake и подавляющее большинство разработок ведется лишь одним поставщиком (Cloudera). Таблицы Hive ACID зависят от формата файлов ORC, поэтому они менее гибкие в плане работы с различными форматами файлов.

Несмотря на то, что таблицы Delta Lake и Hive ACID появились на рынке гораздо раньше, чем Iceberg, Iceberg набирает популярность просто с бешенной скоростью!

 

Преимущества форматов Iceberg в сравнении с другими форматами

Iceberg имеет много общего с  предыдущими open-source проектами Apache, которые фактически стали эталоном, например, Apache Parquet. C точки зрения управления Iceberg полностью независим, он не привязан к какому-либо конкретному движку или инструменту. Поэтому разрабатывать и вносить свой вклад в Iceberg могут сразу несколько компаний из самых разных отраслей, что способствует быстрому развитию продукта. Кроме того, Iceberg обладает рядом преимуществ, среди которых в первую очередь стоит отметить следующие:

  • Все приложения имеют одинаковый доступ к данным, обработка данных не зависит от конкретного механизма и не привязана к нему, что позволяет организациям настраивать Data Lake в соответствии со своими потребностями и требованиями;
  • Оптимизация производительности системы на основе лучших практик, обеспечивающая быстрый доступ к данным;
  • Полная независимость от систем хранения данных, отсутствие зависимости от файловой системы, что обеспечивает гибкость при выборе систем хранения данных по мере необходимости.
  • Многочисленные успешные развертывания с возможностью обработки десятков петабайт и миллионов разделов;
  • 100% открытый исходный код и независимое управление.

 

Благодаря этим преимуществам Iceberg становится все более и более популярным, поскольку позволяет организациям значительно упростить управление данными и использовать все преимущества своего Data Lake.

 

Узнать стоимость решенияЗапросить видео презентацию

← Предыдущая статья
Архитектура и функционал команд в рамках Data Mesh
Следующая статья →
Хранилища данных. Обзор технологий и подходов к проектированию

Решения

Анализировать ФинансыУвеличивайте ПродажиОптимальный Склад и ЛогистикаМаркетинговые Метрики

Клиенты
  • «Восток-Запад» – крупнейший поставщик продуктов в рестораны, кафе, гостиницы, кейтеринговые компании, столовые, комбинаты питания и кондитерские производства. 300+ городов регулярной доставки по всей территории России и странам СНГ; 3500+ товаров профессиональных брендов.

  • ПАО «Ростелеком» — российский провайдер цифровых услуг и сервисов. Предоставляет услуги широкополосного доступа в Интернет, интерактивного телевидения, сотовой связи, местной и дальней телефонной связи и др. Занимает лидирующие позиции на российском рынке высокоскоростного доступа в интернет, платного ТВ, хранения и обработки данных, а также кибербезопасности

  • «Лента» – первая по величине сеть гипермаркетов и четвертая среди крупнейших розничных сетей страны. Компания была основана в 1993 г. в Санкт-Петербурге.

    «Лента» управляет 249 гипермаркетами в 88 городах России и 131 супермаркетом в Москве, Санкт-Петербурге, Сибири, Уральском и Центральном регионах с общей торговой площадью около 1 494 тыс. кв. м. Средняя торговая площадь одного гипермаркета «Лента» составляет около 5 500 кв.м, средняя площадь супермаркета – 800 кв.м. Компания оперирует двенадцатью распределительными центрами. Штат компании – около 50, 5 тыс. человек.

  • «ПрофХолод» — крупнейший в России производитель сэндвич-панелей с пенополиуретаном. 

  • Решения
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Энергетика
    • Фармацевтика
  • Услуги
    • Переход на отечественные BI и DWH
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Техническая поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Платформы
    • FineBI
    • FineReport
    • FineDataLink
    • Коннекторы данных из 1С в BI
    • Airflow + NiFi
    • Visiology
    • Luxms BI
    • Modus BI
    • PIX BI
    • Arenadata
    • ClickHouse
    • Greenplum
    • Postgres Professional
    • Open-source BI: Superset/Metabase
    • Loginom
    • Yandex.DataLens
    • AI / Исскуственный интеллект
    • Optimacros
    • Шины данных
  • Курсы
    • Учебный курс Информационная грамотность
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt
  • Функциональные решения
    • Создание Data Lake
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и прогнозная аналитика
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • Сквозная аналитика
  • Компания
    • О нас
    • Руководство
    • Новости
    • Клиенты
    • Скачать
    • Контакты
    • Политика конфиденциальности
RutubeVkontakteLinkedInYouTube
ООО "Би Ай Консалт",
ИНН: 7811437757,
ОГРН: 1097847154184
199178, Россия,
Санкт-Петербург,
6-ая линия В.О., Д. 63, 4 этаж
Тел: +7 (812) 334-08-01
Тел: +7 (499) 608-13-06
E-mail: info@biconsult.ru

 

 

 

 

 

×

Пользуясь сайтом, вы соглашаетесь с использованием cookies и политикой конфиденциальности.