BI Consult Desktop Logo BI Consult Mobile Logo
  • Russian BI Исследование российских bi
  • Перейти на Fine BI
  • Контакты
  • +7 812 334-08-01
    +7 499 608-13-06
  • Отправить сообщение
  • Главная
  • Продукты Эксперт-BI
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Сельское хозяйство
    • Энергетика
    • FMCG
    • Девелоперы
    • Маркетплейсы
    • Пищевая промышленность
    • Фармацевтика
    • Построение Data Platform
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и FP&A
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • IBP
    • ИТ (CIO)
    • Закупки
  • Платформы
    • Системы бизнес-анализа (BI)
    • Интегрированное бизнес-планирование (IBP)
    • Хранилища данных (DWH / Lakehouse)
    • Каталоги данных (Data Catalog)
    • Системы ETL и ELT
    • AI / Исскуственный интеллект
    • Шина данных (ESB)
    • Система управления мастер-данными (MDM)
    • Семантический слой
  • Услуги
    • Переход на отечественные BI и DWH системы
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений и DWH
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Курсы
    • Учебный курс Информационная грамотность (Data Literacy)
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Greenplum
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt (Data Build Tool)
  • Компания
    • Руководство
    • Новости
    • Клиенты
    • Карьера
    • Скачать
    • Контакты

BI

  • FineBI
  • FineReport
  • FineDataLink
  • FineChatBI (FineAI)
  • Коннекторы данных из 1С в BI
  • Airflow / Nifi
  • Visiology
  • PIX BI
  • Modus BI
  • Yandex.DataLens
  • Open-source BI: Superset/Metabase
  • Luxms BI
  • AW BI + Alpha BI
  • FlyBI + Форсайт. Аналитическая Платформа
  • Loginom
  • Триафлай
  • AI / Исскуственный интеллект
  • Optimacros
  • Навигатор BI
  • Семантический слой

СУБД

  • Arenadata
  • ClickHouse
  • Greenplum
  • Postgres Professional
  • TData

Другое

  • Построение Data Platform
    • Аналитическое хранилище данных
    • Data Lake и Data Engineering
    • Подробнее про Data Lake
    • Внедрение Lakehouse
      • Apache Doris
      • StarRocks
      • Trino
    • Миграция витрин из пропиетарных DWH на новый стек
    • Учебный курс "Современная архитектура хранилища данных"
Главная » Курсы по системам бизнес-анализа и методологии » Учебный курс Современная архитектура хранилища данных » Как Apache Iceberg победил в войне за открытые таблицы

Как Apache Iceberg победил в войне за открытые таблицы

Apache Iceberg сравнительно недавно стал стандартом открытых таблиц для крупных наборов данных. Он может похвастаться активным сообществом и поддержкой многих ведущих поставщиков инфраструктуры данных. Но почему именно  Iceberg стал самым популярным форматом? И что нужно знать, прежде чем погружаться в него?

Iceberg - это высокопроизводительный формат таблиц, который обеспечивает надежность и простоту таблиц SQL для анализа крупномасштабных данных. Его экосистема развивается быстро, предлагая надежные инструменты и поддержку со стороны таких движков, как Apache Spark, Trino и Apache Flink,  а также таких вендоров (Snowflake, Amazon, Dremio и Confluent). Даже Databricks делает ставку на Iceberg, потратив более 1 млрд долларов на Tabular, стартап, соучредителями которого являются некоторые из соавторов Iceberg.

Чтобы понять, почему данный формат таблиц привлек столько внимания, давайте подумаем о сложной реальности современных корпоративных сред данных. Как бы мы ни любили говорить об элегантности современных решений, таких как облачные озера данных и облачные хранилища данных, эти технологии не существуют сами по себе. Вместо этого большинство крупных предприятий представляют собой лоскутное одеяло из несовместимых хранилищ данных и приложений для работы с данными от нескольких поставщиков.

 

Как мы сюда попали

В свое время базы данных с онлайн обработкой транзакций (OLTP) были доминирующей архитектурой для хранения и анализа данных. Затем они уступили свое место хранилищам данных и онлайн системам аналитической обработки (OLAP), которые позволяли проводить более высокопроизводительную аналитику, но были дорогостоящими и трудно масштабируемыми. Чуть позже появилось озеро данных, обеспечивающее объединение структурированных и неструктурированных данных в одном месте.

Большим преимуществом озер данных является предоставление единого пула данных в архитектуре, которая отделяет хранение от вычислений, что делает масштабирование экономически эффективным. Широкое распространение Apache Parquet, формата колоночного хранения данных с открытым исходным кодом, позволяет еще больше снизить затраты на хранение благодаря эффективным схемам сжатия и кодирования данных.

Все это хорошо, но, как мы знаем, существующие технологии имеют привычку задерживаться, поэтому многие из этих архитектур существуют бок о бок на одном и том же предприятии. Iceberg вышел на первый план, потому что он позволяет элегантно соединить эти совершенно разные миры.

Раздрозненная реальность, в которой живет большинство предприятий, не обязательно обусловлена неправильным принятием решений. За последние несколько лет произошел всплеск слияний и поглощений, что привело к тому, что в одной компании сосуществуют разные технологические платформы. Человеческая природа также играет свою роль: одна команда инженеров может страстно верить в Databricks, в то время как другая может любить Snowflake, (возможно, основывась на положительном опыте работы в предыдущей компании). Такие привязанности могут еще больше усложнить реальность корпоративных архитектур данных.

Независимо от причины, такие разрозненные среды приводят к проблемам с доступом к данным и управлением ими. Команды по работе с данными часто хотят объединить данные из разных систем, где бы они ни хранились, а несовместимые системы делают этот союз непрактичным и дорогостоящим. Они могут копировать нужные им наборы данных в другой формат, чтобы обеспечить доступ, но это слишком дорого, да и копии данных редко остаются актуальными в течение долгого времени.

 

 

Почему именно Iceberg оказался на высоте

Iceberg не обязательно превосходит другие открытые форматы файлов в технологическом плане - все, что делает рабочая группа Iceberg, находится на виду и может быть скопировано другими проектами. Но Iceberg - это действительно открытый стандарт, получивший поддержку таких крупных компаний, как Confluent, Amazon, Snowflake и Databricks. Не факт, что Iceberg - единственный формат, который мог бы привлечь массу пользователей и поддержку индустрии, но сделал это именно он. И он действительно очень хорошо выполняет свою задачу.

Если Ваша организация использует Iceberg, Вы можете подключить любой механизм обработки, совместимый с Iceberg, и выполнять самые различные задачи, например, изменять файлы в режиме реального времени или уплотнять таблицы для повышения производительности чтения. Iceberg обеспечивает чистое разделение данных и слоя данных (состоящего из хранилища, управления и оптимизации) от движка обработки, который будет записывать, запрашивать и обновлять данные.

Самое лучшее в Iceberg - это то, что он позволяет управлять данными отдельно от движков запросов и обработки. Он является частью «архитектуры безголовых данных», где данные доступны как в виде таблиц, так и в виде потоков, и Вы можете использовать любой из них (или оба) для аналитики, операций и всего, что находится между ними. Iceberg предоставляет надежную, широко распространенную и производительную технологию, обеспечивающую простоту записи, обнаружения и использования данных, независимо от сценария использования.

 

Вам все еще есть, над чем поработать

Хотя Apache Iceberg и обладает множеством преимуществ, он все же не является исчерпывающим продуктом, предлагающим все и сразу прямо из коробки. Если Вы решите внедрять технологии самостоятельно, а не с помощью управляемой службы, Вам придется создавать некоторые вещи с нуля.

  • В Iceberg отсутствуют некоторые базовые функции обслуживания, которые есть в других коммерческих или управляемых предложениях. Например, в нем нет готовой реализации уплотнения данных, моментальных снимков мира с истекающим сроком действия и других рутинных функций обслуживания. API существуют и являются частью Iceberg, но они должны быть созданы и управляться разработчиком. (Обратите внимание, что одним из ценных предложений Tabular было и есть предоставление именно такой функциональности - ожидайте, что в будущем появится больше сервисов Iceberg, предлагающих то же самое).
  • Iceberg не оснащен предусмотренным способом обработки безопасности и управления, поэтому разработчику придется интегрировать его таким образом, чтобы он мог дать разрешение процессорам, которые будут его использовать.
  • Пока все еще нет согласованного стандарта для каталога метаданных. Совсем недавно компания Snowflake открыла свой каталог Polaris, а Databricks приобрела компанию Tabular и сделала то же самое. Однако четкого стандарта де-факто для каталога Iceberg пока не существует.

 

С учетом мозаики из конфигураций OLTP, OLAP и озер данных перспективы Iceberg заключаются в его способности вносить порядок в хаос, обеспечивая тем самым доступ к данным, где бы они ни находились, без необходимости создавать слабые одноразовые соединения. Несмотря на простоту интеграции и широкую поддержку, открытый формат таблиц еще не является «plug and play», но он продолжает развиваться и закладывает основу для устойчивых стратегий работы с данными, которые могут видоизменяться и масштабироваться в зависимости от потребностей бизнеса.

 

Узнать стоимость решенияЗапросить видео презентацию

← Предыдущая статья
Hudi: Понимание файлов JAR Apache Hudi в AWS EMR и AWS Glue
Следующая статья →
Визуализация файлов Parquet с помощью Apache Superset, Trino или PrestoSQL

Решения

Анализировать ФинансыУвеличивайте ПродажиОптимальный Склад и ЛогистикаМаркетинговые Метрики

Клиенты
  • «ПрофХолод» — крупнейший в России производитель сэндвич-панелей с пенополиуретаном. 

  • Русклимат
    Русклимат — международный торгово-производственный холдинг, концентрирующий опыт ведущих мировых производителей индустрии климата, мощный потенциал конструкторских бюро и лабораторий индустриального дизайна.
     
    Компания образована в 1996 году. За более чем двадцатилетнюю историю Русклимат прошел путь от локальной компании до мощной вертикально-интегрированной многопрофильной структуры.
     
  •  ООО «ММК-Информсервис» создает высокотехнологичные решения для эффективной работы предприятий. Разрабатывают и внедряют телекоммуникационные и бизнес-приложения, автоматизируют производство, выстраивают и поддерживают корпоративную IT-инфраструктуру.

  • ГК «Агропромкомплектация-Курск» - одна из ведущих в Российской Федерации агропромышленных компаний с полным производственным циклом "от поля до прилавка". За 32 года работы на рынке компания заслуженно завоевала репутацию одного из лидеров страны в производстве свинины и молока.

  • Решения
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Энергетика
    • Фармацевтика
  • Услуги
    • Переход на отечественные BI и DWH
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Техническая поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Платформы
    • FineBI
    • FineReport
    • FineDataLink
    • Коннекторы данных из 1С в BI
    • Airflow + NiFi
    • Visiology
    • Luxms BI
    • Modus BI
    • PIX BI
    • Arenadata
    • ClickHouse
    • Greenplum
    • Postgres Professional
    • Open-source BI: Superset/Metabase
    • Loginom
    • Yandex.DataLens
    • AI / Исскуственный интеллект
    • Optimacros
    • Шины данных
  • Курсы
    • Учебный курс Информационная грамотность
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt
  • Функциональные решения
    • Создание Data Lake
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и прогнозная аналитика
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • Сквозная аналитика
  • Компания
    • О нас
    • Руководство
    • Новости
    • Клиенты
    • Скачать
    • Контакты
    • Политика конфиденциальности
RutubeVkontakteLinkedInYouTube
ООО "Би Ай Консалт",
ИНН: 7811437757,
ОГРН: 1097847154184
199178, Россия,
Санкт-Петербург,
6-ая линия В.О., Д. 63, 4 этаж
Тел: +7 (812) 334-08-01
Тел: +7 (499) 608-13-06
E-mail: info@biconsult.ru

 

 

 

 

 

×

Пользуясь сайтом, вы соглашаетесь с использованием cookies и политикой конфиденциальности.