BI Consult Desktop Logo BI Consult Mobile Logo
  • Russian BI Исследование российских bi
  • Перейти на Fine BI
  • Контакты
  • +7 812 334-08-01
    +7 499 608-13-06
  • Отправить сообщение
  • Главная
  • Продукты Эксперт-BI
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Сельское хозяйство
    • Энергетика
    • FMCG
    • Девелоперы
    • Маркетплейсы
    • Пищевая промышленность
    • Фармацевтика
    • Построение Data Platform
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и FP&A
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • IBP
    • ИТ (CIO)
    • Закупки
  • Платформы
    • Системы бизнес-анализа (BI)
    • Интегрированное бизнес-планирование (IBP)
    • Хранилища данных (DWH / Lakehouse)
    • Каталоги данных (Data Catalog)
    • Системы ETL и ELT
    • AI / Исскуственный интеллект
    • Шина данных (ESB)
    • Система управления мастер-данными (MDM)
    • Семантический слой
  • Услуги
    • Переход на отечественные BI и DWH системы
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений и DWH
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Курсы
    • Учебный курс Информационная грамотность (Data Literacy)
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Greenplum
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt (Data Build Tool)
  • Компания
    • Руководство
    • Новости
    • Клиенты
    • Карьера
    • Скачать
    • Контакты

BI

  • FineBI
  • FineReport
  • FineDataLink
  • FineChatBI (FineAI)
  • Коннекторы данных из 1С в BI
  • Airflow / Nifi
  • Visiology
  • PIX BI
  • Modus BI
  • Yandex.DataLens
  • Open-source BI: Superset/Metabase
  • Luxms BI
  • AW BI + Alpha BI
  • FlyBI + Форсайт. Аналитическая Платформа
  • Loginom
  • Триафлай
  • AI / Исскуственный интеллект
  • Optimacros
  • Навигатор BI
  • Семантический слой

СУБД

  • Arenadata
  • ClickHouse
  • Greenplum
  • Postgres Professional
  • TData

Другое

  • Построение Data Platform
    • Аналитическое хранилище данных
    • Data Lake и Data Engineering
    • Подробнее про Data Lake
    • Внедрение Lakehouse
      • Apache Doris
      • StarRocks
      • Trino
    • Миграция витрин из пропиетарных DWH на новый стек
    • Учебный курс "Современная архитектура хранилища данных"
Главная » Курсы по системам бизнес-анализа и методологии » Учебный курс по DWH » Озеро данных: Суть и эволюция

Озеро данных: Суть и эволюция

Озеро данных (Data Lake) — это система хранения и обработки данных, которая отличается от традиционных хранилищ данных тем, что позволяет хранить огромные объемы данных в различных форматах, включая структурированные, полуструктурированные и неструктурированные данные. В отличие от хранилища данных, которое использует стандартизированные схемы для организации данных, озеро данных предоставляет большую гибкость в обработке и хранении информации.

Изначально озера данных использовали Hadoop — открытая распределенная вычислительная платформа и компонент файловой системы HDFS, предназначенные для хранения и обработки больших объемов данных. Эти системы позволяли работать с огромными наборами структурированных и неструктурированных данных на кластерах недорогих компьютеров. Для аналитики в Hadoop использовался MapReduce — подход, при котором задачи разделялись на множество параллельных вычислений. Однако создание задач MapReduce было сложным, что привело к появлению Hive — системы, преобразующей SQL-запросы в задачи MapReduce.

С течением времени, благодаря развитию облачных технологий, хранилища данных на основе Hadoop постепенно уступили место облачным объектным хранилищам, таким как Amazon S3, Minio, Azure Blob Storage. Эти решения стали популярными из-за их дешевизны и удобства. Вместо MapReduce были внедрены более гибкие и быстрые вычислительные движки, такие как Apache Spark, Presto, и Dremio. Однако формат таблиц Hive остался стандартом для распознавания файлов как таблиц для аналитики.

 

Ключевые особенности озера данных

Одним из важнейших отличий озера данных от традиционного хранилища данных является декуплирование (decoupling) компонентов хранения и вычислений. В озере данных нет компонента, который бы выполнял все функции движка хранения данных. Вместо этого вычислительный движок, такой как Apache Spark или Presto, решает, как записывать и обрабатывать данные, которые обычно не оптимизируются и не совершенствуются.

 

Преимущества озера данных

  1. Низкая стоимость: Хранение данных в озере данных и выполнение запросов обходятся дешевле, чем в традиционных хранилищах данных. Это связано с использованием дешевых облачных хранилищ и отсутствии необходимости в жестких схемах данных.
  2. Открытые форматы хранения: Озера данных могут работать с любыми форматами файлов, что дает большую гибкость при работе с различными типами данных. Это позволяет хранить как структурированные, так и неструктурированные данные, включая журналы, данные сенсоров, вложения электронной почты и многое другое.
  3. Обработка неструктурированных данных: Озеро данных идеально подходит для работы с неструктурированными данными. В отличие от хранилища данных, где необходима строгая структура данных, озеро может обрабатывать такие типы данных, как текстовые файлы, изображения, видео и данные с сенсоров.

 

 

Недостатки озера данных

  1. Производительность: Одним из основных недостатков озера данных является отсутствие встроенных оптимизаций, таких как индексы и гарантии ACID (атомарность, согласованность, изолированность, долговечность). Это затрудняет достижение производительности, сопоставимой с хранилищем данных, и требует значительных усилий для настройки и оптимизации компонентов.
  2. Сложная конфигурация: Озера данных требуют значительных инженерных усилий для настройки, оптимизации и обеспечения их эффективной работы. Без должной настройки компоненты могут работать с низкой производительностью и требовать дополнительных ресурсов.
  3. Отсутствие гарантий ACID: В отличие от реляционных баз данных, которые обеспечивают строгие транзакционные гарантии, озера данных не предоставляют таких механизмов, что усложняет задачу обеспечения целостности данных при выполнении сложных операций.

 

Хранилище данных или озеро данных?

Озеро данных хорошо подходит для хранения как структурированных, так и неструктурированных данных. Однако для задач, требующих высокой производительности и строгих гарантий целостности данных, часто требуется копирование данных в хранилище данных. Это приводит к дополнительным затратам и сложности в управлении данными, так как необходимо поддерживать несколько копий данных.

Для выполнения запросов на озере данных используются различные вычислительные движки, такие как Dremio, Presto/Trino, Apache Spark и другие. Однако они сталкиваются с трудностями при обновлении данных, так как формат таблиц Hive ограничивает гибкость в обработке информации.

 

Появление архитектуры Data Lakehouse

Проблемы озера данных и хранилища данных привели к появлению новой архитектуры, которая сочетает лучшие черты обоих решений — Data Lakehouse. Эта архитектура позволяет использовать преимущества озера данных, такие как гибкость и низкая стоимость, в сочетании с возможностями хранилища данных, такими как высокая производительность и транзакционная целостность.

 

Как я впервые познакомился с Lakehouse

В 2021 году, работая в Amazon Alexa, я столкнулся с необходимостью работы с большими данными. В нашей инфраструктуре использовался Redshift (кластер хранилища данных на 128 узлов), который был единственным вариантом для выполнения BI-запросов. Однако подключение к озеру данных через такие системы, как Athena, Hive и Spark, было не таким удобным из-за объема данных и особенностей бизнес-анализа.

В нашей компании также использовалось озеро данных на S3 и EMR (управляемая платформа Hadoop). Проблем с производительностью хранения данных не возникало, однако проблемы начались при интеграции с BI-системами, что вынуждало выгружать данные из озера в хранилище и обратно для использования в ML-задачах.

В это время вступил в силу закон о защите данных (GDPR), что создало дополнительные сложности для работы с озером данных, поскольку в озере просто хранится много файлов, а не структурированных таблиц, что затрудняло выполнение операций удаления.

Именно в этот момент мы начали рассматривать решения типа Lakehouse и внедрять технологии, такие как Delta Lake для Apache Spark. На тот момент Delta Lake был наиболее популярным форматом таблиц, но теперь, по мере развития технологий, актуальной стала поддержка Iceberg.

В Databricks по-прежнему используется Delta Lake по умолчанию, но интеграция с новыми решениями, такими как Iceberg, продолжает развиваться.

Озеро данных предоставляет множество преимуществ, таких как гибкость, масштабируемость и низкая стоимость хранения, но также имеет свои недостатки, включая проблемы с производительностью и отсутствие гарантий ACID. Новая архитектура Data Lakehouse пытается объединить преимущества обеих технологий, минимизируя их недостатки.

 

 

Узнать стоимость решенияЗапросить видео презентацию

← Предыдущая статья
Основные компоненты OLAP
Следующая статья →
Инкрементальное обновление данных: как работает, зачем нужно, и в чём кроются риски
Запросить видео презентацию Запросить доступ к демо стенду online Узнать стоимость лицензий

Задать вопрос

loading...

Решения

Анализировать ФинансыУвеличивайте ПродажиОптимальный Склад и ЛогистикаМаркетинговые Метрики

Клиенты
  • «Восток-Запад» – крупнейший поставщик продуктов в рестораны, кафе, гостиницы, кейтеринговые компании, столовые, комбинаты питания и кондитерские производства. 300+ городов регулярной доставки по всей территории России и странам СНГ; 3500+ товаров профессиональных брендов.

  • С объединением компании Savencia Fromage & Dairy и молочного комбината в г.Белебей, одного из лидеров по производству твердых сычужных сыров в России, Savencia выходит на российский рынок не только как импортер, но и как производитель молочной продукции.

  • ПАО «Транснефть» – крупнейшая российская нефтепроводная компания. «Транснефть» обеспечивает транспортировку более 85% добываемых в России нефти и нефтепродуктов.

  • Нашей компанией был реализован проект автоматизации конвейера данных на базе СПО ETL-инструмента Apache NiFi для клиента ООО «Императорский Монетный Двор» в части актуализации данных, передаваемых из Системы Oracle в Anaplan.

  • Решения
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Энергетика
    • Фармацевтика
  • Услуги
    • Переход на отечественные BI и DWH
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Техническая поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Платформы
    • FineBI
    • FineReport
    • FineDataLink
    • Коннекторы данных из 1С в BI
    • Airflow + NiFi
    • Visiology
    • Luxms BI
    • Modus BI
    • PIX BI
    • Arenadata
    • ClickHouse
    • Greenplum
    • Postgres Professional
    • Open-source BI: Superset/Metabase
    • Loginom
    • Yandex.DataLens
    • AI / Исскуственный интеллект
    • Optimacros
    • Шины данных
  • Курсы
    • Учебный курс Информационная грамотность
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt
  • Функциональные решения
    • Создание Data Lake
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и прогнозная аналитика
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • Сквозная аналитика
  • Компания
    • О нас
    • Руководство
    • Новости
    • Клиенты
    • Скачать
    • Контакты
    • Политика конфиденциальности
RutubeVkontakteLinkedInYouTube
ООО "Би Ай Консалт",
ИНН: 7811437757,
ОГРН: 1097847154184
199178, Россия,
Санкт-Петербург,
6-ая линия В.О., Д. 63, 4 этаж
Тел: +7 (812) 334-08-01
Тел: +7 (499) 608-13-06
E-mail: info@biconsult.ru

 

 

 

 

 

×

Пользуясь сайтом, вы соглашаетесь с использованием cookies и политикой конфиденциальности.