BI Consult Desktop Logo BI Consult Mobile Logo
  • Russian BI Исследование российских bi
  • Перейти на Fine BI
  • Контакты
  • +7 812 334-08-01
    +7 499 608-13-06
  • Отправить сообщение
  • Главная
  • Продукты Эксперт-BI
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Сельское хозяйство
    • Энергетика
    • FMCG
    • Девелоперы
    • Маркетплейсы
    • Пищевая промышленность
    • Фармацевтика
    • Построение Data Platform
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и FP&A
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • IBP
    • ИТ (CIO)
    • Закупки
  • Платформы
    • Системы бизнес-анализа (BI)
    • Интегрированное бизнес-планирование (IBP)
    • Хранилища данных (DWH / Lakehouse)
    • Каталоги данных (Data Catalog)
    • Системы ETL и ELT
    • AI / Исскуственный интеллект
    • Шина данных (ESB)
    • Система управления мастер-данными (MDM)
    • Семантический слой
  • Услуги
    • Переход на отечественные BI и DWH системы
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений и DWH
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Курсы
    • Учебный курс Информационная грамотность (Data Literacy)
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Greenplum
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt (Data Build Tool)
  • Компания
    • Руководство
    • Новости
    • Клиенты
    • Карьера
    • Скачать
    • Контакты

BI

  • FineBI
  • FineReport
  • FineDataLink
  • FineChatBI (FineAI)
  • Коннекторы данных из 1С в BI
  • Airflow / Nifi
  • Visiology
  • PIX BI
  • Modus BI
  • Yandex.DataLens
  • Open-source BI: Superset/Metabase
  • Luxms BI
  • AW BI + Alpha BI
  • FlyBI + Форсайт. Аналитическая Платформа
  • Loginom
  • Триафлай
  • AI / Исскуственный интеллект
  • Optimacros
  • Навигатор BI
  • Семантический слой

СУБД

  • Arenadata
  • ClickHouse
  • Greenplum
  • Postgres Professional
  • TData

Другое

  • Построение Data Platform
    • Аналитическое хранилище данных
    • Data Lake и Data Engineering
    • Подробнее про Data Lake
    • Внедрение Lakehouse
      • Apache Doris
      • StarRocks
      • Trino
    • Миграция витрин из пропиетарных DWH на новый стек
    • Учебный курс "Современная архитектура хранилища данных"
Главная » Курсы по системам бизнес-анализа и методологии » Учебный курс Современная архитектура хранилища данных » DWH и Data Lake - понятия взаимоисключающие или взаимодополняющие?

DWH и Data Lake - понятия взаимоисключающие или взаимодополняющие?

Сегодня мы поговорим о том, почему современные крупные компании развивают DWH, а не Data Lake – одну из самых продвинутых технологий нашего времени.

Не секрет, что в наши дни организации все больше и больше понимают значимость и ценность данных. Если раньше информация, необходимая аналитикам, группировалась вокруг текущих процессов и продуктов, то теперь все происходит с точностью да наоборот— новые продукты и процессы появляются на основе полученных данных.

Именно поэтому уже на самых ранних этапах так важно определиться с тем, как лучше организовать процессы сбора, хранения и обработки данных из самых разных источников, а также выбрать один из наиболее востребованных вариантов - DWH или Data Lake. Первыми, кто столкнулся с этой дилеммой, стали телекоммуникационные компании, затем этим озадачились  финансовые корпорации. Теперь тот же самый вопрос стоит на повестке дня производственных предприятий.

Объем окружающей нас информации растет со скорость света, технологии ML  также не стоят на месте. Как результат, традиционные системы хранения данных просто не в состоянии справиться с современным потоком информации. Концепция того, что «чем больше данных, тем лучше результат, выданный моделью ML» попросту потеряла свою актуальность.

Кроме того, не стоит забывать и о том, что DWH работают только со структурированными  данными. А как же изображения, аудио и все остальные виды NoSQL-данных, которых с каждым днем становится все больше и больше? Ответ прост – для них несколько лет назад были специально разработаны «озёра данных» (Data Lake), основанные на технологиях Hadoop.

 

Плюсы Data Lake

Главное преимущество Data Lake состоит в том,  что они полностью основаны на решениях с открытым кодом и не требуют никаких дополнительных инвестиций в ПО. Кроме того, они предполагают возможность практически бесконечного горизонтального масштабирования, что освобождает от необходимости приобретения дорогостоящих серверных мощностей.

Создав Data Lake, Вы сможете в максимально короткие сроки запустить загрузку данных и начать использовать их в своих целях. На первый взгляд, всё предельно просто и понятно: чем больше данных Вы запустите в пайплайн, тем лучше; Вам не нужно думать о том,  что с ними делать дальше — за Вас все сделает ИИ.

С DWH все гораздо сложнее: создание хранилищ данных – задача дорогостоящая, требующая большого количества времени, измеряемого годами. Далеко не все компании смогли справиться с ней: у кого-то не получилось разобраться с методологией, кто-то не смог правильно построить модели или организовывать потоки трансформации данных и т.д.

Ко всему вышесказанному необходимо добавить тот факт, что настоящих профессионалов в этой области мало, и все они - нарасхват. К тому нужно создавать команды поддержки.

 

 

Data Lake и демократизация данных

«Озеро данных» - дитя эры цифровых технологий, характеризующейся демократизацией данных. В современной компании эффективно работать с информацией должны все, а не только узкоспециализированные сотрудники (в частности, аналитики данных). 

Более того, даже специалисты в области данных вынуждены осваивать новые методы работы с информацией. Если раньше на поиск данных уходило 80% времени, а на аналитику - 20%, то сегодня всё должно быть с точностью да наоборот. К сожалению (или к счастью), в случае Data Lake  время на добычу искомой информации только увеличилось: теперь этот показатель составляет  90% времени ...

Ко всему прочему как никогда актуальным стал принцип GIGO: оказалось, что модели предиктивного анализа хорошо работают на консистентных и структурированных данных, и совершенно не справляются со своей задачей при использовании несопоставимой и прорежённой информации.

Если раньше набор данных можно было собрать в течение нескольких часов (с помощью SQL-запросов), то теперь, при использовании Hadoop, на решение той же самой задачи уходит гораздо больше времени.

 

Как «озеро данных» случайно не превратить в «болото данных»?

Со временем многие специалисты в области данных пришли к выводу, что разумное и эффективное data governance гораздо важнее, чем количество потребляемой информации. Появился совершенно новый термин — «болото данных» (Data Swamp). Люди поняли, что даже в Data Lake не стоит загружать все подряд - нужно классифицировать и систематизировать получаемую информацию.

Цель «получить как можно больше данных» ведет в никуда – сегодня корпоративные пользователи хотят, чтобы используемые ими данные были подробно описаны и организованы. Им важно понимать, откуда взялись эти данные, как они были модифицированы, что они означают, как правильно их интерпретировать и т.д.

Не стоит забывать и о том, что полные и структурированные данные более ценны (в данном случае речь идёт о добавленной стоимости, которую они позволяют получить).

Правильно организованные DWH являются наиболее оптимальным способом хранения информации (при условии, что концепция хранилища данных учитывает абсолютно все требования, предъявляемые  к демократизации данных).

 

BI и демократизация данных

Во многих современных компаниях единым источником корпоративных данных является DWH. Но здесь важно уточнить следующие два момента: 1) «песочницы данных», создаваемые для каждого отдела, оформляющего учётную запись для получения доступа к данным хранилища.  Если в DWH всё основано на Data Governance, то в случае «песочниц данных» — это свобода, при которой корпоративные пользователи могут создавать свои собственные наборы данных, комбинируя информацию из слоя оперативных данных и витрин, обогащая ее внешними данными, а также данными, получаемыми в ходе построения моделей.

2) Широкое использование BI-технологий,  позволяющих расширить круг пользователей, которые могут свободно формировать и проверять гипотезы, основанные на данных, не имея специальных навыков области работы с данными. Они могут составлять и делиться отчетами, обновляемыми при изменении данных в хранилищах или песочницах.

Многие эксперты в области данных утверждают, что подобная система является одним из самых эффективных способов доступа к корпоративной информации и ее визуализации. Рациональное использование всех выше перечисленных компонентов позволяет современным компаниям  органично сочетать Data Governance и Data Democracy.

 

Data Mart: надёжно, долго и дорого

Как правило, в DWH есть два слоя, к которым пользователи получают доступ:

  1. сырые или оперативные данные (копии данных, хранящихся в системах-источниках);
  2. специализированные витрины, создаваемые на основе бизнес-требований (по сути, это и есть квинтэссенция Data Governance)

 

Многие специалисты в сфере данных считают, что правильно задокументированные и находящиеся на сопровождении витрины  данных— это слишком долго и дорого. Отчасти это действительно так, но в жизни есть вещи, которые по определению не могут стоить дёшево, и за которые нужно платить. К их числу относятся  бизнес-задачи, для решения которых требуется особый подход к процессу подготовки данных. В данном случае требования, предъявляемые к качеству информации или регламенту ее сбора, оправдывают все временные и финансовые затраты на создание специализированных Data Mart.

В первую очередь, это касается отчётности (пруденциальной, налоговой или управленческой) — цена ошибок здесь слишком велика. Второй важный момент, который также стоит упомянуть, это  жёсткие требования не только к качеству, но и к регламенту создания наборов данных (особенно в том случае, если речь идет об информации, используемой в маркетинговых целях, или если мы говорим о формировании данных, на основе которых строятся ежедневные стратегии по взысканию проблемной задолженности).

Во многих финансовых структурах данные по Data Mart за предыдущий день должны быть готовы к 8:00, при этом часть информации «захватывается» только по окончании процедуры закрытия предыдущего операционного дня. Без DWH миссия становится невыполнимой (учитывая десятки миллионов счетов и сотни миллионов транзакций, происходящих за день).

 

Как современные финансовые компании организуют слой оперативных данных

Формализованная отчётность — это наследие прошлого. Сегодня ключом к успеху являются скорость изменений и Data Democracy. При этом при всем важно понимать, что Data Mart дорабатываются и оптимизируются относительно медленно.

Так как же в таком случае DWH может отвечать постоянно меняющимся потребностям в ad hoc анализе, а также в оперативной и гибкой отчётности по продажам? Здесь может помочь правильная идеология построения слоя оперативных данных (snapshot состояния систем - источников).

Некоторые DWH развиваются в парадигме, при которой в слой оперативных данных загружаются только те данные, которые действительно необходимы для загрузки в детальный слой или в Data Mart.  Финансовые структуры же изначально разработали и применили концепцию, при  которой в слой оперативных данных загружаются не выборочные элементы, необходимые для создания витрин, а все таблицы целиком. Это первый элемент, на котором основывается оперативный слой DWH в финансовых структурах.

Второй элемент корпоративной экосистемы - это спецификации для всех загружаемых таблиц. Они подробно описывают все виды данных, которые должны быть в этих таблицах, что позволяет всем корпоративным пользователям достаточно быстро разобраться в том, где именно находятся нужная им информация, и тут же начать использовать ее по своему усмотрению.

По большому счету, слой оперативных данных – это что-то вроде Data Lake для внутренних систем -  источников финансовых структур. Обращаться к ИТ - специалистам или в отдел управления данными не нужно. И ещё одна важная и полезная наработка современных компаний — это еженедельный релиз-процесс.

 

Что лучше: DWH или DataLake?

Всё изложенное выше  в общих чертах описывает уникальный  опыт крупнейших финансовых корпораций, подтверждающий то, что начинать работу с данными лучше с построения DWH. Причем это касается не только финансовых организаций, но и любых других компаний, отдающих себе отчет в том, что данные — это ключевой аспект развития в современном мире. Это основа!

Впрочем, мы не можем утверждать, что Data Lake — это неправильный путь развития. Противопоставлять DWH и Data Lake не совсем правильно - это понятия не  взаимоисключающие,  а взаимодополняющие.

Более того, если говорить про NoSQL-данные или модели ML, где оптимальное решение может быть выработано на основе сразу нескольких факторов, которые не всегда можно отследить и понять, то Data Lake — это наиболее целесообразный вариант (по стоимости).

Но перед тем, как переходить к машинному обучению или Data Lake, важно научиться работать с основой, а именно правильно использовать внутренние корпоративные данные, DWH и BI-технологии. И, конечно же, ориентироваться на потребности каждой конкретной компании и монетизацию данных.

 

Узнать стоимость решенияЗапросить видео презентацию

← Предыдущая статья
Понимание процесса CDC
Следующая статья →
Как не ошибиться при создании Data Lake / DWH / BI
Запросить видео презентацию Запросить доступ к демо стенду online Узнать стоимость лицензий

Задать вопрос

loading...

Решения

Анализировать ФинансыУвеличивайте ПродажиОптимальный Склад и ЛогистикаМаркетинговые Метрики

Клиенты
  • Компания "Норникель" - лидер горно-металлургической отрасли в России и мире. Она производит металлы, необходимые для развития экологичной экономики и транспорта.

  • ООО "Уральская транспортная компания" — это транспортно-логистическая компания, специализирующаяся на железнодорожных перевозках грузов, создана в 2009 году.

  • Компания ООО "Комус" - один из лидеров российского рынка оптовых продаж офисных товаров и техники. Компания поставляет широкий ассортимент продукции - от канцелярских принадлежностей до компьютерной техники и офисной мебели.

  • Группа компаний "Дёке" производит товары для внешней отделки загородных домов. Ассортимент включает виниловый сайдинг, фасадные панели, водосточные системы, чердачные лестницы и гибкую битумную черепицу. Продукция Дёке вызывает гордость у сотрудников и партнеров компании.

  • Решения
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Энергетика
    • Фармацевтика
  • Услуги
    • Переход на отечественные BI и DWH
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Техническая поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Платформы
    • FineBI
    • FineReport
    • FineDataLink
    • Коннекторы данных из 1С в BI
    • Airflow + NiFi
    • Visiology
    • Luxms BI
    • Modus BI
    • PIX BI
    • Arenadata
    • ClickHouse
    • Greenplum
    • Postgres Professional
    • Open-source BI: Superset/Metabase
    • Loginom
    • Yandex.DataLens
    • AI / Исскуственный интеллект
    • Optimacros
    • Шины данных
  • Курсы
    • Учебный курс Информационная грамотность
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt
  • Функциональные решения
    • Создание Data Lake
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и прогнозная аналитика
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • Сквозная аналитика
  • Компания
    • О нас
    • Руководство
    • Новости
    • Клиенты
    • Скачать
    • Контакты
    • Политика конфиденциальности
RutubeVkontakteLinkedInYouTube
ООО "Би Ай Консалт",
ИНН: 7811437757,
ОГРН: 1097847154184
199178, Россия,
Санкт-Петербург,
6-ая линия В.О., Д. 63, 4 этаж
Тел: +7 (812) 334-08-01
Тел: +7 (499) 608-13-06
E-mail: info@biconsult.ru

 

 

 

 

 

×

Пользуясь сайтом, вы соглашаетесь с использованием cookies и политикой конфиденциальности.