BI Consult Desktop Logo BI Consult Mobile Logo
  • Russian BI Исследование российских bi
  • Перейти на Fine BI
  • Контакты
  • +7 812 334-08-01
    +7 499 608-13-06
  • Отправить сообщение
  • Главная
  • Продукты Эксперт-BI
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Сельское хозяйство
    • Энергетика
    • FMCG
    • Девелоперы
    • Маркетплейсы
    • Пищевая промышленность
    • Фармацевтика
    • Построение Data Platform
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и FP&A
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • IBP
    • ИТ (CIO)
    • Закупки
  • Платформы
    • Системы бизнес-анализа (BI)
    • Интегрированное бизнес-планирование (IBP)
    • Хранилища данных (DWH / Lakehouse)
    • Каталоги данных (Data Catalog)
    • Системы ETL и ELT
    • AI / Исскуственный интеллект
    • Шина данных (ESB)
    • Система управления мастер-данными (MDM)
    • Семантический слой
  • Услуги
    • Переход на отечественные BI и DWH системы
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений и DWH
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Курсы
    • Учебный курс Информационная грамотность (Data Literacy)
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Greenplum
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt (Data Build Tool)
  • Компания
    • Руководство
    • Новости
    • Клиенты
    • Карьера
    • Скачать
    • Контакты

Услуги

  • Переход на отечественные BI и DWH системы
  • Консалтинг
    • Проект внедрения российской BI-платформы
  • План обучения и сертификации
  • Бесплатное обучение
  • Пилотный проект
  • Сопровождение и поддержка
  • Технические задания
  • Сбор требований для проекта внедрения BI-системы
  • Аудит BI приложений и DWH
  • Разработка BI Стратегии
  • Styleguide для BI-системы
  • Выделенная команда
  • Как выбрать подходящую современную BI-систему
  • Настойка и поддержка баз данных

Отраслевые решения

  • Дистрибуция
  • Розничная торговля
  • Производство
  • Операторы связи
  • Банки
  • Страхование
  • Фармацевтика
  • Нефтегазовый сектор
  • Лизинг
  • Логистика
  • Медицина
  • Сеть ресторанов
  • Сельское хозяйство и агрохолдинги
  • Энергетика
  • E-Commerce
  • FMCG
  • Пищевая промышленность
  • Селлеры на маркетплейсах
  • Строительные компании и девелоперы

Функциональные решения

  • Управление по KPI
  • Финансы
  • Продажи
  • Склад
  • Категорийный менеджмент
  • HR
  • Маркетинг
  • Внутренний аудит
  • Геоаналитика, аналитика на географической карте
  • Цепочка поставок (SCM)
  • S&OP и FP&A
  • Разработка стратегии цифровой трансформации
  • Process Mining
  • Интегрированное планирование (IBP)
  • Закупки
  • ИТ (CIO)
  • Построение хранилища данных
  • Создание Data Lake и Data Engineering
Главная » Курсы по системам бизнес-анализа и методологии » Учебный курс Современная архитектура хранилища данных » Продаем «Дом озера данных»

Продаем «Дом озера данных»

Введение

Появившееся недавно повальное увлечение пользователей озерами данных кажется мне большим шумом из ничего. Идея заключается в том, чтобы у пользователя была единая платформа для поддержки всех данных и всех рабочих процессов (хранилище данных, бизнес-аналитика, AI/ML, потоковая передача). Ну что ж, Snowflake уже долгое время может поддерживать эти сценарии и даже вышла за их пределы. Я считаю, что по большей части (или даже всегда) ажиотаж создают конкуренты, которые пытаются догнать Snowflake.

Хотя я не являюсь сторонником сохранения термина «озеро данных», будет все же интересно узнать, что он из себя представляет и откуда взялся. В ходе своего исследования я узнал, что этот термин впервые употребил, как полагают, Jellyvision Lab клиент компании Snowflake, еще в июле 2017 года! Вы понимаете, что впервые его использовали в отношении Snowflake. Более того, его впервые использовали в отношении Snowflake примерно за два года, прежде чем другие подхватили этот термин и начали его активно использовать!

В этом посте я кратко расскажу вам об основных особенностях озера данных, покажу, что у Snowflake эти функции есть уже довольно давно, расскажу, как появился термин (спойлер: словосочетание впервые использовалась для описания возможностей Snowflake) и обсудим, что будет дальше.

 

Так что же такое «озеро данных»?

Хотя в последнее время кажется, что все стараются употреблять модный термин «дом озера данных», первый толчок, похоже, дал Databricks. В начале прошлого года (в конце января 2020 года) Databricks опубликовала пост в блоге "Что такое дом озера данных?" В нём они пытались доказать, что Databricks – лучшая платформа, которая отвечает требованиям хранилища данных. Но правда ли это? И почему они вообще не упомянули Snowflake в своей статье? Чтобы ответить на эти вопросы, сначала нужно понять, что должно представлять озеро данных.

Вот мое краткое изложение/определение «дома озера данных»:

Дом озера данных – это архитектурный подход для управления всеми вашими данными (структурированными, полуструктурированными или неструктурированными) и поддержки всех ваших рабочих нагрузок с данными (хранилище данных, бизнес-аналитика, AI/ML и потоковая передача).

Но погодите, разве у Snowflake раньше не было этих функций? Ответ: да, были. Давайте вкратце рассмотрим каждое из этих требований и поймем, почему Snowflake является оригинальным домом озера данных.

 

Управление всеми вашими данными

Причиной создания этих озер данных было устранение недостатков традиционных хранилищ данных. Но озера данных на основе файлов привели к еще одному разрозненному хранилищу, и к тому же, ими трудно управлять. Именно эту проблему пытались решить основатели Snowflake: объединить хранилище данных и озеро данных в единую платформу. Именно это они и сделали. С самого начала в Snowflake была встроенная поддержка как структурированных, так и полуструктурированных данных, и это устраняло необходимость в озере данных на основе файлов.

А как насчет неструктурированных данных, таких как изображения, отсканированные документы и т. д.? Многие реляционные базы данных предлагают возможность хранить неструктурированные данные в течение некоторого времени (в виде двоичных или больших двоичных данных), но в большинстве случаев это нерентабельно или даже невозможно хранить все в таком виде. Также довольно непрактично обрабатывать эти данные из реляционной базы данных. Поэтому, традиционный ответ таков: оставить неструктурированные данные в файловой системе и обрабатывать их оттуда с помощью систем и служб вне базы данных.

У Snowflake уже есть невероятная поддержка для работы с неструктурированными данными, и во время саммита Data Cloud в ноябре 2020 года Snowflake объявила о новых функциях, которые сделают эту интеграцию еще эффективнее (подробности см. в Сессии «Что будет дальше с облаком данных» с Кристианом Кляйнерманом, начиная с 36:02 и резюме Data Cloud Summit). Но сегодня с помощью встроенной интеграции облачного хранилища и функции внешних функций вы можете обрабатывать любой неструктурированный файл с помощью любого процесса или службы, и использовать или сохранять результаты в Snowflake.

 

Управление всеми вашими рабочими нагрузками

С самого начала целью Snowflake было создание единой платформы, которая могла бы поддерживать все рабочие нагрузки в компании. Вот три основные рабочие нагрузки по данным в организации, выделенные хранилищем: DW/BI (хранилище данных), AI/ML и Потоковая передача. Хотя о каждой из них можно рассказать довольно много, вот краткий обзор того, как Snowflake поддерживает каждую из них.

Хранилище данных (DW) и связанные с ним рабочие нагрузки бизнес-аналитики (BI) были и остаются основой аналитики. С самого начала Snowflake поддерживал все ключевые функции DW, включая управление с помощью детального контроля доступа на основе ролей (RBAC), надежную реализацию ANSI SQL, которая поддерживает все типы операций (DQL, DML, DDL), транзакции с несколькими операторами, Соответствие ACID, богатые возможности программирования и многое, многое другое. Но в отличие от всех других DW, Snowflake сделала это уникальным образом, создав с нуля новую платформу для общедоступного облака. Это означает, что Snowflake реально может воспользоваться масштабом, предлагаемым общедоступным облаком. Дополнительные сведения о возможностях DW/BI в Snowflake см. странице Snowflake – хранилище для ваших данных.

Вторая ключевая рабочая нагрузка, которую следует учитывать – это AI/ML. Snowflake уже некоторое время поддерживает такую функцию. Исследования показывают, что специалисты по обработке данных тратят около 80% своего времени на поиск и подготовку данных. Snowflake может устранить необходимость в большей части этих бесполезных усилий, консолидируя все ваши данные (в их собственном формате) и предоставляя специалистам по данным практически неограниченную производительность и масштабирование, а также возможность проектировать функции и преобразовывать их с использованием SQL, Java или Scala. Все основные инструменты, библиотеки и языки сценариев AI/ML очень хорошо работают со Snowflake благодаря различным драйверам. Сюда входят коннекторы JDBC/ODBC, Python, R и Spark. Более того, Snowflake имеет богатую партнерскую экосистему в области AI/ML. Сюда входят DataRobot, Dataiku, H20.ai, Amazon Sagemaker, Azure ML и многие другие. А если и этого будет недостаточно, Snowflake анонсировала новые функции, такие как функции Java/Scala и Python, которые позволят рабочим нагрузкам AI/ML запускаться непосредственно внутри Snowflake. Дополнительные сведения о возможностях AI/ML Snowflake см. На странице Snowflake для науки о данных.

Третья важная рабочая нагрузка, которую следует учитывать – это потоковая передача. И, вероятно, самый важный вопрос, который следует задавать всякий раз, когда кто-то упоминает о потоковой передаче данных, будет таким: «какую конкретно задержку вы имеете в виду?» В потоковой передаче может быть что угодно – от миллисекундной задержки до нескольких минут и даже тридцати с лишним минут. Я обнаружил, что для большинства клиентов приемлемая задержка потоковой передачи находится в пределах 5–10 минут. И Snowflake уже долгое время может поддерживать эту задержку с помощью своих Continuous Data Pipelines (включая Snowpipe, Snowflake Connector для Kafka, Tasks и Streams) или других инструментов партнерской репликации (таких как HVR, Replicate, Fivetran, и другие.). Фактически, сегодня задержки Snowflake составляют половину этого диапазона. Безусловно, сейчас есть организации, которые предъявляют требования к потоковой передаче с задержками от нескольких секунд до миллисекунд, но часто эти решения создаются с использованием специальных инструментов и решений для потоковой передачи.

 

Snowflake всегда была в центре внимания.

13 июля 2017 года Джереми Энгл, в то время руководитель группы разработки данных в Jellyvision, представил группе пользователей AWS  «Стратегии поддержки аналитики в реальном времени, OLAP и интерактивного исследования данных» (его слайды можно найти здесь). Он обсудил их потребности в приеме полуструктурированных данных в режиме почти реального времени, а также проблемы, с которыми они столкнулись при работе и извлечении выгоды из своего озера данных. Он искал что-то, что давало бы преимущества как традиционного хранилища данных, так и озера данных:

 

 

И в тот июльский день 2017 года он ответил: «Snowflake». Но это еще не все, он также придумал новый термин для описания того, что платформа Snowflake уже предоставляла в то время. Он придумал термин «озеро данных». Вот слайд, подтверждающий это:

 

Таким образом, термин «дом озера данных» впервые использовали 13 июля 2017 года для описания платформы Snowflake и ее способности поддерживать обе рабочие нагрузки с данными.

 

Есть кое-что гораздо большее

Платформа Snowflake предоставляется как услуга с практически нулевым обслуживанием и охватывает всех трех основных поставщиков общедоступных облаков. Они предлагают единую платформу, которая поддерживает все ваши данные и все бизнес-нагрузки, у нее централизованная система безопасности и управление. Но есть еще кое-что. Она поддерживает облако данных – глобальную сеть, объединяющую мировые данные. Клиенты из разных регионов могут безопасно обмениваться своими данными и кодом. Данными могут обмениваться даже поставщики облачных услуг без необходимости создавать и поддерживать дорогостоящие задания ETL для передачи данных и поддержания их в актуальном состоянии. Это достигается с помощью Data Marketplace, частных обменов данными или прямых обменов данными.

 

 

 

Узнать стоимость решенияЗапросить видео презентацию

← Предыдущая статья
Современная архитектура хранилища данных: традиционное или облачное хранилище данных
Следующая статья →
Data Engineer и Data Scientist: какая вообще разница?

Решения

Анализировать ФинансыУвеличивайте ПродажиОптимальный Склад и ЛогистикаМаркетинговые Метрики

Клиенты
  • KazanExpress — торговая площадка, на которой представлены товары с бесплатной доставкой за один день в более, чем 70 городах России. Аналитическое решение на базе платформы данных Yandex Cloud позволило компании обеспечить демократизацию данных. Результат — принятие обоснованных решений на всех уровнях, увеличение лояльности партнеров и повышение прозрачности бизнеса.

    Мониторинг ключевых метрик в реальном времени минимизировал недополученную прибыль и обеспечил рост прибыльных направлений, а возможности геоаналитики сервиса Yandex DataLens помогли за короткое время проанализировать локации для открытия более 90 ПВЗ в 25 городах России и заложить основу для роста компании.

  • В «Пивоваренной компании «Балтика» аналитическая платформа Loginom применяется для моделирования процессов или построения отчетов, в том числе для формирования рекомендаций по корректировке плана промоактивностей.
     
  • С объединением компании Savencia Fromage & Dairy и молочного комбината в г.Белебей, одного из лидеров по производству твердых сычужных сыров в России, Savencia выходит на российский рынок не только как импортер, но и как производитель молочной продукции.

  • MoneyCare — кредитная платформа и сервис для ПОС-кредитования в магазинах, установленная в более чем 18 тысячах трейдинговых точек и сотрудничающая с 11 главными банками России.

  • Решения
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Энергетика
    • Фармацевтика
  • Услуги
    • Переход на отечественные BI и DWH
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Техническая поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Платформы
    • FineBI
    • FineReport
    • FineDataLink
    • Коннекторы данных из 1С в BI
    • Airflow + NiFi
    • Visiology
    • Luxms BI
    • Modus BI
    • PIX BI
    • Arenadata
    • ClickHouse
    • Greenplum
    • Postgres Professional
    • Open-source BI: Superset/Metabase
    • Loginom
    • Yandex.DataLens
    • AI / Исскуственный интеллект
    • Optimacros
    • Шины данных
  • Курсы
    • Учебный курс Информационная грамотность
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt
  • Функциональные решения
    • Создание Data Lake
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и прогнозная аналитика
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • Сквозная аналитика
  • Компания
    • О нас
    • Руководство
    • Новости
    • Клиенты
    • Скачать
    • Контакты
    • Политика конфиденциальности
RutubeVkontakteLinkedInYouTube
ООО "Би Ай Консалт",
ИНН: 7811437757,
ОГРН: 1097847154184
199178, Россия,
Санкт-Петербург,
6-ая линия В.О., Д. 63, 4 этаж
Тел: +7 (812) 334-08-01
Тел: +7 (499) 608-13-06
E-mail: info@biconsult.ru

 

 

 

 

 

×

Пользуясь сайтом, вы соглашаетесь с использованием cookies и политикой конфиденциальности.