BI Consult Desktop Logo BI Consult Mobile Logo
  • Russian BI Исследование российских bi
  • Перейти на Fine BI
  • Контакты
  • +7 812 334-08-01
    +7 499 608-13-06
  • Отправить сообщение
  • Главная
  • Продукты Эксперт-BI
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Сельское хозяйство
    • Энергетика
    • FMCG
    • Девелоперы
    • Маркетплейсы
    • Пищевая промышленность
    • Фармацевтика
    • Построение Data Platform
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и FP&A
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • IBP
    • ИТ (CIO)
    • Закупки
  • Платформы
    • Системы бизнес-анализа (BI)
    • Интегрированное бизнес-планирование (IBP)
    • Хранилища данных (DWH / Lakehouse)
    • Каталоги данных (Data Catalog)
    • Системы ETL и ELT
    • AI / Исскуственный интеллект
    • Шина данных (ESB)
    • Система управления мастер-данными (MDM)
    • Семантический слой
  • Услуги
    • Переход на отечественные BI и DWH системы
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений и DWH
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Курсы
    • Учебный курс Информационная грамотность (Data Literacy)
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Greenplum
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt (Data Build Tool)
  • Компания
    • Руководство
    • Новости
    • Клиенты
    • Карьера
    • Скачать
    • Контакты

Услуги

  • Переход на отечественные BI и DWH системы
  • Консалтинг
    • Проект внедрения российской BI-платформы
  • План обучения и сертификации
  • Бесплатное обучение
  • Пилотный проект
  • Сопровождение и поддержка
  • Технические задания
  • Сбор требований для проекта внедрения BI-системы
  • Аудит BI приложений и DWH
  • Разработка BI Стратегии
  • Styleguide для BI-системы
  • Выделенная команда
  • Как выбрать подходящую современную BI-систему
  • Настойка и поддержка баз данных

Отраслевые решения

  • Дистрибуция
  • Розничная торговля
  • Производство
  • Операторы связи
  • Банки
  • Страхование
  • Фармацевтика
  • Нефтегазовый сектор
  • Лизинг
  • Логистика
  • Медицина
  • Сеть ресторанов
  • Сельское хозяйство и агрохолдинги
  • Энергетика
  • E-Commerce
  • FMCG
  • Пищевая промышленность
  • Селлеры на маркетплейсах
  • Строительные компании и девелоперы

Функциональные решения

  • Управление по KPI
  • Финансы
  • Продажи
  • Склад
  • Категорийный менеджмент
  • HR
  • Маркетинг
  • Внутренний аудит
  • Геоаналитика, аналитика на географической карте
  • Цепочка поставок (SCM)
  • S&OP и FP&A
  • Разработка стратегии цифровой трансформации
  • Process Mining
  • Интегрированное планирование (IBP)
  • Закупки
  • ИТ (CIO)
  • Построение хранилища данных
  • Создание Data Lake и Data Engineering
Главная » Курсы по системам бизнес-анализа и методологии » Учебный курс Современная архитектура хранилища данных » 4 ключевых шаблона для загрузки данных в хранилище данных

4 ключевых шаблона для загрузки данных в хранилище данных

Введение

Загрузка данных в хранилище данных является ключевым компонентом большинства конвейеров данных. Если вам интересно

  • Как обрабатывать SQL-загрузки?
  • Какие шаблоны используются для загрузки данных в хранилище данных?

 

тогда эта статья для вас. В этой статье мы рассмотрим 4 ключевых шаблона для загрузки данных в хранилище данных. Конвейеры данных обычно используют один или несколько шаблонов, показанных ниже. Распознавание этих шаблонов может помочь вам разработать лучшие и понять существующие конвейеры данных.

 

Шаблоны

1. Конвейеры пакетных данных

Это конвейеры данных, которые запускаются с запланированным интервалом не менее 5 минут.

 

1.1 Процесс => Хранилище данных

Обычно сюда входит один процесс, который извлекает данные из некоторого источника и загружает их в хранилище. Количество сетевых обращений к хранилищу данных должно быть низким за счет группирования нескольких (или всех, если позволяет память процесса) вставок в один вызов вставки-базы данных (т. е. микро-/мини-пакетирование).

Например, если вы используете Python и Postgres (в качестве хранилища данных), вы можете использовать execute_values для вставки нескольких строк одним сетевым вызовом.

Плюсы:

  1. Простота настройки, запуска, мониторинга и отладки.
  2. Большие машины могут обрабатывать значительный объем данных.

 

Минусы:

  1. Не масштабируется за пределы одной машины. Это станет проблемой, если размер ваших данных очень велик.
  2. Вставки в хранилище данных будут узким местом. Этого можно избежать, запустив несколько процессов параллельно. Однако это может привести к неправильному порядку вставок, если не соблюдать осторожность.

 

1.2 Процесс => Облачное хранилище => Хранилище данных

 

Обычно это включает распределенный процесс (иногда одиночный процесс), который параллельно записывает данные в облачную систему хранения. Затем следует процесс параллельного копирования данных из облачной системы хранения в хранилище данных.

Некоторые хранилища данных поддерживают внешние таблицы, которые позволяют считывать данные непосредственно из S3. Это избавит от необходимости выполнять команду COPY .

Плюсы:

  1. Может загружать очень большие объемы данных.
  2. Запись в облачную систему хранения и вставка ее в хранилище данных распараллелены, что делает этот подход быстродейственным.

 

Минусы:

  1. Управление кластером распределенных систем может быть дорогостоящим.
  2. Для внешних таблиц для создания новых разделов может потребоваться выполнение команды ALTER TABLE ADD PARTITION.

 

2. Конвейеры данных почти в реальном времени

Это постоянно работающие конвейеры данных. Обычно время между созданием данных и моментом, когда они стают доступны в хранилище данных составляет менее минуты. Например: Конвейер данных для приема кликов и показов с веб-сайта в хранилище данных.

 

2.1 Поток данных => Потребитель => Хранилище данных

Обычно сюда входит поток данных (от другого процесса) и есть получатель этого потока данных. Процесс-получатель потребляет записи, выполняет обогащение данных (необязательно), собирает пакет записей в памяти и вставляет его в хранилище данных.

Примечание. Некоторые проекты, такие как ksqldb и clickhouse, позволяют напрямую запрашивать данные в теме Kafka. Однако они не заменяют хранилище данных.

Плюсы:

  1. Широкий выбор готовых коннекторов.
  2. В большинстве хранилищ данных установлены коннекторы (например, коннектор Snowflake Kafka).
  3. Получателя можно легко распараллелить с группами потребителей.

 

Минусы:

  1. Обратите особое внимание на семантику вставки хотя бы раз, как того требует ваша система.
  2. Когда несколько потребителей вставляют данные в хранилище данных, не гарантируется, что порядок вставки будет таким же, как когда они входят в поток данных. Вам нужно будет работать с этим осторожно, если это необходимо. Ссылка: Порядок сообщений в Kafka.

 

2.2 Облачное хранилище => процесс => хранилище данных

Как правило сюда входят данные (обычно небольшой пакет строк), попадающие в облачную систему хранения (от другого процесса) и систему мониторинга, которая обнаруживает их и запускает процесс для вставки этих данных в хранилище данных.

Например, вы можете настроить триггер s3 для запуска лямбда-процесса для вставки данных в хранилище данных, когда данные попадают в S3.

 

Плюсы:

  1. У большинства поставщиков облачных услуг есть поддержка для мониторинга своей системы облачного хранения и запуска процесса (обычно называется бессерверным).
  2. Некоторые хранилища данных также поддерживают этот шаблон (например, Snowpipe).
  3. Необработанные данные, хранящиеся в облачной системе хранения, обеспечивают дополнительную избыточность данных.

 

Минусы:

  1. Обратите особое внимание на ограничения на количество процессов, которые могут быть запущены при сильном трафике.
  2. Когда несколько процессов вставляют данные в хранилище данных, не гарантируется, что порядок вставки будет таким же, как и в облачной системе хранения. Вам нужно будет обращаться с этим осторожно, если это необходимо.

 

Вывод

Надеюсь, эта статья даст вам хорошее представление об общих шаблонах, которые используются для загрузки данных в хранилище данных. В большинстве случаев используется один или комбинация вышеперечисленных шаблонов.

В следующий раз, когда вы будете создавать конвейер для загрузки данных в хранилище данных, попробуйте один из этих шаблонов загрузки. Вы будете удивлены тем, как большинство инструментов, облачных провайдеров и сред оркестровки поддерживают и продвигают эти шаблоны.

Если вы использовали другой шаблон или у вас есть какие-либо вопросы или комментарии, пожалуйста, оставьте их в разделе комментариев ниже.

Узнать стоимость решенияЗапросить видео презентацию

← Предыдущая статья
Управление ресурсами Azure с помощью задач автоматизации
Следующая статья →
Среда разработки данных с CI/CD

Решения

Анализировать ФинансыУвеличивайте ПродажиОптимальный Склад и ЛогистикаМаркетинговые Метрики

Клиенты
  • AbbVie – компания, которая стремится решить самые серьезные проблемы здравоохранения. Это биофармацевтическая компания, сфокусированная на исследованиях и разработках.

  • СберКорус (Группа компаний Сбербанка) – это ИТ‑компания, ИТ‑интегратор, SaaS-провайдер. Является разработчиком цифровых сервисов и услуг для автоматизации широкого диапазона бизнес-процессов юридических лиц. В 2004 году компания стала первым в России оператором электронного документооборота, а в 2012 году вошла в экосистему Сбера. 

  • ООО "Уральская транспортная компания" — это транспортно-логистическая компания, специализирующаяся на железнодорожных перевозках грузов, создана в 2009 году.

  • Компания "Норникель" - лидер горно-металлургической отрасли в России и мире. Она производит металлы, необходимые для развития экологичной экономики и транспорта.

  • Решения
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Энергетика
    • Фармацевтика
  • Услуги
    • Переход на отечественные BI и DWH
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Техническая поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Платформы
    • FineBI
    • FineReport
    • FineDataLink
    • Коннекторы данных из 1С в BI
    • Airflow + NiFi
    • Visiology
    • Luxms BI
    • Modus BI
    • PIX BI
    • Arenadata
    • ClickHouse
    • Greenplum
    • Postgres Professional
    • Open-source BI: Superset/Metabase
    • Loginom
    • Yandex.DataLens
    • AI / Исскуственный интеллект
    • Optimacros
    • Шины данных
  • Курсы
    • Учебный курс Информационная грамотность
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt
  • Функциональные решения
    • Создание Data Lake
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и прогнозная аналитика
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • Сквозная аналитика
  • Компания
    • О нас
    • Руководство
    • Новости
    • Клиенты
    • Скачать
    • Контакты
    • Политика конфиденциальности
RutubeVkontakteLinkedInYouTube
ООО "Би Ай Консалт",
ИНН: 7811437757,
ОГРН: 1097847154184
199178, Россия,
Санкт-Петербург,
6-ая линия В.О., Д. 63, 4 этаж
Тел: +7 (812) 334-08-01
Тел: +7 (499) 608-13-06
E-mail: info@biconsult.ru

 

 

 

 

 

×

Пользуясь сайтом, вы соглашаетесь с использованием cookies и политикой конфиденциальности.