BI Consult Desktop Logo BI Consult Mobile Logo
  • Russian BI Исследование российских bi
  • Перейти на Fine BI
  • Контакты
  • +7 812 334-08-01
    +7 499 608-13-06
  • Отправить сообщение
  • Главная
  • Продукты Эксперт-BI
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Сельское хозяйство
    • Энергетика
    • FMCG
    • Девелоперы
    • Маркетплейсы
    • Пищевая промышленность
    • Фармацевтика
    • Построение Data Platform
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и FP&A
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • IBP
    • ИТ (CIO)
    • Закупки
  • Платформы
    • Системы бизнес-анализа (BI)
    • Интегрированное бизнес-планирование (IBP)
    • Хранилища данных (DWH / Lakehouse)
    • Каталоги данных (Data Catalog)
    • Системы ETL и ELT
    • AI / Исскуственный интеллект
    • Шина данных (ESB)
    • Система управления мастер-данными (MDM)
    • Семантический слой
  • Услуги
    • Переход на отечественные BI и DWH системы
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений и DWH
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Курсы
    • Учебный курс Информационная грамотность (Data Literacy)
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Greenplum
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt (Data Build Tool)
  • Компания
    • Руководство
    • Новости
    • Клиенты
    • Карьера
    • Скачать
    • Контакты

BI

  • FineBI
  • FineReport
  • FineDataLink
  • FineChatBI (FineAI)
  • Коннекторы данных из 1С в BI
  • Airflow / Nifi
  • Visiology
  • PIX BI
  • Modus BI
  • Yandex.DataLens
  • Open-source BI: Superset/Metabase
  • Luxms BI
  • AW BI + Alpha BI
  • FlyBI + Форсайт. Аналитическая Платформа
  • Loginom
  • Триафлай
  • AI / Исскуственный интеллект
  • Optimacros
  • Навигатор BI
  • Семантический слой

СУБД

  • Arenadata
  • ClickHouse
  • Greenplum
  • Postgres Professional
  • TData

Другое

  • Построение Data Platform
    • Аналитическое хранилище данных
    • Data Lake и Data Engineering
    • Подробнее про Data Lake
    • Внедрение Lakehouse
      • Apache Doris
      • StarRocks
      • Trino
    • Миграция витрин из пропиетарных DWH на новый стек
    • Учебный курс "Современная архитектура хранилища данных"
Главная » Курсы по системам бизнес-анализа и методологии » Учебный курс Современная архитектура хранилища данных » Учебный курс: StarRocks — полный практический гид по внедрению и эксплуатации » Модуль 5. Загрузка данных в StarRocks

Модуль 5. Загрузка данных в StarRocks

Методологическое понимание загрузки в StarRocks

StarRocks изначально проектировался как система, способная работать и с batch-загрузками, и с real-time ingestion.
От того, как мы настроим процесс загрузки, зависит:

  • насколько свежие данные будут видеть BI-пользователи;
  • выдержит ли кластер пики нагрузки;
  • не «зальём» ли мы диски лишними партициями и компакшнами;
  • будут ли данные консистентными (особенно при upsert/delete).

 

Ключевые подходы:

  1. Batch ingestion — крупными порциями, с планированием окон загрузки (ETL или скрипты).
  2. Real-time ingestion — непрерывная подача из Kafka/Flink/CDC, с минимальной задержкой.
  3. Hybrid — сырые данные идут real-time, агрегаты — batch.

 

Методология выбора режима:

  • Если SLA по свежести < 5 мин — идём в real-time ingestion.
  • Если SLA по свежести ≥ 1 час и данные корректируются — batch с upsert.
  • Если данные стабильны, объёмы большие — batch в ночные окна.

 

 

Методы загрузки данных

1. Broker Load — классический batch

  • Работает через внешнего брокера (HDFS, S3).
  • Асинхронная загрузка.
  • Форматы: CSV, JSON, Parquet, ORC.
  • Можно задавать фильтры, маппинг колонок.
  • Хорош для больших исторических загрузок.

 

Пример:

LOAD LABEL my_load_20250810
(
    DATA INFILE("s3://bucket/path/*.parquet")
    INTO TABLE sales
    FORMAT AS "parquet"
    (col1, col2, col3)
)
WITH BROKER "my_s3"
(
    "aws_access_key"="xxx",
    "aws_secret_key"="yyy"
)
PROPERTIES
(
    "timeout"="3600",
    "max_filter_ratio"="0.05"
);

 

Stream Load — синхронная загрузка

  • Отправка данных напрямую через HTTP.
  • Удобно для интеграций из приложений.
  • Не требует файлового хранилища.
  • Форматы: CSV, JSON.

 

Пример:

curl --location-trusted -u user:pass \
    -H "label:load_20250810_01" \
    -H "format:json" \
    -T data.json \
    http://fe_host:8030/api/db_name/sales/_stream_load

 

Routine Load — real-time из Kafka

  • Постоянно читаем топик Kafka.
  • Поддержка нескольких партиций и параллельной загрузки.
  • Можно маппить JSON → таблицу.
  • Настраивается через SQL.

 

Пример:

CREATE ROUTINE LOAD db.sales_load
ON sales
COLUMNS(id, ts, amount)
PROPERTIES
(
    "desired_concurrent_number"="3",
    "max_batch_rows"="50000",
    "max_batch_interval"="5"
)
FROM KAFKA
(
    "kafka_broker_list"="broker1:9092,broker2:9092",
    "kafka_topic"="sales_events",
    "property.group.id"="sr_sales_loader"
);

 

External Table / Hive / Iceberg

  • Подключение внешних таблиц без копирования данных.
  • Подходит для Lakehouse-архитектуры.
  • StarRocks читает напрямую из Iceberg/Hive/S3.

 

Пример:

CREATE EXTERNAL TABLE ext_sales (
    id BIGINT, ts DATETIME, amount DECIMAL(10,2)
)
ENGINE=HIVE
PROPERTIES
(
    "database"="dwh",
    "table"="sales",
    "hive.metastore.uris"="thrift://metastore:9083"
);

 

Технические особенности ingestion

  • Batch (Broker/Stream) — данные пишутся в новые сегменты, затем сегменты компакшнятся.
  • Routine Load — ingestion идёт фоново, сегменты периодически сбрасываются.
  • PK-таблицы — каждый upsert требует построения delta-segment, потом compaction.
  • Aggregate Key — агрегация на ingest при добавлении строк.
  • Duplicate Key — просто вставка без изменений.

 

Влияние на BE:

  • Batch даёт пик нагрузки → надо планировать окна.
  • Real-time постоянно грузит CPU и диск → надо оставлять запас.

 

Практические кейсы

Кейс 1. Историческая загрузка 5 ТБ

  • Проблема: загрузка исторических продаж с S3.
  • Решение: Broker Load с Parquet-файлами, партиция по месяцу.
  • Оптимизация: загрузка параллельно по месяцам, max_filter_ratio=0.05.
  • Результат: загрузка за 6 часов.
  • Риск: падение FE при большом количестве LABEL.
  • Защита: удалять старые LABEL, следить за /transactions.

 

Кейс 2. Real-time заказы в e-commerce

  • Проблема: обновление заказов в реальном времени, SLA < 3 сек.
  • Решение: Routine Load из Kafka в PK-таблицу, партиция по дню+часу.
  • Оптимизация: max_batch_interval=5 сек, параллельность=4.
  • Риск: compaction отстаёт при пиках.
  • Защита: планировать compaction в «тихие часы» и добавлять BE.

 

Кейс 3. Lakehouse-витрины

  • Проблема: нужно подключить Iceberg без копирования.
  • Решение: External Table на S3.
  • Оптимизация: партиции Iceberg синхронизированы с BI-фильтрами.
  • Риск: медленные запросы при полном скане.
  • Защита: кэширование или перенос часто используемых данных в StarRocks-таблицы.

 

Риски и меры

Риск

Симптом

Как избежать

Перегрузка FE при массовом Broker Load

Ошибки метаданных

Параллелить по партициям, следить за транзакциями

Lag в Kafka ingestion

Данные отстают

Настроить desired_concurrent_number, следить за compaction

Перекос по ключу в дистрибуции

Одни BE перегружены

Выбирать равномерный hash key

Компакшн забивает диск

Рост latency

Ночные окна, RF=3, быстрые NVMe

BI-отчёты бьют по сырым данным

Долгие запросы

Материализованные представления

 

Методологические рекомендации

  1. Разделяйте зоны загрузки:
    • Raw zone (Duplicate Key) для сырых данных.
    • Aggregated zone (Aggregate Key) для BI.
  2. TTL на партиции — удаляйте старые данные или агрегируйте.
  3. Параллелизация загрузки — по партициям или shard’ам.
  4. Тестируйте ingestion под пиковую нагрузку до выхода в прод.
  5. Ведите документацию по потокам — источник, формат, SLA.

 

 

 

Узнать стоимость решенияЗапросить видео презентацию

← Предыдущая статья
Модуль 4. Моделирование данных в StarRocks
Следующая статья →
Модуль 6. Язык запросов в StarRocks и оптимизация SQL

Решения

Анализировать ФинансыУвеличивайте ПродажиОптимальный Склад и ЛогистикаМаркетинговые Метрики

Клиенты
  • С объединением компании Savencia Fromage & Dairy и молочного комбината в г.Белебей, одного из лидеров по производству твердых сычужных сыров в России, Savencia выходит на российский рынок не только как импортер, но и как производитель молочной продукции.

  •  ООО «ММК-Информсервис» создает высокотехнологичные решения для эффективной работы предприятий. Разрабатывают и внедряют телекоммуникационные и бизнес-приложения, автоматизируют производство, выстраивают и поддерживают корпоративную IT-инфраструктуру.

  • ГК «Агропромкомплектация-Курск» - одна из ведущих в Российской Федерации агропромышленных компаний с полным производственным циклом "от поля до прилавка". За 32 года работы на рынке компания заслуженно завоевала репутацию одного из лидеров страны в производстве свинины и молока.

  • KERAMA MARAZZI — международный бренд, входящий в число лидеров глобального рынка керамики. Бизнес компании охватывает весь процесс создания керамических изделий, от глиняных карьеров до фирменной розницы во всех крупных городах РФ и за рубежом.

  • Решения
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Энергетика
    • Фармацевтика
  • Услуги
    • Переход на отечественные BI и DWH
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Техническая поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Платформы
    • FineBI
    • FineReport
    • FineDataLink
    • Коннекторы данных из 1С в BI
    • Airflow + NiFi
    • Visiology
    • Luxms BI
    • Modus BI
    • PIX BI
    • Arenadata
    • ClickHouse
    • Greenplum
    • Postgres Professional
    • Open-source BI: Superset/Metabase
    • Loginom
    • Yandex.DataLens
    • AI / Исскуственный интеллект
    • Optimacros
    • Шины данных
  • Курсы
    • Учебный курс Информационная грамотность
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt
  • Функциональные решения
    • Создание Data Lake
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и прогнозная аналитика
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • Сквозная аналитика
  • Компания
    • О нас
    • Руководство
    • Новости
    • Клиенты
    • Скачать
    • Контакты
    • Политика конфиденциальности
RutubeVkontakteLinkedInYouTube
ООО "Би Ай Консалт",
ИНН: 7811437757,
ОГРН: 1097847154184
199178, Россия,
Санкт-Петербург,
6-ая линия В.О., Д. 63, 4 этаж
Тел: +7 (812) 334-08-01
Тел: +7 (499) 608-13-06
E-mail: info@biconsult.ru

 

 

 

 

 

×

Пользуясь сайтом, вы соглашаетесь с использованием cookies и политикой конфиденциальности.