BI Consult Desktop Logo BI Consult Mobile Logo
  • Russian BI Исследование российских bi
  • Перейти на Fine BI
  • Контакты
  • +7 812 334-08-01
    +7 499 608-13-06
  • Отправить сообщение
  • Главная
  • Продукты Эксперт-BI
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Сельское хозяйство
    • Энергетика
    • FMCG
    • Девелоперы
    • Маркетплейсы
    • Пищевая промышленность
    • Фармацевтика
    • Построение Data Platform
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и FP&A
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • IBP
    • ИТ (CIO)
    • Закупки
  • Платформы
    • Системы бизнес-анализа (BI)
    • Интегрированное бизнес-планирование (IBP)
    • Хранилища данных (DWH / Lakehouse)
    • Каталоги данных (Data Catalog)
    • Системы ETL и ELT
    • AI / Исскуственный интеллект
    • Шина данных (ESB)
    • Система управления мастер-данными (MDM)
    • Семантический слой
  • Услуги
    • Переход на отечественные BI и DWH системы
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений и DWH
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Курсы
    • Учебный курс Информационная грамотность (Data Literacy)
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Greenplum
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt (Data Build Tool)
  • Компания
    • Руководство
    • Новости
    • Клиенты
    • Карьера
    • Скачать
    • Контакты

BI

  • FineBI
  • FineReport
  • FineDataLink
  • FineChatBI (FineAI)
  • Коннекторы данных из 1С в BI
  • Airflow / Nifi
  • Visiology
  • PIX BI
  • Modus BI
  • Yandex.DataLens
  • Open-source BI: Superset/Metabase
  • Luxms BI
  • AW BI + Alpha BI
  • FlyBI + Форсайт. Аналитическая Платформа
  • Loginom
  • Триафлай
  • AI / Исскуственный интеллект
  • Optimacros
  • Навигатор BI
  • Семантический слой

СУБД

  • Arenadata
  • ClickHouse
  • Greenplum
  • Postgres Professional
  • TData

Другое

  • Построение Data Platform
    • Аналитическое хранилище данных
    • Data Lake и Data Engineering
    • Подробнее про Data Lake
    • Внедрение Lakehouse
      • Apache Doris
      • StarRocks
      • Trino
    • Миграция витрин из пропиетарных DWH на новый стек
    • Учебный курс "Современная архитектура хранилища данных"
Главная » Курсы по системам бизнес-анализа и методологии » Учебный курс Современная архитектура хранилища данных » Учебный курс: StarRocks — полный практический гид по внедрению и эксплуатации » Модуль 4. Моделирование данных в StarRocks

Модуль 4. Моделирование данных в StarRocks

Методологическое значение моделирования

В StarRocks проектирование таблиц — это архитектурное решение, а не просто разработка схемы.
Ошибки на этом этапе приводят к тому, что:

  • простая агрегация в BI идёт 30 секунд вместо 1–2;
  • таблицы растут в 5 раз быстрее, чем ожидалось;
  • ingest «захлёбывается» при пиках;
  • MV не используются оптимизатором, и нагрузка падает на сырые данные.

 

Методология проектирования в StarRocks отличается от классических реляционных DWH, потому что:

  • система не делает полноценных индексов в стиле PostgreSQL — мы должны закладывать их логику в структуру данных;
  • компоновка данных (sort key, partition, distribution) влияет на план выполнения;
  • типы таблиц (Duplicate, Aggregate, Primary Key) задают физическое поведение данных.

 

 

Типы таблиц и когда их использовать

StarRocks поддерживает три типа таблиц, которые напрямую влияют на ingestion, хранение и запросы:

  1. Duplicate Key Table
    • Что это: хранит дубликаты строк как есть.
    • Когда использовать:
      • сырые логи, где важно сохранить 100% оригинала;
      • временные зоны обработки перед агрегацией;
      • стейджинговые зоны.
    • Плюсы: быстрый ingest, простая структура.
    • Минусы: быстрый рост объёма, без агрегации.
  2. Aggregate Key Table
  3. Что это: агрегирует строки по ключам, значения по колонкам объединяются агрегатными функциями (SUM, MIN, MAX и др.).
  4. Когда использовать:
    • предагрегированные витрины;
    • отчёты по датам/категориям, где историчность на уровне агрегации.
  5. Плюсы: экономия места, быстрые запросы.
  6. Минусы: потеря детализации, ingest медленнее.
  7. Что это: поддерживает upsert и delete по ключу.
  8. Когда использовать:
    • витрины, где данные обновляются;
    • интеграция с CDC;
    • real-time отчёты с коррекциями.
  9. Плюсы: удобное обновление, консистентность.
  10. Минусы: выше нагрузка на BE, дороже по диску.
  11. Primary Key Table

 

Партиционирование (Partitioning)

Зачем:

  • Уменьшает объём сканирования в запросах.
  • Ускоряет загрузку (ingest) за счёт работы с конкретными партициями.
  • Облегчает удаление/архивацию старых данных.

 

Варианты:

  • Range Partition — по дате или диапазону чисел.
  • List Partition — по значению (например, региону).
  • Composite Partition — сочетание (дата+регион).

 

Методологические советы:

  • Для real-time — день или час как партиция.
  • Для batch-аналитики — месяц или квартал.
  • Не плодить тысячи партиций — FE начинает тормозить на метаданных.

 

Пример:

PARTITION BY RANGE (dt) (
    PARTITION p202501 VALUES LESS THAN ("2025-02-01"),
    PARTITION p202502 VALUES LESS THAN ("2025-03-01")
)

 

Дистрибуция (Distribution)

Зачем:

  • Равномерная нагрузка по BE-нoдам.
  • Минимизация «горячих» сегментов.

 

Варианты:

  • Hash — по одному или нескольким бизнес-ключам (например, customer_id).
  • Random — только для тестов или низких объёмов.

 

Методологический совет: выбирать ключ, который:

  • равномерно распределён,
  • часто участвует в фильтрах или join,
  • не создаёт «горячие» партиции.

 

Ключ сортировки (Sort Key)

Что это:

  • Определяет порядок данных внутри сегментов.
  • Влияет на скорость фильтрации и агрегаций.

 

Пример:
Для витрины продаж (region_id, sale_date) → сортируем по sale_date внутри region_id.

 

Совет:

  • Не злоупотреблять количеством колонок — сортировка по 1–3 колонкам обычно достаточно.
  • Сортировать по часто используемым в WHERE и GROUP BY полям.

 

Материализованные представления (MV)

Зачем:

  • Хранить результаты тяжёлых запросов и переписывать SQL BI-инструмента на MV.
  • Ускорять join и агрегации.

 

Пример:

CREATE MATERIALIZED VIEW mv_sales
AS
SELECT region_id, dt, SUM(amount) AS total_sales
FROM sales
GROUP BY region_id, dt;

 

Методология:

  • Создавать MV под конкретные BI-дашборды.
  • Проверять с EXPLAIN что запросы реально используют MV.
  • Обновление — инкрементальное при возможности.

 

Практические кейсы

Кейс 1. Оптимизация витрины продаж

  • Проблема: запрос по продажам за 2 года (1,5 млрд строк) занимал 40 сек.
  • Решение:
    • Перевели таблицу в Aggregate Key по (region_id, sale_date).
    • Добавили MV с предагрегацией по неделям.
    • Применили партиционирование по месяцам.
  • Результат: запрос сократился до 1,8 сек.
  • Риск: потеря детализации на уровне транзакций.
  • Защита: хранить дубликаты в отдельной raw-таблице.

 

Кейс 2. Real-time мониторинг логов

  • Проблема: ingest из Kafka 300k событий/сек, запросы начали лагать.
  • Решение:
    • Перевели на PK-таблицу с upsert по session_id.
    • Разбили партиции по дню+часу.
    • Увеличили batch в Routine Load.
  • Результат: латентность снизилась до 3 сек.
  • Риск: рост нагрузки на compaction.
  • Защита: ночные окна компакшна.

 

Риски и как от них застраховаться

Риск

Симптом

Как избежать

Неверный тип таблицы

Медленные запросы или ingest

Выбирать на основе профиля данных (Raw, Aggregated, Upsert)

Перекос в дистрибуции

Одни BE перегружены

Подбор ключа, анализ распределения

Слишком мелкие партиции

Рост метаданных, лаги в FE

Укрупнять партиции

MV не используется

BI стреляет в сырые таблицы

Проверять переписывание с EXPLAIN

TTL удаляет нужные данные

Потеря истории

Разделить active/historical зоны

 

Методологические рекомендации

  1. Думать от запроса, а не от исходных данных — BI-дэшборды и их SLA определяют модель.
  2. Raw zone + витрины — хранить сырые данные и строить отдельные таблицы под BI.
  3. Инкрементальное обновление MVs — избегать полной перестройки.
  4. TTL и агрегация старых данных — уменьшает нагрузку и хранение.
  5. Ежеквартальный аудит схемы — удалять неиспользуемые колонки, витрины, MV.

 

Узнать стоимость решенияЗапросить видео презентацию

← Предыдущая статья
Модуль 3. Развёртывание и конфигурация StarRocks
Следующая статья →
Модуль 5. Загрузка данных в StarRocks

Решения

Анализировать ФинансыУвеличивайте ПродажиОптимальный Склад и ЛогистикаМаркетинговые Метрики

Клиенты
  • ЭГИС - международная фармацевтическая компания, основанная в 1907 году в Венгрии. Компания имеет представительства более чем в 60 странах мира, в том числе в России. Компания ЭГИС является одним из ведущих производителей дженерических лекарственных средств в Центральной и Восточной Европе. Её деятельность охватывает все звенья производственно-сбытовой фармацевтической цепочки.

  • Компания "Норникель" - лидер горно-металлургической отрасли в России и мире. Она производит металлы, необходимые для развития экологичной экономики и транспорта.

  • С объединением компании Savencia Fromage & Dairy и молочного комбината в г.Белебей, одного из лидеров по производству твердых сычужных сыров в России, Savencia выходит на российский рынок не только как импортер, но и как производитель молочной продукции.

  • ПАО АНК «Башнефть» — российская вертикально-интегрированная нефтяная компания, с 2016 года входит в ПАО НК «Роснефть». Главный офис расположен в городе Уфе (Башкортостан). Добыча углеводородов – более 21 млн тонн нефти в год. Объем переработки – более 18 млн тонн нефти в год. Число сотрудников – более 33 тыс. человек.

  • Решения
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Энергетика
    • Фармацевтика
  • Услуги
    • Переход на отечественные BI и DWH
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Техническая поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Платформы
    • FineBI
    • FineReport
    • FineDataLink
    • Коннекторы данных из 1С в BI
    • Airflow + NiFi
    • Visiology
    • Luxms BI
    • Modus BI
    • PIX BI
    • Arenadata
    • ClickHouse
    • Greenplum
    • Postgres Professional
    • Open-source BI: Superset/Metabase
    • Loginom
    • Yandex.DataLens
    • AI / Исскуственный интеллект
    • Optimacros
    • Шины данных
  • Курсы
    • Учебный курс Информационная грамотность
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt
  • Функциональные решения
    • Создание Data Lake
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и прогнозная аналитика
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • Сквозная аналитика
  • Компания
    • О нас
    • Руководство
    • Новости
    • Клиенты
    • Скачать
    • Контакты
    • Политика конфиденциальности
RutubeVkontakteLinkedInYouTube
ООО "Би Ай Консалт",
ИНН: 7811437757,
ОГРН: 1097847154184
199178, Россия,
Санкт-Петербург,
6-ая линия В.О., Д. 63, 4 этаж
Тел: +7 (812) 334-08-01
Тел: +7 (499) 608-13-06
E-mail: info@biconsult.ru

 

 

 

 

 

×

Пользуясь сайтом, вы соглашаетесь с использованием cookies и политикой конфиденциальности.