BI Consult Desktop Logo BI Consult Mobile Logo
  • Russian BI Исследование российских bi
  • Перейти на Fine BI
  • Контакты
  • +7 812 334-08-01
    +7 499 608-13-06
  • Отправить сообщение
  • Главная
  • Продукты Эксперт-BI
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Сельское хозяйство
    • Энергетика
    • FMCG
    • Девелоперы
    • Маркетплейсы
    • Пищевая промышленность
    • Фармацевтика
    • Построение Data Platform
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и FP&A
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • IBP
    • ИТ (CIO)
    • Закупки
  • Платформы
    • Системы бизнес-анализа (BI)
    • Интегрированное бизнес-планирование (IBP)
    • Хранилища данных (DWH / Lakehouse)
    • Каталоги данных (Data Catalog)
    • Системы ETL и ELT
    • AI / Исскуственный интеллект
    • Шина данных (ESB)
    • Система управления мастер-данными (MDM)
    • Семантический слой
  • Услуги
    • Переход на отечественные BI и DWH системы
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений и DWH
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Курсы
    • Учебный курс Информационная грамотность (Data Literacy)
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Greenplum
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt (Data Build Tool)
  • Компания
    • Руководство
    • Новости
    • Клиенты
    • Карьера
    • Скачать
    • Контакты

BI

  • FineBI
  • FineReport
  • FineDataLink
  • FineChatBI (FineAI)
  • Коннекторы данных из 1С в BI
  • Airflow / Nifi
  • Visiology
  • PIX BI
  • Modus BI
  • Yandex.DataLens
  • Open-source BI: Superset/Metabase
  • Luxms BI
  • AW BI + Alpha BI
  • FlyBI + Форсайт. Аналитическая Платформа
  • Loginom
  • Триафлай
  • AI / Исскуственный интеллект
  • Optimacros
  • Навигатор BI
  • Семантический слой

СУБД

  • Arenadata
  • ClickHouse
  • Greenplum
  • Postgres Professional
  • TData

Другое

  • Построение Data Platform
    • Аналитическое хранилище данных
    • Data Lake и Data Engineering
    • Подробнее про Data Lake
    • Внедрение Lakehouse
      • Apache Doris
      • StarRocks
      • Trino
    • Миграция витрин из пропиетарных DWH на новый стек
    • Учебный курс "Современная архитектура хранилища данных"
Главная » Курсы по системам бизнес-анализа и методологии » Учебный курс по DWH » Учебный курс "Использование Kubernetes (k8s) при внедрении BI и DWH" » Модуль 12. Экономика и сайзинг

Модуль 12. Экономика и сайзинг

Зачем считать

Цель — обеспечить SLO BI/витрин минимальной разумной инфраструктурой и иметь прозрачный TCO (Total Cost of Ownership). Смотрим не «цены в вакууме», а нагрузку → ёмкость → стоимость → оптимизации.

 

Capacity planning: что и как замерять

CPU

  • Интерактивные запросы (Trino/ClickHouse): p95 длительности × пиковая конкурентность.
    Оценка: vCPU_need ≈ concurrency × vCPU_per_query × (1 + headroom); для Trino часто 0.5–1 vCPU на активный запрос (без экстремальной агрегации).
  • BI web: небольшие 1–4 vCPU на под, масштаб по RPS/p95. Воркеры отчётов — отдельно.
  • ETL/DAG: считайте задачи одновременно (burst), не DAG/сутки.

 

Память

  • Trino: Mem_need ≈ concurrency × working_set_per_query × (1+headroom). На старте берите 4–8 ГБ/запрос (аналитика средней тяжести), добавляйте spill-диски.
  • ClickHouse: зависит от max_threads и набора данных; на «холодном» кэше память критичнее CPU.
  • BI web: 1–2 ГБ/реплика; Metabase (JVM) — следите за Xmx и паузами GC.

 

Диск/IOPS

  • Postgres: отдельный быстрый том под WAL; ориентир — сотни/тысячи IOPS на пике; латентность <1–2 мс.
  • ClickHouse: последовательные записи (MergeTree) + пики при merge/compaction; NVMe сильно помогает.
  • S3/MinIO: пропускная способность сети и параллелизм клиентов важнее IOPS.

 

Сеть

  • Ingress p95/p99, дыра на экспорт/импорт файлов, throughput к S3.
  • Внутри кластера — планируйте 10/25 GbE для узлов «тяжёлых» пулов.

 

Практика замера: прогоните k6 по BI (см. Модуль 8), плюс репрезентативные SQL-наборы по Trino/CH. Возьмите пиковые значения и заложите headroom 20–40% (в отчётные окна).

 

Requests/Limits и QoS — чтобы «не переплатить»

  • Requests ≈ p50, Limits ≈ p95 конкретного сервиса (не «на глаз»).
  • У stateful (БД, Kafka, CH) — requests ближе к пику; web — ближе к среднему.
  • Не ставьте Limits=Requests у JVM без замеров — получите early OOM.
  • QoS классы (Guaranteed/Burstable) и bin-packing: лучше 2–3 «типоразмера» подов/нод, чем зоопарк.

 

Хранилище: S3 vs блок, hot/warm/cold

Что куда

  • Hot (секунды отклика): Postgres (метаданные/оперативные витрины), ClickHouse (горячие партиции). Блок-тома (NVMe/SSD), репликация.
  • Warm (десятки секунд): Iceberg/Parquet в S3 + Trino. Образцовый вариант для большинства BI.
  • Cold (минуты/часы): архивы, бэкапы, версии снапшотов — S3 с дешёвыми классами хранения.

 

Стоимость и накладные

  • Блок (Ceph/RBD/локальные SSD) дороже за TB, но даёт IOPS/латентность. Учитывайте репликацию (×2–3).
  • S3 — дешёв по TB, но платите пропускной/операции и (в облаках) egress. В on-prem MinIO — без egress, но считаем диски/узлы.
  • Iceberg требует компакшнов — планируйте compute окна (см. Модуль 7).

 

Spot/Preemptible и «дешёвые мегаватты»

  • Где уместно: Trino workers, статeless web, воркеры Celery, Spark/Flink.
  • Где нельзя: координатор Trino, БД, ZooKeeper/метасторы.
  • Правила: запускайте на отдельном пуле с taints; держите минимум on-demand для покрытия базового трафика; тестируйте preemption (до 30 сек предупреждения).

 

Политика логов и метрик (ретеншн = деньги)

  • Логи: разделение по классам:
    • доступ/инфраструктура — 7–14 дней,
    • безопасность/аудит — 90–180 дней (архив в S3),
    • дебаг — 1–3 дня (семплинг).
  • Метрики: Prometheus 10–30 дней, долгосрочно — в Thanos/Mimir (S3).
  • Трейсы: семплинг (1–10%), горячие 7 дней, архив — S3.

 

Модель стоимости (скелет)

Compute:
Cost_compute = Σ (nodes_count_pool × price_per_node_month_pool)
Где nodes_count получаем из CPU/Memory требований с учётом headroom и bin-packing.

 

Storage:
Cost_block = TB_block × price_block × replication_factor
Cost_S3 = TB_S3 × price_S3
Cost_backup = TB_backup × price_backup

 

Сеть:
Cost_egress = TB_egress × price_egress_per_TB (в он-прем — обычно 0).

 

Observability:
Cost_logs = GB_logs_month × price_per_GB_month
Cost_metrics = … (если платите внешнему сервису)

 

Total:
TCO_month = Compute + Storage + Network + Observability + Support/Licenses (если есть)

 

Типовые архитектуры и драйверы TCO

Вариант 1 — All-in k8s (Ceph + S3/MinIO):

  • Контроль и гибкость, меньше egress. – CAPEX на диски/узлы, накладные Ceph (репликация).
    Драйверы: цена блок-хранилища и репликации, доля hot-таблиц на SSD, размер пулов Trino.

 

Вариант 2 — Гибрид (BI вне k8s):

  • Быстрый запуск, меньше статeless-узлов. – Составная сеть, отдельные VM-издержки.
    Драйверы: сеть между VM и k8s, отдельные лицензии/поддержка BI.

 

Вариант 3 — Lakehouse-first (Trino+S3, минимум ClickHouse/DB):

  • Самый низкий TB-cost. – Больше compute в Trino/компакшны.
    Драйверы: объёмы S3, окна компакшна/ресурсы, конкаррентность интерактивных запросов.

 

Где экономить (без боли для SLO)

  1. Уберите «малые файлы» в S3 (Iceberg rewrite/compaction) — ускорит Trino и уменьшит метаданные.
  2. Кэшируйте (Redis, result cache Trino/CH) популярные запросы.
  3. PgBouncer/лимиты: фиксируйте connection-budget BI/ETL, чтобы HPA не «съел» БД.
  4. Разделите пулы узлов и включите spot для эластичных workers.
  5. Ставьте requests по факту, не по «мечте»; используйте VPA-рекомендации для baseline.
  6. Ретеншн логов: горячие коротко, остальное — в S3 (чем реже нужен поиск, тем дешевле).
  7. Разумные индексы/партиции в Postgres/CH — снижение CPU/IO без увеличения TB.
  8. Scale-to-zero в Dev/Stage на ночь/выходные (CronHPA/KEDA).

 

Риски оценки и как защищаться

Риск

Симптом

Что сделать

Недосайзинг

SLO падает в отчётные окна

Headroom 20–40%; хронометраж пиков; canary-тесты

Пересайзинг

Пустые узлы, высокий счёт

Requests по факту, bin-packing, меньше «типоразмеров»

Ceph «съел бюджет»

×3 к TB-стоимости

Разнести hot (Ceph) и warm/cold (S3), tune RF, учитывать EC

Логи «заливают»

Рост TB и счёта

Ретеншн по классам, семплинг, JSON-строгий формат, фильтрация на входе

Spot «роняет» отчёты

Прерывания в прайм-тайм

Минимум on-demand для базы трафика, graceful shutdown, retry с idempotency

Egress в облаках

«Неожиданная» строка в счёте

Держать BI рядом с данными, кэш, CDN/проксирование

 

Практика: калькулятор TCO для 3 вариантов

Что внутри файла (см. ссылку выше):

  • Вкладка Inputs — нагрузки (конкурентность Trino/ETL, объёмы данных, логи), спецификации узлов и цены (на узел и на TB-месяц), а также базовые параметры по вариантам (кол-во стейтлесс/DB-узлов и TB под БД).
  • Вкладка Results — пересчёт требуемых ETL-узлов (по формуле из Inputs), объёмов S3/бэкапов/логов и итоговые месячные TCO для трёх архитектур:
    • V1: All-in k8s (Ceph + S3/MinIO),
    • V2: Гибрид (BI вне k8s),
    • V3: Lakehouse-first (упор на S3/Trino).

 

Как пользоваться, шаг за шагом:

  1. Замените placeholder-цены в Inputs на ваши (или ₽).
  2. Подставьте свои пики: Trino concurrency, Airflow concurrent tasks, объёмы raw/curated, логи.
  3. Проверьте headroom (обычно 0.2–0.4) и overhead для ETL (1.05–1.2).
  4. При необходимости измените «базовые» узлы/ТБ по вариантам (DB-узлы/объёмы).
  5. Смотрите Results → TOTAL monthly cost по вариантам, сравнивайте «чувствительность» TCO при изменении параметров (что сильнее всего «двигает» счёт).

 

Скачать калькулятор TCO (XLSX)

 

Чек-лист перед бюджетом/пилотом

  • Есть реальные измерения нагрузки (k6, SQL-наборы), не экспертные оценки.
  • Requests/Limits проставлены и пересмотрены по замерам; QoS понятен.
  • Разделены hot/warm/cold уровни с явными классами хранилища.
  • Headroom и «N+1» в пиках; планы масштабирования (HPA/KEDA).
  • Ретеншн логов/метрик оформлен и принят безопасниками.
  • Spot-политика/узлы: где можно — включили; где нельзя — запрещено.
  • DR-стоимости (репликации/бэкапы) включены в TCO, не забыты.
  • Есть опорные меры оптимизации (компакшн Iceberg, кэш, пулы коннектов, pre-aggregations).
  • Runbook «что режем первым» при превышении бюджета (частоты компакшнов, cold-тиир, лимиты экспорта).

 

Узнать стоимость решенияЗапросить видео презентацию

← Предыдущая статья
Модуль 11. Надёжность и масштабирование
Следующая статья →
Модуль 13. Данные, качество и каталог
Запросить видео презентацию Запросить доступ к демо стенду online Узнать стоимость лицензий

Задать вопрос

loading...

Решения

Анализировать ФинансыУвеличивайте ПродажиОптимальный Склад и ЛогистикаМаркетинговые Метрики

Клиенты
  • КАМИ – компания-лидер по поставкам тяжёлых станков в России, занимающаяся продажей и обслуживанием оборудования для обработки металла и дерева, изготовления мебели и не только. На сегодняшний день в компании работают более 1300 человек, запущено 10 обучающих центров, в продаже более 7000 единиц техники. 

  • С объединением компании Savencia Fromage & Dairy и молочного комбината в г.Белебей, одного из лидеров по производству твердых сычужных сыров в России, Savencia выходит на российский рынок не только как импортер, но и как производитель молочной продукции.

  • Группа компаний «Невский кондитер» основана в 1996 году в Санкт-Петербурге и на сегодняшний день является одним из крупнейших производителей кондитерских изделий в России.

     

  • Торгово-производственному холдингу ТБМ, специализирующемуся на поставке комплектующих и фурнитуры для производства окон, дверей, стеклопакетов и мебели, был необходим аналитический инструмент для выявления узким мест и поиска зон роста бизнеса и, как результат, оптимизации процессов. Добиться этого можно было, только внедрив data-driven подход.

  • Решения
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Энергетика
    • Фармацевтика
  • Услуги
    • Переход на отечественные BI и DWH
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Техническая поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Платформы
    • FineBI
    • FineReport
    • FineDataLink
    • Коннекторы данных из 1С в BI
    • Airflow + NiFi
    • Visiology
    • Luxms BI
    • Modus BI
    • PIX BI
    • Arenadata
    • ClickHouse
    • Greenplum
    • Postgres Professional
    • Open-source BI: Superset/Metabase
    • Loginom
    • Yandex.DataLens
    • AI / Исскуственный интеллект
    • Optimacros
    • Шины данных
  • Курсы
    • Учебный курс Информационная грамотность
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt
  • Функциональные решения
    • Создание Data Lake
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и прогнозная аналитика
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • Сквозная аналитика
  • Компания
    • О нас
    • Руководство
    • Новости
    • Клиенты
    • Скачать
    • Контакты
    • Политика конфиденциальности
RutubeVkontakteLinkedInYouTube
ООО "Би Ай Консалт",
ИНН: 7811437757,
ОГРН: 1097847154184
199178, Россия,
Санкт-Петербург,
6-ая линия В.О., Д. 63, 4 этаж
Тел: +7 (812) 334-08-01
Тел: +7 (499) 608-13-06
E-mail: info@biconsult.ru

 

 

 

 

 

×

Пользуясь сайтом, вы соглашаетесь с использованием cookies и политикой конфиденциальности.