BI Consult Desktop Logo BI Consult Mobile Logo
  • Russian BI Исследование российских bi
  • Перейти на Fine BI
  • Контакты
  • +7 812 334-08-01
    +7 499 608-13-06
  • Отправить сообщение
  • Главная
  • Продукты Эксперт-BI
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Сельское хозяйство
    • Энергетика
    • FMCG
    • Девелоперы
    • Маркетплейсы
    • Пищевая промышленность
    • Фармацевтика
    • Построение Data Platform
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и FP&A
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • IBP
    • ИТ (CIO)
    • Закупки
  • Платформы
    • Системы бизнес-анализа (BI)
    • Интегрированное бизнес-планирование (IBP)
    • Хранилища данных (DWH / Lakehouse)
    • Каталоги данных (Data Catalog)
    • Системы ETL и ELT
    • AI / Исскуственный интеллект
    • Шина данных (ESB)
    • Система управления мастер-данными (MDM)
    • Семантический слой
  • Услуги
    • Переход на отечественные BI и DWH системы
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений и DWH
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Курсы
    • Учебный курс Информационная грамотность (Data Literacy)
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Greenplum
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt (Data Build Tool)
  • Компания
    • Руководство
    • Новости
    • Клиенты
    • Карьера
    • Скачать
    • Контакты

BI

  • FineBI
  • FineReport
  • FineDataLink
  • FineChatBI (FineAI)
  • Коннекторы данных из 1С в BI
  • Airflow / Nifi
  • Visiology
  • PIX BI
  • Modus BI
  • Yandex.DataLens
  • Open-source BI: Superset/Metabase
  • Luxms BI
  • AW BI + Alpha BI
  • FlyBI + Форсайт. Аналитическая Платформа
  • Loginom
  • Триафлай
  • AI / Исскуственный интеллект
  • Optimacros
  • Навигатор BI
  • Семантический слой

СУБД

  • Arenadata
  • ClickHouse
  • Greenplum
  • Postgres Professional
  • TData

Другое

  • Построение Data Platform
    • Аналитическое хранилище данных
    • Data Lake и Data Engineering
    • Подробнее про Data Lake
    • Внедрение Lakehouse
      • Apache Doris
      • StarRocks
      • Trino
    • Миграция витрин из пропиетарных DWH на новый стек
    • Учебный курс "Современная архитектура хранилища данных"
Главная » Курсы по системам бизнес-анализа и методологии » Учебный курс по DWH » Учебный курс "Использование Kubernetes (k8s) при внедрении BI и DWH" » Модуль 25. Мониторинг и логирование

Модуль 25. Мониторинг и логирование

Цель: собрать метрики и логи из k8s и стека данных (PG/CH/Trino/Airflow/Ingress и т. д.), построить дашборды SLI/SLO, настроить алерты без шума и выстроить хранение (retention/стоимость).

Результат: kube-prometheus-stack/Alertmanager/Grafana + Loki (или EFK) + бэкенд длительного хранения (VictoriaMetrics/Thanos/Mimir). Есть чек-листы и runbook’и.

 

Архитектура наблюдаемости: «плоскости» и потоки

Метрики

  • Пуллер: Prometheus скрапит /metrics (kube-components, exporters, приложения).
  • Агрегация/долгое хранение:
    • Малый/средний масштаб → Prometheus single + remote_write в VictoriaMetrics (single/cluster).
    • Крупный/мультикластер → Thanos/Cortex/Mimir (объектное хранилище, федерация).
  • Где взять метрики:
  • k8s: kube-state-metrics, node_exporter, cAdvisor, control-plane (/metrics).
  • BI/DWH: Postgres/pgBouncer, ClickHouse, Trino, Airflow, Kafka/Connect, Ingress (nginx/HAProxy/Traefik), MinIO/S3 (4xx/5xx, латентность).
  • Отрисовка: Grafana (дашборды, аннотации релизов).
  • Алертинг: Alertmanager (маршрутизация/инхибирование/сайлэнсы).

 

Логи

  • Агент: Promtail (Loki) или Fluent Bit (EFK).
  • Бэкенд: Loki (болт+объектное S3, индекс по лейблам; дешёвле ES), либо Elasticsearch/OpenSearch (дороже, но богатый поиск).
  • Аудит: лог kube-api audit в тот же бэкенд с отдельной меткой/индексом.

 

Служебные компоненты k8s

  • metrics-server — даёт краткоживущие CPU/Mem для HPA (не для исторических графиков).
  • kube-state-metrics — «снимок состояния объектов k8s» (реплики, статусы, версии).

 

«Золотые сигналы» и SLO для BI/DWH

SRE-оптика (4 Golden Signals): latency, traffic, errors, saturation.

  • Пользовательский край (Ingress): p50/p95/p99 latency, RPS, 4xx/5xx rate, saturation воркеров.
  • BI: успешность запросов/экспортов, p95 построения дашборда, очередь заданий (воркеры Celery).
  • Trino: доля успешных запросов, p95 queued/execution time, количество воркеров/спиллы, task failures.
  • ClickHouse: merges backlog, replication queue, parts, read/write latency, диск/ inode, rejected queries.
  • Postgres: connections (max, used), locks/waits, replication lag, bgwriter, bloat, WAL.
  • Airflow: task_duration p95, task_failed rate, scheduler delay, очередь executora.
  • CDC/Kafka: lag по топикам/partition, ретенции, consumer group lag.
  • Платформа k8s:
    • apiserver request duration/inflight,
    • etcd commit/WAL latency, leader changes,
    • scheduler e2e latency/pending pods,
    • controller workqueue depth,
    • kubelet pod start latency/NotReady nodes,
    • kube-proxy sync, conntrack.

 

Для каждого домена задаём SLO (напр. «Успешность запросов Trino ≥ 99% за 30 дней; p95 latency ≤ 4 с»), строим дашборд SLO + алерты по burn-rate.

 

Компоненты и их роль

  • Prometheus Operator (kube-prometheus-stack): CRD для Prometheus/Alertmanager/Grafana, ServiceMonitor/PodMonitor — меньше «ручного» конфигурирования.
  • metrics-server: краткоживущие resource-метрики для HPA (не путать с Prometheus).
  • kube-state-metrics: метрики по объектам (replicas, status, age, version).
  • VictoriaMetrics: быстрая TSDB (single/cluster), дешёвое длительное хранение, пром-совместимо.
  • Loki + Promtail: дешёвое хранение логов; лейблы/LogQL; globs/мультилайн.
  • Alertmanager: маршруты по лейблам (team, severity), инхибирование, шаблоны, дежурства.

 

Кардинальность, ретенции и стоимость

  • Кардинальность меток — враг TSDB/лог-индекса. Нельзя метить pod_uid, request_id, sql_hash и т. п. как лейблы — держите их в полях (для логов) или как значения (для метрик с histogram).
  • Ретеншн метрик:
    • локально в Prometheus: 7–15 дней,
    • длительно (VM/Thanos): 6–18 месяцев.
  • Ретеншн логов:
  • «горячие» 7–14 дней,
  • архив (объектное хранилище) 90–180 дней.
  • Скрап-интервалы: 15–30 с для основных; 1–5 м для «тяжёлых» экспортеров.
  • Recording rules: вычисляйте p95/p99, rates и агрегаты заранее (меньше нагрузка на запросы и алерты).

 

Логи: структура и сбор

  • Структурируйте логи JSON (уровень, ts, msg, request_id, user, duration_ms, status).
  • Многострочные исключения (Java/Go) — настраиваем мультилайн в агенте.
  • PII-защита: редактируйте/маскируйте на стороне приложения или на агенте (drop/replace).
  • Label-схема в Loki: низкая кардинальность — cluster, namespace, app, container, pod (без uid), level, team. Идентификаторы запросов — только как поля.
  • Аудит API: отдельный stream с меткой audit=true, парсинг полей (верб/ресурс/кто/где).

 

Алертинг без шума (Alertmanager + правила)

Подход: меньше «железа»-алертов, больше симптомов/бизнес-SLO. Склейка похожих алертов, инхибирование «нижних» при «верхнем» инциденте.

  • Маршрутизация: по team, service, severity; каждый alert-rule содержит runbook_url, owner=team-X.
  • Иерархия:
    • Critical — SLO нарушается (burn-rate), платформа не отвечает, потеря данных.
    • Warning — тренд к деградации, «подготовиться».
  • Burn-rate (пример): быстрый 5 мин и медленный 1 ч окна. Если оба красные — «срочно».
  • Inhibition: при KubeAPIHighErrorRate подавляем «хвост» 5xx у приложений/Ingress (если причина на краю).
  • Дежурства/тихие часы: интеграция с PagerDuty/Telegram/Slack, «сайлэнсы» на плановые окна.

 

Примеры идей правил (без деталей PromQL):

  • APIServerHighLatency, EtcdHighCommitLatency, SchedulerHighPending.
  • NodeNotReady (>=2 узла) > 5 мин.
  • IngressHigh5xx + HighP95Latency.
  • TrinoHighQueryFailureRate/LongQueue.
  • CHReplicationQueueHigh / MergesBacklogHigh.
  • PGReplicationLagHigh / ConnectionsExhausted.
  • AirflowTaskFailureRateHigh / SchedulerDelayHigh.
  • Bucket4xx/5xxHigh (S3/RGW).
  • AuditK8sSuspiciousRBACChange (создан ClusterRole с *).

 

Практические шаги (лабораторка за 1–2 дня)

  1. Развернуть kube-prometheus-stack (Prometheus, Alertmanager, Grafana, ksm, node_exporter).
  2. Подключить экспортеры: Ingress, Postgres, ClickHouse, Trino, Airflow; проверить таргеты UP.
  3. Включить VictoriaMetrics (remote_write) или Thanos для длительного хранения; настроить ретеншн.
  4. Собрать SLO-дашборды: BI (p95 latency/5xx), Trino (success/queue), CH (replication/merges), PG (lag/conn). Добавить релиз-аннотации.
  5. Алерты-гейты: завести минимум 6 правил (APIServer/etcd/Ingress/Trino/CH/PG) с runbook_url и маршрутизацией по командам.
  6. Развернуть Loki+Promtail, задать схему лейблов, включить мультилайн; прогнать запросы LogQL, завести алерт по level="error" с фильтрами.
  7. Аудит API: включить политику аудита, слить в Loki, сделать дашборд «RBAC-изменения».
  8. Проверка шума: нагрузочный тест → оценить объём алертов; включить инхибирование и группировку.

 

Риски и анти-паттерны

Риск

Проявление

Что делать

Шумные алерты

Дежурные «глохнут», игнор

SLO/burn-rate, инхибирование, группировка, дебоунс; ownership и runbook’и

Взрыв кардинальности

OOM у TSDB/Loki, медленные запросы

Нормализуйте лейблы, дропайте pod_uid, используйте recording rules

Ретенции без бюджета

«Лопнул» диск, рост счетов

План ретеншнов, холодное хранение в S3, компрессия

metrics-server «путают» с мониторингом

«Нет истории в Grafana»

Выделить роли: metrics-server только HPA; исторические — Prometheus

Собираем всё подряд

Нагрузили API, TSDB

Скрап-частота разумная, таргеты по ServiceMonitor, дропаут лишних метрик

Логи без структуры

Поиск «на удачу», медленно

JSON-формат, request_id, уровни; анти-PII фильтры

Нет аудита

Не видно изменений прав

Включить audit-лог, дашборды и алерты на RBAC-события

 

Мини-фрагменты (ровно сколько нужно)

Алерт по burn-rate (идея, не копируйте без адаптации):

- alert: IngressSLOBurn
  expr: (rate(nginx_ingress_controller_requests{status=~"5.."}[5m]) /
         rate(nginx_ingress_controller_requests[5m])) > 0.02
  for: 5m
  labels: { severity: critical, team: bi, service: ingress }
  annotations:
    summary: "5xx на входе превышает бюджет ошибок"
    runbook_url: "https://runbooks/ingress-5xx"

 

Политика аудита (эскиз):

apiVersion: audit.k8s.io/v1
kind: Policy
rules:
- level: Metadata
  verbs: ["create","update","patch"]
  resources:
  - group: "rbac.authorization.k8s.io"
    resources: ["clusterroles","clusterrolebindings","roles","rolebindings"]

 

Чек-лист «готово к продакшену»

  • kube-prometheus-stack развёрнут; таргеты UP; ретеншн локальный ≥ 7 дней.
  • Длительное хранение: VictoriaMetrics/Thanos; recording rules для p95/p99.
  • Grafana: дашборды SLO для BI/Trino/CH/PG/Ingress; релиз-аннотации.
  • Alertmanager: маршруты по командам, инхибирование, шаблоны, интеграция с он-коллом; runbook_url в правилах.
  • Loki/Promtail: структурные логи, схема лейблов с низкой кардинальностью, мультилайн; ретеншн и архив.
  • Аудит API включён, есть дашборд «RBAC-изменения» и алерт на «опасные» операции.
  • Документы: SLO-каталог, регламент тюнинга алертов, runbook’и «Ingress 5xx», «Trino queue», «CH replication», «PG connections», «API latency».

 

Вопрос-ответ

В: Зачем нам VictoriaMetrics/Thanos, если есть Prometheus?
О: Prometheus хорош для «недели-двух». Для месяцев/лет и мультикластера — дешевле и надёжнее хранить в VM/Thanos (объектное S3, шардинг, репликация).

 

В: Loki или Elasticsearch?
О: Loki дешевле (индекс только по лейблам) и чаще «достаточен» для платформы/BI. Elasticsearch/OpenSearch — мощнее поиск/агрегации, но дороже в эксплуатации.

 

В: metrics-server не видно в Grafana, это баг?
О: Нет. Он — про HPA, а не историю. Историю собирает Prometheus с node_exporter/kubelet/kube-state-metrics.

 

В: С чего начать, чтобы не зашуметь алертами?
О: С SLO-дашбордов и 10–15 целевых правил (Ingress, API/etcd, Trino, CH, PG, Airflow). Сразу включите inhibition и burn-rate. Всё остальное — позже, итеративно.

 

В: Как привязать алерт к команде?
О: Лейблы team, service в правилах + маршруты в Alertmanager. Каждому правилу — runbook_url и владелец.

 

В: Что такое «взрыв кардинальности» и почему это больно?
О: Слишком много уникальных значений лейбла (например, sql_hash как лейбл). TSDB/индекс «встаёт». Делайте это как поля/значения, а не как лейблы; агрегируйте recording-rules.

 

В: Как контролировать стоимость логов?
О: Снизу: уровень логов (drop debug), выборочные источники, короткий «горячий» ретеншн, архив в S3, квоты на инжест/группы.

 

Устойчивая наблюдаемость — это не «поставить Grafana». Это дисциплина: Prometheus + долгое хранение, дашборды SLO, алерты по симптомам с burn-rate, структурные логи в Loki, аудит API, и строгий контроль кардинальности/ретеншна. Тогда алерты не будут шуметь, дежурные — выгорать, а BI/DWH — падать «внезапно».

 

Узнать стоимость решенияЗапросить видео презентацию

← Предыдущая статья
Модуль 24. Безопасность Kubernetes
Следующая статья →
Модуль 26. GitOps и CI/CD для Kubernetes
Запросить видео презентацию Запросить доступ к демо стенду online Узнать стоимость лицензий

Задать вопрос

loading...

Решения

Анализировать ФинансыУвеличивайте ПродажиОптимальный Склад и ЛогистикаМаркетинговые Метрики

Клиенты
  • НПФ «Будущее» — один из крупнейших негосударственных пенсионных фондов России, предоставляющий услуги по пенсионному обеспечению и накоплениям. Фонд активно внедряет цифровые технологии для повышения качества обслуживания клиентов.

  •  ООО «ММК-Информсервис» создает высокотехнологичные решения для эффективной работы предприятий. Разрабатывают и внедряют телекоммуникационные и бизнес-приложения, автоматизируют производство, выстраивают и поддерживают корпоративную IT-инфраструктуру.

  • ПАО «Транснефть» – крупнейшая российская нефтепроводная компания. «Транснефть» обеспечивает транспортировку более 85% добываемых в России нефти и нефтепродуктов.

  • Банк "Санкт-Петербург" - это универсальный коммерческий банк, предоставляющий полный спектр финансовых услуг для частных и корпоративных клиентов. Банк основан в 1990 году и имеет генеральную лицензию Банка России на осуществление банковских операций. Сеть банка включает более 170 офисов и отделений, а также свыше 1000 банкоматов и терминалов в Санкт-Петербурге, Москве и других регионах.

  • Решения
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Энергетика
    • Фармацевтика
  • Услуги
    • Переход на отечественные BI и DWH
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Техническая поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Платформы
    • FineBI
    • FineReport
    • FineDataLink
    • Коннекторы данных из 1С в BI
    • Airflow + NiFi
    • Visiology
    • Luxms BI
    • Modus BI
    • PIX BI
    • Arenadata
    • ClickHouse
    • Greenplum
    • Postgres Professional
    • Open-source BI: Superset/Metabase
    • Loginom
    • Yandex.DataLens
    • AI / Исскуственный интеллект
    • Optimacros
    • Шины данных
  • Курсы
    • Учебный курс Информационная грамотность
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt
  • Функциональные решения
    • Создание Data Lake
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и прогнозная аналитика
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • Сквозная аналитика
  • Компания
    • О нас
    • Руководство
    • Новости
    • Клиенты
    • Скачать
    • Контакты
    • Политика конфиденциальности
RutubeVkontakteLinkedInYouTube
ООО "Би Ай Консалт",
ИНН: 7811437757,
ОГРН: 1097847154184
199178, Россия,
Санкт-Петербург,
6-ая линия В.О., Д. 63, 4 этаж
Тел: +7 (812) 334-08-01
Тел: +7 (499) 608-13-06
E-mail: info@biconsult.ru

 

 

 

 

 

×

Пользуясь сайтом, вы соглашаетесь с использованием cookies и политикой конфиденциальности.