Полный глоссарий по теме Kubernetes для BI/DWH
Базовые сущности Kubernetes
- Kubernetes (k8s) — оркестратор контейнеров. В BI/DWH даёт управляемость, масштабирование, изоляцию. Риск: усложнение по сравнению с VM.
- Кластер (Cluster) — совокупность узлов (master/control plane + worker).
- Узел (Node) — VM/сервер, где запускаются поды. Node Pool — группа узлов с одинаковой конфигурацией/политикой.
- Под (Pod) — минимальная вычислительная единица (один или несколько контейнеров + общий IPC/FS/сеть). В BI — веб/воркеры; в DWH — сегменты БД/координатор.
- Контейнер (Container) — единица исполнения (обычно OCI-образ).
- Неймспейс (Namespace) — логическая изоляция внутри кластера (команды/проекты/окружения).
-
Контроллеры (Controllers) — управляющие объекты:
- Deployment — декларативный менеджер stateless-подов (rolling update).
- StatefulSet — для stateful-приложений с закреплёнными идентичностями/томами.
- DaemonSet — по одному поду на ноду (агенты логов/метрик).
- Job/CronJob — одноразовые/периодические задания (ETL, рассылка отчётов).
- Сервис (Service) — стабильная виртуальная IP/имя и балансировка до набора подов. Типы: ClusterIP, NodePort, LoadBalancer.
- ConfigMap/Secret — конфигурации и секреты (пароли/ключи). Риск: не хранить секреты в ConfigMap.
- Volume / PersistentVolume (PV) / PersistentVolumeClaim (PVC) — устойчивое хранилище для подов.
- StorageClass (SC) — класс хранилища (параметры провиженинга/политики).
- Ingress / Gateway API — L7-маршрутизация HTTP(S) внутрь кластера.
- kube-apiserver / scheduler / controller-manager / etcd / kubelet / kube-proxy — компоненты control plane и агентов на узлах. Риск: перегрузка control plane, бэкап etcd.
Сеть и безопасность сети
- CNI (Container Network Interface) — плагин сетевой подсистемы (Calico, Cilium, Flannel).
- Kube-DNS / CoreDNS — кластерный DNS.
- NetworkPolicy — L3/L4-политики (кто с кем по IP/портам). Default-deny — базовая гигиена.
- Service Mesh (Istio/Linkerd) — L7-прокси + mTLS, маршрутизация, наблюдаемость, AuthorizationPolicy. Полезно для тонкого контроля BI API/микросервисов.
- mTLS (Mutual TLS) — взаимная аутентификация и шифрование трафика между сервисами.
- Egress — исходящий трафик из кластера (FQDN-политики, Egress Gateway). Риск: «дырка» 0.0.0.0/0.
- Ingress Controller — реализация Ingress (NGINX, HAProxy, Traefik) или Gateway Controller по Gateway API.
- WAF (Web Application Firewall) — фильтрация HTTP-трафика (часто как модуль NGINX/Ingress).
- Load Balancer (L4/L7) — балансировка на внешнем уровне (облака/MetalLB on-prem).
- TLS/cert-manager — управление сертификатами (авто-выдача/продление). Риск: истекшие сертификаты.
Хранилище и данные
- RWO/RWX — режимы доступа к томам: ReadWriteOnce (один pod/нода) и ReadWriteMany (несколько). Для БД — почти всегда RWO.
- CSI (Container Storage Interface) — драйверы хранилищ (Ceph RBD, EBS, etc.).
- Rook/Ceph — распределённое блочное/файловое хранилище в кластере.
- NFS — сетевой файловый ресурс (удобно для файлов/экспортов; риск для БД/журналов).
- Object Storage (S3/MinIO) — объектное хранилище для файлов/бэкапов/«тёплых/холодных» слоёв.
- Iceberg/Hudi/Delta Lake — табличные форматы на объектном хранилище: ACID, schema evolution, time travel.
- Hive Metastore / Catalog — каталог таблиц для Trino/Spark/Iceberg.
- ReclaimPolicy (Retain/Delete) — поведение PV после удаления PVC (для данных — чаще Retain).
- PITR (Point-in-Time Recovery) — восстановление БД на момент времени (WAL-архивы для PG, backup для CH/GP).
- Backup/Restore (Velero/Stash, WAL-G/pgBackRest, clickhouse-backup) — резервные копии и восстановление.
Производительность и ресурсы
- Requests/Limits — гарантии и верхние границы CPU/памяти пода. Риск: отсутствие — нестабильный планировщик, OOM.
- QoS классы — Guaranteed/Burstable/BestEffort по заданным ресурсам.
- HPA (Horizontal Pod Autoscaler) — автоскейл по метрикам (CPU/RAM/кастом).
- VPA (Vertical Pod Autoscaler) — рекомендации/перезапуск с «новыми» requests.
- Cluster Autoscaler (CA) — масштабирование пулов узлов.
- KEDA — автоскейл по внешним событиям (очереди/Kafka).
- TopologySpreadConstraints / Affinity/Anti-Affinity — распределение подов по зонам/узлам.
- PDB (PodDisruptionBudget) — бюджет на одновременные «выпадения» подов при drain/апгрейде.
- Over-subscription — завышенные лимиты/заниженные requests → OOM, троттлинг.
- Spot/Preemptible — дешёвые прерываемые узлы; уместны для эластичных ETL/тяжёлых вычислений.
Наблюдаемость и эксплуатация
- Prometheus/Grafana — метрики/дашборды.
- metrics-server / kube-state-metrics — системные метрики/состояния объектов.
- Loki/EFK (Elasticsearch-Fluentd-Kibana) — логирование.
- Alertmanager — маршрутизация алертов.
- Tracing (Jaeger/Tempo/OpenTelemetry) — распределённые трейсы (полезно для BI API/микросервисов).
- SLI/SLO/Error Budget — индикаторы/уровни обслуживания и бюджет ошибок.
- Burn-rate — скорость «сжигания» бюджета ошибок (пороговые алерты).
- Runbook/Playbook — инструкции по инцидентам и релизам.
Безопасность платформы
- RBAC (Role-Based Access Control) — права для пользователей/сервис-аккаунтов.
- ServiceAccount / Token — идентичность пода в API k8s.
- Pod Security (Admission) — уровни baseline/restricted (замена PSP).
- OPA Gatekeeper / Kyverno — политики валидации манифестов (запрет :latest, обязательные ресурсы и т.д.).
- Image Scanning (Trivy/Grype/Anchore) — поиск уязвимостей в образах.
- Supply Chain Security (SBOM, cosign) — подпись образов, состав ПО.
- Secrets Store CSI / External Secrets Operator / Vault — интеграции для секретов (динамические/ротация).
- Audit Log — журнал действий в кластере (важно для комплаенса).
GitOps и CI/CD
- GitOps (Argo CD/Flux CD) — декларативное управление через Git → кластер.
- Helm / Kustomize — пакетирование и патчинг манифестов.
- SSA (Server-Side Apply) — «умное» применение с отслеживанием владельца полей.
- Canary / Blue-Green / Rolling Update — стратегии выката.
- Pipeline Secrets — управление секретами в CI (OIDC-федерация, short-lived токены).
- ADR (Architecture Decision Record) — фиксация архитектурных решений.
Обновления и совместимость
- SemVer / Minor/patch — семантические версии, минорные апгрейды кластера.
- API Deprecation Policy — правила удаления старых версий API (нужно мигрировать Ingress, CronJob и т. п.).
- kubeadm/kubespray/kOps/K3s — утилиты/дистрибутивы для установки.
- Managed Kubernetes — управляемые сервисы (Yandex MK8s, GKE/EKS/AKS).
- Pluto/kubent/kubeconform — поиск устаревших API и валидация схем.
- Webhook (Mutating/Validating) — перехват и проверка запросов к API (осторожно при апгрейдах).
- etcd snapshot — резерв конфигурационного состояния кластера.
BI/DWH-специфика
- BI-платформы (Superset/Metabase/российские: PIX BI, Visiology, Модус BI) — визуализация/отчёты; важно: SSO, кэш, пул соединений, лимиты.
- Trino/Presto — распределённый SQL-движок по разным источникам (S3/Iceberg/CH/PG).
- ClickHouse (CH) — колоночная БД: MergeTree, Replicated, Distributed, Keeper (координация). В k8s — оператор, RWO-диски, TTL → S3.
- Postgres Pro (PG) — реляционная БД; Patroni/pgpool/HA-паттерны, WAL-архив, PITR.
- Greenplum (GP) — MPP-БД: мастер/стэндбай, сегменты/зеркала. В k8s — StatefulSet на RWO и аккуратный interconnect.
- Kafka/Debezium — шина событий и CDC из OLTP.
- Airflow/Dagster — оркестрация ETL/ELT.
- dbt Core — трансформации SQL-моделей (инкременты/тесты).
- Data Catalog/MDM — каталог/мастер-данные (Arenadata DC, «Гармония» и др.); важно: SSO, роли, API/lineage.
- RLS/CLS (Row/Column-Level Security) — разграничение доступа в BI/БД по строкам/столбцам.
- Query Pushdown — выполнение вычислений в СУБД, а не в BI.
Экономика/управление стоимостью
- TCO/ROI — полная стоимость владения / окупаемость.
- Capacity Planning — планирование ресурсов (CPU/Memory/IOPS/Network).
- FinOps — практика управления расходами (автоскейл, spot, квоты/лимиты, ретеншн логов).
- Cold/Warm/Hot — классы данных по частоте доступа (S3/блок/локальный NVMe).
- Retain/TTL — политики хранения и авто-очистка (CronJob, логи, отчёты).
Надёжность и DR
- HA (High Availability) — отказоустойчивость (репликации, кворумы, PDB).
- DR (Disaster Recovery) — восстановление после аварии (backup-only / active-passive).
- Chaos Engineering — искусственные сбои для проверки устойчивости.
- SLA/SLM — соглашение об уровне сервиса/управление жизненным циклом SLA.
- MTTR/MTBF — среднее время восстановления/безотказной работы.
Управление качеством данных и метаданными
- DQ (Data Quality) — проверки качества (Great Expectations).
- SLA витрин — сроки готовности/актуальности отчётных наборов.
- Lineage (OpenLineage/Marquez) — происхождение данных (от источника до отчёта).
- Steward/Owner — стюард/владелец датасета (ответственные роли).
Термины эксплуатации и практик
- Runbook — инструкция на инцидент (что делать по шагам).
- Playbook — типовой процесс (релиз, миграция).
- SMOKE-тесты — базовая проверка «сервис жив», «дашборды строятся».
- Canary Node/Pool — пилотная группа узлов/подов для безопасной обкатки.
- Break-glass — временное ручное вмешательство с последующим оформлением в Git.
Частые анти-паттерны (как «красные флаги» в глоссарии)
- :latest — плавающий тег образа → непредсказуемость.
- Нет requests/limits — нестабильность планирования/HPA.
- Данные в emptyDir/RWX для БД — риск потери/коррупции.
- Плоская сеть (нет NetworkPolicy) — отсутствие изоляции.
- Ручные kubectl edit в проде — дрейф от GitOps.
- PSP-наследие — устаревшая модель; переход на Pod Security/Kyverno.



