Матрица компетенций и дорожная карта развития команды на 3–6 месяцев для платформы BI/DWH на Kubernetes
Назначение документа
- Дать прозрачные ожидания для ролей (что значит «готов к продакшену»).
- Сформировать T-shaped профиль специалистов: глубокая зона + базовая грамотность в смежных.
- Задать измеримые критерии (практические проверки), не «прочитали – молодцы».
- Спланировать 3–6 месяцев развития: чему учиться, какие артефакты сдать.
Командная топология и роли
Рекомендуемая минимальная команда на один кластер и один домен данных (можно совмещать роли в малых командах):
|
Роль |
Зона ответственности (RACI кратко) |
|---|---|
|
Kubernetes Platform Engineer / SRE |
R за кластер, CNI/CSI/Ingress, GitOps, апгрейды, DR; A за SLO инфраструктуры |
|
DevOps/CI-CD Engineer |
R за CI/CD, артефакты (чарты, манифесты), релизную политику, безопасность пайплайнов |
|
DBA (Postgres/ClickHouse/Greenplum) |
R за БД, репликацию, PITR, производительность, планы запросов |
|
Data Engineer / Orchestrator (Airflow/Dagster/Kafka) |
R за конвейеры, SLA витрин, дебаг ETL, ресурсные профили |
|
BI Developer (Superset/Metabase/российские BI) |
R за модели/дашборды, кэш/соединения, SSO/RLS, лимиты |
|
NetSec/Platform Security |
R за RBAC, PodSecurity/OPA, NetworkPolicy/mesh, секреты, аудит |
|
Observability Engineer |
R за Prometheus/Grafana/Loki/алертинг, SLI/SLO и burn-rate |
|
Архитектор/Продакт платформы |
A за roadmap, приоритезацию, согласование нефункциональных требований |
Примечание: в маленьких командах SRE = DevOps, Observability = SRE; BI Developer часто у data-команды.
Уровни компетенций (общая шкала)
- L1 (База) — понимает концепции, выполняет по инструкциям/под присмотром.
- L2 (Рабочий уровень) — работает самостоятельно, решает типовые инциденты.
- L3 (Продвинутый) — проектирует решения, делает ревью, автоматизирует.
- L4 (Лидер/Эксперт) — определяет стандарты, ведёт сложные миграции/DR, обучает других.
Матрица компетенций (по доменам)
Kubernetes Core, сети, хранилище
|
Домен → / Уровень ↓ |
L1 |
L2 |
L3 |
L4 |
|---|---|---|---|---|
|
K8s базовые объекты |
Понимает Pod/Deployment/Service |
Пишет манифесты, probes, RBAC |
Проектирует StatefulSet/PDB/TopologySpread |
Задаёт стандарты, проводит апгрейды API |
|
Сеть (CNI/Ingress) |
Отличает Service типы |
Настраивает Ingress/TLS |
Проектирует egress, NetworkPolicy, mTLS |
Проектирует mesh/egress-шлюз, сегментацию |
|
Хранилище (CSI/PVC) |
RWO/RWX, PV/PVC |
Настраивает SC, бэкапы Volumes |
Пишет runbook PITR, tiered storage |
Проектирует перформанс, DR-копии |
Безопасность и политики
|
Домен → / Уровень ↓ |
L1 |
L2 |
L3 |
L4 |
|---|---|---|---|---|
|
RBAC/PodSecurity |
Пользуется SA/roles |
Проектирует роли минимум-прав |
Имплементирует PodSecurity baseline/restricted |
Выстраивает Kyverno/Gatekeeper контроль |
|
Секреты/SSO |
ConfigMap/Secret |
Vault/External Secrets, OIDC |
SSO c групповым маппингом, ротация ключей |
Политики токенов, аудит, комплаенс |
GitOps, CI/CD, автоматизация
|
Домен → / Уровень ↓ |
L1 |
L2 |
L3 |
L4 |
|---|---|---|---|---|
|
GitOps |
Pull-реквесты, basic Helm |
Артефакты, промо Dev→Stage→Prod |
Мультикластер/мульти-тенант GitOps |
Организационные стандарты, полигоны тестов |
|
CI/CD |
Запускает пайплайны |
Helm/Kustomize, секреты в CI |
Политики качества (линтеры, OPA) |
Supply chain security, подписи образов |
|
API автоматизация |
kubectl по инструкции |
Python-скрипты (SSA), Ansible |
Контроллеры (Go), Terraform каркас |
Платформенные операторы/CRD |
Данные/БД/BI/Оркестрация
|
Домен → / Уровень ↓ |
L1 |
L2 |
L3 |
L4 |
|---|---|---|---|---|
|
DBA (PG/CH/GP) |
Базовые бэкапы |
PITR/репликация |
Тюнинг и планы запросов, HA |
DR стратегии, миграции версий/кластера |
|
Оркестрация (Airflow/Kafka) |
DAG по шаблону |
SLA/DQ/ретраи, ресурсы |
Масштабирование воркеров/KEDA |
Канареечные конвейеры, zero-downtime |
|
BI (Superset/Metabase/российские) |
Подключает источник |
Кэш, пулы, лимиты, SSO |
RLS/CLS, нагрузочные профили |
Референс-паттерны, бюджет СУБД |
Наблюдаемость/Надёжность/Финансы
|
Домен → / Уровень ↓ |
L1 |
L2 |
L3 |
L4 |
|---|---|---|---|---|
|
Observability |
Дашборды базовые |
SLI/SLO, алерты, логирование |
Трейсинг, корелляция, burn-rate |
Охват 100%, SLO-review/ошибкобюджет |
|
SRE/Надёжность |
Runbook’и по инструкции |
Постмортемы, PDB, хаос-тесты |
DR/restore-дни, канареечные ноды |
Организационный SRE процесс |
|
FinOps/сайзинг |
Requests/limits базовые |
TCO оценка, квоты |
Автоскейл, spot-пулы, overprovision |
Фин-модели, KPI стоимости/SLA |
Практические проверки (evidence-based)
Каждый домен имеет контрольные задания — их выполнение фиксируется артефактами (PR, чарты, дашборды, отчёты):
- K8s Core (L2): поднять StatefulSet Postgres с PVC (RWO), готовность через startup/readiness, PDB ≥ 1, бэкап/restore в S3 (отчёт).
- NetworkPolicy (L3): включить default-deny, сделать allow-сети для Ingress/BI/DB + egress к S3; представить схему потоков.
- GitOps (L2): собрать Helm-чарт BI-приложения (values для Dev/Stage/Prod), настроить ArgoCD, показать промо и rollback через PR.
- Security (L3): интеграция с OIDC, Kyverno: запрет :latest, обязательные ресурсы; демонстрация отказа «плохого» манифеста.
- Observability (L2→L3): дашборд SLO (p95 latency, ошибки, HPA=max), алерты burn-rate; корелляция с ресурсами.
- DBA (L3): план запроса, индекс/партиция (PG/CH), измерение до/после; PITR до T-часа; отчёт с шагами и метриками.
Дорожная карта 3–6 месяцев
Месяцы 0–1: База и быстрая гигиена
- Общие воркшопы: Модули 1–6, 23–26 (из вашего курса).
- Артефакты: базовый Helm-чарт «BI-шлюз», Namespace-пакет (Quota/LimitRange/PodSecurity/NP), SSO на стейдже.
- Цели: все роли достигают L1, ключевые (SRE/DevOps/DBA/DE) — L2 по ядру.
- Риски: перегрузка задачами → выделяйте 20–30% времени на обучение.
Месяцы 2–3: Продукционность и безопасность
- Работы: включить default-deny в прод-ns, внедрить Vault/ESO; GitOps промо Dev→Stage→Prod; алерты SLO.
- Артефакты: runbook инцидентов, playbook выката, policy-каталог (Kyverno/Gatekeeper).
- Цели: SRE/DevOps/NetSec — L3 по сети/безопасности; BI/DBA — L2–L3 (кэш/пулы, PITR).
Месяцы 4–6: Масштабирование и устойчивость
- Работы: autoscaling (HPA/VPA/CA), spot-пулы, DR-репетиция; миграция устаревших API; кейс ClickHouse/Greenplum (модули 28–29).
- Артефакты: DR-план, отчёт о хаос-тесте, экономический отчёт (TCO/FinOps), ADR по egress-стратегии.
- Цели: лидеры доменов достигают L4 по своим зонам; покрытие политиками ≥ 80%, SLO и burn-rate в повседневной работе.
Индивидуальные планы развития (по ролям)
SRE/Platform
- Фокус: сеть/Ingress/egress, CSI, апгрейды, DR.
- Цели 3 мес: L3 по NetworkPolicy/Ingress/TLS/CSI; GitOps на все системные компоненты; runbooks & алерты.
- Цели 6 мес: DR-день, blue/green кластер, autoscaling пулы (вкл. spot), стабильные апгрейды без даунтайма.
DevOps/CI-CD
- Фокус: Helm/Kustomize, Argo/Flux, supply-chain security.
- 3 мес: чарт-фабрика, шаблоны values, политический гейт (линтеры/OPA).
- 6 мес: подписи образов, автогенерация релизов, мультикластерные промо.
DBA (PG/CH/GP)
- Фокус: HA/PITR/кворум/репликации, планы запросов, ресурсные очереди.
- 3 мес: PITR и резерв; набор дашбордов производительности.
- 6 мес: наставничество BI/DE, стандарты схем/индексов, участие в DR.
Data Engineer / Orchestrator
- Фокус: SLA/ретраи, KEDA, ресурсные профили, DQ/lineage.
- 3 мес: стабильные DAG’и с SLO/метриками; масштабирование воркеров.
- 6 мес: CDC→S3/Iceberg→Trino→dbt конвейеры с SLO.
BI Developer
- Фокус: кэш/квоты, SSO/RLS, устойчивые дашборды, нагрузочное тестирование.
- 3 мес: лимиты/таймауты, пулы соединений, smoke-наборы; «чёрный список» тяжёлых паттернов.
- 6 мес: витрины/матвью, аудит дешбордов, контроль расходов на запросы.
NetSec/Platform Security
- Фокус: PodSecurity, RBAC минимум-прав, Kyverno, mTLS/mesh, аудит.
- 3 мес: baseline политика и NP по умолчанию во всех prod ns.
- 6 мес: coverage ≥ 80%, Egress-контур (mesh/egress GW или CNI-FQDN), регулярные pentest-спринты.
Observability
- Фокус: единые метрики/лог-форматы, трейсинг, burn-rate.
- 3 мес: SLO на ключевые сервисы (BI, DB, ingress), алерты.
- 6 мес: трейсинг end-to-end, отчёты SLO-compliance, «шум» < 5% алертов.
Метрики зрелости и готовности (KPI)
- DORA: change failure rate < 15%, lead time < 1 нед.
- SLO: выполнение ≥ 99% для BI-портала; MTTR < 30 мин для S2.
- Политики: покрытие Kyverno/PSA ≥ 80% прод-подов.
- FinOps: расходы/запрос в пределах бюджета; доля spot-ресурсов ≥ 20% (где уместно).
- Обучение: выполнено ≥ 80% практических заданий из матрицы.
Риски организационные и как их снимать
|
Риск |
Проявление |
Митигирующие действия |
|---|---|---|
|
Silo/одиночные герои |
Знание у 1 человека |
Парное дежурство, ротация, общие runbook’и |
|
Нет времени на обучение |
«Пожары», техдолг |
Резерв 20–30% времени на апгрейды/учёбу |
|
Быстрые «хотфиксы» мимо GitOps |
Дрифт и сюрпризы |
Break-glass с пост-PR, аудит |
|
Охват политиками низкий |
Инциденты безопасности |
Централизованный policy-каталог, ревью |
|
Перфоманс деградирует |
p95 растёт, жалобы |
Еженедельный SLO-review, backlog перф-работ |
Приложения: шаблоны оценок
Шаблон индивидуальной оценки (пример)
|
Домен |
Требуемый уровень |
Доказательство (ссылка на PR/дашборд/отчёт) |
Итог |
|---|---|---|---|
|
GitOps (Helm/Kustomize) |
L2 |
PR-ссылки, argo-history |
✓ |
|
NetworkPolicy/mTLS |
L3 |
Манифесты, схема потоков, тесты deny |
☐ |
|
PITR/бэкап |
L2 |
Отчёт restore, логи |
✓ |
|
SLO/алерты |
L2 |
Дашборд, правило burn-rate |
✓ |
Чек-лист «готов к продакшену» (краткий)
- Namespace-пакет (Quota/LimitRange/PodSecurity/NP).
- GitOps + SSA + PR-гейты.
- SSO/секреты через ESO/Vault.
- Дашборды SLO + алерты.
- Бэкапы и недавний успешный



