Data Lakehouse vs DWH - выбор архитектуры под бизнес-сценарии
Выбор архитектуры хранения и обработки данных является одним из ключевых стратегических решений для компании, влияющим на гибкость, стоимость и возможности аналитики. Традиционные Data Warehouse (DWH) долгое время оставались стандартом корпоративной аналитики, однако с ростом объемов данных и появлением новых сценариев, таких как машинное обучение и real-time аналитика, на первый план вышли Data Lake и концепция Lakehouse, объединяющая преимущества обоих подходов.
В этом разделе рассматриваются различия и области применения DWH, Data Lake и Lakehouse архитектур, а также критерии их выбора в зависимости от бизнес-задач. Особое внимание уделяется архитектурным принципам, управлению данными, качеству и безопасности, а также экономике внедрения. Такой подход позволяет определить оптимальную архитектуру под конкретные сценарии и выстроить стратегию развития data-платформы с учетом будущих требований бизнеса и технологий.
- Введение: цели курса и базовые понятия
- Бизнес-контекст: требования к данным, KPI и регуляторика
- Терминология и концептуальные рамки: DWH, data lake, lakehouse
- Эволюция архитектуры данных: от EDW к lakehouse
- Архитектурные парадигмы: DWH, data lake, lakehouse и data mesh
- Бизнес-сценарии и критерии выбора архитектуры
- Архитектура lakehouse: принципы, слои и транзакции
- Архитектура традиционного DWH: принципы, слои и ограничения
- Стандарты, форматы и протоколы: Parquet, ORC, Avro, JSON, SQL, ACID
- Метаданные и каталог данных: управление, lineage и бизнес-слой
- Безопасность и соблюдение требований: IAM, RBAC, data masking, аудит и retention
- Управление качеством данных: профилирование, тестирование, мониторинг и SLO
- Архитектура хранения: raw, curated, serving; версии и time travel
- Ингест и обработка данных: ETL, ELT, batch и streaming
- Интеграционные паттерны: CDC, событийная архитектура, API и файловые конвейеры
- Инструменты хранения и транзакций: Delta Lake, Apache Iceberg, Apache Hudi
- Вычислительные платформы: Spark, Flink, SQL-движки, Databricks, Snowflake, BigQuery
- Архитектура обработки потоков и пакетной обработки: режимы, задержки и балансировка
- Модели данных: dimensional, data vault, anchor modeling и схемы согласования
- Архитектура слоя сервиса и семантики: бизнес-слой, BI-слой и semantic layer
- Управление данными и контракты: согласованность, ответственность и SLA
- Стратегии миграции и эволюции: поэтапный переход на lakehouse
- Экономика данных: TCO, ROI, бюджетирование и управляемые расходы
- Управление изменениями и организационная готовность: роли и процессы
- Операционная дисциплина: мониторинг, observability и SRE для данных
- CI/CD и автоматизация данных: пайплайны, тестирование и развёртывание
- Роли и компетенции: дата-архитектор, data engineer, platform engineer, product owner
- Кейсы по отраслевым сценариям: финансы, розничная торговля, телеком, производство
- Data Lakehouse vs DWH: риски архитектуры и способы снижения: безопасность, качество и задержки
- Стандарты будущего: отраслевые и открытые стандарты данных
- Модель зрелости архитектуры данных и способы её оценки
- Развитие карьеры и навыков: план обучения и сертификации




