Учебный курс по DWH
В рамках курса вы познакомитесь с основными понятиями и задачами, возникающими при создании хранилищ данных. Поймете, как цели влияют на выбор архитектуры и к каким последствиям может привести недостаточное внимание к компонентам. Составите представление о ролях и влиянии участников команды на результат.
В программе курса будут описаны практические подходы к проектированию и внедрению хранилищ данных и его компонент. Вы рассмотрите управление жизненным циклом, включая вывод из эксплуатации и миграцию на новые системы, затронете темы управления данными и построения сервисов на их основе.
В практической части слушатели разобьются на две команды: одна из команд проработает проект по миграции хранилища данных с учетом стратегических целей развития предприятия, а вторая оценит его с точки зрения возможностей, ресурсов и сроков.
1. Введение
- Понятие «хранилище данных». Его возможности и ограничения
- Зачем создается DWH, какую бизнес-задачу оно решает
- DWH как продукт: платформа, инструменты, масштабирование команды
- Что такое DWH и почему без них данные компании почти бесполезны
- Архитектура корпоративного хранилища данных
- Краткий ликбез по data warehouse
- Что такое хранилище данных?
- Полное руководство по происхождению данных в 2022 году
- Что такое хранилище данных Data Warehouse и зачем оно бизнесу
- Антихрупкость архитектуры хранилищ данных
- Методология построения DWH
- Пошаговый план по внедрению DWH
- Правильная архитектура данных
2. Компоненты и архитектура
- Архитектура Data Warehouse: традиционные vs. облачные модели
- Архитектура Data Warehouse: подробное описание
- Компоненты хранилища данных
- Уверенная аналитика начинается с правильного хранилища данных: полный гид по выбору DWH для бизнеса
- Типовые компоненты и протекающие процессы
- Обзор основных компонентов (stage, ods, dds, datamart, bi, metadata) и процессов (ETL, ELT, DQ, lineage)
- СУБД для аналитики: Greenplum или ClickHouse?
- ClickHouse vs PostgreSQL в мельчайших подробностях
- Как выбрать СУБД?
- Хранилище корпоративных данных: компоненты EDW, ключевые концепты и типы архитектуры
- Метрики качества данных для DWH (или KPI для KPI)
- Основные компоненты OLAP
- Инкрементальное обновление данных: как работает, зачем нужно, и в чём кроются риски
- База по базам данных — Storage
- Как мы построили внутреннее хранилище данных в ClickHouse (и как это повторить)
- КХД живёт не от архитектуры, а от дисциплины: типовые ошибки и как их закрыть на годы вперёд
- Горизонтальное масштабирование баз данных: полное руководство по репликации, партиционированию и шардированию от экспертов в области высоконагруженных систем
- Аналитика как двигатель бизнеса: от данных к действиям
Это комплексная программа, которая от начала и до конца проведёт вас через весь цикл работы со StarRocks — от установки и настройки до проектирования архитектуры, оптимизации и интеграции с BI-системами. Мы учим не только «нажимать кнопки», но и понимать методологию, уметь обосновать архитектурные решения и избегать типичных ошибок при внедрении. Курс разработан так, чтобы его можно было использовать как инструкцию по внедрению StarRocks в реальном проекте — с готовыми DDL-примерами, схемами архитектуры, чек-листами по сайзингу и безопасной эксплуатации.
Это практическая программа для архитекторов данных, SRE/DevOps, DBA, дата-инженеров и BI-разработчиков, которая помогает принять взвешенное решение «нужен ли k8s» и безопасно довести платформу до продакшена. Вы последовательно пройдёте путь от TCO/ROI и критериев целесообразности до настройки сети, хранения и безопасности (RBAC, PodSecurity, NetworkPolicy, mTLS/mesh, SSO), а затем освоите GitOps/CI-CD, наблюдаемость (SLI/SLO, алертинг, логи, трейсинг) и экономику (сайзинг, autoscaling, spot). Отдельные блоки посвящены stateful-нагрузкам и российским решениям (PIX BI, Visiology, Модус BI, Arenadata, Postgres Pro, Гармония MDM), а также ClickHouse, Greenplum, Trino, Iceberg и полному конвейеру CDC→S3/Iceberg→dbt→BI.
3. Управление данными - Data Governance
- Как управлять версиями вашего SQL
- Общие и частные вопросы управления данными предприятия
- Информация рассматривается как актив, приносящий ценность и имеющий затраты на получение
- Концепция «мастер-данные» и системы по их управлению – MDM
- Основы моделирования данных
- Моделирование данных: почему игнорирование архитектуры стоит времени и денег
4. Методики проектирования хранилищ
- Концепции Инмона, Кимбалла и DataVault
- Построение хранилища данных для традиционной отрасли
- Классические подходы к проектированию хранилищ данных
- Data Warehouse Layering Best Practices
- ETL
- Шаги проектирования хранилища
- Типовые приемы и инструментарий при создании хранилища данных
- Экспертиза участников и инфраструктуры
- Обзор гибких методологий проектирования DWH
- Рекомендации по разработке баз данных и клиентских приложений
- Снежинка, Data Vault, Anchor Modeling. Какая методология проектирования DWH подойдет для вашего бизнеса?
- Моделирование данных и архитектура хранилищ данных: концепции и сравнение методологий Kimball, Data Vault 2.0 и Anchor Modeling с акцентом на практическую реализацию
- Построение витрин регуляторной отчётности в финансовых системах
- Построение Data Mart в SQL: от staging до аналитической модели
- Моделирование витрин данных: факты, измерения и семантика
- Медленно изменяющиеся измерения (SCD) в витринах данных
5. Область хранения исходных данных - Stage
- Потребность в хранении исходных данных из системы источника
- Типичные ошибки при организации данной области и ее отличие от «озера данных»
6. Области постоянного хранения - ODS и DDS
- Слои операционного и многомерного хранения данных
- Процессы извлечения, очистки, контроля и сохранения - ETL\ELT
- Трансформация в целевую схему хранения
- Slowly Changing Dimensions (SCDs)
7. Системы-потребители данных хранилища
- Типовые сценарии использования данных из хранилищ
- Основные потребители - системы бизнес-аналитики «BI»
- Устройство типовой БИ системы и причины их большого разнообразия
8. Новые вызовы в развитии хранилищ данных
- Обзор основных проблем, с которыми сталкиваются хранилища при росте
- Новые вызовы в области машинного обучения
- Концепция Data Mesh как альтернатива дальнейшего развития.
- Импортозамещение BI своими руками
9. DBeaver
DBeaver — это клиентское программное обеспечение SQL и инструмент администрирования базы данных. Для реляционных баз данных он использует интерфейс прикладного программирования (API) JDBC для взаимодействия с базами данных через драйвер JDBC. Для других баз данных (NoSQL) используются собственные драйверы баз данных. Он предоставляет редактор, поддерживающий завершение кода и подсветку синтаксиса. Он предоставляет архитектуру подключаемых модулей (основанную на архитектуре подключаемых модулей Eclipse), которая позволяет пользователям изменять большую часть поведения приложения, чтобы обеспечить специфичные для базы данных функции или функции, независимые от базы данных. Он написан на Java и основан на платформе Eclipse.
- Установка DBeaver
- Лицензия DBeaver
- DBeaver: базовые операции
- DBeaver: создание подключения
- Прокачка SQL–запросов с помощью DBeaver
- Дамп БД MySQL из удаленного сервера в локальное устройство с помощью DBeaver
- Добавление драйвера Cassandra JDBC в DBeaver Community Edition
- Начало работы с DBeaver на распределенной базе данных SQL
- Как подключить DBeaver к REST через драйвер JDBC
- Исправление проблемы неправильного часового пояса в DBeaver с помощью ClickHouse
- DBeaver на удаленном сервере: Как настроить соединения ClickHouse и Oracle
- Установка и настройка DBeaver на Linux (Ubuntu)
- Как установить и работать с DBeaver в Linux.
- Запрос данных Excel с помощью DBeaver: Руководство для начинающих
- Оптимизация работы с базами данных: Моделирование данных с помощью Dbeaver
Хотите узнать больше о мире данных?
- Современная архитектура хранилища данных — расширенное и углублённое продолжение базового DWH-курса. Здесь вы найдете больше практики, больше технологий и полное понимание современного подхода к построению хранилищ данных.
- PostgreSQL, Greenplum, ClickHouse — курсы по конкретным СУБД, которые часто применяются в проектах по аналитике и построению DWH.
- Apache Airflow и NiFi — курс по современным оркестраторам данных (ETL-процессы), которые позволяют строить надёжные и управляемые пайплайны.
- «Руководство по DWH: Архитектура, Инструменты, Внедрение» — практический курс для тех, кто участвует в проектах внедрения хранилищ данных.
- Курсы по Greenplum, ClickHouse, Airflow и NiFi — углублённое изучение каждой технологии, примеры из реальных проектов.
- Курсы по Arenadata — работа с российскими промышленными решениями в области хранения и обработки данных.
Книги Кимбалла
EfCore.SchemaCompare — инструмент для сравнения схем баз данных Entity Framework Core (EF Core). Он позволяет проверять различия между базой данных и миграциями, обеспечивая удобный способ отслеживания изменений в схемах данных. Этот инструмент может быть полезен для управления версиями баз данных и предотвращения ошибок, связанных с несовпадением структуры данных при разработке приложений на EF Core

- Sandbox Governance Model - управление песочницами, доступами, стоимостью и рисками
- Sandbox-архитектура для DWH и ML-аналитики - проектирование и изоляция сред
- Классификация песочниц данных: типы, сценарии использования и жизненный цикл
- Песочницы данных: SQL, BI и ML-sandbox в корпоративной data-платформе
- SQL для DWH: оптимизация аналитических запросов и работа с большими объёмами
- Fact & Dimension Tables на практике
- Выбор типов фактов: transaction, snapshot, accumulating
- Гранулярность фактов и бизнес-смысл данных: как не сломать аналитику



