Полное руководство по использованию Iceberg для хранилищ данных
Современные хранилища данных требуют не только масштабируемости и гибкости, но и надежных механизмов управления данными, обеспечивающих консистентность, версионирование и контроль изменений. Apache Iceberg представляет собой открытый табличный формат нового поколения, который решает ключевые ограничения классических Data Lake, добавляя поддержку ACID-транзакций, эволюции схем и эффективной работы с большими объемами данных.
В этом разделе рассматриваются архитектурные принципы Iceberg: организация метаданных, управление версиями и snapshot-модель, механизмы оптимизации запросов и интеграция с современными аналитическими движками, такими как Spark, Flink и Trino. Особое внимание уделяется вопросам эксплуатации, миграции на Iceberg и построения устойчивых Lakehouse-архитектур, что позволяет использовать его как основу для современных аналитических и AI-платформ.
- Введение в Iceberg: цели курса и контекст корпоративных хранилищ данных
- Термины и базовые концепции Iceberg
- Архитектура Iceberg: таблица как совокупность снимков и метаданных
- Хранение данных: data files, delete files и манифесты
- Модель данных и эволюция схемы: типы, nullable, rename и совместимость
- Эволюция partitioning: partition specs, динамические разделы
- ACID, транзакции и консистентность: атомарные коммиты и издержки
- Версионирование и time travel: чтение по состоянию таблицы
- Удаление, обновление и MERGE: delete files, position deletes и upserts
- Поиск и фильтрация: data skipping, статистика файлов и фильтры
- Прогнозирование и оптимизация исполнения: prune и фильтры на уровне метаданных
- Форматы файлов и компрессия: Parquet, ORC, кодировки и схемы эволюции
- Хранение и каталоги: HadoopCatalog, HiveCatalog, GlueCatalog, Nessie как реестр
- Архитектура хранения в облаке: S3, GCS, ADLS и локальные хранилища
- Интеграция с Spark: драйверы, совмещение и паттерны
- Интеграция с Flink: конвейеры, connectors и транзакционные сценарии
- Интеграция с Trino/Presto: запросы, оптимизация и совместимость
- Интеграция с Hive: совместимость с SQL и мета-хранилищем
- Безопасность и управление доступом: модели IAM/ABAC и политики безопасности
- Мониторинг и операционная устойчивость: метрики, алерты, логи и трассировки
- Эксплуатационные практики: вакуум, expire, архивы и очистка снимков
- Миграции и переход на Iceberg: стратегии переноса существующих дата-слоев
- Риски и проблемы: совместимость, миграции, откаты и деградация
- Архитектурная стратегия внедрения Iceberg: целевая архитектура и принципы
- Дорожная карта и стандарты развития Iceberg: стандарты, совместимости, будущее
- Практические кейсы внедрения: отраслевые сценарии и эксперименты
- Практическое руководство по реализации: проектирование, конфигурация, CI/CD
- Тестирование и качество данных: методики тестирования и верификации
- Управление данными и регуляторика: аудит, хранение и ретеншн



