Hadoop с нуля: архитектура HDFS и Data Lake
Курс даёт системное понимание Hadoop как основы для работы с большими данными и построения корпоративных Data Lake. Вы разберётесь, как устроено распределённое хранение данных в HDFS, как работает YARN и каким образом Hadoop обеспечивает масштабируемость и отказоустойчивость.
Внутри — архитектура кластера, форматы хранения (Parquet, ORC, Avro), обработка данных через MapReduce и Spark, а также интеграция с экосистемой Hadoop. Отдельный акцент сделан на построении Data Lake, управлении метаданными и безопасности.
Курс помогает понять фундамент big data архитектуры и даёт базу для работы с современными data-платформами.
- Введение в Hadoop и большие данные: контекст, термины и цели
- Архитектура экосистемы Hadoop: основные компоненты
- История Hadoop: эволюция от MapReduce к YARN
- Основы распределенного хранения: принципы HDFS
- Терминология Hadoop: ноды, блоки, репликация, namespace
- Архитектура HDFS: Namenode, Datanode, HA и журналируемый namespace
- Управление метаданными и безопасностью в HDFS
- Репликация, консистентность и отказоустойчивость HDFS
- Форматы хранения и файловые контейнеры: Parquet, ORC, Avro, SequenceFile
- Хранение мелких и больших файлов в HDFS: проблемы и подходы
- Архитектура YARN: ResourceManager, NodeManager, ApplicationMaster
- Планирование ресурсов в YARN: Capacity и Fair Scheduler
- Контейнеризация и выполнение задач в YARN: схемы обновления и fault tolerance
- Методы обработки на Hadoop: MapReduce, Tez, Spark on Hadoop
- Интеграция с источниками данных: HDFS, HBase, Hive, Impala, Sqoop, Flume
- Потоковая и микро-батч обработка: Storm, Kafka, Spark Structured Streaming
- Конвейеры данных и корпоративный Data Lake: архитектурные принципы
- Data Lake и lakehouse: концепции, принципы, сравнение
- Метаданные и каталоги данных: Apache Atlas, Ranger, Sentry
- Безопасность и управление доступом: Kerberos, HDFS ACLs, политики Ranger
- Интеграционные стандарты и протоколы: WebHDFS, Hadoop FS API, REST
- Архитектурные паттерны корпоративного data lake: layered, curated zones, governance
- Инфраструктура развёртывания: on-premises, облако, гибридные модели
- Эксплуатация и операционная модель: мониторинг, алерты, бэкапы, релизы
- Мониторинг, логирование и наблюдаемость: метрики и инструменты
- Развитие и зрелость: дорожные карты, управление данными, масштабирование




