FAQ по Arenadata Hadoop (ADH)
Чем ADH отличается от стандартного Hadoop?
Hadoop включает не только файловую систему HDFS и менеджер ресурсов YARN, но и множество инструментов для работы с большими данными. Настройка такой экосистемы и ее эксплуатация — сложная инженерная задача.
С Arenadata Cluster Manager (ADCM) этот процесс значительно упрощается:
- Arenadata Hadoop (ADH) поставляется с заранее настроенным и оптимизированным набором компонентов Apache, включая HDFS, YARN, HBase, Spark, Hive, Sqoop, Solr, Impala.
- В отличие от "ванильного" Hadoop, ADH имеет встроенную систему безопасности на базе Kerberos, Ranger и Knox с возможностью интеграции с Active Directory.
- В состав входит система мониторинга, обеспечивающая контроль всех компонентов ADH.
Какие инструменты управления и мониторинга доступны в ADH?
- Управление сервисами в кластере.
- Централизованное управление кластером (запуск, остановка, изменение конфигурации сервисов, управление ресурсами).
- Возможность пошаговой установки сервисов на любое количество узлов.
- Настройка прав доступа к строкам и столбцам баз данных, файлам HDFS (включая доменную авторизацию через LDAP).
- Полноценная установка системы без подключения к интернету.
Какие механизмы безопасности реализованы в ADH?
ADH интегрирован с системой управления безопасностью Arenadata Platform Security (ADPS), которая включает:
- Аутентификацию через Kerberos, интеграцию с LDAP/Active Directory.
- Поддержку Apache Knox и Apache Ranger для безопасного доступа к кластерам Hadoop.
- Ведение журналов и аудит доступа.
В совокупности ADPS обеспечивает комплексную защиту данных, управление доступом на основе политик и контроль безопасности на всех уровнях.
Как реплицируются данные в ADH?
HDFS обеспечивает надежное хранение больших файлов за счет разбиения их на блоки одинакового размера. Эти блоки реплицируются между серверами для обеспечения отказоустойчивости.
Какие форматы хранения данных поддерживаются?
ADH реализует концепцию "озера данных" (Data Lake), что позволяет загружать в кластер данные в любом формате.
Для аналитической обработки и работы с Spark, Hive, Impala рекомендуется использовать колоночные форматы хранения, такие как Parquet и ORC, которые обеспечивают эффективное сжатие и оптимизацию запросов.
Каков максимальный объем данных, который можно хранить в ADH?
Теоретически ограничений нет. Известны кластеры Hadoop объемом 100+ ПБ. LinkedIn, например, использует Hadoop-кластер на 10 000+ узлов, хранящий 500+ ПБ данных.
Поддерживается ли сжатие данных?
Да, сжатие не только уменьшает объем хранимых данных, но и ускоряет аналитическую обработку, так как снижает объем данных, передаваемых между узлами.
Что такое Apache Hive?
Hive — это SQL-движок, работающий поверх Hadoop, который использует HDFS для хранения данных. Он предназначен для выполнения SQL-запросов к большим объемам данных, обеспечивая низкую стоимость хранения и масштабируемую аналитику.
Что такое HBase?
HBase — распределенная NoSQL-база данных типа key-value, предназначенная для OLTP-нагрузок в экосистеме Hadoop. В сочетании с Apache Phoenix поддерживает SQL-запросы и индексирование, что делает его частью SQL-on-Hadoop.
Что такое Apache Spark?
Spark — высокопроизводительная платформа параллельной обработки, предназначенная для инженерии данных, анализа и машинного обучения в Hadoop. Поддерживает API для Python, Java, Scala, R.
Что такое Impala?
Impala — высокопроизводительный SQL-движок MPP, предназначенный для обработки больших объемов данных в реальном времени. Он выполняет интерактивные запросы к данным в HDFS и легко интегрируется с BI-инструментами.



