Техническая документация по Arenadata
Раздел 1. Установка дистрибутивов Arenadata
План установки Arenadata DB (ADB)
Требования к окружению:
- ОС: CentOS 7 / RHEL 7 (или Arenadata OS)
- CPU: от 8 ядер
- RAM: от 32 ГБ
- Диск: SSD/NVMe, желательно выделенный диск под WAL и Data
- Сеть: соединение между узлами кластера по SSH без пароля, скорость от 1 Гбит/с
Этапы установки:
-
Подготовка хостов:
- Создание пользователей (обычно arenadata)
- Настройка /etc/hosts
- Настройка SELinux/Firewall
- Установка ADCM (Arenadata Cluster Manager):
- Скачивание дистрибутива с портала
- Установка через RPM: sudo rpm -ivh adcm-<версия>.rpm
- Доступ к Web-интерфейсу: http://<host>:8000
- Добавление всех хостов в ADCM
- Установка агентского ПО на хосты
- Загрузка bundle с компонентами (ADB, PXF, Monitoring)
- Назначение ролей на хосты (master, segment, standby)
- Выполнение пошаговой установки
- Использование adb status, adb gpstate
- Проверка в ADCM-интерфейсе
- Создание inventory:
- Развертывание компонентов:
- Проверка состояния кластера
План установки Arenadata Streaming, Harmony MDM и Catalog (опционально)
- Установка аналогична: добавление узлов, назначение ролей, последовательное выполнение задач через ADCM.
Раздел 2. Компонент PXF (Platform Extension Framework)
Назначение PXF
PXF — это расширение для доступа из Arenadata DB к внешним источникам данных:
- Hadoop HDFS
- Hive
- Amazon S3 / MinIO
- JDBC-совместимые СУБД
- REST API
Архитектура
- PXF устанавливается как сервис на каждый сегментный узел
- Использует Tomcat в качестве контейнера
- Общается с Greenplum через GPFDist-протокол
Конфигурация
- Установка в составе ADB (через ADCM или вручную)
-
Конфигурация:
- Файл: /etc/pxf/conf/pxf-site.xml
-
Основные параметры:
- pxf.service.user — пользователь, от имени которого будет работать сервис
- pxf.service.address — адрес, по которому сервис доступен
- pxf.fs.defaultFS — если подключается Hadoop, указывается адрес HDFS
- Проверка доступа и тестирование подключения к источникам данных
- Перезапуск сервиса:
systemctl restart pxf
Примеры SQL-запросов
CREATE EXTERNAL TABLE ext_table (
id int,
name text
)
LOCATION ('pxf://my-bucket/data.csv?PROFILE=s3:text')
FORMAT 'CSV';
SELECT * FROM ext_table;
Раздел 3. Компонент LogSearch (Логирование и аудит)
Назначение
LogSearch — инструмент агрегации логов компонентов Arenadata (ADB, Streaming, Catalog и др.).
Состав
- Logstash (сбор логов и трансформация)
- Elasticsearch (централизованное хранилище логов)
- Kibana (визуализация и дашборды)
- Filebeat или Fluentd (агенты для отправки логов)
Конфигурация
-
Настройка агентов:
- Установка на каждый узел кластера
- Настройка путей к логам (например, ADB: /data/master/gpseg-1/pg_log/*.log)
- Настройка формата и протокола передачи (syslog, json, multiline)
- Logstash:
- Настройка pipeline: input → filter → output
- Поддержка шаблонов разбора логов Greenplum, Hadoop, NiFi
- Настройка индексирования, ротации и репликации
- Контроль дискового пространства и нагрузок
-
Создание визуализаций по ключевым метрикам:
- Ошибки, варнинги
- Аудит доступа
- Производительность компонентов
- Elasticsearch:
- Kibana:
Установка через ADCM
- Добавление роли logsearch
- Указание хостов для компонентов ELK-стека
- Загрузка шаблонов, настройка retention policy и алертов
Примечание
Следование политикам безопасности
- Использовать изолированные сервисные аккаунты с ограниченными правами
- Отключать root-доступ по SSH
- Использовать TLS/SSL для всех API и web-интерфейсов
- Настроить аутентификацию по ключу и двухфакторную авторизацию
- Ограничить публичные порты на firewall/iptables
- Вести централизованный аудит доступа через LogSearch
Использование корректных версий Java, Python, Hadoop
- Java: OpenJDK 11 или 17 (в зависимости от версии продукта)
- Python: версии 3.6–3.10, проверенные на совместимость с ADCM и Catalog
- Hadoop: версии, протестированные Arenadata (обычно 3.x с патчами)
- Не использовать system-wide Java/Python — задать версии в переменных среды
Настройка мониторинга и оповещений через ADCM
- Добавить ADCM Monitoring bundle (Prometheus + Grafana)
- Настроить роли мониторинга для всех хостов
- Подключить экспортеры (Node exporter, GP exporter, Kafka exporter и т.д.)
- Настроить алерты (disk usage, service down, query latency)
- Интеграция с почтой, Telegram, Zabbix (через webhook или SMTP)
Arenadata документация — это официальные технические и эксплуатационные материалы по продуктам Arenadata, доступные как в онлайн-формате, так и через партнёрские порталы. Документация охватывает весь стек: от установки и настройки до мониторинга, обновлений и интеграции с BI/ETL-инструментами.
Где доступна документация
|
Источник |
Формат |
Доступ |
|---|---|---|
|
docs.arenadata.io |
HTML (основной портал) |
Открыт |
|
Партнёрские порталы (например, DataFinder) |
PDF, HTML, Markdown |
По регистрации |
|
GitHub (репозитории Arenadata) |
README, example configs |
Открыт |
|
Arenadata Cloud (SaaS UI) |
Встроенные подсказки |
Через интерфейс |
|
PDF-инструкции от партнёров |
PDF (по запросу) |
При работе через интегратора |
Основные разделы документации
|
Раздел |
Описание |
|---|---|
|
Установка |
Инструкции по установке ADB, ADPG, ADQM, Streaming, Catalog, Harmony |
|
Настройка |
Конфигурация параметров, roles, сетей, security, окружения |
|
Эксплуатация |
Запуск, остановка, скрипты администрирования, проверка кластеров |
|
Мониторинг |
Использование Prometheus, exporters, Grafana dashboards |
|
Безопасность |
TLS, аутентификация, RBAC, аудит через pgAudit или LogSearch |
|
Обновление и миграции |
Процедуры upgrade, backup/restore, переход CE → Enterprise |
|
Интеграции |
Интеграция с Kafka, NiFi, Superset, Airflow, Spark, DWH, BI |
|
Использование ADCM |
Управление сервисами, ролями, хостами и шаблонами через Cluster Manager |
|
Метаданные и MDM |
Harmony, Catalog, lineage, бизнес-термины |
|
Архитектура |
Компоненты, схемы взаимодействий, модели развёртывания |
Примеры полезных документов
|
Название |
Продукт |
Содержание |
|---|---|---|
|
installation-guide-adpg.pdf |
ADPG |
Подготовка ОС, установка, конфигурация, тест-запуск |
|
adcm-user-manual.md |
ADCM |
Создание кластеров, работа с bundles, управление хостами |
|
catalog-data-lineage-setup.md |
Catalog |
Настройка lineage, описание entity/asset types |
|
adqm-performance-tuning.pdf |
ADQM |
Тюнинг памяти, сжатия, MergeTree-таблиц |
|
harmony-mdm-user-guide.pdf |
Harmony MDM |
Создание справочников, согласование записей, импорт/экспорт |
|
arenadata-streaming-niFi-cookbook |
ADS |
Потоковые пайплайны, шаблоны Flow, кастомные процессоры |
ТОП-20 разделов документации Arenadata, которые должен знать администратор
Полезный справочник для системных администраторов, DevOps-инженеров и инженеров сопровождения.
1. Установка и начальная настройка продуктов
Раздел: installation-guide-*.pdf
Содержит: список зависимостей, параметры ОС, шаблоны конфигурации для:
- ADB (Greenplum)
- ADPG (PostgreSQL)
- ADQM (ClickHouse)
- Arenadata Streaming (Kafka/NiFi)
Обязательно изучить перед первым развёртыванием.
2. Конфигурация параметров БД (GUC)
Раздел: gp-guc, postgresql.conf, ch-settings.xml
Содержит: оптимальные значения GUC/CH-параметров под нагрузку, рекомендации по ресурсам, кешированию, планировщикам.
3. Работа с ADCM
Раздел: adcm-user-guide.md, bundle structure
Содержит: инструкции по управлению кластерами, ролями, хостами, обновлениями сервисов, запуску задач.
4. Мониторинг (Prometheus + Grafana)
Раздел: monitoring-guide.md, arenadata-dashboards
Содержит: exporters, настройки алертов, JSON-дэшборды, правила SLA-метрик.
5. Настройка безопасности
Раздел: security-settings.md
Содержит: работа с TLS, шифрование трафика, настройка RBAC в ADPG/ADQM, безопасный доступ к ADCM.
6. Резервное копирование
Раздел: backup-strategy.pdf, adpg-backup.md
Содержит: pgBackRest, clickhouse-backup, бэкап NiFi, Kafka, методики cold/hot backup, расписания.
7. Обновление продуктов
Раздел: update-strategy.md
Содержит: как обновить сервисы через ADCM, правила последовательности обновлений ADB/ADPG/ADQM, откат.
8. Интеграция с BI (JDBC/ODBC)
Раздел: bi-connectivity.md
Содержит: строки подключения, тонкости при работе с Superset, Power BI, Tableau, Datalens.
9. Мониторинг логов (LogSearch)
Раздел: logsearch-guide.md
Содержит: сбор логов с систем, настройка алертов, поиск по индексам, Kibana / OpenSearch.
10. Метаданные и Catalog
Раздел: catalog-setup.md, lineage.md
Содержит: настройка типов активов, интеграция с Spark, Hive, NiFi, API-доступ, автосбор lineage.
11. MDM / Harmony
Раздел: harmony-admin-guide.md
Содержит: настройка пользователей, схем справочников, процессы согласования, журнал изменений.
12. Организация потоков данных (Streaming)
Раздел: nifi-flow-examples.md, kafka-cluster.md
Содержит: шаблоны потоков, CDC из PostgreSQL, маршруты Kafka → ClickHouse / ADPG / MinIO.
13. Работа с Failover / HA (ADPG)
Раздел: patroni-setup.md, pgpool.conf
Содержит: настройка Patroni, ETCD, переключение мастера, мониторинг репликации.
14. Сборка bundle-пакетов для ADCM
Раздел: adcm-packaging/examples
Содержит: структура директорий, meta.yaml, скрипты init / install / upgrade / actions.
15. Диагностика производительности (ADB/ADPG/ADQM)
Раздел: performance-checklist.md
Содержит: команды EXPLAIN, pg_stat_activity, настройки planner, анализ skew/spill в ADB.
16. Работа с каталогами данных (MinIO, S3, HDFS)
Раздел: object-storage-setup.md
Содержит: инструкции по загрузке, политике хранения, доступу с NiFi, Spark, Kafka.
17. Работа с инцидентами и журналами
Раздел: troubleshooting.md
Содержит: типовые ошибки, логи, команды диагностики, приоритеты тикетов.
18. Работа с ETL-процессами (NiFi, Spark)
Раздел: nifi-processors.md, spark-executor-tuning.md
Содержит: настройка flowfile storage, retry policies, batch size, JVM тюнинг.
19. LDAP и SSO интеграция
Раздел: ldap-integration.md
Содержит: подключение Arenadata Platform к корпоративным IAM-системам.
20. Развёртывание CE в dev-среде
Раздел: community-install.md
Содержит: запуск на локальной машине, Docker, подключение Superset, тестирование ETL.
Заключение
Эти 20 разделов — минимум, который должен знать любой админ или DevOps-инженер, работающий с Arenadata. Их понимание позволяет:
- Быстро внедрять и поддерживать платформу
- Минимизировать риски и простоев
- Упрощать CI/CD, резервное копирование и восстановление
- Интегрировать BI, ETL и корпоративные стандарты безопасности



