Средства мониторинга и резервного копирования в платформе Arenadata (все продукты)
Эта статья охватывает полный стек Arenadata: ADB (Greenplum), ADPG (PostgreSQL), ADQM (ClickHouse/QuickMarts), Catalog, Harmony MDM, Streaming Platform, LogSearch. Рассматриваются промышленные средства мониторинга, резервного копирования, восстановления и best practices эксплуатации.
Мониторинг и резервное копирование являются ключевыми аспектами эксплуатации продуктов Arenadata в промышленной среде. Arenadata предоставляет встроенные и интегрируемые инструменты для контроля состояния систем, предиктивной диагностики, автоматизации резервного копирования и восстановления, а также аудита активности.
Мониторинг Arenadata
Архитектура мониторинга
- Сбор метрик: Node Exporter, PostgreSQL Exporter, ADB Exporter, ClickHouse Exporter, Kafka Exporter, NiFi Exporter, Elastic Exporter, Zookeeper Exporter
- Хранилище: Prometheus (pull model)
- Визуализация: Grafana с шаблонами дашбордов из ADCM Monitoring Bundle
- Оповещения: Alertmanager + SMTP, Telegram, Slack, Webhook
ADB (Greenplum)
-
Метрики:
- Доступность сегментов, latency master↔segments
- Утилизация I/O, CPU, memory
- Locks, Deadlocks, Query Runtime
- Инструменты: gpmon, gpperfmon, gpstate, ADB Exporter
- Дашборды:
- ADB Cluster Health
- Segment Performance
- Query Execution Time
ADPG (PostgreSQL)
- Экспортёр: postgres_exporter
-
Метрики:
- Query duration, Slow queries, Autovacuum activity
- Replication lag, WAL size, Checkpoints
- Locking, idle in transaction
- Интеграция с Patroni: состояние кластера, роль узлов, lag
ADQM (ClickHouse)
- Экспортёр: ClickHouse Exporter
-
Метрики:
- Replication delay, inserts/sec, merges, merges time
- Disk usage per part, mutation status
- Keeper sessions
- Шардирование и HA-индикаторы
Catalog
- REST API latency, response rate, ingestion duration
- Queue length Airflow DAG, timeouts
- Логирование действий пользователей (LogSearch)
Harmony MDM
- SLA-панели по жизненному циклу карточек
- Ошибки дедупликации и валидации
- Метрики выполнения процессов согласования
Streaming Platform
-
Kafka:
- Lag, throughput, replication state, topic size
- Under-replicated partitions
- NiFi:
- FlowFile queue size, backpressure, errors
- Processor metrics: duration, success/failure
- Streaming delay, executor status, job latency
- Spark:
LogSearch
-
Elastic:
- Heap memory usage, index status, node health
- Logstash:
- Pipeline throughput, dead letter queues
- Dashboard latency, error visualization logs
- Kibana:
Резервное копирование (Backup)
ADB
- Инструменты: gpcrondump, gpdbrestore, pg_basebackup, gpbarman
-
Стратегия:
- Full dump раз в сутки
- Incremental каждые 4–6 часов
- WAL архив в реальном времени
- Команды:
gpcrondump -x adb -G -u /backups pg_basebackup -Ft -z -D /pg_backup -U backupuser
- PITR: archive_command, recovery.conf
Варианты:
- gpcrondump: логическое резервное копирование
- gpbarman: встроенное средство для физических бэкапов
- pg_basebackup: для PostgreSQL-компонента ADB
- Снимки томов через LVM / Ceph / SAN (если используется)
План бэкапа:
- Полный dump — ежедневно ночью
- Дифференциальный — каждые 4 часа
- WAL архивирование — постоянно (через archive_command)
Команды:
gpcrondump -x mydb -u /mnt/backups -G -a pg_basebackup -D /mnt/pg_backups/ -Fp -Xs -P -v
Восстановление:
gpdbrestore -e -t 20240506 -u /mnt/backups -a
ADPG
- Инструменты: pg_dump, pg_basebackup, wal-g
- Примеры:
pg_dump -Fc -f /backup/db.dump dbname pg_basebackup -R -D /pg_backup -X stream -U replicator
- WAL-G: архив в S3/MinIO
- Patroni + etcd — репликация и failover
ADQM
-
Средства:
- BACKUP TABLE и RESTORE TABLE
- Файловый snapshot данных
- Снапшоты ZooKeeper и конфигураций (users.xml, config.xml)
- Пример:
BACKUP TABLE db.table TO '/mnt/backup';
Catalog
- PostgreSQL-level dump + API-экспорт:
pg_dump -U catalog -Fc catalogdb > /backup/catalog.dump
- JSON экспорт через REST API для lineage, glossary, assets
- Интеграция с Git (CI/CD моделей, терминов)
Harmony MDM
- Бэкап PostgreSQL
- Экспорт карточек, очередей, моделей через API
- Контроль целостности и согласованности
- Версионирование моделей в Git
LogSearch
- Snapshot API (Elasticsearch):
PUT /_snapshot/repo/backup_20240507
- Репликация Elastic индексов
- Конфиги Filebeat/Logstash — хранение в Git
Streaming Platform
-
Kafka:
- Dump топиков, snapshot метаданных ZooKeeper
- NiFi:
- XML export через Registry + Git
- Checkpoint директории, jar-файлы, схемы jobs
- Spark:
Рекомендации
- Еженедельный dry restore
- Использование именованных снапшотов
- Мониторинг валидности WAL
- Репликация бэкапов в offsite-хранилище (Ceph, S3)
- Хранение до 30 дней или согласно SLA
- Отчёты: графики активности, нагрузка ingestion, доля ошибок
- Использовать отдельный диск или хранилище под резервные копии
- Использовать систему меток: backup_YYYYMMDD_FULL.sql / logsearch_snapshot_YYMMDD
- Интеграция с Git/CI/CD для версионирования пайплайнов NiFi и ingestion
- Хранить не менее 7 полных бэкапов + 30 дней WAL
- Проверять валидность бэкапов (dry restore) раз в неделю
- Хранить каталог восстановлений: лог бэкапов, контрольные суммы, автор
Заключение
Мониторинг и бэкап в Arenadata строятся на открытых стандартах, масштабируемы и адаптированы к разнородным нагрузкам. Интеграция с GitOps, Prometheus и API делает платформу полностью управляемой в условиях высокой доступности и соответствия корпоративным политикам защиты данных.



