BI Consult Desktop Logo BI Consult Mobile Logo
  • Russian BI Исследование российских bi
  • Перейти на Fine BI
  • Контакты
  • +7 812 334-08-01
    +7 499 608-13-06
  • Отправить сообщение
  • Главная
  • Продукты Эксперт-BI
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Сельское хозяйство
    • Энергетика
    • FMCG
    • Девелоперы
    • Маркетплейсы
    • Пищевая промышленность
    • Фармацевтика
    • Построение Data Platform
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и FP&A
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • IBP
    • ИТ (CIO)
    • Закупки
  • Платформы
    • Системы бизнес-анализа (BI)
    • Интегрированное бизнес-планирование (IBP)
    • Хранилища данных (DWH / Lakehouse)
    • Каталоги данных (Data Catalog)
    • Системы ETL и ELT
    • AI / Исскуственный интеллект
    • Шина данных (ESB)
    • Система управления мастер-данными (MDM)
    • Семантический слой
  • Услуги
    • Переход на отечественные BI и DWH системы
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений и DWH
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Курсы
    • Учебный курс Информационная грамотность (Data Literacy)
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Greenplum
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt (Data Build Tool)
  • Компания
    • Руководство
    • Новости
    • Клиенты
    • Карьера
    • Скачать
    • Контакты

BI

  • FineBI
  • FineReport
  • FineDataLink
  • FineChatBI (FineAI)
  • Коннекторы данных из 1С в BI
  • Airflow / Nifi
  • Visiology
  • PIX BI
  • Modus BI
  • Yandex.DataLens
  • Open-source BI: Superset/Metabase
  • Luxms BI
  • AW BI + Alpha BI
  • FlyBI + Форсайт. Аналитическая Платформа
  • Loginom
  • Триафлай
  • AI / Исскуственный интеллект
  • Optimacros
  • Навигатор BI
  • Семантический слой

СУБД

  • Arenadata
  • ClickHouse
  • Greenplum
  • Postgres Professional
  • TData

Другое

  • Построение Data Platform
    • Аналитическое хранилище данных
    • Data Lake и Data Engineering
    • Подробнее про Data Lake
    • Внедрение Lakehouse
      • Apache Doris
      • StarRocks
      • Trino
    • Миграция витрин из пропиетарных DWH на новый стек
    • Учебный курс "Современная архитектура хранилища данных"
Главная » Курсы по системам бизнес-анализа и методологии » Учебный курс Современная архитектура хранилища данных » Эксплуатация Dagster » Хранение артефактов и событий: логи, материализации и артефакты пайплайна

Хранение артефактов и событий: логи, материализации и артефакты пайплайна

Артефакты пайплайна и связанные с ними события - основа воспроизводимости, управляемости и доверия к данным в цифровой трансформации. В Dagster артефакты охватывают как материальные выходы вычислений (материализации), так и наблюдения за состоянием и качеством данных. Логи выполнения фиксируют ход вычислений, ошибки и контекст выполнения. Совокупность этих данных формирует дерево линейности данных, обеспечивает аудит и позволяет осуществлять управляемый мониторинг платформы оркестрации. В данной главе рассматривается как Dagster хранит и обрабатывает артефакты и события, какие данные и схемы используются, какие интеграции поддерживаются и как проектировать эффективные стратегии эксплуатации.

Погружение в тему начинается с архитектуры хранения и моделирования артефактов, затем переходит к практикам публикации материалов и наблюдений, рассматривает выбор хранилищ и интеграции с инструментами управления данными, а завершается вопросами мониторинга, безопасности и жизненного цикла артефактов. Особое внимание уделяется причинам и следствиям принятых архитектурных решений: почему хранение событий и артефактов разделено, как достигается консистентность и целостность, какие механизмы защиты данных внедряются, и какие сценарии занимают центральное место в эксплуатации Dagster.

  • Архитектура и модели артефактов в Dagster
  • Хранение логов и артефактов: хранилища, протоколы и схемы
  • Интеграции и инструменты управления данными
  • Мониторинг, аудит и управление версионированием
  • Безопасность, соответствие требованиям и операционные практики

     

Архитектура хранения артефактов и событий

Артефакты и события Dagster подвергаются обработке через набор взаимодействующих компонентов: журнал событий, хранилище запусков, хранилище артефактов и промежуточные хранилища. Основная идея состоит в разделе ответственности: журнал событий фиксирует каждое действие внутри выполнения (миссии Solid, Materialization, Observations, Failures), хранилище запусков хранит состояние исполнения и метаданные запусков, а хранилище артефактов отвечает за метаданные артефактов и их маршрут к потребителям данных. Прямое хранение больших артефактов в базе не всегда необходимо: чаще применяется концепция ссылочного хранения и рынки объектных хранилищ (object stores) для больших материалов.

  • Компоненты и их ответственность

    • Журнал событий (event_log_storage): сохраняет каждую запись события исполнения: запуск, завершение, ошибка, материализация, наблюдение и прочие системные события. Эти данные нужны для аудита и расследования проблем.
    • Хранилище запусков (run_storage): хранит состояние каждого запуска, включая текущее состояние шагов, план исполнения и контекст выполнения.
    • Хранилище артефактов (asset/process/storage metadata): сохраняет метаданные материалов, сведения о версиях и источниках данных, активы и их взаимосвязи.
    • Промежуточные и вычислительные хранилища (intermediary_storage / compute_logs): поддерживают временные артефакты, логи вычислений и отладочную информацию.
  • Как данные движутся по потоку

    1. Solid выполняется в рамках запуска и может породить один или несколько Materialization и/или Observation событий.
    2. Эти события записываются в журнал событий и, при необходимости, обновляют метаданные артефактов в хранилище артефактов.
    3. Метаданные об артефактах индексируются и становятся доступными через Dagit и внешние инструменты поиска и lineage.
    4. Владелец данных может использовать полученные артефакты для дальнейших конвейеров, отчетности и аудита.
  • Модели консистентности и отказоустойчивости
    В Dagster приняты принципы идемпотентности и последовательной записи. Запросы на создание материалов и наблюдений привязаны к конкретному запуску и шагу выполнения. В большинстве реализаций поддерживаются транзакционные обработки в хранилищах (особенно для PostgreSQL), что обеспечивает целостность данных в случае сбоев. В крупных развёртываниях применяется репликация и резервное копирование хранилищ, чтобы минимизировать риск потери логов и артефактов при сбоях инфраструктуры.

  • Применение схем и индексов
    Архитектура хранения артефактов проектируется с учётом быстрого поиска по AssetKey, по времени выпуска и по контексту выполнения. В реальных системах создаются индексы по более часто используемым полям: asset_key, run_id, event_type, timestamp. Это ускоряет запросы к Dagit, DataHub/OpenLineage и другим системам управления данными, особенно в больших пайплайнах с тысячами материалов.

  • Интеграции и открытые стандарты
    Архитектура Dagster поддерживает интеграции с внешними системами управления данными и контроля линейности. OpenLineage и DataHub позволяют экспортировать события и линейность артефактов в централизованные каталоги данных. Это не только облегчает аудит, но и упрощает соответствие регуляторным требованиям, когда требуется видеть источник данных, зависимости и циркуляцию артефактов по конвейеру.

     

Модели артефактов: материализации, артефакты пайплайна и наблюдения

Артефакты пайплайна чаще всего принимают форму материалов (Materialization) и наблюдений (AssetObservation). Материализация соответствует факту появления или обновления ценного артефакта (например, итоговую таблицу или файловый набор) и сопровождается метаданными и, при необходимости, ссылками на данные, схему и объем. Наблюдения служат для фиксации истинности фактов о данных без необходимости повторной материализации, например контрольные суммы, размер, валидность данных, обнаружение сбоев, предупреждений и т. п.

  • AssetKey и семантика
    AssetKey является иерархическим ключом, который однозначно идентифицирует артефакт в рамках набора активов. Он может отражать бизнес-объекты (например, ['market', 'sales', 'daily']) или модульность данных по доменам. Что важно при проектировании схем артефактов, так это предсказуемость именования и согласованность в across pipelines, чтобы lineage и кросс-конвейерная интеграция были простыми.

  • Материализация и наблюдение: различия и применение
    Materialization представляет собой создание артефакта в конкретном контексте времени и среды исполнения. Оно записывается в журнал событий и обновляет метаданные артефактов. Наблюдение же обычно фиксирует факт существования или состояние данных без необходимости повторной загрузки или переработки. Это особенно полезно для проверки качества данных, отслеживания изменений в внешних источниках или в процессе непрерывной интеграции данных.

  • Метаданные и типы значений
    В материалациях и наблюдениях в Dagster допускаются различные типы метаданных: числа, строки, даты, словари и списки. Метаданные служат дополнительным контекстом для артефактов - источник данных, версия схемы, количество строк, контрольные суммы, параметры трансформации и т. п. Их структурированность облегчает последующую агрегацию и поиск.

  • Жизненный цикл артефактов
    Артефакт может проходить через стадии: создание (materialization), обновление версии (например, после повторной обработки), валидирование (через наблюдения и ожидания), и возможную устаревание или инвалидирование (invalidate) при изменении источника или логики конвейера. В дневнике артефактов сохраняются все события, и все они доступны для аудита и пересмотра.

  • Пример кода: как выдать материализацию в Solid

    from dagster import Materialization, AssetKey
    
    def my_op(context):
        ## вычисления и подготовка данных
        yield Materialization(asset_key=AssetKey(['market', 'sales']), description='Daily sales data')
        ## далее можно возвращать результат через Output, если требуется сохранить значение
      
  • Прозрачность и lineage
    Материализации формируют lineage между входами и выходами, что позволяет проследить происхождение данных на любом этапе конвейера. Это критично для аудита и для регуляторных требований, когда требуется проследить, откуда пришли данные, какие преобразования над ними выполнялись и какие артефакты в итоге созданы.

     

Хранилища, протоколы и интеграции

Эффективность и надёжность хранения артефактов во многом зависят от конфигурации хранилищ и применяемых протоколов. Dagster поддерживает различные реализации хранилищ и может сочетать их по мере роста проекта. В зависимости от задач можно выбрать: локальные файловые хранилища для разработки, PostgreSQL или CockroachDB для производственных окружений, облачные объектные хранилища для артефактного контента и внешние сервисы для линейности.

  • Выбор хранилищ

    • Журнал событий и запусков: PostgreSQL, CockroachDB или другие поддерживаемые реляционные СУБД. Они обеспечивают транзакционность и быстрые запросы к истории выполнения.
    • Хранилище артефактов и метаданных: объектные хранилища (S3, GCS, Azure Blob) или файловые схемы. Большие артефакты лучше размещать вне БД и хранить ссылки на них в метаданных артефактов.
    • Промежуточные данные и логи вычислений: локальные файловые хранилища или облачные аналогии, в зависимости от требований к доступности и задержкам.
  • Протоколы и схемы взаимодействия
    Архитектура опирается на строгую идентификацию запусков, привязку событий к конкретным шагам и контекстам выполнения. Этим обеспечивается повторяемость и возможность ретроспективного анализа. Протоколы событий основываются на наборе типов событий: StartRun, StartStep, Materialization, Observation, Failure и т. п. Эти типы гармонизированы с фреймворком Dagster и поддерживаемыми инструментами для lineage.

  • Интеграции с инструментами управления данными
    OpenLineage обеспечивает стандартизированный экспорт событий об исполнении конвейера в источники управляющих систем, что облегчает построение единой картины линейности данных. DataHub может использоваться для каталогизации артефактов и их связей между пакетами данных, сервисами и командами. Встраивание таких интеграций в пайплайны Dagster позволяет организациям получить единый инструмент для аудита, сортировки и мониторинга архитектуры данных.

  • Конфигурационные примеры
    Приведённый ниже фрагмент иллюстрирует, как могут быть организованы хранилища в Dagster. Конкретные детали зависят от версии Dagster и используемой инфраструктуры, поэтому адаптация под окружение обязательна.

    dagster:
      storage:
        filesystem:
          base_dir: /var/dagster/artifacts
      run_storage:
        postgres:
          postgres_url: postgresql://dagster:password@db-host:5432/dagster
      event_log_storage:
        postgres:
          postgres_url: postgresql://dagster:password@db-host:5432/dagster
      compute_logs:
        postgres:
          postgres_url: postgresql://dagster:password@db-host:5432/dagster
      intermediary_storage:
        filesystem:
          base_dir: /var/dagster/intermediates
      open_lineage:
        enabled: true
      datahub:
        enabled: true
      asset_repository:
        s3:
          bucket: dagster-assets
          region: us-east-1
      ## секреты и параметры доступа следует хранить в безопасном хранилище секретов
      secret_store:
        aws_secrets_manager:
          region: us-east-1
      
  • Производительность, безопасность и архитектурные практики
    При проектировании хранилищ следует уделять внимание задержкам чтения и записи, резервному копированию, репликации и резервируемым стратегиям. Индексы по ключевым полям, регулярная архивизация старых логов и материалов, а также возможность выбора разных уровней хранения (горячие/холодные данные) позволяют масштабировать систему без потери доступности. В целях безопасности следует реализовать строгий доступ к логам и артефактам, разграничить роли между командами и обеспечить шифрование в покое и в транзите, а также безопасное хранение учетных данных и ключей доступа.

     

Мониторинг, аудит и управление данными об артефактах

Эффективная эксплуатация требует прозрачного контроля над артефактами и событиями. Dagster предоставляет средства мониторинга через Dagit UI, а также открытые интеграции с инструментами управления данными. Важнейшие аспекты включают обзор lineage, контроль версий артефактов, мониторинг качества данных и аудит изменений.

  • Dagit как точка доступа
    Dagit отображает историю запусков, связанные материализации и наблюдения, связь между артефактами и исходными данными, а также текущие статусы конвейеров. Через Dagit можно запускать повторные исполнения, анализировать причины сбоев и просматривать подробности по каждому артефакту.

  • Линея артефактов и управление зависимостями
    Линейность данных обеспечивает видимость «происхождения» артефактов: какие источники данных участвовали, какие преобразования выполнялись и какие результаты получились. Это чрезвычайно важно для аудита, восстановления после сбоев и compliant-процессов. Интеграции с OpenLineage и DataHub позволяют экспортировать lineage в централизованный каталог.

  • Метрики и операционная observability
    Включение метрик по времени исполнения, задержкам между шагами, частоте повторных материалов и качеству данных помогает обнаруживать проблемы на ранней стадии. Внедряются dashboards и alerting, основанные на порогах ошибок, длительных стадиях конвейера и аномалиях в метаданных артефактов.

  • Управление версиями и ретенции
    Версионирование артефактов и контроль версий материалов позволяют сравнивать результаты между запусками и откатываться к ранее проверенным версиям. Политики ретенции требуются для поддержания баланса между доступностью артефактов для анализа и стоимостью хранения. В продакшн-сценариях рекомендуется устанавливать архивирование старых материалов в холодное хранилище и периодически удалять устаревшие записи с истекающим сроком хранения.

  • Практики эксплуатации

    • Регулярная проверка целостности артефактов и журналов событий.
    • Автоматизированные тесты подлинности данных и контроль метаданных.
    • Групповая инфраструктура: разделение ролей, аудит доступа к артефактам и журналам.
    • Планирование резервного копирования и восстановления с учётом критичности артефактов.
  • Пример конфигурации интеграций аудита

    ## Псевдоконфигурация для экспорта событий в DataHub/OpenLineage
    open_lineage:
      enabled: true
    datahub:
      enabled: true
      endpoint: https://datahub.company.local
    audit_log:
      enabled: true
      sink:
        type: postgres
        connection_string: postgresql://audit:password@audit-host:5432/audit
      retention_days: 365
    

    Безопасность, управление версиями и соответствие требованиям

Эксплуатационный режим требует обеспечения конфиденциальности, целостности и доступности артефактов. Роли и политики доступа должны ограничивать возможность чтения и модификации артефактной информации в зависимости от роли пользователя. Ключевые принципы включают:

  • Защита данных на каждом уровне
    Шифрование в покое и в транзите, безопасное хранение ключей, интеграция с системами секретов (например, AWS Secrets Manager, Vault). В Dagster следует использовать ограничение прав доступа на чтение артефактных записей и логов, особенно для данных, подпадающих под правовые и регуляторные требования.

  • Контроль доступа и политики RBAC
    Регулярно пересматриваются роли и привилегии пользователей Dagit, а также сервисных аккаунтов, выполняющих автоматические интеграции. Важно обеспечить разделение обязанностей между разработчиками конвейеров, операторами и административными специалистами по данным.

  • Версионирование и откат
    Каждый артефакт имеет версию, которая отражает его состояние по времени. При изменении источника данных или логики трансформации можно откатываться к предыдущей версии материалов и повторно выполнять необходимые шаги. Жизненный цикл артефактов следует документировать и контролировать через политики издательства и обработки изменений.

  • Политики хранения и ретенции
    Определяются сроки хранения для логов, материалов и метаданных, а также процедуры архивирования. Горячие данные должны быть доступны быстро, но для исторических анализов и аудита применяются архивные копии. Нормативные требования могут диктовать специфические сроки сохранения артефактной информации в зависимости от домена.

  • Соответствие требованиям и аудит
    Включение OpenLineage/DataHub обеспечивает необходимый уровень видимости цепочек данных и действий в системе. Это облегчает доказывание соответствия регламентам, снижает риски и ускоряет процессы аудита в случае проверок.

     

Примеры эксплуатации и сценарии внедрения

  • Небольшая команда: локальная разработка и предпросмотр артефактов
    Для разработчиков, работающих на локальной машине, часто достаточны SQLite или локальные файловые хранилища и небольшой набор тестовых материалов. Dagit предоставляет полную видимость над артефактами и их линейностью, позволяя быстро тестировать новые источники и трансформации без риска воздействия на продакшн.

  • Средний бизнес: развёртывание в контейнерах
    При развёртывании в Kubernetes и использовании PostgreSQL для журнала событий и запусков, а также S3 для артефактного контента, становится реально управлять несколькими командами и конвейерами. Вводятся политики доступа, ретенции и резервного копирования. OpenLineage и DataHub используются для каталогизации и аудита.

  • Корпоративная среда: масштабная платформа с Data Governance
    В условиях строгих требований к аудитам и регуляторике настраиваются централизованные каталоги линейности, строгие политики доступа, политики версионирования и сложные сценарии миграции схем хранилищ. Интеграции с DataHub/OpenLineage позволяют строить полноценный провайденный план данных, а Dagit становится единым ориентиром для инженеров по данным и аналитиков.

  • Примеры сценариев восстановления
    При сбое одного компонента журналов исполнение можно пересобрать из материалов и логов, если они сохранены в долговременных хранилищах. Восстановление требует последовательного повторного запуска с учетом состояния данных и зависимостей, чтобы не нарушить консистентность артефактов и линейности.

     

Key takeaways

  • Артефакты и события Dagster образуют фундамент для воспроизводимости и аудита данных; они разделены по ролям: Materialization/Observation и журнал исполнения.
  • Архитектура хранения включает журнал событий, хранилище запусков и хранилище артефактов, с возможностью использования внешних объектных хранилищ для крупных материалов.
  • Метаданные артефактов и линейность данных критично поддерживаются через AssetKey, Materialization и AssetObservation, что облегчает lineage и регуляторный учёт.
  • Интеграции с OpenLineage и DataHub позволяют строить единый каталог линейности линейности и управлять данными на уровне предприятия.
  • Безопасность и соответствие требованиям требуют RBAC, шифрование, управление секретами, политики хранения и регулярный аудит артефактных данных.
  • Эффективная эксплуатация достигается через грамотное конфигурирование хранилищ, индексацию, планирование резервного копирования и устойчивую стратегию ретенции.
  • Практика в Dagster строится на концепциях повторяемости, идемпотентности и прозрачности данных, что позволяет управлять эволюцией пайплайнов без риска потери информации.

     

FAQ

  1. Что такое артефакты в Dagster и зачем они нужны?

Артефакты в Dagster - это результаты и сопутствующая информация, возникающая в процессе выполнения пайплайна: материалы и наблюдения за данными. Они обеспечивают воспроизводимость, поддержку линейности и прозрачность для аудита. Материализации отражают создание или обновление конкретного активного набора данных, наблюдения фиксируют качественные или контекстуальные характеристики артефактов без повторной трансформации.

 

  1. Какие типы артефактов поддерживает Dagster?

Dagster поддерживает Materialization (материализации), AssetObservation (наблюдения за активами), а также метаданные и вычислительную историю, привязанные к AssetKey. Это позволяет не только фиксировать данные, но и описывать их происхождение, качество и эволюцию во времени.

 

  1. Как Dagster хранит логи и артефакты?

Dagster разделяет логи исполнения и артефакты на различные хранилища: журналы событий и запусков хранятся в одном или нескольких реляционных БД, артефактные метаданные - в базе и/или в объектном хранилище, материалы и связанные данные - в ссылочном виде (обычно S3/GCS) с метаданными в БД. Такая архитектура обеспечивает баланс между производительностью поиска и долговечностью крупных артефактов.

 

  1. Какие хранилища и интеграции рекомендуется использовать в продакшене?

Рекомендуются PostgreSQL или аналогичные СУБД для журнала событий и запусков, а также облачные объектные хранилища (S3, GCS) для артефактного контента. OpenLineage и DataHub можно внедрить для централизованного управления линейностью и каталогов данных. Выбор конкретной реализации зависит от объема данных, требований к задержкам и регуляторных ограничений.

 

  1. Как обеспечить долговечность и консистентность артефактов?

Консистентность достигается через транзакционные операции в хранилищах и детальное связывание событий с конкретным запуском и шагом. Долговечность достигается резервным копированием, репликациями и хранением критических артефактов в долговременном хранилище. Важно также внедрить политику ретенции и архивирования для старых материалов и логов.

 

  1. Как интегрировать Dagster с инструментами управления данными и линейностью?

OpenLineage и DataHub позволяют экспортировать события и линейность в единый каталог. Это облегчает аудит и управление данными на уровне предприятия. Интеграции требуют настройки экспорта событий и синхронизацию метаданных между Dagster и внешними системами каталогов.

 

  1. Как безопасно управлять артефактами, содержащими чувствительные данные?

Необходимо внедрить RBAC, ограничение доступа к Dagit и к артефактным данным, использовать безопасное хранилище секретов и шифрование в покое и в транзите. Чувствительные данные должны быть доступны только уполномоченным сервисам и пользователям, а логи и артефакты должны соответствовать требованиям конфиденциальности.

 

  1. Каковы лучшие практики версионирования артефактов?

Каждый артефакт имеет версию, отражающую момент времени и состояние источников. При изменении источников или трансформаций выполняется повторная материализация, и новая версия артефакта регистрируется в журнале. Регулярно документируются изменения в lineage и подписанные версии артефактов, чтобы обеспечивалось воспроизводимость.

 

  1. С какими проблемами сталкиваются при мониторинге артефактов и как их решать?

Проблемы могут включать задержки в индексации, неполный lineage, размер логов и сложность аудита. Решения включают:

  • настройку индексов и шардирования для масштабирования запросов,
  • включение OpenLineage/DataHub и настройку регулярного экспорта событий,
  • аудитные проверки и контрольные тесты качества данных,
  • планирование архивирования и ретенции.

 

  1. Какие шаги следует предпринять для перехода к продакшн-эксплуатации хранения артефактов?

Начать с проектирования модели AssetKey и схемы материалов, выбрать подходящие хранилища (реляционная БД для журналов, объектное хранилище для артефактов), настроить Dagit и мониторинг, внедрить OpenLineage/DataHub для lineage, реализовать политики ретенции и безопасности, выпустить первую версию документации по управляющим процессам и регулярно проводить аудиты и ротацию ключей.

 

← Предыдущая статья
Компоненты исполнения: executors, run launcher и вычислительные бэкенды
Следующая статья →
Расписание и мониторинг: schedulers, sensors и Dagster daemon

 

Узнать стоимость решенияЗапросить видео презентацию

Запросить видео презентацию Запросить доступ к демо стенду online Узнать стоимость лицензий

Задать вопрос

loading...

Решения

Анализировать ФинансыУвеличивайте ПродажиОптимальный Склад и ЛогистикаМаркетинговые Метрики

Клиенты
  • КАМИ – компания-лидер по поставкам тяжёлых станков в России, занимающаяся продажей и обслуживанием оборудования для обработки металла и дерева, изготовления мебели и не только. На сегодняшний день в компании работают более 1300 человек, запущено 10 обучающих центров, в продаже более 7000 единиц техники. 

  • KERAMA MARAZZI — международный бренд, входящий в число лидеров глобального рынка керамики. Бизнес компании охватывает весь процесс создания керамических изделий, от глиняных карьеров до фирменной розницы во всех крупных городах РФ и за рубежом.

  • Розничный и интернет-магазин 12 Storeez один из лидеров на рынке женской одежды. С географией рынка не только на территории России, своя продукция представлена еще и в таких странах как Казахстан и Дубай.

  • Ситилинк

    Электронный дискаунтер «Ситилинк» — один из крупнейших онлайн‑ритейлеров России (3‑е место по объему онлайн‑продаж в рейтинге Data Insight и Ruward 2016 года E‑commerce Index TOP‑100, 8 место в рейтинге Forbes «20 самых дорогих компаний Рунета — 2017»). На рынке работает 9 лет.

    В ассортименте дискаунтера более 50 000 наименований компьютерной цифровой, бытовой и садовой техники, офисной мебели и других товарных категорий. Более 700 мировых брендов в портфеле. Около 4 000 сотрудников по всей России

  • Решения
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Энергетика
    • Фармацевтика
  • Услуги
    • Переход на отечественные BI и DWH
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Техническая поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Платформы
    • FineBI
    • FineReport
    • FineDataLink
    • Коннекторы данных из 1С в BI
    • Airflow + NiFi
    • Visiology
    • Luxms BI
    • Modus BI
    • PIX BI
    • Arenadata
    • ClickHouse
    • Greenplum
    • Postgres Professional
    • Open-source BI: Superset/Metabase
    • Loginom
    • Yandex.DataLens
    • AI / Исскуственный интеллект
    • Optimacros
    • Шины данных
  • Курсы
    • Учебный курс Информационная грамотность
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt
  • Функциональные решения
    • Создание Data Lake
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и прогнозная аналитика
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • Сквозная аналитика
  • Компания
    • О нас
    • Руководство
    • Новости
    • Клиенты
    • Скачать
    • Контакты
    • Политика конфиденциальности
RutubeVkontakteLinkedInYouTube
ООО "Би Ай Консалт",
ИНН: 7811437757,
ОГРН: 1097847154184
199178, Россия,
Санкт-Петербург,
6-ая линия В.О., Д. 63, 4 этаж
Тел: +7 (812) 334-08-01
Тел: +7 (499) 608-13-06
E-mail: info@biconsult.ru

 

 

 

 

 

×

Пользуясь сайтом, вы соглашаетесь с использованием cookies и политикой конфиденциальности.