Введение в наиболее важные аспекты современной наблюдаемости данных
Ирония нынешнего спроса на решения для обеспечения наблюдаемости данных заключается в том, что мир данных наконец-то догоняет физический мир.
Компании, продающие все, от коробок для завтрака до водяных кроватей, уже давно имеют возможность получить полную информацию о своих цепочках поставок. Управление цепочками поставок как дисциплина восходит к 1980-м годам. Практика применения аналитики к цепочкам поставок гораздо более древняя.
Компания, продающая ланчбокс, может рассчитывать на то, что она будет знать о его статусе и владельце на каждом этапе создания ланчбокса – практически от идеи до того, как ребенок пойдет с ним в школу, - от производства до доставки, складирования, мерчандайзинга и доставки в торговую точку.
Компании, занимающиеся обработкой данных, теперь могут рассчитывать на такую же глубину доступа к своим каналам передачи данных, включая предиктивный мониторинг и аналитику.
Независимо от того, продает ли компания наборы геопространственных данных, рекомендации по повышению доходности инвестиций или платформу для онлайн–гемблинга как услугу, данные - это то, что продается, или, по крайней мере, их часть.
Даже если компания использует данные внутри компании для принятия важных решений, а не предлагает их в виде продукта непосредственно клиентам, эти данные важны для бизнеса. Слишком долго компаниям приходилось полагаться на устаревший мониторинг, который больше подходит для хранения, чем для организации.
Если вы не можете надежно обнаружить сбои в работе или устаревшие данные, вы не сможете диагностировать и устранять проблемы, не говоря уже о том, чтобы опережать их.
Вот почему для многих компаний возможность наблюдения за данными больше не является обязательной. Именно поэтому наш подход к наблюдаемости в Astronomer сосредоточен на продуктах, основанных на данных: это способ мышления о продуктах, основанных на данных, и их активах, связанных с результатами бизнеса.
Наблюдаемость данных: три столпа
Наблюдаемость данных - это способность понимать работоспособность информационного продукта и его состояние в рамках фрагментированной экосистемы данных, и ее можно разделить на три основные функции или назначения: аналитику, мониторинг и оповещение.
Аналитика
Аналитика касается производительности, статуса и взаимосвязей между зависимостями в продукте данных, таком как задачи и наборы данных. Аналитика может делать больше, чем просто “сообщать новости” о конвейере. Примером конвейерной аналитики является отслеживание производительности выполнения задач с течением времени для прогнозирования результатов. Например, скорость, с которой продолжительность выполнения задачи стала меньше стандартного отклонения от продолжительности выполнения этой задачи с течением времени, может позволить предсказать, насколько вероятно, что продукт обработки данных будет соответствовать ожиданиям в отношении стоимости и надежности в будущем.
Мониторинг
Мониторинг касается проверок качества данных, отслеживания продолжительности выполнения задач и конвейера, проверки статуса выполнения и соглашений об уровне обслуживания (SLA) для отслеживания свежести и своевременности данных. Вообще говоря, соглашения об уровне обслуживания - это контракты, которые определяют приемлемое предоставление услуг (например, время безотказной работы платформы) и компенсацию, причитающуюся в случае нарушений (например, кредиты за использование платформы). В контексте наблюдаемости данных соглашения об уровне обслуживания - это ожидаемые пороговые значения для своевременной доставки или свежести данных. Они могут использоваться для измерения и отслеживания производительности, а также для запуска оповещений.
Оповещение
Оповещение выходит за рамки обычного реактивного оповещения – например, при сбое выполнения задачи – и включает в себя проактивное оповещение. Соглашения об уровне обслуживания предоставляют несколько уровней уведомлений, поэтому платформа может уведомлять владельцев конвейеров не только о том, что продолжительность выполнения или период времени между запусками нарушают соглашение об уровне обслуживания, но и о том, что продолжительность выполнения в процессе находится в пределах указанного диапазона, в котором отсутствует соглашение об уровне обслуживания. Благодаря аналитике и мониторингу надежное решение для обеспечения наблюдаемости может использовать эту аналитику и мониторинг для предупреждения владельца продукта обработки данных в случае аномалий – например, если продолжительность выполнения задачи превышает стандартное отклонение от предыдущих запусков этой задачи.
Наблюдаемость данных: почему это важно

Уведомления о сбое задачи сами по себе иногда приносят мало пользы.
Если все, на что может рассчитывать инженер по обработке данных в плане наблюдаемости, – это реактивные оповещения о сбоях в задачах (получение уведомления по электронной почте, когда что–то уже сломалось), это не обеспечивает полной защиты критически важных цепочек поставок данных в организации.
Команды, ответственные за разработку и поддержание в рабочем состоянии критически важной цепочки поставок, нуждаются в расширении возможностей и поддержке на основе анализа данных о состоянии здоровья и производительности. Конечно, реактивные оповещения необходимы, но в случае критически важных конвейеров они не обеспечивают достаточной защиты и не позволяют командам быстро анализировать данные по первопричинам (RCA) или предотвращать сбои при самостоятельном использовании.
Чтобы иметь все возможности для защиты критически важных активов, инженерам необходимо иметь представление о том, кому что принадлежит в их цепочках поставок и в масштабах всей организации, поскольку критически важные информационные продукты часто поставляются за счет активов, принадлежащих нескольким командам. Им также необходима историческая и прогнозная аналитика для получения информации о работоспособности этих активов: единое окно для всего, что используется в информационном продукте.
Команды должны быть уведомлены, если конвейеру грозит сбой или данные для критически важной информационной панели могут устареть, и у них должна быть возможность быстро выявить и устранить первопричину. Это требует, в дополнение к аналитике и мониторингу, чтобы инженер имел возможность отслеживать происхождение данных в решении для обеспечения наблюдаемости – отслеживание, которое в идеале дополняется информацией о статусе выполнения и продолжительности выполнения и другими метаданными, которые могут помочь владельцам продуктов обработки данных в организации максимально эффективно устранять проблему самостоятельно, даже если проблема возникает в процессе обработки данных. первопричина находится в разработке другой команды.
Почему полезно отслеживать происхождение данных
Отслеживание происхождения данных помогает вам увидеть общую картину ваших данных, показывая, откуда они берутся, как они меняются, кому они принадлежат на каждом этапе и куда они направляются. Такая ясность облегчает доверие к вашим данным. Отслеживая данные на разных уровнях в различных информационных ресурсах, таких как таблицы хранилища, хранилища данных и задачи воздушного потока, отслеживание происхождения помогает анализировать влияние и быстро устранять проблемы. Знание того, как одна часть ваших данных влияет на другие, позволяет принимать более разумные решения и избегать непредвиденных проблем. Такая прозрачность повышает доверие к точности данных для конкретных случаев использования и позволяет принимать обоснованные решения до внесения изменений и избегать нежелательных изменений в дальнейшем.
Аналитика в Astro Observe
Панель мониторинга унифицированных продуктов обработки данных предоставляет исторические данные о производительности продуктов обработки данных в соответствии с ожиданиями в отношении своевременности и свежести, а также прогнозную оценку, благодаря чему вы сразу получаете полезную информацию о состоянии активов. Панель мониторинга позволяет выявлять задачи, которые неэффективны или ставят под угрозу критически важные бизнес-активы, прежде чем они приведут к полному краху. Аналитика в Astro Observe использует соглашения об уровне обслуживания (подробнее об этом ниже).

Панель мониторинга продукта данных в Astro Observe. Панель мониторинга отображает прогнозную оценку с цветовой кодировкой и историческую аналитику, основанную на показателях продукта данных в соответствии с ожиданиями в отношении своевременности и свежести.
Расширенный график происхождения данных Astro Observe визуализирует восходящие и нисходящие зависимости во всех ресурсах продукта данных с информацией о статусе выполнения и продолжительности выполнения на узлах задачи. Также имеется панель подробных сведений, содержащая предупреждения, рекомендации и ссылку на Airflow для отладки. Вы можете использовать график, чтобы узнать о пути, по которому данные в вашей организации проходят через различные группы, включая различные развертывания, прежде чем они попадут в конечный пункт назначения. Без такого отслеживания цепочки передачи данных сложнее узнать обо всех конвейерах, которые касаются критически важных данных в организации, а также о том, к кому обращаться в случае сбоя или задержки выполнения вышестоящих задач.
Мониторинг в Astro Observe
Вы можете использовать соглашения об уровне обслуживания для определения ожиданий в отношении своевременной доставки и свежести данных продуктов. Используемые в сочетании с оповещениями, соглашения об уровне обслуживания значительно расширяют набор функций мониторинга Airflow. В Astro Observe вы можете использовать соглашения об уровне обслуживания для мониторинга конвейеров на предмет несвоевременной доставки данных, составляющих важный отчет, или на предмет свежести данных в критически важной информационной панели – возможности, которой Airflow с открытым исходным кодом сам по себе не предоставляет. (Технически, вы можете попробовать использовать соглашения об уровне обслуживания Airflow, но мы не рекомендуем этого делать.) Соглашения об уровне обслуживания также позволяют получать аналитические данные в продукте, так что вы можете сразу увидеть тенденции в производительности активов.

Интерфейс для создания соглашения об уровне обслуживания в Astro Observe.
Astro Observe поддерживает автоматическое обнаружение аномалий, которое предупреждает вас о выполнении задач с длительностью, превышающей стандартное отклонение от предыдущих запусков задачи, так что вы можете выявлять и отлаживать проблемные задачи до того, как они задержат или нарушат работу ваших конвейеров.

Предупреждение об обнаружении аномалии в Astro Observe.
Оповещение в Astro Observe
Вы можете настроить оповещения для уведомлений о том, что продукты данных не соответствуют требованиям SLA. В уведомлениях содержатся ссылки на ресурсы для быстрой отладки. Вы также можете использовать упреждающие оповещения, чтобы получать уведомления, если для ресурса может быть нарушено соглашение об уровне обслуживания за своевременность или свежесть.

Интерфейс для создания упреждающего оповещения в Astro Observe.
Уведомления о предупреждениях от платформы содержат ссылки на все оцениваемые ресурсы и их статусы, что позволяет быстро находить и отлаживать задачи, вызвавшие задержку или сбой.

Активы оцениваются в соответствии с соглашением об уровне обслуживания, что позволяет выявить активы, которые привели к задержке или сбою конвейера.
Начало работы с Astro Observe
Astro Observe расширяет возможности команд, предоставляя им глубокое представление о цепочках поставок, которые создают их информационные продукты. Вы можете легко создавать продукты для обработки данных, используя все разрозненные ресурсы вашей организации, которые обеспечивают работу критически важного продукта для обработки данных, что позволяет легко отслеживать производительность и устранять проблемы по мере их возникновения даже в разных развертываниях.



