Полный гид по Data Lineage

Data lineage – явление не новое, но автоматизация наконец-то сделала этот процесс общедоступным и масштабируемым.
В прежние времена (еще в середине 2010-х гг.) формирование data lineage требовало серьезных усилий, выполняемых вручную. Это включало в себя идентификацию активов данных, их отслеживание до источников поступления, документирование этих источников, составление схемы прохождения данных через различные конвейеры и этапы трансформации, а также определение мест, где данные были представлены в инструментальных панелях и отчетах. Такой традиционный метод документирования истории данных требовал много времени и усилий.
Сегодня автоматизация и машинное обучение позволили поставщикам начать предлагать инструменты для data lineage в больших масштабах. Безусловно, data lineage должно стать частью современного стека данных, но если оно не будет выстроено правильно, от него будет не больше пользы, чем от яркой обертки от конфет.
Поэтому настало время погрузиться в эту тему глубже. Давайте разберемся, в чем же заключается сложность data lineage, и как компании, стремящиеся извлечь из данных максимальную ценность, могут с нею справиться.
Что такое data lineage? В чем его важность?
Для начала дадим краткое определение data lineage. Data lineage - это тип метаданных, позволяющий проследить взаимосвязи между восходящими и нисходящими потоками в конвейерах данных. Линейность - это отображение того, откуда берутся данные, как они изменяются по мере продвижения по конвейеру и в какой точке попадают к конечным потребителям.
По мере усложнения массивов данных становится все сложнее определить их происхождение. Однако при правильном подходе построение data lineage оказывается невероятно полезным занятием. Data lineage помогает командам, работающим с данными:
- Понять, как изменения в конкретных активах повлияют на последующие зависимые активы, чтобы не работать вслепую;
- В случае возникновения проблем с данными быстрее устранять их первопричину, поскольку можно сразу увидеть, какие именно ошибки могли привести к сбою всего процесса;
- Немедленно доносить информацию о некачественных данных до потребителей, которые полагаются на отчеты и таблицы, активно информируя их о возможных неточностях в используемых данных и уведомляя об устранении проблем.
К сожалению, некоторые новые подходы к составлению data lineage в большей степени ориентированы на создание привлекательных графиков, а не на составление насыщенной и информативной карты. В отличие от сквозного анализа эти поверхностные подходы не обеспечивают надежной функциональности и всестороннего охвата, необходимого для получения максимального результата от анализа данных.
Не позвольте Вашему варианту data lineage превратиться в тарелку со спагетти!
Давайте рассмотрим сигналы, указывающие на возможную неисправность data lineage решения, и способы, с помощью которых команды специалистов по работе с данными могут найти лучший вариант разрешения сложившейся ситуации:
1 Ориентируйтесь на качество, а не на количество
Современные компании стремятся быть ориентированными на данные, однако сбор большего количества данных не всегда является наилучшим решением для бизнеса. Данные, не имеющие отношения к аналитике, могут стать просто шумом. Накопление больших массивов данных не означает автоматического увеличения их ценности, но однозначно гарантирует увеличение затрат на хранение и обслуживание.
Именно поэтому большие данные понемногу уменьшаются. По прогнозам Gartner, около 70% oрганизаций уже в ближайшее время сместят акцент с больших данных на малые и широкие данные, приняв подход, позволяющий обеспечить более мощную аналитику данных и искусственный интеллект.
Ключевую роль в принятии таких решений должно играть data lineage. Вместо того чтобы просто использовать автоматизацию для сбора и создания поверхностных графиков данных, линейные решения должны включать важную информацию, например, о том, какие активы, кем и как используются. Получив более полную картину использования данных, команды смогут лучше понять, какие данные наиболее ценны для их организации. Устаревшие таблицы или активы, которые больше не используются, будут изъяты из эксплуатации, чтобы избежать потенциальных проблем и путаницы в дальнейшем и помочь бизнесу сосредоточиться на качестве данных, а не на их количестве.
2 Выявите главное с data lineage
Петр Джанда недавно опубликовал статью о том, что команды, работающие с данными, должны обращаться с lineage, как с картами — в частности, как с Google Maps. Он утверждает, что data lineage должно облегчать запросы, чтобы найти то, что Вы ищете, а не полагаться на сложные визуальные образы, по которым трудно ориентироваться.
Например, Вы должны иметь возможность найти нужный Вам продуктовый магазин, не загромождая свой обзор окружающими кофейнями и заправками. "В современных инструментах потенциал data lineage не используется", - пишет Петр. "За исключением нескольких фильтров data lineage не предназначен для поиска; он предназначен для показа. Это большая разница". Мы не можем с этим не согласиться. Командам, работающим с данными, не нужно видеть все данные - им нужно уметь находить то, что важно для решения конкретной проблемы или ответа на конкретный вопрос.

Вот почему так важен lineage на уровне полей. В течение нескольких лет нормой считалась история на уровне таблиц - когда инженеры по обработке данных хотели понять, почему или как произошел сбой в конвейерах данных, им требовалась более высокая детализация. Data lineage на уровне полей помогает командам определить влияние конкретных изменений кода, операций и данных на последующие поля и отчеты.
При сбоях data lineage на уровне полей выявит наиболее важные отчеты, которые могут быть затронуты. Кроме того, такое решение сокращает время на решение проблем, позволяя командам, занимающимся обработкой данных, быстро найти первопричину их возникновения.
3 Организуйте data lineage для более четкого понимания ситуации
Data lineage может пойти по стопам Google Maps и в другом направлении: за счет простой и понятной интерпретации структуры и символов, используемых в линейке.
Подобно тому, как в Google Maps используются единые значки и цвета для обозначения типов предприятий (например, автозаправочных станций и продуктовых магазинов), в решениях для работы с данными должны использоваться четкие соглашения о наименованиях и цветах для описываемых данных, вплоть до логотипов различных инструментов, составляющих конвейеры данных.
По мере того как системы данных становятся все более сложными, организация data lineage поможет командам как можно быстрее извлечь максимальную пользу из своих данных.
4 Обеспечьте верный контекст для data lineage
Хотя накопление данных ради самих данных, возможно, и не поможет удовлетворить потребности бизнеса, сбор и организация большего количества метаданных с правильным бизнес-контекстом - это, скорее всего, хорошая идея. Data lineage, включающая богатые контекстные метаданные, невероятно полезна, поскольку помогает командам быстрее устранять неполадки и понимать, как потенциальные изменения схемы повлияют на последующие отчеты.
Правильные метаданные для конкретного актива данных, включенные в data lineage, позволяют получить ответы, необходимые для принятия обоснованных решений:
- Кто является владельцем этого информационного актива?
- Где находится этот актив?
- Какие данные он содержит?
- Является ли он актуальным и важным для заинтересованных сторон?
- Кто полагается на этот актив, когда я вношу в него изменения?
Когда подобная контекстная информация об использовании информационных активов в бизнесе становится доступной для поиска за счет надежной структуры данных, управление инцидентами становится проще. Вы можете быстрее устранять сбои и сообщать о состоянии затронутых данных заинтересованным сторонам в организации.
5 Маcштабируйте data lineage в соответствии с бизнес-потребностями
В конечном счете, для того, чтобы обеспечить ценность данных, необходимо добиться того, чтобы data lineage была богатой, полезной и масштабируемой. В противном случае это просто "приманка для глаз", которая красиво смотрится в презентациях руководителей, но мало чем может реально помочь командам в предотвращении инцидентов с данными или в ускорении их устранения.
Ранее мы уже упоминали о том, что data lineage стала новым "горячим" слоем в стеке данных благодаря автоматизации. И действительно, автоматизация помогает масштабировать data lineage для работы с новыми источниками данных, новыми конвейерами и более сложными преобразованиями.
Опять же, обратите внимание на карты. Карта не может быть полезной, если она показывает только часть того, что существует в реальном мире. Не имея полного видения ситуации, нельзя полагаться на карту, чтобы найти все необходимое или проложить маршрут из точки А в точку Б. То же самое справедливо и для data lineage.
Решения data lineage должны масштабироваться за счет автоматизации, не урезая охват данных. Каждый конвейер, каждый уровень стека и каждый отчет должны быть приняты во внимание, вплоть до уровня полей, при этом они должны быть доступными для обнаружения, чтобы команды могли найти именно то, что они ищут; важна четкая организация данных, позволяющая легко интерпретировать информацию, и правильные контекстные метаданные, помогающие командам принимать решения быстрее.
Как мы уже сказали ранее, data lineage – мероприятие сложное. Но если его организовать верно, оно продемонстрирует Вам всю свою силу и мощь!
Итог: если data lineage не приносит Вам пользы, в ней нет никакого смысла

Несмотря на то, что сейчас кажется, что data lineage происходит повсеместно, следует помнить, что мы находимся на начальном этапе развития автоматизированной data lineage. Инструменты - Collibra, Informatica, Amundsen, Octopai, Monte Carlo или другие - будут и дальше совершенствоваться, и пока Вы вооружены знаниями о том, как должен выглядеть качественный анализ данных, Вам будет интересно наблюдать за тем, куда движется отрасль.
Наши прогнозы? Эта категория будет в меньшей степени ориентироваться на привлекательные графики данных и в большей - на мощную функциональность, подобную Google Maps.
Хотите увидеть всю мощь data lineage в действии? Узнайте, как команда инженеров по обработке данных в Resident использует линейность и наблюдаемость данных для сокращения числа инцидентов с данными на 90%. А если вы хотите изучить сквозной анализ данных с помощью, свяжитесь с нами. Мы с удовольствием поделимся с Вами нашим подходом к повышению качества данных за счет использования действительно data lineage.





