BI Consult Desktop Logo BI Consult Mobile Logo
  • Russian BI Исследование российских bi
  • Перейти на Fine BI
  • Контакты
  • +7 812 334-08-01
    +7 499 608-13-06
  • Отправить сообщение
  • Главная
  • Продукты Эксперт-BI
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Сельское хозяйство
    • Энергетика
    • FMCG
    • Девелоперы
    • Маркетплейсы
    • Пищевая промышленность
    • Фармацевтика
    • Построение Data Platform
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и FP&A
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • IBP
    • ИТ (CIO)
    • Закупки
  • Платформы
    • Системы бизнес-анализа (BI)
    • Интегрированное бизнес-планирование (IBP)
    • Хранилища данных (DWH / Lakehouse)
    • Каталоги данных (Data Catalog)
    • Системы ETL и ELT
    • AI / Исскуственный интеллект
    • Шина данных (ESB)
    • Система управления мастер-данными (MDM)
    • Семантический слой
  • Услуги
    • Переход на отечественные BI и DWH системы
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений и DWH
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Курсы
    • Учебный курс Информационная грамотность (Data Literacy)
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Greenplum
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt (Data Build Tool)
  • Компания
    • Руководство
    • Новости
    • Клиенты
    • Карьера
    • Скачать
    • Контакты

BI

  • FineBI
  • FineReport
  • FineDataLink
  • FineChatBI (FineAI)
  • Коннекторы данных из 1С в BI
  • Airflow / Nifi
  • Visiology
  • PIX BI
  • Modus BI
  • Yandex.DataLens
  • Open-source BI: Superset/Metabase
  • Luxms BI
  • AW BI + Alpha BI
  • FlyBI + Форсайт. Аналитическая Платформа
  • Loginom
  • Триафлай
  • AI / Исскуственный интеллект
  • Optimacros
  • Навигатор BI
  • Семантический слой

СУБД

  • Arenadata
  • ClickHouse
  • Greenplum
  • Postgres Professional
  • TData

Другое

  • Построение Data Platform
    • Аналитическое хранилище данных
    • Data Lake и Data Engineering
    • Подробнее про Data Lake
    • Внедрение Lakehouse
      • Apache Doris
      • StarRocks
      • Trino
    • Миграция витрин из пропиетарных DWH на новый стек
    • Учебный курс "Современная архитектура хранилища данных"
Главная » Курсы по системам бизнес-анализа и методологии » Учебный курс по DWH » Архитектура Data Warehouse: подробное описание

Архитектура Data Warehouse: подробное описание

Введение

Прежде чем погрузиться в детали архитектуры хранилища данных, давайте как следует разберемся в назначении хранилища данных. Хранилища данных уникальны тем, что в одном месте хранятся как актуальные, так и архивные данные. Хранилище данных - это репозиторий данных, которые были получены из самых разных источников. Данные организованы в таблицы и другие базы данных, чтоб делает их более доступными и удобными в использовании. Хотя термин "хранилище данных" может вызывать ассоциации с большими хранилищами, предъявляющими высокие требования к хранению данных, многие современные хранилища максимально оптимизированы для того, чтобы ими могли использовать компании любого размера.

В этой статье мы расскажем обо всем, что нужно знать о проектировании архитектуры хранилища данных. Мы объясним, почему хранилища данных необходимы и как они могут быть реализованы, а также обсудим основные типы архитектур и выделим факторы, которые следует учитывать при выборе между различными вариантами.

 

Архитектура Data Warehouse

Существует три подхода к созданию хранилища данных: одноуровневый, двухуровневый и трехуровневый.

Одноуровневая архитектура (1-Tier): данный тип предназначен для хранения минимального объема данных. В реальной жизни данная структура используется редко.

 

Двухуровневая архитектура (2-Tier): хранилище данных - это совокупность данных, представленных в формате, который легко преобразовать и затем загрузить в базу данных. Хранилища данных могут быть реализованы различными способами, и очень важно выбрать именно тот, который подходит для нужд Вашего бизнеса. Самое важное, что следует учитывать, - это масштабируемость.

 

Трехуровневая архитектура (3-Tier): архитектурная модель программного комплекса, предполагающая наличие в нём трёх типов уровней:

  1. Нижний уровень хранилища данных - это реляционная система баз данных. Внутренние инструменты очищают, преобразуют и загружают данные в этот уровень.
  2. OLAP-сервер среднего уровня основан либо на ROLAP, либо на MOLAP. Хранилища данных, которые облегчают взаимодействие конечного пользователя с базой данных, и OLAP-серверы среднего уровня, которые абстрагируют OLAP от конечного пользователя, называются OLAP-серверами среднего уровня
  3. Внешний клиентский слой верхнего уровня важен, поскольку это первая точка взаимодействия с данными. Именно здесь данные представляются конечному пользователю, и на их основе принимаются решения. Внешний клиентский уровень верхнего уровня должен работать с данными в режиме реального времени и уметь быстро их обрабатывать. Также важно работать с данными в формате, который верхний уровень может понять и использовать. Как правило, данные верхнего уровня имеют формат реляционной базы данных, но это может быть файл или поток. Данные верхнего уровня должны быть хорошо структурированы, проверены и структурированы таким образом, чтобы облегчить профилирование и аналитику данных.

 

Свойства архитектуры Data Warehouse

Система хранения данных должна отвечать следующим требованиям:

  • Аналитические и транзакционные процессы можно максимально разделить ;
  • Масштабируемость решения должна проявляться в способности обрабатывать огромные объемы данных и передавать их в различные пункты назначения с высокой скоростью и в различных форматах. Поток данных должен обрабатываться и представляться в требуемом формате, в нужное время и в нужном месте, с минимальным воздействием на существующую инфраструктуру. Поток данных должен быть защищен и управляться с максимальным уровнем конфиденциальности и целостности. Размер потока данных и скорость их генерации должны определяться бизнес-требованиями, а имеющиеся аппаратные и программные ресурсы должны использоваться максимально эффективно;
  • Архитектура должна быть расширяемой; новые функции (например, искусственный интеллект) могут быть реализованы в существующем сервисе путем расширения его API. В Новые технологии также должны внедряться в основные сервисы; основные сервисы могут быть расширены для новых бизнес-функций, таких как управление отношениями с клиентами;
  • Безопасность данных - важнейший аспект стратегии управления данными. Средства контроля безопасности данных в самом источнике подразумевают создание средств контроля доступа к данным и их шифрование, а также политики безопасности данных и мониторинг доступа к ним;
  • Пользователи должны иметь возможность работать с данными максимально эффективно и результативно. Управление хранилищем данных должно быть простым даже для новичков.

 

Типы архитектуры Data Warehouse

Существует три типа архитектуры хранилища данных:

 

Одноуровневая архитектура

Одноуровневые архитектуры используются для пакетной обработки данных, а также для обработки в режиме реального времени. Сначала данные передаются в одноуровневую архитектуру, где они преобразуются в формат, пригодный для обработки в режиме реального времени. Такая архитектура известна как "однопоточная". После этого данные передаются в систему, работающую в режиме реального времени. В настоящее время одноуровневые архитектуры являются наиболее предпочтительным способом обработки оперативных данных.

 

Промежуточное ПО для хранения и обработки данных должно уметь определять качество данных, прежде чем они будут преобразованы в необходимую информацию.

 

Двухуровневая архитектура

В двухуровневом хранилище данных аналитический процесс отделен от бизнес-процесса. Это позволяет в разы повысить уровень контроля данных. Кроме того, двухуровневая система обеспечивает лучшее понимание данных и позволяет принимать более взвешенные решения.

 

Основные характеристики двухуровневой архитектуры:

  • Источник данных имеет решающее значение для целостности хранилища данных. Целостность данных, хранящихся в хранилище данных, должна быть гарантирована на 100 %. Целостность данных - это степень достоверности или точности значений данных, хранящихся в базе данных;
  • Data staging - это ключевой процесс ETL, который позволяет значительно сократить время, необходимое для извлечения, преобразования и загрузки большого набора данных. Инструменты ETL могут извлекать данные из различных источников, преобразовывать их с помощью специфических инструментов и загружать в хранилище данных;
  • Метаданные хранилища данных - важнейший компонент хранилища данных. Это информация, которая помогает администратору хранилища данных решить, какие данные удалить, какие сохранить, а какие использовать в будущих отчетах. Она также важна для поддержания согласованности данных;
  • Профилирование данных также имеет большое значение, поскольку оно помогает проверить целостность данных. Важно помнить, что это не просто хранилище данных, а живая платформа данных, которая получает и анализирует огромные объемы данных. Поэтому важно следить за изменениями данных, масштабируемостью и производительностью системы в целом.

 

Трехуровневая архитектура

Трехуровневая структура включает в себя слой источника, согласованный слой и слой хранилища данных. Согласованный слой располагается между исходными данными и хранилищем данных. Основным недостатком согласованного слоя является тот факт, что невозможно полностью игнорировать проблемы с данными до их согласования. Поэтому основное внимание должно быть сосредоточено на целостности, точности и непротиворечивости данных. Например, предположим, что в хранилище данных содержатся данные компании, которые достаточно часто обновляются, например информация о заказах. В этом случае оптимальным подходом будет использование веб-инструмента обновления хранилища данных, который извлекает самые актуальные данные из хранилища данных и обновляет их в корпоративном приложении. Такая архитектура подходит для систем с длительным жизненным циклом. Эта архитектура также известна как архитектура, ориентированная на данные. В основном, такая структура используется для крупномасштабных систем.

 

Преимущества архитектуры Data Warehouse

  • Витрины данных — это часть хранилища данных, которая занимается каким-то одним вопросом. Зачастую они создаются и управляются определенным бизнес-отделом. Поскольку они предметно-ориентированы, как правило, они берут данные лишь из небольшого числа источников, которыми могут быть внутренние операционные системы, озера данных, централизованное хранилище данных или какие-либо внешние источники. Витрины данных обычно сжаты и менее сложны, чем хранилища данных, что упрощает их создание и обслуживание;
  • Процесс изменений начинается с выявления проблем и болевых точек Вашей существующей системы, затем составляется план решения этих проблем с помощью новой системы. После этого система тестируется для того, чтобы убедиться, что все работает именно так, как ожидалось. Как только система признана пригодной для использования, начинается процесс изменений;
  • Не зря более 90 % данных, которые собирают предприятия, хранятся в хранилищах данных. Многие хранилища данных предназначены для поддержки процессов ETL и доставки данных в CRM-систему для того, чтобы бизнес-пользователи могли просматривать фактические данные и принимать взвешенные решения;
  • С помощью хранилища данных Вы можете использовать все преимущества процессов ETL. Хранилище данных - это центральный репозиторий Ваших данных, доступ к которым могут получить все Ваши аналитические платформы;
  • Хранилища данных стали еще более быстрыми и производительными благодаря внедрению баз данных NoSQL (в частности, MongoDB или GARIA), позволяющих проводить аналитику в режиме реального времени, оптимизировать процесс принятия решений, а также увеличивать рентабельность.

 

Недостатки архитектуры Data Warehouse

  • Обслуживание хранилища данных – критически важная задача, которую необходимо выполнять качественно, что требует больших усилий, которые, в свою, очередь не всегда оправданы с точки зрения инвестиций. При этом хранилище данных может стать важнейшим компонентом системы управления корпоративными данными;
  • Для того, чтобы ускорить процесс и свести к минимуму время, необходимое для извлечения данных, можно воспользоваться некоторыми инструментами ETL, позволяющими  автоматизировать данный процесс. Однако автоматическое извлечение не гарантирует, что данные будут очищены и проверены должным образом. Когда данные проверены и процесс очистки автоматизирован, они готовы к вводу в хранилище;
  • Интеграция данных необходима любой организации, обрабатывающей большие объемы данных. Необходимо убедиться в том, что все данные интегрированы в хранилище. Для этого можно использовать методы интеллектуального анализа данных;
  • Инфраструктура хранилища должна быть построена так, чтобы анализ огромных объемов данных и их хранение было организовано наиболее экономичным и эффективным способом;
  • Одним из важных аспектов архитектуры хранилища данных, который необходимо тщательно продумать, является источник данных. Если данные поступают из нескольких источников, например из внешних источников, таких как датчики или авторизованные партнеры, то очень важно подумать об интеграции данных. Сначала организация должна решить, с какими источниками данных она будет работать, а затем приступить к интеграции этих источников данных.

 

Заключение

Архитектура хранилища данных - это набор взаимосвязанных БД, которые хранят, организуют и анализируют данные. Она состоит из трех основных компонентов: хранилища данных, аналитической структуры и интеграционного слоя. Хранилище данных - это центральный репозиторий всех данных. Аналитическая структура - это ПО, которое обрабатывает данные и организует их в таблицы. Интеграционный слой - это ПО, которое соединяет базы данных вместе и делает их доступными для других приложений. Архитектура хранилища данных - важная часть любой ИТ-инфраструктуры, поскольку именно она помогает оптимизировать работу всей системы.

Узнать стоимость решенияЗапросить видео презентацию

← Предыдущая статья
Хранилище корпоративных данных: компоненты EDW, ключевые концепты и типы архитектуры
Следующая статья →
Как выбрать СУБД?
Запросить видео презентацию Запросить доступ к демо стенду online Узнать стоимость лицензий

Задать вопрос

loading...

Решения

Анализировать ФинансыУвеличивайте ПродажиОптимальный Склад и ЛогистикаМаркетинговые Метрики

Клиенты
  • Группа компаний «Галакс» ведет свою деятельность с 2005 года, являясь в те годы дистрибьютором известных международных марок в ряде крупнейших торговых сетей России в сегменте аудио и видео аксессуаров. Активно работая в этом направлении и приобретая ценный опыт, начали создавать собственные торговые марки «GAL» и «VIXTER»

  • Авиакомпания NordStar (АО «АК «НордСтар») – работает под данным брендом с 2008 г. и сейчас входит в топ-15 крупнейших российских авиакомпаний (данные Росавиации) с пассажирооборотом более 1 млн человек в год. АО «АК «НордСтар» выполняет и внутренние, и внешние рейсы, а ее основные хабы - Домодедово, Пулково и Емельяново. С 2021 года компания является базовым перевозчиком аэропорта Норильск.

  • "Холодильник.ру" - крупнейший в России интернет-магазин бытовой техники и электроники. Компания была основана в 2003 году и за почти 20 лет работы завоевала лидирующие позиции на рынке онлайн ритейла. По данным исследовательского агентства Data Insight, "Холодильник.ру" входит в top-10 крупнейших интернет-магазинов России в категории "электроника и бытовая техника". Компания имеет развитую логистическую инфраструктуру и ежедневно осуществляет более 3500 доставок заказов по всей стране.

  • ПАО АНК «Башнефть» — российская вертикально-интегрированная нефтяная компания, с 2016 года входит в ПАО НК «Роснефть». Главный офис расположен в городе Уфе (Башкортостан). Добыча углеводородов – более 21 млн тонн нефти в год. Объем переработки – более 18 млн тонн нефти в год. Число сотрудников – более 33 тыс. человек.

  • Решения
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Энергетика
    • Фармацевтика
  • Услуги
    • Переход на отечественные BI и DWH
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Техническая поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Платформы
    • FineBI
    • FineReport
    • FineDataLink
    • Коннекторы данных из 1С в BI
    • Airflow + NiFi
    • Visiology
    • Luxms BI
    • Modus BI
    • PIX BI
    • Arenadata
    • ClickHouse
    • Greenplum
    • Postgres Professional
    • Open-source BI: Superset/Metabase
    • Loginom
    • Yandex.DataLens
    • AI / Исскуственный интеллект
    • Optimacros
    • Шины данных
  • Курсы
    • Учебный курс Информационная грамотность
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt
  • Функциональные решения
    • Создание Data Lake
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и прогнозная аналитика
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • Сквозная аналитика
  • Компания
    • О нас
    • Руководство
    • Новости
    • Клиенты
    • Скачать
    • Контакты
    • Политика конфиденциальности
RutubeVkontakteLinkedInYouTube
ООО "Би Ай Консалт",
ИНН: 7811437757,
ОГРН: 1097847154184
199178, Россия,
Санкт-Петербург,
6-ая линия В.О., Д. 63, 4 этаж
Тел: +7 (812) 334-08-01
Тел: +7 (499) 608-13-06
E-mail: info@biconsult.ru

 

 

 

 

 

×

Пользуясь сайтом, вы соглашаетесь с использованием cookies и политикой конфиденциальности.