BI Consult Desktop Logo BI Consult Mobile Logo
  • Russian BI Исследование российских bi
  • Перейти на Fine BI
  • Контакты
  • +7 812 334-08-01
    +7 499 608-13-06
  • Отправить сообщение
  • Главная
  • Продукты Эксперт-BI
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Сельское хозяйство
    • Энергетика
    • FMCG
    • Девелоперы
    • Маркетплейсы
    • Пищевая промышленность
    • Фармацевтика
    • Построение Data Platform
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и FP&A
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • IBP
    • ИТ (CIO)
    • Закупки
  • Платформы
    • Системы бизнес-анализа (BI)
    • Интегрированное бизнес-планирование (IBP)
    • Хранилища данных (DWH / Lakehouse)
    • Каталоги данных (Data Catalog)
    • Системы ETL и ELT
    • AI / Исскуственный интеллект
    • Шина данных (ESB)
    • Система управления мастер-данными (MDM)
    • Семантический слой
  • Услуги
    • Переход на отечественные BI и DWH системы
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений и DWH
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Курсы
    • Учебный курс Информационная грамотность (Data Literacy)
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Greenplum
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt (Data Build Tool)
  • Компания
    • Руководство
    • Новости
    • Клиенты
    • Карьера
    • Скачать
    • Контакты

BI

  • FineBI
  • FineReport
  • FineDataLink
  • FineChatBI (FineAI)
  • Коннекторы данных из 1С в BI
  • Airflow / Nifi
  • Visiology
  • PIX BI
  • Modus BI
  • Yandex.DataLens
  • Open-source BI: Superset/Metabase
  • Luxms BI
  • AW BI + Alpha BI
  • FlyBI + Форсайт. Аналитическая Платформа
  • Loginom
  • Триафлай
  • AI / Исскуственный интеллект
  • Optimacros
  • Навигатор BI
  • Семантический слой

СУБД

  • Arenadata
  • ClickHouse
  • Greenplum
  • Postgres Professional
  • TData

Другое

  • Построение Data Platform
    • Аналитическое хранилище данных
    • Data Lake и Data Engineering
    • Подробнее про Data Lake
    • Внедрение Lakehouse
      • Apache Doris
      • StarRocks
      • Trino
    • Миграция витрин из пропиетарных DWH на новый стек
    • Учебный курс "Современная архитектура хранилища данных"
Главная » Курсы по системам бизнес-анализа и методологии » Учебный курс Современная архитектура хранилища данных » Аналитика: обработка данных с помощью Trino

Аналитика: обработка данных с помощью Trino

Trino - это open-source движок запросов, способный выполнять запросы к различным хранилищам данных.

Trino, ранее известный как Presto SQL, - это распределенный SQL-движок с открытым исходным кодом, предназначенный для аналитики Big Data. Разработан для обеспечения высокой производительности и масштабируемости интерактивных аналитических запросов к большим массивам данных.

Представляем Вашему вниманию краткий обзор того, как именно можно использовать Trino в аналитических целях.

В зависимости от требований каждого конкретного проекта мы выбираем самые разные хранилища данных, такие как RDBMS, NoSQL DB, очереди сообщений, эластичные хранилища данных и т.д.

Основная проблема с некоторыми из них заключается в том, что, несмотря на то, что они очень хорошо справляются со своими основными задачами, заглянуть в них или написать произвольный запрос и получить из него какие-то конкретные данные очень сложно.

Рассмотрим Kafka. Данное решение идеально в плане выполнения функций системы обмена сообщениями, но у нас были случаи, когда мы хотели проверить данные в очереди, чтобы узнать, были ли произведены определенные пакеты данных, сколько раз они были произведены, когда они были произведены и т. д., и сделать это было очень сложно.

Некоторые NoSQL БД позволяют пользователям выполнять запросы только по ключам разделов, и если нам нужно время от времени выполнять запрос по какому-то произвольному столбцу, то сделать это невозможно (единственный выход - экспорт данных в какую-то платформу хранения данных или создание дублирующих таблиц в самой базе данных с нужными ключами разделов).

Наконец, мы не можем запросить данные из нескольких различных источников данных и объединить их в целях создания единого набора данных.

Один из способов сделать все это, как уже говорилось ранее, заключается в экспорте данных в Data Lake и переиндексировании данных непосредственно в целевой системе.

В большинстве случаев это работает. Но что, если Вы не хотите часто запрашивать эти данные? В этом случае их экспорт в Data Lake - лишь пустая трата дискового пространства.

Что делать, если Вы хотите запросить только самые последние данные? Большинство заданий по экспорту выполняются раз в день, в основном в конце дня.

Далее, каждый источник данных имеет свой собственный синтаксис для запроса данных, поэтому полезно иметь один язык, который позволяет делать запросы сразу из всех источников данных.

Trino позволяет запрашивать данные на месте, без необходимости их перемещения или  переиндексирования.

Trino был создан как проект Presto внутри Facebook, он был разработан для быстрой обработки запросов к большим наборам данных. Его разработчики утверждают, что он используется для запросов к петабайтам данных.

Facebook выложил Presto в открытый доступ в 2013 году, в течение нескольких последующих лет  он получил широкое признание в индустрии данных. В 2020 году команда, работавшая над Presto, переименовала его в Trino.

 

Как видите, в Trino есть координатор, рабочие узлы и коннекторы.

Когда пользователь отправляет запрос к определенному источнику данных через клиента Trino, в первую очередь он попадает к координатору, который затем разбирает этот запрос и запрашивает отдельные источники данных на предмет метаданных. Эти метаданные сообщают Trino, как эти данные хранятся и индексируются в целевом источнике данных. Используя эту информацию, он создает план запроса, запускает несколько рабочих узлов и  назначает им задания для запроса целевого источника данных.

Затем рабочие узлы запрашивают часть данных, за которую они отвечают, и отправляют результат своего запроса вышестоящим рабочим узлам. В конце потока данные, полученные от нескольких рабочих  узлов, соединяются вместе и возвращаются координатору, который передает их клиенту.

Взаимодействие между координатором и рабочими узлами, а также между самими рабочими узлами происходит через REST по HTTP/HTTPS.

Список коннекторов Trino доступен по следующей ссылке: https://trino.io/docs/current/connector.html

 

Установка

Инструкция по установке и настройке Trino доступна по ссылке: https://trino.io/docs/current/installation/deployment.html

Для начала установите JRE и JDK.

sudo apt update
sudo apt install openjdk-11-jre-headless
sudo apt install default-jre
wget <URL to the .tgz file>

 

Настройка

Распакуйте файл .tgz, перейдите в каталог etc. Теперь нужно добавить некоторые настройки.

После добавления всех файлов дерево файлов будет выглядеть следующим образом.

 

Ниже приведены примеры конфигурационных файлов, которые я использовал для Kafka и Cassandra:

  • config.properties

 

 

Если все настройки верны, то сервер должен запуститься.

 

Клиент Trino

Для запроса данных из настроенных источников данных Вам нужен клиент Trino. Настройка клиента Trino очень проста, следуйте инструкциям, доступным по ссылке: https://trino.io/docs/current/installation/cli.html

Это было очень краткое введение в Trino. Если Вам не нравится работать с клиентом Trino, Вы можете интегрировать его с Apache Superset. Наконец, Trino также предлагает jdbc driver, который позволяет подключаться к Trino из любого java-приложения.

 

Узнать стоимость решенияЗапросить видео презентацию

← Предыдущая статья
7 уроков, которые я вынес в процессе переноса кода dbt из Snowflake в Trino
Следующая статья →
Группы ресурсов в шлюзе Trino Chango

Решения

Анализировать ФинансыУвеличивайте ПродажиОптимальный Склад и ЛогистикаМаркетинговые Метрики

Клиенты
  • KazanExpress — торговая площадка, на которой представлены товары с бесплатной доставкой за один день в более, чем 70 городах России. Аналитическое решение на базе платформы данных Yandex Cloud позволило компании обеспечить демократизацию данных. Результат — принятие обоснованных решений на всех уровнях, увеличение лояльности партнеров и повышение прозрачности бизнеса.

    Мониторинг ключевых метрик в реальном времени минимизировал недополученную прибыль и обеспечил рост прибыльных направлений, а возможности геоаналитики сервиса Yandex DataLens помогли за короткое время проанализировать локации для открытия более 90 ПВЗ в 25 городах России и заложить основу для роста компании.

  • ПАО «Транснефть» – крупнейшая российская нефтепроводная компания. «Транснефть» обеспечивает транспортировку более 85% добываемых в России нефти и нефтепродуктов.

  • Ситилинк

    Электронный дискаунтер «Ситилинк» — один из крупнейших онлайн‑ритейлеров России (3‑е место по объему онлайн‑продаж в рейтинге Data Insight и Ruward 2016 года E‑commerce Index TOP‑100, 8 место в рейтинге Forbes «20 самых дорогих компаний Рунета — 2017»). На рынке работает 9 лет.

    В ассортименте дискаунтера более 50 000 наименований компьютерной цифровой, бытовой и садовой техники, офисной мебели и других товарных категорий. Более 700 мировых брендов в портфеле. Около 4 000 сотрудников по всей России

  • "Холодильник.ру" - крупнейший в России интернет-магазин бытовой техники и электроники. Компания была основана в 2003 году и за почти 20 лет работы завоевала лидирующие позиции на рынке онлайн ритейла. По данным исследовательского агентства Data Insight, "Холодильник.ру" входит в top-10 крупнейших интернет-магазинов России в категории "электроника и бытовая техника". Компания имеет развитую логистическую инфраструктуру и ежедневно осуществляет более 3500 доставок заказов по всей стране.

  • Решения
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Энергетика
    • Фармацевтика
  • Услуги
    • Переход на отечественные BI и DWH
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Техническая поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Платформы
    • FineBI
    • FineReport
    • FineDataLink
    • Коннекторы данных из 1С в BI
    • Airflow + NiFi
    • Visiology
    • Luxms BI
    • Modus BI
    • PIX BI
    • Arenadata
    • ClickHouse
    • Greenplum
    • Postgres Professional
    • Open-source BI: Superset/Metabase
    • Loginom
    • Yandex.DataLens
    • AI / Исскуственный интеллект
    • Optimacros
    • Шины данных
  • Курсы
    • Учебный курс Информационная грамотность
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt
  • Функциональные решения
    • Создание Data Lake
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и прогнозная аналитика
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • Сквозная аналитика
  • Компания
    • О нас
    • Руководство
    • Новости
    • Клиенты
    • Скачать
    • Контакты
    • Политика конфиденциальности
RutubeVkontakteLinkedInYouTube
ООО "Би Ай Консалт",
ИНН: 7811437757,
ОГРН: 1097847154184
199178, Россия,
Санкт-Петербург,
6-ая линия В.О., Д. 63, 4 этаж
Тел: +7 (812) 334-08-01
Тел: +7 (499) 608-13-06
E-mail: info@biconsult.ru

 

 

 

 

 

×

Пользуясь сайтом, вы соглашаетесь с использованием cookies и политикой конфиденциальности.