BI Consult Desktop Logo BI Consult Mobile Logo
  • Russian BI Исследование российских bi
  • Перейти на Fine BI
  • Контакты
  • +7 812 334-08-01
    +7 499 608-13-06
  • Отправить сообщение
  • Главная
  • Продукты Эксперт-BI
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Сельское хозяйство
    • Энергетика
    • FMCG
    • Девелоперы
    • Маркетплейсы
    • Пищевая промышленность
    • Фармацевтика
    • Построение Data Platform
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и FP&A
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • IBP
    • ИТ (CIO)
    • Закупки
  • Платформы
    • Системы бизнес-анализа (BI)
    • Интегрированное бизнес-планирование (IBP)
    • Хранилища данных (DWH / Lakehouse)
    • Каталоги данных (Data Catalog)
    • Системы ETL и ELT
    • AI / Исскуственный интеллект
    • Шина данных (ESB)
    • Система управления мастер-данными (MDM)
    • Семантический слой
  • Услуги
    • Переход на отечественные BI и DWH системы
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений и DWH
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Курсы
    • Учебный курс Информационная грамотность (Data Literacy)
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Greenplum
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt (Data Build Tool)
  • Компания
    • Руководство
    • Новости
    • Клиенты
    • Карьера
    • Скачать
    • Контакты

BI

  • FineBI
  • FineReport
  • FineDataLink
  • FineChatBI (FineAI)
  • Коннекторы данных из 1С в BI
  • Airflow / Nifi
  • Visiology
  • PIX BI
  • Modus BI
  • Yandex.DataLens
  • Open-source BI: Superset/Metabase
  • Luxms BI
  • AW BI + Alpha BI
  • FlyBI + Форсайт. Аналитическая Платформа
  • Loginom
  • Триафлай
  • AI / Исскуственный интеллект
  • Optimacros
  • Навигатор BI
  • Семантический слой

СУБД

  • Arenadata
  • ClickHouse
  • Greenplum
  • Postgres Professional
  • TData

Другое

  • Построение Data Platform
    • Аналитическое хранилище данных
    • Data Lake и Data Engineering
    • Подробнее про Data Lake
    • Внедрение Lakehouse
      • Apache Doris
      • StarRocks
      • Trino
    • Миграция витрин из пропиетарных DWH на новый стек
    • Учебный курс "Современная архитектура хранилища данных"
Главная » Курсы по системам бизнес-анализа и методологии » Учебный курс Современная архитектура хранилища данных » Trino vs Apache Spark

Trino vs Apache Spark

Я постоянно слежу за тем, как специалисты в области данных  сравнивают различные технологии. В этой статье мы рассмотрим двух самых настоящих гигантов, а именно Apache Spark и Trino (бывший PrestoSQL). Несмотря на то, что обе эти технологии отлично подходят для распределенных запросов, у каждой из них есть свои сильные и слабые стороны. Вот мое мнение насчет того, в каких случаях лучше выбрать Trino.

 

Молниеносная скорость: Trino специально для интерактивного анализа

Trino - это идеальный инструмент для быстрого выполнения запросов. Вам нужно нарезать данные из разных источников в режиме реального времени? Trino - это то, что Вам нужно. Его конвейерная архитектура позволяют выполнять различные этапы плана запроса одновременно. Это означает, что Вы получаете результаты своих запросов гораздо быстрее, особенно при итеративном анализе, когда Вы постоянно уточняете свои запросы.

Секреты скорости Trino:

  • Обработка в памяти: Trino хранит часто используемые данные в памяти на рабочих узлах. Поэтому необходимости в постоянном считывании данных с диска HDFS или S3 нет. Spark, напротив, по умолчанию записывает промежуточные данные на диск, что добавляет дополнительный шаг ввода-вывода.

 

  • Конвейерное выполнение: Trino разбивает запросы на этапы и выполняет их параллельно. Как только данные одного этапа готовы, запускается следующий этап, не дожидаясь завершения всего запроса. Такой конвейерный подход позволяет использовать ресурсы максимально  эффективно. В Spark этапы обычно выполняются последовательно, что может привести к простоям.

 

  • Обработка столбцов: Trino использует колоночные форматы данных, такие как Parquet. Это позволяет Trino считывать только определенные столбцы, необходимые для каждого конкретного запроса, что по сравнению с форматами, ориентированными на строки, происходит гораздо быстрее. Spark также может работать со столбцовыми форматами, но Trino делает это гораздо быстрее.

 

  • Оптимизации Pushdown: Trino переносит операции фильтрации и проецирования ближе к источнику данных (HDFS/S3). Это означает, что обратно на кластер нужно передавать еще меньше данных, что значительно повышает эффективность обработки запросов. Spark также может выполнять pushdown, но все же Trino в этом плане гораздо производительнее.

 

  • Оптимизированный проект: В отличие от Spark, Trino - это движок запросов, сфокусированный на одной задаче - быстром выполнении запросов. У него нет накладных расходов, как у фреймворка распределенной обработки общего назначения. Это позволяет значительно снизить потребление ресурсов.

 

 

Почему бы просто не использовать Spark?

Безусловно, Spark – достаточно мощный инструмент, но он не всегда подходит для интерактивного анализа или для запросов к большим наборам данных. И вот почему:

  • Поэтапное выполнение в Spark: Spark выполняет запросы поэтапно, что требует больше времени, особенно при интерактивном использовании, когда Вы постоянно уточняете результаты запросов. Конвейерное выполнение Trino обеспечивает более быстрый отклик.

 

  • Перерасход ресурсов: Более широкая функциональность Spark может быть ресурсоемкой. Если Ваша основная цель - быстрый запрос из HDFS/S3, Trino выполнит его гораздо эффективнее на имеющемся оборудовании.

 

  • Фокус на SQL: SQL-подход Trino облегчает написание и понимание запросов, особенно для аналитиков данных, которые уже хорошо знакомы с SQL. Для выполнения сложных задач в Spark может потребоваться программирование на Java/Scala.

 

Благодаря обработке в памяти, конвейерному выполнению и оптимизации для колоночных форматов данных Trino отлично справляется с быстрыми интерактивными запросами к данным, хранящимся в HDFS или S3.

 

Простота SQL: говорите на языке данных

Если Вы - профи в области SQL, Trino обязательно станет Вашим самым лучшим другом. Он поддерживает широкий спектр стандартных функций SQL, что значительно упрощает процесс написания и обработки запросов. Это большая победа для аналитиков данных, которые наконец-то могут сосредоточиться на логике, не мучаясь со сложным синтаксисом. Spark SQL, несмотря на все свои возможности, может потребовать программирования на Java/Scala.

 

Экономичный расход ресурсов

Trino - это чемпион в легком весе. Он разработан специально для быстрого выполнения запросов и в отличие от Spark не требует расходов, связанных с распределенными вычислениями общего назначения. На  практике это означает меньшее потребление ресурсов на Вашем кластере, что позволяет использовать имеющееся у Вас оборудование по максимуму. Spark, будучи более широким фреймворком, является более ресурсоемким.

 

Компромисс: в каких случаях пальма первенства достается Spark?

Несмотря на то, что Trino отлично зарекомендовал себя в определенных областях, его нельзя назвать универсальным решением. Вот задачи, с которыми Spark справляется гораздо эффективнее:

  • Пакетная обработка больших данных: Нужно обработать огромные массивы данных за один раз? В этом случае возможности распределенной обработки Spark практически безграничны. Он с легкостью может обрабатывать огромные объемы данных, которые могут перегрузить Trino.

 

  • Отказоустойчивость: Если риск потери данных является для Вас критическим, обратите внимание на отказоустойчивость Spark. Он может полностью восстановиться после сбоев и продолжать обработку данных, на что Trino не рассчитан.

 

  • Машинное обучение и многое другое: Spark - многоцелевая рабочая лошадка. Данное решение выходит далеко за рамки SQL, позволяя создавать конвейеры машинного обучения и выполнять другие сложные манипуляции с данными в рамках одной и той же структуры. Trino ориентирован исключительно на обработку запросов.

 

Приговор

Моя шпаргалка выглядит следующим образом:

  • Интерактивный анализ и скорость - Trino
  • Пакетная обработка больших объемов данных - Spark
  • Эффективное использование ресурсов - Trino
  • Отказоустойчивость - Spark
  • Интеграция машинного обучения - Spark
  • Простота SQL - Trino

 

В следующий раз при выборе наиболее подходящего инструмента обязательно учитывайте все эти факторы. И Trino, и Spark – действительно мощные инструменты, понимание их сильных и слабых сторон поможет Вам справиться с Вашими задачами гораздо быстрее и эффективнее!

 

Узнать стоимость решенияЗапросить видео презентацию

← Предыдущая статья
Группы ресурсов в шлюзе Trino Chango
Следующая статья →
Создание облегченной конфигурации Trino

Решения

Анализировать ФинансыУвеличивайте ПродажиОптимальный Склад и ЛогистикаМаркетинговые Метрики

Клиенты
  • ПАО АНК «Башнефть» — российская вертикально-интегрированная нефтяная компания, с 2016 года входит в ПАО НК «Роснефть». Главный офис расположен в городе Уфе (Башкортостан). Добыча углеводородов – более 21 млн тонн нефти в год. Объем переработки – более 18 млн тонн нефти в год. Число сотрудников – более 33 тыс. человек.

  • ООО «Ай Пи Ти Групп» (IPT Group) — многопрофильный консалтинговый холдинг, специализирующийся на юридическом и финансовом сопровождении бизнеса. IPT Group занимает высокие позиции в профессиональных рейтингах, входит в ТОП-30 лучших юридических компаний России по версии «Право.ru-300», Global Law Experts и др.

  • Ситилинк

    Электронный дискаунтер «Ситилинк» — один из крупнейших онлайн‑ритейлеров России (3‑е место по объему онлайн‑продаж в рейтинге Data Insight и Ruward 2016 года E‑commerce Index TOP‑100, 8 место в рейтинге Forbes «20 самых дорогих компаний Рунета — 2017»). На рынке работает 9 лет.

    В ассортименте дискаунтера более 50 000 наименований компьютерной цифровой, бытовой и садовой техники, офисной мебели и других товарных категорий. Более 700 мировых брендов в портфеле. Около 4 000 сотрудников по всей России

  • АО «Новосибирскэнергосбыт» является единственным гарантирующим поставщиком электроэнергии на территории г. Новосибирска и Новосибирской области. Предприятие отвечает за электроснабжение клиентов, закупая электроэнергию на оптовом рынке, регулируя поставку электроэнергии через договорные отношения с сетевыми организациями.

  • Решения
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Энергетика
    • Фармацевтика
  • Услуги
    • Переход на отечественные BI и DWH
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Техническая поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Платформы
    • FineBI
    • FineReport
    • FineDataLink
    • Коннекторы данных из 1С в BI
    • Airflow + NiFi
    • Visiology
    • Luxms BI
    • Modus BI
    • PIX BI
    • Arenadata
    • ClickHouse
    • Greenplum
    • Postgres Professional
    • Open-source BI: Superset/Metabase
    • Loginom
    • Yandex.DataLens
    • AI / Исскуственный интеллект
    • Optimacros
    • Шины данных
  • Курсы
    • Учебный курс Информационная грамотность
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt
  • Функциональные решения
    • Создание Data Lake
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и прогнозная аналитика
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • Сквозная аналитика
  • Компания
    • О нас
    • Руководство
    • Новости
    • Клиенты
    • Скачать
    • Контакты
    • Политика конфиденциальности
RutubeVkontakteLinkedInYouTube
ООО "Би Ай Консалт",
ИНН: 7811437757,
ОГРН: 1097847154184
199178, Россия,
Санкт-Петербург,
6-ая линия В.О., Д. 63, 4 этаж
Тел: +7 (812) 334-08-01
Тел: +7 (499) 608-13-06
E-mail: info@biconsult.ru

 

 

 

 

 

×

Пользуясь сайтом, вы соглашаетесь с использованием cookies и политикой конфиденциальности.