BI Consult Desktop Logo BI Consult Mobile Logo
  • Russian BI Исследование российских bi
  • Перейти на Fine BI
  • Контакты
  • +7 812 334-08-01
    +7 499 608-13-06
  • Отправить сообщение
  • Главная
  • Продукты Эксперт-BI
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Сельское хозяйство
    • Энергетика
    • FMCG
    • Девелоперы
    • Маркетплейсы
    • Пищевая промышленность
    • Фармацевтика
    • Построение Data Platform
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и FP&A
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • IBP
    • ИТ (CIO)
    • Закупки
  • Платформы
    • Системы бизнес-анализа (BI)
    • Интегрированное бизнес-планирование (IBP)
    • Хранилища данных (DWH / Lakehouse)
    • Каталоги данных (Data Catalog)
    • Системы ETL и ELT
    • AI / Исскуственный интеллект
    • Шина данных (ESB)
    • Система управления мастер-данными (MDM)
    • Семантический слой
  • Услуги
    • Переход на отечественные BI и DWH системы
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений и DWH
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Курсы
    • Учебный курс Информационная грамотность (Data Literacy)
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Greenplum
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt (Data Build Tool)
  • Компания
    • Руководство
    • Новости
    • Клиенты
    • Карьера
    • Скачать
    • Контакты

BI

  • FineBI
  • FineReport
  • FineDataLink
  • FineChatBI (FineAI)
  • Коннекторы данных из 1С в BI
  • Airflow / Nifi
  • Visiology
  • PIX BI
  • Modus BI
  • Yandex.DataLens
  • Open-source BI: Superset/Metabase
  • Luxms BI
  • AW BI + Alpha BI
  • FlyBI + Форсайт. Аналитическая Платформа
  • Loginom
  • Триафлай
  • AI / Исскуственный интеллект
  • Optimacros
  • Навигатор BI
  • Семантический слой

СУБД

  • Arenadata
  • ClickHouse
  • Greenplum
  • Postgres Professional
  • TData

Другое

  • Построение Data Platform
    • Аналитическое хранилище данных
    • Data Lake и Data Engineering
    • Подробнее про Data Lake
    • Внедрение Lakehouse
      • Apache Doris
      • StarRocks
      • Trino
    • Миграция витрин из пропиетарных DWH на новый стек
    • Учебный курс "Современная архитектура хранилища данных"
Главная » Курсы по системам бизнес-анализа и методологии » Учебный курс Современная архитектура хранилища данных » Apache Parquet

Apache Parquet

Apache Parquet – open-source колоночно-ориентированный формат хранения данных, который может работать с различными схемами кодирования и сжатия, что позволяет оптимизировать его для эффективной работы с Big Data.

 

Apache Parquet -  колоночно-ориентированный формат хранения данных с открытым исходным кодом, разработанный компанией Cloudera, который предназначен для быстрой обработки сложных данных. Изначально он был создан для обмена данными в экосистеме Apache Hadoop, но затем стал частью и других проектов с открытым исходным кодом, таких как Delta Lake, Apache Iceberg и InfluxDB, а также системами Big Data, такими как Hive, Drill, Impala, Presto, Spark, Kudu, Redshift, BigQuery, Snowflake, Clickhouse и т.д. Многие из этих проектов работают с файлами Parquet.

Parquet поддерживает различные схемы кодирования и сжатия на основе каждого столбца, что позволяет эффективно хранить и извлекать данные в большом количестве. Также поддерживаются словари и кодирование по длине строки (RLE) и широкий спектр типов данных, таких как числовые, текстовые и структурированные данные, например JSON. Parquet позволяет включать метаданные (такие как схема, минимальные/максимальные значения и фильтры Блума) на основе каждого столбца. Это помогает планировщику и исполнителю запросов оптимизировать то, что нужно прочитать и декодировать из файла Paquet.

Кроме того, он построен на вложенных структурах данных с использованием  алгоритма сборки, впервые описанного в рамках Dremel от Google.

Apache Parquet является частью проекта Apache Arrow, поэтому он поддерживает большое количество языков, включая Java, C++, Python, R, Ruby, JavaScript, Rust и Go.

 

Основные преимущества Parquet

  • Высокая производительность — количество операций I/O и вычислений минимизировано, поскольку при выполнении запросов сканируется подмножество столбцов используя необходимые данные.
  • Компрессия — организация хранения однородных данных в столбцах обеспечивает лучшее сжатие. Словари и кодирование длины строки обеспечивают эффективное хранение повторяющихся значений.
  • Open Source — надежная экосистема с открытым исходным кодом, которая постоянно совершенствуется благодаря активному сообществу.

 

Как Parquet хранит данные

Давайте на конкретном примере посмотрим, как Parquet хранит данные в столбцах. Ниже представлен простой набор данных, касательно 3 датчиков, с информацией об их идентификаторах, типе и местоположении. Хранение данных в формате, основанном на строках, например csv или Arvo, будет выглядеть следующим образом:

 

При хранении данных колоночно-ориентированного формата, которым является рассматриваемый нами Parquet, данные организованы следующим образом:

 

Колоночно-ориентированный формат хранения данных более удобен для восприятия, поскольку это типичный способ организации данных в электронных таблицах. Кроме того, хранение данных более экономично, поскольку хранилища на основе строк, такие как CSV, не сжимают данные так эффективно, как Parquet.

 

InfluxDB и формат Parquet

Вот пример, с помощью которого мы постараемся продемонстрировать то, как InfluxDB хранит данные временных рядов в формате файлов Parquet.

 

Измерение отображается на один или несколько файлов Parquet, а теги, поля и временные метки - на отдельные столбцы, использующие различные схемы кодирования для достижения наилучшего сжатия файлов.

 

Кроме того, данные организованы в непересекающиеся временные диапазоны. Ниже представлены 3 примера файлов Parquet для одного и того же измерения, но в трех разных временных группах.

 

Такой запрос выполняется быстрее, поскольку позволяет пользователю собрать данные за фиксированный промежуток времени. Кроме того, хранение данных временных рядов таким образом позволяет при необходимости легко удалять данные и экономить драгоценное место.

 

Parquet и функциональная совместимость

Открытый исходный код Parquet и его широкое распространение в других технологиях и экосистемах означает, что пользователи Apache Parquet могут использовать данные временных рядов, хранящиеся в файлах Parquet, в других приложениях. Это позволяет пользователям расширить возможности работы с данными временных рядов  и применять их в тех областях и приложениях, которые ранее были недоступны.

 

 

Узнать стоимость решенияЗапросить видео презентацию

← Предыдущая статья
Apache Parquet: как приручить open-source колоночно-ориентированный формат хранения Big Data
Следующая статья →
Как использовать Apache Hudi для управления Data Lake: руководство для начинающих пользователей
Запросить видео презентацию Запросить доступ к демо стенду online Узнать стоимость лицензий

Задать вопрос

loading...

Решения

Анализировать ФинансыУвеличивайте ПродажиОптимальный Склад и ЛогистикаМаркетинговые Метрики

Клиенты
  • Группа компаний «Галакс» ведет свою деятельность с 2005 года, являясь в те годы дистрибьютором известных международных марок в ряде крупнейших торговых сетей России в сегменте аудио и видео аксессуаров. Активно работая в этом направлении и приобретая ценный опыт, начали создавать собственные торговые марки «GAL» и «VIXTER»

  • ГК «Акрон Холдинг», одно из крупнейших в России промышленно-металлургических предприятий, запустил проект по модернизации управления данными. В качестве целевого решения для анализа ключевых данных компания выбрала систему PIX BI. В компании уже более 100 пользователей PIX BI, и в этом году в планах увеличить их число в два раза.

  • «ПрофХолод» — крупнейший в России производитель сэндвич-панелей с пенополиуретаном. 

  • АО «НСПК» - оператор национальной системы платежных карт, который предоставляет операционные услуги и услуги платежного клиринга операторам платежных систем, в том числе Банку России и кредитным организациям. В задачи АО «НСПК» входит обеспечение бесперебойного доступа к переводам денежных средств в Российской Федерации с использованием платежных инструментов.  Также компания является оператором национальной платёжной системы «Мир» и операционным и платёжным клиринговым центром Системы быстрых платежей (СБП).

  • Решения
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Энергетика
    • Фармацевтика
  • Услуги
    • Переход на отечественные BI и DWH
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Техническая поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Платформы
    • FineBI
    • FineReport
    • FineDataLink
    • Коннекторы данных из 1С в BI
    • Airflow + NiFi
    • Visiology
    • Luxms BI
    • Modus BI
    • PIX BI
    • Arenadata
    • ClickHouse
    • Greenplum
    • Postgres Professional
    • Open-source BI: Superset/Metabase
    • Loginom
    • Yandex.DataLens
    • AI / Исскуственный интеллект
    • Optimacros
    • Шины данных
  • Курсы
    • Учебный курс Информационная грамотность
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt
  • Функциональные решения
    • Создание Data Lake
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и прогнозная аналитика
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • Сквозная аналитика
  • Компания
    • О нас
    • Руководство
    • Новости
    • Клиенты
    • Скачать
    • Контакты
    • Политика конфиденциальности
RutubeVkontakteLinkedInYouTube
ООО "Би Ай Консалт",
ИНН: 7811437757,
ОГРН: 1097847154184
199178, Россия,
Санкт-Петербург,
6-ая линия В.О., Д. 63, 4 этаж
Тел: +7 (812) 334-08-01
Тел: +7 (499) 608-13-06
E-mail: info@biconsult.ru

 

 

 

 

 

×

Пользуясь сайтом, вы соглашаетесь с использованием cookies и политикой конфиденциальности.