BI Consult Desktop Logo BI Consult Mobile Logo
  • Russian BI Исследование российских bi
  • Перейти на Fine BI
  • Контакты
  • +7 812 334-08-01
    +7 499 608-13-06
  • Отправить сообщение
  • Главная
  • Продукты Эксперт-BI
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Сельское хозяйство
    • Энергетика
    • FMCG
    • Девелоперы
    • Маркетплейсы
    • Пищевая промышленность
    • Фармацевтика
    • Построение Data Platform
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и FP&A
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • IBP
    • ИТ (CIO)
    • Закупки
  • Платформы
    • Системы бизнес-анализа (BI)
    • Интегрированное бизнес-планирование (IBP)
    • Хранилища данных (DWH / Lakehouse)
    • Каталоги данных (Data Catalog)
    • Системы ETL и ELT
    • AI / Исскуственный интеллект
    • Шина данных (ESB)
    • Система управления мастер-данными (MDM)
    • Семантический слой
  • Услуги
    • Переход на отечественные BI и DWH системы
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений и DWH
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Курсы
    • Учебный курс Информационная грамотность (Data Literacy)
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Greenplum
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt (Data Build Tool)
  • Компания
    • Руководство
    • Новости
    • Клиенты
    • Карьера
    • Скачать
    • Контакты

BI

  • FineBI
  • FineReport
  • FineDataLink
  • FineChatBI (FineAI)
  • Коннекторы данных из 1С в BI
  • Airflow / Nifi
  • Visiology
  • PIX BI
  • Modus BI
  • Yandex.DataLens
  • Open-source BI: Superset/Metabase
  • Luxms BI
  • AW BI + Alpha BI
  • FlyBI + Форсайт. Аналитическая Платформа
  • Loginom
  • Триафлай
  • AI / Исскуственный интеллект
  • Optimacros
  • Навигатор BI
  • Семантический слой

СУБД

  • Arenadata
  • ClickHouse
  • Greenplum
  • Postgres Professional
  • TData

Другое

  • Построение Data Platform
    • Аналитическое хранилище данных
    • Data Lake и Data Engineering
    • Подробнее про Data Lake
    • Внедрение Lakehouse
      • Apache Doris
      • StarRocks
      • Trino
    • Миграция витрин из пропиетарных DWH на новый стек
    • Учебный курс "Современная архитектура хранилища данных"
Главная » Курсы по системам бизнес-анализа и методологии » Учебный курс Современная архитектура хранилища данных » Petastorm: Простой подход к моделям глубокого обучения в формате Apache Parquet

Petastorm: Простой подход к моделям глубокого обучения в формате Apache Parquet

Petastorm, библиотека доступа к данным с открытым исходным кодом, позволяет проводить одноузловое или распределенное обучение, а также оценку моделей глубокого обучения именно на основе наборов данных в формате Apache Parquet и наборов данных, которые уже загружены как Apache Spark DataFrames. Она поддерживает самые популярные фреймворки ML  основе Python, такие как Tensorflow, PyTorch и PySpark. Более подробная информация доступна на официальной странице Petastorm в GitHub и официальной документации.

Petastorm позволяет проводить как одномашинное, так и распределенное обучение, а также поддерживает множество ML-фреймворков на базе Python, таких как NumPy, Tensorflow, Theano, Pytorch и PySpark. Это лучшая библиотека для оценки моделей глубокого обучения с использованием наборов данных в формате Apache Parquet.

В статье мы рассмотрим следующие темы:

  • Создание набора данных Petastorm, совместимого с различными ML-фреймворками
  • Анализ и работа с набором данных
  • Распараллеливание операций загрузки и декодирования данных

 

Ключевые характеристики Petastorm

Для поддержки различных сценариев обучения алгоритмов в Petastorm реализованы различные функции, включая эффективную реализацию разделения данных, фильтрацию строк, перемешивание, доступ к подмножеству полей и поддержку данных временных рядов. Эти данные также называются n-граммами.

 

Структура типичного набора данных

  • Несколько столбцов, содержащих сигналы, полученные от датчиков, которые были собраны во время испытаний автомобилей, включая камеры и радары.
  • Созданные вручную метки, которые хранятся в виде полей в строке.

 

Строки в типичном наборе данных отсортированы в хронологическом порядке. Стандартный размер строки составляет от 30 до 100.

 

 

Создание набора данных Petastorm, совместимого с различными ML-фреймворками

Чтобы сгенерировать набор данных с помощью Petastorm, нужно определить Unischema, которая представляет собой просто схему данных. На этом этапе Вам нужно определить схему, поскольку Petastorm переведет ее во все поддерживаемые форматы фреймворков, включая TensorFlow, чистый Python и PySpark.

Для чтения экземпляра Unischema достаточно указать путь к набору данных, так как он сериализуется как настраиваемое поле в метаданных хранилища Parquet.

 

Анализ и работа с набором данных

Анализ и работа с набором данных возможны благодаря использованию формата данных Parquet, который поддерживается Spark, что обусловливает наличие инструментов Spark.

 

Распараллеливание операций загрузки и декодирования данных

Petastorm использует две стратегии распараллеливания операций загрузки и декодирования данных:

  • Реализация пула потоков
  • Реализация пула процессов

 

Стратегический выбор зависит от типа данных, которые Вы хотите читать.

В типичном сценарии  “Модель машинного обучения: Python Sklearn & Keras», стратегия реализации пула потоков используется, когда строка содержит закодированные изображения с высоким разрешением. Это связано с тем, что в этом случае большая часть времени обработки тратится на декодирование изображений с помощью кода на C++. В этом случае глобальная блокировка интерпретатора Python (GIL) не поддерживается.

При небольших размерах строк целесообразно использовать стратегию реализации пула процессов. В этом случае большая часть обработки выполняется только с помощью кода Python. Для того, чтобы преодолеть сериализацию выполнения, вызванную глобальной блокировкой интерпретатора, должны параллельно работать сразу несколько процессов.

 

Заключение

Petastorm является библиотекой доступа к данным с открытым исходным кодом, разработанной компанией Uber ATG. Данное решение позволяет проводить как одномашинное, так и распределенное обучение, а также оценку моделей глубокого обучения на основе наборов данных в формате Apache Parquet.

В этой статье рассказывается о том, как использовать Petastorm в качестве основного подхода, позволяющего использовать всего один набор данных. В ней также рассматриваются поддерживаемые инструменты, которые помогают оценивать модели глубокого обучения.

Petastorm работает с самыми популярными фреймворками машинного обучения на базе Python, такие как PyTorch, PySpark и Tensorflow.

 

Узнать стоимость решенияЗапросить видео презентацию

← Предыдущая статья
Визуализация файлов Parquet с помощью Apache Superset, Trino или PrestoSQL
Следующая статья →
Глубокое погружение в Apache Parquet: Эффективное хранение данных для аналитики
Запросить видео презентацию Запросить доступ к демо стенду online Узнать стоимость лицензий

Задать вопрос

loading...

Решения

Анализировать ФинансыУвеличивайте ПродажиОптимальный Склад и ЛогистикаМаркетинговые Метрики

Клиенты
  • ООО "Уральская транспортная компания" — это транспортно-логистическая компания, специализирующаяся на железнодорожных перевозках грузов, создана в 2009 году.

  • АО «Евросиб СПб–транспортные системы» – оператор контейнерных сервисов с широкой сетью маршрутов на внутрироссийских и международных направлениях. Имеет успешный опыт управления парком фитинговых платформ, а также организации ускоренных контейнерных поездов, в основе которых точное расписание, оптимальные сроки доставки груза и экономическая целесообразность.

  • Группа компаний «Невский кондитер» основана в 1996 году в Санкт-Петербурге и на сегодняшний день является одним из крупнейших производителей кондитерских изделий в России.

     

  • Группа компаний "Дёке" производит товары для внешней отделки загородных домов. Ассортимент включает виниловый сайдинг, фасадные панели, водосточные системы, чердачные лестницы и гибкую битумную черепицу. Продукция Дёке вызывает гордость у сотрудников и партнеров компании.

  • Решения
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Энергетика
    • Фармацевтика
  • Услуги
    • Переход на отечественные BI и DWH
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Техническая поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Платформы
    • FineBI
    • FineReport
    • FineDataLink
    • Коннекторы данных из 1С в BI
    • Airflow + NiFi
    • Visiology
    • Luxms BI
    • Modus BI
    • PIX BI
    • Arenadata
    • ClickHouse
    • Greenplum
    • Postgres Professional
    • Open-source BI: Superset/Metabase
    • Loginom
    • Yandex.DataLens
    • AI / Исскуственный интеллект
    • Optimacros
    • Шины данных
  • Курсы
    • Учебный курс Информационная грамотность
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt
  • Функциональные решения
    • Создание Data Lake
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и прогнозная аналитика
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • Сквозная аналитика
  • Компания
    • О нас
    • Руководство
    • Новости
    • Клиенты
    • Скачать
    • Контакты
    • Политика конфиденциальности
RutubeVkontakteLinkedInYouTube
ООО "Би Ай Консалт",
ИНН: 7811437757,
ОГРН: 1097847154184
199178, Россия,
Санкт-Петербург,
6-ая линия В.О., Д. 63, 4 этаж
Тел: +7 (812) 334-08-01
Тел: +7 (499) 608-13-06
E-mail: info@biconsult.ru

 

 

 

 

 

×

Пользуясь сайтом, вы соглашаетесь с использованием cookies и политикой конфиденциальности.