BI Consult Desktop Logo BI Consult Mobile Logo
  • Russian BI Исследование российских bi
  • Перейти на Fine BI
  • Контакты
  • +7 812 334-08-01
    +7 499 608-13-06
  • Отправить сообщение
  • Главная
  • Продукты Эксперт-BI
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Сельское хозяйство
    • Энергетика
    • FMCG
    • Девелоперы
    • Маркетплейсы
    • Пищевая промышленность
    • Фармацевтика
    • Построение Data Platform
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и FP&A
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • IBP
    • ИТ (CIO)
    • Закупки
  • Платформы
    • Системы бизнес-анализа (BI)
    • Интегрированное бизнес-планирование (IBP)
    • Хранилища данных (DWH / Lakehouse)
    • Каталоги данных (Data Catalog)
    • Системы ETL и ELT
    • AI / Исскуственный интеллект
    • Шина данных (ESB)
    • Система управления мастер-данными (MDM)
    • Семантический слой
  • Услуги
    • Переход на отечественные BI и DWH системы
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений и DWH
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Курсы
    • Учебный курс Информационная грамотность (Data Literacy)
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Greenplum
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt (Data Build Tool)
  • Компания
    • Руководство
    • Новости
    • Клиенты
    • Карьера
    • Скачать
    • Контакты

BI

  • FineBI
  • FineReport
  • FineDataLink
  • FineChatBI (FineAI)
  • Коннекторы данных из 1С в BI
  • Airflow / Nifi
  • Visiology
  • PIX BI
  • Modus BI
  • Yandex.DataLens
  • Open-source BI: Superset/Metabase
  • Luxms BI
  • AW BI + Alpha BI
  • FlyBI + Форсайт. Аналитическая Платформа
  • Loginom
  • Триафлай
  • AI / Исскуственный интеллект
  • Optimacros
  • Навигатор BI
  • Семантический слой

СУБД

  • Arenadata
  • ClickHouse
  • Greenplum
  • Postgres Professional
  • TData

Другое

  • Построение Data Platform
    • Аналитическое хранилище данных
    • Data Lake и Data Engineering
    • Подробнее про Data Lake
    • Внедрение Lakehouse
      • Apache Doris
      • StarRocks
      • Trino
    • Миграция витрин из пропиетарных DWH на новый стек
    • Учебный курс "Современная архитектура хранилища данных"
Главная » Курсы по системам бизнес-анализа и методологии » Учебный курс по Greenplum » Прокачайте свои навыки работы с Big Data: расширенные возможности исследования данных с помощью GreenplumPython 1.1.0 + расширенный поиск по эмбеддингам в PostgreSQL и Greenplum

Прокачайте свои навыки работы с Big Data: расширенные возможности исследования данных с помощью GreenplumPython 1.1.0 + расширенный поиск по эмбеддингам в PostgreSQL и Greenplum

Открываем новые горизонты анализа данных с помощью расширенного поиска по эмбеддингам

GreenplumPython, Python API, позволяет пользователям обрабатывать большие объемы данных, от терабайт до петабайт, в базах данных Greenplum/PostgreSQL с помощью Python данных, не прибегая к экспорту данных на локальные машины. Данное решение было выпущено в качестве первой версии GA в феврале 2023 года.

 

 

Основы GreenplumPython

Эта библиотека Python позволяет Data Scientistам писать код в привычном для них стиле Pythonic. Она в разы упрощает процесс преобразования данных, обучения моделей машинного обучения и интерактивного анализа больших наборов данных - и все это происходит в рамках безопасной и надежной платформы Greenplum.

 

Эволюция до версии 1.1.0: поиск по эмбеддингам

Перенесемся в 5 января 2024 года, ведь именно тогда в релизе GreenplumPython 1.1.0 впервые появилась инновационная функция - поиск по эмбеддингам. Эмбеддинги, генерируюемые моделями искусственного интеллекта, обеспечивают компактное и осмысленное представление объектов в числовом векторном пространстве и отражают семантические отношения между объектами.

В быстро развивающейся сфере искусственного интеллекта и машинного обучения эмбеддинги играют очень важную роль, так как помогают эффективно извлекать из данных значимую информацию, необходимую для понимания закономерностей, корреляций данных и глубинных структур. Управление эмбеддингами оказалось довольно сложной задачей, но это просто необходимо для перехода на качественно новый уровень работы с данными.  

 

Важность поиска по эмбеддингам

GreenplumPython 1.1.0 решает проблему управления эмбеддингами с помощью расширения pgvector. С этой новой функцией изучение неструктурированных данных в базе данных становится не только доступной, но и неотъемлемой частью процесса изучения данных.

Давайте разберемся в том, как же работает эта новая функция и почему она выводит GreenplumPython на лидерские позиции в области интеллектуального исследования данных.

NB: Функция, представленная в этом руководстве, в настоящее время является экспериментальной и не дает никаких гарантий стабильной работы API.

 

Установка пакета

Установите самую последнюю версию GreenplumPython:

python3 -m pip install --upgrade greenplum-python

 

Подключение к БД

После установки GreenplumPython необходимо установить подключение к Greenplum.

import greenplumpython as gp
db = gp.database(uri="postgres://localhost:7000")

 

Исследование набора данных

В этой статье мы будем использовать набор данных wikimedia, содержащих копию  википроектов Wikimedia в виде викитекста и метаданных в XML. Этот набор данных хранится в таблице wiki_small, которая содержит 6 столбцов (pub_date, label, id,category_id, title и body),

wiki = db.create_dataframe("wiki_small")
wiki.order_by("id", ascending=False)[:2]

 

 

и 100 000 строк.

import greenplumython.builtins.functions as F
wiki.apply(lambda _: F.count())

 

 

Для повышения эффективности сгенерированные вкрапления хранятся в ориентированном на столбцы подходе, т. е. отдельно от входного DataFrame. Входной DataFrame должен иметь уникальный ключ для идентификации кортежей в результатах поиска. Поэтому перед созданием индекса вкраплений необходимо сохранить DataFrame в базе данных и проверить, что DataFrame имеет уникальный ключ.

wiki = wiki.check_unique(columns={"id"})

 

Генерация эмбеддинов и индексирование

После проверки уникального ключа мы можем создать индекс встраивания тела столбца, используя модель all-MiniLM-L6-v2 от HuggingFace с новым модулем встраивания. Расширение pgvector теперь поддерживает два типа индексов, HNSW и IVFFLAT. Тип индекса по умолчанию - HNSW, но мы можем изменить его на IVFFLAT, указав method=«ivfflat»:

import greenplumpython.experimental.embedding

wiki = wiki.embedding().create_index(column="body", model_name="all-MiniLM-L6-v2")
wiki.order_by("id", ascending=False)[:2]

 

 

Семантический поиск по эмбеддингам

С помощью индекса мы можем осуществлять поиск на основе семантического сходства:

wiki.embedding().search(column="body", query="artificial intelligence", top_k=1)

 

 

Это очень эффективный способ, поскольку нам не нужно сканировать все данные.

 

Генерация эмбеддингов без индексирования

Если мы хотим просто сгенерировать эмбеддинги без создания векторного индекса, мы можем использовать функцию create_embedding() из модуля embedding:

from greenplumpython.experimental.embedding import create_embedding

Поскольку мы не индексируем векторы, DataFrame не нужно хранить в базе данных в виде таблицы. И нам не нужно указывать уникальный ключ в случае, если эмбеддинги находятся в одном датафрейме.

Более того, если мы хотим сохранить эмбеддинги в виде векторного типа с размерностью эмбеддинга, чтобы впоследствии их можно было индексировать, нам нужно привести результат к типу gp.type_(«vector», modifier=<embedding_dimension>).

wiki.order_by("id", ascending=False)[:2].assign(
    embedding_col=lambda t: (
        gp.type_("vector", modifier=384)(create_embedding(t["body"], "all-MiniLM-L6-v2"))
    ),
)

 

 

Единовременная полная очистка

Для удобства управления комбинация индекса и базовой таблицы записывается в базу данных.

Попытка уничтожить только базовую таблицу будет неудачной:

%reload_ext sql
%sql postgresql://localhost:7000
%sql DROP TABLE wiki_small

 

 

Чтобы уничтожить базовую таблицу, нам также нужно уничтожить и индекс. Этого можно добиться с помощью CASCADE:

%%sql
DROP TABLE wiki_small CASCADE;

SELECT oid, relname
FROM gp_dist_random('pg_class')
WHERE relname = 'cte_88c394ed9d744c0f8e2fcf78be806a9a';

 

 

Как видите, после DROP CASCADE индекс также удаляется для всех сегментов.

 

Заключение

В этой статье мы показали Вам, как специалисты по изучению данных могут использовать GreenplumPython для управления генерацией и поиском эмбеддингов непосредственно в Greenplum с помощью простых команд на языке Python. Это выгодно и удобно для специалистов, которые хотят изучать большие объемы неструктурированных данных и использовать Greenplum в качестве векторной базы данных. Кроме того, это обеспечивает большую гибкость в управлении развертыванием и использованием моделей с открытым исходным кодом в Greenplum.

 

Узнать стоимость решенияЗапросить видео презентацию

← Предыдущая статья
Введение в Greenplum
Следующая статья →
Создание мощнейшего поиска данных на основе ИИ в Greenplum с помощью pgvector и OpenAI

Решения

Анализировать ФинансыУвеличивайте ПродажиОптимальный Склад и ЛогистикаМаркетинговые Метрики

Клиенты
  • ООО "Интернэшнл Ресторант Брэндс" – это крупнейший франчайзинговый партнер компании Yum! Brands Russia & CIS в России, отвечающий за рост и развитие бренда KFC на территории РФ. На сегодняшний день у компании более 350 ресторанов. Ежедневно в рестораны приходит 200 000+ гостей.

  • Русклимат
    Русклимат — международный торгово-производственный холдинг, концентрирующий опыт ведущих мировых производителей индустрии климата, мощный потенциал конструкторских бюро и лабораторий индустриального дизайна.
     
    Компания образована в 1996 году. За более чем двадцатилетнюю историю Русклимат прошел путь от локальной компании до мощной вертикально-интегрированной многопрофильной структуры.
     
  • ПАО «Ростелеком» — российский провайдер цифровых услуг и сервисов. Предоставляет услуги широкополосного доступа в Интернет, интерактивного телевидения, сотовой связи, местной и дальней телефонной связи и др. Занимает лидирующие позиции на российском рынке высокоскоростного доступа в интернет, платного ТВ, хранения и обработки данных, а также кибербезопасности

  • ООО "Уральская транспортная компания" — это транспортно-логистическая компания, специализирующаяся на железнодорожных перевозках грузов, создана в 2009 году.

  • Решения
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Энергетика
    • Фармацевтика
  • Услуги
    • Переход на отечественные BI и DWH
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Техническая поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Платформы
    • FineBI
    • FineReport
    • FineDataLink
    • Коннекторы данных из 1С в BI
    • Airflow + NiFi
    • Visiology
    • Luxms BI
    • Modus BI
    • PIX BI
    • Arenadata
    • ClickHouse
    • Greenplum
    • Postgres Professional
    • Open-source BI: Superset/Metabase
    • Loginom
    • Yandex.DataLens
    • AI / Исскуственный интеллект
    • Optimacros
    • Шины данных
  • Курсы
    • Учебный курс Информационная грамотность
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt
  • Функциональные решения
    • Создание Data Lake
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и прогнозная аналитика
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • Сквозная аналитика
  • Компания
    • О нас
    • Руководство
    • Новости
    • Клиенты
    • Скачать
    • Контакты
    • Политика конфиденциальности
RutubeVkontakteLinkedInYouTube
ООО "Би Ай Консалт",
ИНН: 7811437757,
ОГРН: 1097847154184
199178, Россия,
Санкт-Петербург,
6-ая линия В.О., Д. 63, 4 этаж
Тел: +7 (812) 334-08-01
Тел: +7 (499) 608-13-06
E-mail: info@biconsult.ru

 

 

 

 

 

×

Пользуясь сайтом, вы соглашаетесь с использованием cookies и политикой конфиденциальности.