BI Consult Desktop Logo BI Consult Mobile Logo
  • Russian BI Исследование российских bi
  • Перейти на Fine BI
  • Контакты
  • +7 812 334-08-01
    +7 499 608-13-06
  • Отправить сообщение
  • Главная
  • Продукты Эксперт-BI
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Сельское хозяйство
    • Энергетика
    • FMCG
    • Девелоперы
    • Маркетплейсы
    • Пищевая промышленность
    • Фармацевтика
    • Построение Data Platform
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и FP&A
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • IBP
    • ИТ (CIO)
    • Закупки
  • Платформы
    • Системы бизнес-анализа (BI)
    • Интегрированное бизнес-планирование (IBP)
    • Хранилища данных (DWH / Lakehouse)
    • Каталоги данных (Data Catalog)
    • Системы ETL и ELT
    • AI / Исскуственный интеллект
    • Шина данных (ESB)
    • Система управления мастер-данными (MDM)
    • Семантический слой
  • Услуги
    • Переход на отечественные BI и DWH системы
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений и DWH
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Курсы
    • Учебный курс Информационная грамотность (Data Literacy)
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Greenplum
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt (Data Build Tool)
  • Компания
    • Руководство
    • Новости
    • Клиенты
    • Карьера
    • Скачать
    • Контакты

BI

  • FineBI
  • FineReport
  • FineDataLink
  • FineChatBI (FineAI)
  • Коннекторы данных из 1С в BI
  • Airflow / Nifi
  • Visiology
  • PIX BI
  • Modus BI
  • Yandex.DataLens
  • Open-source BI: Superset/Metabase
  • Luxms BI
  • AW BI + Alpha BI
  • FlyBI + Форсайт. Аналитическая Платформа
  • Loginom
  • Триафлай
  • AI / Исскуственный интеллект
  • Optimacros
  • Навигатор BI
  • Семантический слой

СУБД

  • Arenadata
  • ClickHouse
  • Greenplum
  • Postgres Professional
  • TData

Другое

  • Построение Data Platform
    • Аналитическое хранилище данных
    • Data Lake и Data Engineering
    • Подробнее про Data Lake
    • Внедрение Lakehouse
      • Apache Doris
      • StarRocks
      • Trino
    • Миграция витрин из пропиетарных DWH на новый стек
    • Учебный курс "Современная архитектура хранилища данных"
Главная » Курсы по системам бизнес-анализа и методологии » Учебный курс Современная архитектура хранилища данных » Что такое Apache Spark и где его используют

Что такое Apache Spark и где его используют

Apache Spark — это open-source фреймворк для распределенной обработки больших данных. Его используют для batch-обработки, потоковой аналитики, SQL-запросов, машинного обучения и обработки данных в кластерах Hadoop, Kubernetes, облаках и автономных окружениях.

Spark стал популярным благодаря скорости, работе с данными в памяти, удобным API и поддержке нескольких языков: Scala, Java, Python и R. В статье разберем, что такое Apache Spark, из каких компонентов он состоит, чем Spark Core отличается от Spark SQL и Spark Streaming, зачем нужны MLlib и GraphX, а также в каких задачах Spark действительно полезен.

Что внутри:

  • что такое Apache Spark простыми словами;
  • зачем нужен фреймворк для распределенной обработки данных;
  • основные преимущества Spark;
  • Spark Core и управление вычислениями;
  • Spark SQL и DataFrame;
  • Spark Streaming и обработка потоковых данных;
  • MLlib для машинного обучения;
  • GraphX для графовых вычислений;
  • поддерживаемые языки: Scala, Java, Python и R;
  • где запускают Spark: Hadoop YARN, Kubernetes, облака и standalone;
  • примеры применения Spark в аналитике и data engineering.

 

Apache Spark — это open source фреймворк для параллельной обработки и анализа неструктурированных данных. Apache Spark в настоящий момент является наиболее перспективным проектом Apache и позиционируется как универсальная платформа для обработки данных и быстрых кластерных вычислений. Apache Spark производит все операции в оперативной памяти, благодаря чему выигрывает в производительности в 100 раз и позволяет обрабатывать данные в потоке. Apache Spark работает в среде кластеров Hadoop на YARN, под управлением Mesos, в облаке на AWS или других облачных сервисах, а также полностью автономно.
 
Основные преимущества Apache Spark:
  • Производительность
  • Удобный интерфейс
  • Отказоустойчивость
  • Поддержка четырех языков: Scala, Java, Python и R
 

Компоненты архитектуры Apache Spark

Apache Spark состоит из пяти компонентов: ядра и четырех библиотек, каждая из которых решает определенную задачу.
 

1. Ядро Apache Spark (Spark Core) — основа фреймворка. Это базовый движок для параллельной и распределенной обработки данных. Ядро отвечает за:

  • Управление памятью и восстановление системы после отказов
  • Планирование, распределение и отслеживание заданий в кластере
  • Взаимодействие с хранилищем данных

 

2. Apache Spark SQL — одна из четырех библиотек фреймворка, которая использует структуру данных DataFrames и может выступать в роли распределенного механизма запросов SQL. Библиотека возникла как порт Apache Hive для работы поверх Apache Spark (вместо MapReduce), а сейчас уже интегрирована со стеком Spark. Apache Spark SQL обеспечивает поддержку различных источников данных и позволяет переплетать SQL-запросы с трансформациями кода.

3. Apache Spark Streaming — инструмент для обработки потоковых данных, который легко интегрируется с широким спектром популярных источников данных: HDFS, Flume, Kafka, ZeroMQ, Kinesis и Twitter. Apache Spark Streaming обрабатывает данные в реальном в режиме micro-batch, минимальное время обработки каждого micro-batch 0,5 секунды. Apache Spark Streaming получает входные потоки данных и разбивает данные на пакеты. Далее они обрабатываются движком Apache Spark, после чего генерируется конечный поток данных также в пакетной форме. API Spark Streaming точно соответствует API Spark Core, поэтому можно одновременно работать как с пакетными, так и с потоковыми данными.

4. MLlib – библиотека для машинного обучения, предоставляющая различные алгоритмы: классификация, регрессия, деревья принятия решений, рекомендация, кластеризация, тематическое моделирование и т.д.
 
5. GraphX – это библиотека для работы с графами и выполнения с ними параллельных операций. Библиотека предоставляет собой универсальный инструмент для исследовательского анализа и итерационных вычислений на основе графов. Кроме встроенных операций, GraphX также имеет библиотеку обычных алгоритмов для работы с графами, например, PageRank.
 
 
Некоторые примеры применения Apache Spark:
  • Банки и страховые компании (прогноз востребованности услуг)
  • Поисковики и социальные сети (выявление фейковых аккаунтов, оптимизация таргетинга и т.д.)
  • Службы такси (анализ времени и геолокаций, прогноз спроса и цен)
  • Транспортные и авиакомпании (модели для прогнозирования задержек рейсов)
 
В целом Spark подходит для решения любых задач, где необходима быстрая обработка больших объемов данных и/или продвинутая аналитика на больших данных.

 

Spark предоставляет быструю и универсальную платформу для обработки данных. По сравнению с Hadoop Spark ускоряет работу программ в памяти более чем в 100 раз, а на диске – более чем в 10 раз. Spark дает больше возможностей для работы с данными. Его синтаксис не так сложен, чтобы начать погружение, для сравнения приведу пример из Pandas.

Для работы с Spark, нужно создать сессию.

```

spark = SparkSession.builder.getOrCreate()

```

Во время создания сессии, происходит кластеризация.

Pandas

```

data = pd.read_csv('data.csv') 

````

Spark

````

  data = spark.read.csv(path=’data.csv’, header=True, sep=’,’)

````

Далее, сгруппируем данные и «сместим» в колонке на одну позицию. В Pandas это делается так:

```

data[group1] = pandas_df.groupby(group2)[group3].shift(-1)

```

В Spark

```

w = Window().partitionBy("group2").orderBy("group3")

data = data.withColumn("group2", lag("group2", -1, 0).over(w))

```

Можно использовать оконную функцию, где partitionBy отвечает за группировку данных, а orderBy сортировка. Функция lag принимает 3 параметра: это колонка, шаг смещения и значения, которые будет на месте шага. Или для группировки можно использовать обычную функцию groupBy, которая тоже есть в Spark. Разница в том, что с окном каждая строка будет связана с результатом агрегирования, вычисленным для всего окна. Однако при группировке каждая группа будет связана с результатом агрегации в этой группе (группа строк становится только одной строкой).

```

dataframe = spark.range(6).withColumn("key", 'id % 2)

dataframe.show

windowing = Window.partitionBy("key")

dataframe.withColumn("sum", sum(col("id")).over(windowing).show

dataframe.groupBy("key").agg(sum('id)).show

К сожалению, некоторых функций может не быть в Spark (например, factorize).

```

  labels_start, uniques = pd.factorize(anomaly_time['activity_start']) anomaly_time['activity_start_code'] = labels_start

```

Spark

````

win_func = Window().partitionBy().orderBy(lit(' '))


data = data.select('name_column').distinct().withColumn('name_column', row_number().over(win_func) - 1)

````

Функция  factorize закодирует объект как перечислимый тип или категориальную переменную, или присвоит объекту идентификатор.

```

codes, uniques = pd.factorize(['b', 'b', 'a', 'c', 'b'])

codes

array([0, 0, 1, 2, 0]...)

```

Для выполнения подобного функционала в Spark, берется колонка select (‘name_column’) и выбираются все уникальные значения, с помощью функции distinct. Далее с помощью функции withColumn создается колонка и присваивается номер строки (чтобы начиналось с 0 — я отнимаю 1).

Вывод

Apache Spark  это огромная система, с множеством инструментов для разных типов задач от SQL до машинного обучения. В этой статье был показан лишь маленький кусочек от всего Spark, но даже этого хватит, чтобы начать обрабатывать данные.

 

FAQ

Вопрос: Что такое Apache Spark?

Ответ: Apache Spark — это фреймворк с открытым исходным кодом для распределенной обработки больших данных. Он позволяет выполнять вычисления на кластере и работать с batch-данными, потоками, SQL и машинным обучением.

 

Вопрос: Для чего используют Spark?

Ответ: Spark используют для ETL, обработки больших данных, аналитики, потоковой обработки, машинного обучения, подготовки витрин данных, расчета признаков и интеграции данных из разных источников.

 

Вопрос: Что такое Spark SQL?

Ответ: Spark SQL — компонент Apache Spark для работы со структурированными данными через SQL и DataFrame API. Он позволяет выполнять распределенные SQL-запросы и совмещать их с кодом на Python, Scala, Java или R.

 

Вопрос: Чем Spark Streaming отличается от обычной batch-обработки?

Ответ: Batch-обработка работает с накопленными наборами данных, а Spark Streaming обрабатывает входящие потоки небольшими пакетами. Это позволяет строить почти real-time пайплайны данных.

 

Вопрос: Что такое MLlib?

Ответ: MLlib — библиотека машинного обучения в Apache Spark. В ней есть алгоритмы классификации, регрессии, кластеризации, рекомендаций и инструменты подготовки признаков.

 

  • Apache Airflow DAGs: основы и расписания
  • ETL и ELT: 5 основных отличий
  • DWH: зачем компании хранилище данных
  • Что такое Parquet: преимущества и случаи использования
  • Алгоритмы кластеризации в машинном обучении

 

 

Узнать стоимость решенияЗапросить видео презентацию

← Предыдущая статья
Введение в Data Engineering. ETL, схема «звезды» и Airflow
Следующая статья →
Основные функции ETL-систем
Запросить видео презентацию Запросить доступ к демо стенду online Узнать стоимость лицензий

Задать вопрос

loading...

Решения

Анализировать ФинансыУвеличивайте ПродажиОптимальный Склад и ЛогистикаМаркетинговые Метрики

Клиенты
  • ООО "Интернэшнл Ресторант Брэндс" – это крупнейший франчайзинговый партнер компании Yum! Brands Russia & CIS в России, отвечающий за рост и развитие бренда KFC на территории РФ. На сегодняшний день у компании более 350 ресторанов. Ежедневно в рестораны приходит 200 000+ гостей.

  • КАМИ – компания-лидер по поставкам тяжёлых станков в России, занимающаяся продажей и обслуживанием оборудования для обработки металла и дерева, изготовления мебели и не только. На сегодняшний день в компании работают более 1300 человек, запущено 10 обучающих центров, в продаже более 7000 единиц техники. 

  • Розничный и интернет-магазин 12 Storeez один из лидеров на рынке женской одежды. С географией рынка не только на территории России, своя продукция представлена еще и в таких странах как Казахстан и Дубай.

  • MoneyCare — кредитная платформа и сервис для ПОС-кредитования в магазинах, установленная в более чем 18 тысячах трейдинговых точек и сотрудничающая с 11 главными банками России.

  • Решения
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Энергетика
    • Фармацевтика
  • Услуги
    • Переход на отечественные BI и DWH
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Техническая поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Платформы
    • FineBI
    • FineReport
    • FineDataLink
    • Коннекторы данных из 1С в BI
    • Airflow + NiFi
    • Visiology
    • Luxms BI
    • Modus BI
    • PIX BI
    • Arenadata
    • ClickHouse
    • Greenplum
    • Postgres Professional
    • Open-source BI: Superset/Metabase
    • Loginom
    • Yandex.DataLens
    • AI / Исскуственный интеллект
    • Optimacros
    • Шины данных
  • Курсы
    • Учебный курс Информационная грамотность
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt
  • Функциональные решения
    • Создание Data Lake
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и прогнозная аналитика
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • Сквозная аналитика
  • Компания
    • О нас
    • Руководство
    • Новости
    • Клиенты
    • Скачать
    • Контакты
    • Политика конфиденциальности
RutubeVkontakteLinkedInYouTube
ООО "Би Ай Консалт",
ИНН: 7811437757,
ОГРН: 1097847154184
199178, Россия,
Санкт-Петербург,
6-ая линия В.О., Д. 63, 4 этаж
Тел: +7 (812) 334-08-01
Тел: +7 (499) 608-13-06
E-mail: info@biconsult.ru

 

 

 

 

 

×

Пользуясь сайтом, вы соглашаетесь с использованием cookies и политикой конфиденциальности.