Возможности

Весь путь данных — от файла до решения

88 готовых узлов покрывают подготовку, интеграцию, аналитику и машинное обучение. Ниже — по категориям, с объяснением, зачем это бизнесу и на каком примере это работает. Ни для одного из этих сценариев не нужно писать код.

📥

Импорт и экспорт

Загрузка данных из файлов и систем и выгрузка результата в нужном формате. DataPrep сам распознаёт типы полей, кодировки (включая Windows-1251 из 1С и русского Excel) и разделители, а также умеет читать иерархический JSON/XML.

Зачем бизнесу: перестать «сводить руками» выгрузки из разных систем — данные попадают в работу сразу и корректно.

Пример: собрать в один отчёт продажи из CSV кассы, справочник товаров из JSON и план из Excel.

Текст/CSVExcelJSONXML
⚙️

Трансформация данных

Ядро подготовки: фильтрация строк, группировка и агрегаты (суммы, средние, количества), соединение таблиц (JOIN), объединение источников (UNION), подстановка справочников, расчётные поля по формулам, сортировка, сводные таблицы (pivot), работа с датами.

Зачем бизнесу: любой отчёт или витрина данных собирается за часы — и потом повторяется одним нажатием.

Пример: обогатить заказы сегментом клиента из справочника и посчитать выручку по регионам и менеджерам.

ФильтрГруппировкаСоединение (JOIN)ОбъединениеКалькуляторСводная (Куб)Дата и время
🧼

Качество и подготовка данных

Приведение «грязных» данных в порядок: заполнение пропусков, поиск дубликатов и противоречий, очистка выбросов, нормализация текста и справочников, перекодировка статусов в читаемые метки, разбор составных полей (ФИО, даты, JSON-строки).

Зачем бизнесу: решения принимаются на достоверных данных, а не на «мусоре» — меньше ошибок и переделок.

Пример: очистить клиентский справочник от дублей и опечаток перед рассылкой или сверкой.

Заполнение пропусковДубликатыОчистка выбросовОчистка текстаЗамена значенийРазбить столбец
🔎

Исследование данных (EDA)

Быстро понять, что внутри набора: статистика по полям, частоты значений, корреляции, факторный анализ (снижение размерности), автокорреляция и сезонность.

Зачем бизнесу: находить закономерности и аномалии до того, как они превратятся в проблему или упущенную возможность.

Пример: увидеть, какие темы обращений в поддержку растут и как они связаны с оттоком.

СтатистикаЧастоты значенийКорреляцияФакторный анализ (PCA)Качество данных
🧠

Машинное обучение и Data Mining

Готовые модели как обычные блоки: кластеризация (k-means, EM, сети Кохонена), регрессии, деревья решений, наивный Байес, нейросети, ассоциативные правила (анализ корзины). Есть проверка качества моделей (точность, ROC/AUC).

Зачем бизнесу: сегментация, скоринг и рекомендации становятся доступны без команды дата-сайентистов.

Пример: оценить вероятность оттока клиента и заранее удержать ценных.

КластеризацияРегрессияДерево решенийНейросетьНаивный БайесАссоциации (Apriori)Оценка качества
📈

Прогноз и временные ряды

Прогнозирование продаж и спроса (ARIMAX), сезонная декомпозиция (тренд + сезонность + остаток), сглаживание, когортный анализ удержания.

Зачем бизнесу: планировать закупки, производство и бюджеты на основе данных, а не интуиции.

Пример: спрогнозировать спрос по товарам на следующий сезон и рассчитать план поставок.

Прогноз (ARIMAX)Сезонная декомпозицияСглаживаниеКогорты
📊

Визуализация

Наглядные результаты прямо в конвейере: столбчатые, линейные и круговые диаграммы, Парето, воронка, ABC, гистограммы, диаграммы рассеяния, сводный куб и тепловые карты, ROC-кривые, прогнозные графики.

Зачем бизнесу: увидеть картину и принять решение сразу — без выгрузки в отдельный BI-инструмент.

Пример: показать структуру выручки по регионам и динамику по месяцам на одном экране.

ДиаграммыГистограммаРассеяниеКуб / pivotТепловые картыROC/AUC
🔀

Управление процессом

Сложную бизнес-логику собирают из блоков: ветвление по условиям (маршруты «да/нет»), циклы (повтор обработки по группам), вложенные подмодели — переиспользуемые «под-сценарии», в том числе рекурсивные.

Зачем бизнесу: описывать реальные регламенты и правила без программиста — и переиспользовать их между задачами.

Пример: «гейт качества»: партии выше нормы дефектов уходят на отдельную ветку обработки.

УсловиеЦиклПодмодельПеременные и параметры
🌳

Иерархические данные и интеграция

Работа с деревьями (каталоги, оргструктуры, вложенный JSON), взаимное преобразование «таблица ↔ дерево», обмен через XML, загрузка из внешних веб-сервисов (REST).

Зачем бизнесу: подключать данные из учётных систем и сервисов без ручного экспорта-импорта.

Пример: развернуть товарный каталог из вложенного JSON в плоскую таблицу для анализа.

Дерево данныхJSON ↔ таблицаОбмен XMLREST-запрос
🧑‍💻

Программирование — когда нужна гибкость

Для нестандартной логики есть узел «JavaScript-процессор»: он позволяет описать произвольное преобразование прямо в мастере. Это остаётся частью визуального конвейера — логика видна и переносима, а не спрятана в отдельной системе.

Зачем бизнесу: не упираться в «так нельзя» — любую особенную формулу или правило можно выразить, не покидая инструмент.

JavaScript-процессорФормулыСвои правила

Большие данные и корпоративные интеграции (опция)

Когда данных слишком много для браузера или нужен доступ к базам, подключается опциональный бэкенд: аналитический SQL и режим больших данных (DuckDB — проверено до 300 млн строк), REST-интеграции, публикация сценария по HTTP и планировщик регулярных прогонов.

Зачем бизнесу: тот же инструмент масштабируется с ростом компании — от отдела до корпоративного контура.

SQL / DuckDBДо 300 млн строкПубликация по HTTPПланировщик

Один инструмент вместо цепочки Excel, скриптов и заявок в ИТ

Посмотрите, как эти возможности решают конкретные бизнес-задачи.