Enterprise Search

Корпоративный поиск с AI: находите ответы в документах, базах знаний и системах компании с помощью RAG и GraphRAG.

Обсудить проект

Проблема: информационный хаос

В средней enterprise-компании данные распределены по десяткам систем. Сотрудники тратят до 30% рабочего времени на поиск нужной информации, а обычный полнотекстовый поиск не справляется с семантическими запросами.

10+

Систем с корпоративными данными

Confluence, SharePoint, Jira, CRM, ERP, 1C, корпоративная почта, файловые хранилища, внутренние wiki, базы знаний. Информация фрагментирована, дублируется и часто противоречит себе в разных источниках.

1.8 ч

В день на поиск информации

По данным McKinsey, среднестатистический сотрудник тратит почти два часа в день на поиск нужной информации. Для компании с 1000 сотрудников это эквивалент 225 полных ставок, потраченных исключительно на поиск.

40%

Знаний теряется при увольнении

Экспертные знания сотрудников не документированы или разбросаны по переписке и чатам. При увольнении ключевых специалистов компания теряет критически важный контекст, который невозможно восстановить.

Enterprise Search с AI решает эту проблему системно. Вместо простого полнотекстового поиска система понимает смысл вопроса, находит релевантные фрагменты в разных источниках и синтезирует точный ответ с указанием первоисточников.

Архитектура Enterprise Search

Современный корпоративный поиск строится как конвейер из пяти ключевых этапов: от подключения источников до генерации ответа с цитатами.

Источники данных Confluence SharePoint Jira / Docs CRM / ERP Email / Chat File Storage Коннекторы + Chunking + Embedding + Индексация BM25 (Keyword) Точное совпадение + Vector Search Семантическое сходство = Hybrid Search RRF / weighted Reranking (Cross-Encoder) LLM Generation Ответ + цитаты + источники
1

Коннекторы

Подключение к 10+ корпоративным системам: Confluence, SharePoint, Jira, CRM, почта, файловые хранилища. Инкрементальная синхронизация с отслеживанием изменений.

2

Индексация

Chunking документов с учётом структуры, генерация embeddings через модели (OpenAI, Cohere, E5), сохранение в векторную БД (Qdrant, Weaviate, Milvus).

3

Hybrid Search

Комбинация BM25 (точное совпадение ключевых слов) и Vector Search (семантическое сходство). Reciprocal Rank Fusion объединяет результаты обоих методов.

4

Reranking

Cross-encoder модель переранжирует top-K результатов, оценивая пару «запрос-документ» целиком. Повышает точность на 15-25% по сравнению с первичным ранжированием.

5

Генерация

LLM синтезирует ответ на основе найденных фрагментов. Каждое утверждение сопровождается ссылкой на источник. Если ответа нет в контексте — модель честно об этом сообщает.

GraphRAG: знания как граф

Классический RAG работает с изолированными фрагментами текста. GraphRAG извлекает сущности и связи, строя граф знаний, который позволяет отвечать на вопросы, требующие синтеза информации из множества документов.

Entity Extraction

LLM извлекает из документов именованные сущности: людей, организации, продукты, процессы, технологии. Каждая сущность получает уникальный идентификатор и набор атрибутов. На корпусе из 10 000 документов обычно выявляется 50 000-200 000 сущностей, формирующих основу графа знаний.

Relation Extraction

Помимо сущностей, система извлекает связи между ними: «сотрудник X отвечает за проект Y», «продукт A использует технологию B», «регламент C утверждён директором D». Связи типизированы и могут иметь атрибуты (дата, вес, контекст), что позволяет строить точные запросы к графу.

Community Detection

Алгоритмы кластеризации (Leiden, Louvain) выявляют плотно связанные группы сущностей — тематические кластеры. Для каждого кластера LLM генерирует суммарное описание. Это позволяет отвечать на обзорные вопросы вроде «какие направления R&D развивает компания?» без просмотра всех документов.

Multi-hop Reasoning

Граф знаний позволяет выстраивать цепочки рассуждений через несколько связей: «кто из сотрудников работал над проектами, использующими технологию X, и при этом взаимодействовал с клиентом Y?». Классический RAG не способен ответить на такие вопросы, так как информация разбросана по десяткам документов.

Temporal Reasoning

Связи в графе могут быть темпоральными: «регламент действовал с марта по ноябрь 2024», «сотрудник перешёл в другой отдел в Q2 2025». Это позволяет отвечать на вопросы с учётом времени: «кто отвечал за проект X на момент инцидента?».

Explainability

Граф знаний делает рассуждения AI прозрачными. Пользователь видит не только ответ, но и цепочку связей, по которой он был получен. Это критически важно для compliance-сценариев, где необходимо обосновать каждое утверждение и отследить его до первоисточника.

RAG vs GraphRAG vs Hybrid

Каждый подход имеет свои сильные стороны. Оптимальная архитектура часто комбинирует несколько методов для разных типов запросов.

Критерий RAG GraphRAG Hybrid (RAG + Graph)
Точечные вопросы Отлично. Быстро находит конкретный фрагмент с ответом. Избыточно. Построение графа не даёт преимущества. Отлично. Маршрутизатор направляет в RAG-ветку.
Обзорные вопросы Плохо. Фрагменты изолированы, нет синтеза. Отлично. Community summaries дают целостную картину. Отлично. Маршрутизатор направляет в Graph-ветку.
Multi-hop вопросы Плохо. Не может связать факты из разных документов. Хорошо. Граф позволяет строить цепочки. Хорошо. Комбинирует traversal и retrieval.
Скорость индексации Быстро. Chunking + embedding. Медленно. Entity + relation extraction через LLM. Средне. Параллельная индексация.
Стоимость Низкая. Минимальные вызовы LLM при индексации. Высокая. Массовые вызовы LLM для извлечения сущностей. Средняя. Оптимизация через батчинг.
Актуальность Высокая. Инкрементальные обновления. Средняя. Требует перестроения графа. Высокая. RAG обновляется мгновенно, граф — периодически.
Рекомендация FAQ, документация, регламенты R&D, compliance, организационная структура Универсальное enterprise-решение
Наша рекомендация: для большинства enterprise-сценариев оптимален гибридный подход. Маршрутизатор классифицирует входящий запрос и направляет его в RAG-ветку (для точечных вопросов) или Graph-ветку (для обзорных и multi-hop запросов). Это сочетает скорость RAG с глубиной GraphRAG.

Безопасность корпоративного поиска

Enterprise Search работает с конфиденциальными данными организации. Безопасность — не опция, а фундаментальное требование на каждом этапе конвейера.

Row-Level Security

Каждый фрагмент при индексации помечается ACL (access control list) из исходной системы. При поиске применяется фильтрация: пользователь видит только те документы, к которым имеет доступ в оригинальной системе. Это работает на уровне векторной БД, до передачи контекста в LLM.

Document-Level Permissions

Полная синхронизация прав доступа из исходных систем: Confluence spaces, SharePoint permissions, Jira project roles. При изменении прав в исходной системе они автоматически обновляются в поисковом индексе. Задержка обновления — не более 15 минут.

ACL Inheritance

Поддержка иерархического наследования прав: доступ к пространству в Confluence автоматически распространяется на все страницы. При этом переопределения на уровне отдельных страниц корректно обрабатываются, включая запреты (deny rules).

PII Detection & Masking

Автоматическое обнаружение персональных данных (ФИО, паспорта, ИНН, телефоны, email) в процессе индексации. PII маскируется или удаляется в зависимости от политики. В ответе LLM персональные данные не фигурируют, если у пользователя нет соответствующих прав.

Audit Trail

Полное логирование всех поисковых запросов: кто спрашивал, что спрашивал, какие документы были найдены, какой ответ был сгенерирован. Логи хранятся в SIEM-совместимом формате для интеграции с корпоративной системой мониторинга безопасности.

Data Residency

Все данные хранятся и обрабатываются в контуре заказчика. Поддержка on-premise развёртывания с локальными LLM (LLaMA, Mistral, Qwen) и векторными БД. Ни один байт корпоративных данных не покидает инфраструктуру компании.

Zero Trust Architecture

Каждый запрос аутентифицируется и авторизуется. Интеграция с корпоративным SSO (SAML, OIDC), поддержка MFA. Токены доступа имеют ограниченный срок жизни и ротируются автоматически. Все взаимодействия между компонентами шифруются (mTLS).

Compliance-Ready

Архитектура соответствует требованиям 152-ФЗ, GDPR и отраслевым стандартам. Поддержка retention policies: автоматическое удаление данных из индекса при удалении из источника. Генерация отчётов для аудиторов по формату SOC 2.

Готовы к умному корпоративному поиску?

Обсудим, как Enterprise Search с AI может трансформировать работу с информацией в вашей организации — от выбора архитектуры до запуска пилота.

Обсудить проект