Корпоративный поиск с AI: находите ответы в документах, базах знаний и системах компании с помощью RAG и GraphRAG.
Обсудить проектВ средней enterprise-компании данные распределены по десяткам систем. Сотрудники тратят до 30% рабочего времени на поиск нужной информации, а обычный полнотекстовый поиск не справляется с семантическими запросами.
Confluence, SharePoint, Jira, CRM, ERP, 1C, корпоративная почта, файловые хранилища, внутренние wiki, базы знаний. Информация фрагментирована, дублируется и часто противоречит себе в разных источниках.
По данным McKinsey, среднестатистический сотрудник тратит почти два часа в день на поиск нужной информации. Для компании с 1000 сотрудников это эквивалент 225 полных ставок, потраченных исключительно на поиск.
Экспертные знания сотрудников не документированы или разбросаны по переписке и чатам. При увольнении ключевых специалистов компания теряет критически важный контекст, который невозможно восстановить.
Современный корпоративный поиск строится как конвейер из пяти ключевых этапов: от подключения источников до генерации ответа с цитатами.
Подключение к 10+ корпоративным системам: Confluence, SharePoint, Jira, CRM, почта, файловые хранилища. Инкрементальная синхронизация с отслеживанием изменений.
Chunking документов с учётом структуры, генерация embeddings через модели (OpenAI, Cohere, E5), сохранение в векторную БД (Qdrant, Weaviate, Milvus).
Комбинация BM25 (точное совпадение ключевых слов) и Vector Search (семантическое сходство). Reciprocal Rank Fusion объединяет результаты обоих методов.
Cross-encoder модель переранжирует top-K результатов, оценивая пару «запрос-документ» целиком. Повышает точность на 15-25% по сравнению с первичным ранжированием.
LLM синтезирует ответ на основе найденных фрагментов. Каждое утверждение сопровождается ссылкой на источник. Если ответа нет в контексте — модель честно об этом сообщает.
Классический RAG работает с изолированными фрагментами текста. GraphRAG извлекает сущности и связи, строя граф знаний, который позволяет отвечать на вопросы, требующие синтеза информации из множества документов.
LLM извлекает из документов именованные сущности: людей, организации, продукты, процессы, технологии. Каждая сущность получает уникальный идентификатор и набор атрибутов. На корпусе из 10 000 документов обычно выявляется 50 000-200 000 сущностей, формирующих основу графа знаний.
Помимо сущностей, система извлекает связи между ними: «сотрудник X отвечает за проект Y», «продукт A использует технологию B», «регламент C утверждён директором D». Связи типизированы и могут иметь атрибуты (дата, вес, контекст), что позволяет строить точные запросы к графу.
Алгоритмы кластеризации (Leiden, Louvain) выявляют плотно связанные группы сущностей — тематические кластеры. Для каждого кластера LLM генерирует суммарное описание. Это позволяет отвечать на обзорные вопросы вроде «какие направления R&D развивает компания?» без просмотра всех документов.
Граф знаний позволяет выстраивать цепочки рассуждений через несколько связей: «кто из сотрудников работал над проектами, использующими технологию X, и при этом взаимодействовал с клиентом Y?». Классический RAG не способен ответить на такие вопросы, так как информация разбросана по десяткам документов.
Связи в графе могут быть темпоральными: «регламент действовал с марта по ноябрь 2024», «сотрудник перешёл в другой отдел в Q2 2025». Это позволяет отвечать на вопросы с учётом времени: «кто отвечал за проект X на момент инцидента?».
Граф знаний делает рассуждения AI прозрачными. Пользователь видит не только ответ, но и цепочку связей, по которой он был получен. Это критически важно для compliance-сценариев, где необходимо обосновать каждое утверждение и отследить его до первоисточника.
Каждый подход имеет свои сильные стороны. Оптимальная архитектура часто комбинирует несколько методов для разных типов запросов.
| Критерий | RAG | GraphRAG | Hybrid (RAG + Graph) |
|---|---|---|---|
| Точечные вопросы | Отлично. Быстро находит конкретный фрагмент с ответом. | Избыточно. Построение графа не даёт преимущества. | Отлично. Маршрутизатор направляет в RAG-ветку. |
| Обзорные вопросы | Плохо. Фрагменты изолированы, нет синтеза. | Отлично. Community summaries дают целостную картину. | Отлично. Маршрутизатор направляет в Graph-ветку. |
| Multi-hop вопросы | Плохо. Не может связать факты из разных документов. | Хорошо. Граф позволяет строить цепочки. | Хорошо. Комбинирует traversal и retrieval. |
| Скорость индексации | Быстро. Chunking + embedding. | Медленно. Entity + relation extraction через LLM. | Средне. Параллельная индексация. |
| Стоимость | Низкая. Минимальные вызовы LLM при индексации. | Высокая. Массовые вызовы LLM для извлечения сущностей. | Средняя. Оптимизация через батчинг. |
| Актуальность | Высокая. Инкрементальные обновления. | Средняя. Требует перестроения графа. | Высокая. RAG обновляется мгновенно, граф — периодически. |
| Рекомендация | FAQ, документация, регламенты | R&D, compliance, организационная структура | Универсальное enterprise-решение |
Enterprise Search работает с конфиденциальными данными организации. Безопасность — не опция, а фундаментальное требование на каждом этапе конвейера.
Каждый фрагмент при индексации помечается ACL (access control list) из исходной системы. При поиске применяется фильтрация: пользователь видит только те документы, к которым имеет доступ в оригинальной системе. Это работает на уровне векторной БД, до передачи контекста в LLM.
Полная синхронизация прав доступа из исходных систем: Confluence spaces, SharePoint permissions, Jira project roles. При изменении прав в исходной системе они автоматически обновляются в поисковом индексе. Задержка обновления — не более 15 минут.
Поддержка иерархического наследования прав: доступ к пространству в Confluence автоматически распространяется на все страницы. При этом переопределения на уровне отдельных страниц корректно обрабатываются, включая запреты (deny rules).
Автоматическое обнаружение персональных данных (ФИО, паспорта, ИНН, телефоны, email) в процессе индексации. PII маскируется или удаляется в зависимости от политики. В ответе LLM персональные данные не фигурируют, если у пользователя нет соответствующих прав.
Полное логирование всех поисковых запросов: кто спрашивал, что спрашивал, какие документы были найдены, какой ответ был сгенерирован. Логи хранятся в SIEM-совместимом формате для интеграции с корпоративной системой мониторинга безопасности.
Все данные хранятся и обрабатываются в контуре заказчика. Поддержка on-premise развёртывания с локальными LLM (LLaMA, Mistral, Qwen) и векторными БД. Ни один байт корпоративных данных не покидает инфраструктуру компании.
Каждый запрос аутентифицируется и авторизуется. Интеграция с корпоративным SSO (SAML, OIDC), поддержка MFA. Токены доступа имеют ограниченный срок жизни и ротируются автоматически. Все взаимодействия между компонентами шифруются (mTLS).
Архитектура соответствует требованиям 152-ФЗ, GDPR и отраслевым стандартам. Поддержка retention policies: автоматическое удаление данных из индекса при удалении из источника. Генерация отчётов для аудиторов по формату SOC 2.
Обсудим, как Enterprise Search с AI может трансформировать работу с информацией в вашей организации — от выбора архитектуры до запуска пилота.
Обсудить проект