Semantic Layer for AI

Семантический слой — фундамент для надёжной работы AI с корпоративными данными. Без него AI генерирует правдоподобную ерунду.

Обсудить проект

Проблема: AI без семантического слоя

Когда компании начинают подключать AI-агентов к корпоративным базам данных, возникает системная проблема: языковая модель не понимает структуру данных так, как её понимают люди. LLM оперирует словами, контекстами и статистическими вероятностями — но не бизнес-смыслом таблиц и полей.

«Без семантического слоя AI превращается в генератор правдоподобной ерунды. С семантическим слоем он начинает работать с управленческими понятиями.» — из авторского исследования BI Consult «AI в BI. Круг Громова 2026»

Представьте типичную ситуацию: в хранилище данных есть поля revenue, net_revenue, gross_sales, total_amount — и все они похожи на «выручку». Какое из них использовать для ответа на вопрос «Какова выручка за квартал?» — зависит от контекста, региона, продуктовой линейки и десятков корпоративных правил. LLM не знает этих правил. Без семантического слоя она угадывает — и угадывает убедительно, но неверно.

Без семантического слоя

  • AI выбирает поля таблиц по созвучию с вопросом, а не по бизнес-смыслу
  • Путается в гранулярности: суммирует то, что нельзя суммировать, усредняет то, что должно агрегироваться иначе
  • Игнорирует фильтры-по-умолчанию: например, исключение аннулированных заказов
  • Не знает о связях между таблицами — строит ошибочные JOIN-ы
  • Выдаёт убедительно звучащие цифры, которые невозможно проверить
  • Результаты разнятся от запроса к запросу при одинаковом вопросе

С семантическим слоем

  • AI работает с метриками и измерениями, определёнными аналитиками
  • Использует бизнес-термины: «выручка», «маржа», «активные клиенты»
  • Правила расчётов зафиксированы и детерминированы — нет вариаций
  • Связи между объектами явно описаны — правильные JOIN-ы гарантированы
  • Результаты воспроизводимы и сверяемы с BI-отчётами
  • Возможен аудит: всегда видно, какой запрос сгенерирован и почему

Gartner (2026): «К 2028 году 60% проектов агентной аналитики, полагающихся исключительно на MCP без согласованного семантического слоя, потерпят неудачу из-за ненадёжности результатов и отсутствия доверия со стороны бизнеса.»

Это не теоретическая угроза. Проекты, в которых AI-агент напрямую генерирует SQL к сырым таблицам хранилища, уже демонстрируют характерный паттерн: первые демо впечатляют, но через несколько недель эксплуатации доверие пользователей рушится после первых же обнаруженных ошибок в цифрах. Семантический слой — это страховка от этого сценария.

Что такое семантический слой

Семантический слой — это программный слой абстракции, расположенный между физическими данными (DWH, озёра данных, транзакционные БД) и их потребителями: BI-системами, аналитиками, приложениями и — теперь — AI-агентами.

Семантический слой определяет бизнес-объекты и правила работы с ними:

Элемент Что описывает Пример
Метрика (Measure) Числовой показатель с правилом агрегации Выручка = SUM(orders.amount) WHERE status != 'cancelled'
Измерение (Dimension) Аналитический срез, по которому можно группировать Регион, Категория товара, Менеджер, Период
Правило расчёта Формула вычисления из базовых полей Маржа = (Выручка − Себестоимость) / Выручка × 100
Связь (Join) Как соединяются таблицы и сущности orders LEFT JOIN customers ON orders.customer_id = customers.id
Фильтры-по-умолчанию Условия, всегда применяемые к запросу is_deleted = false, currency = 'RUB'
Синонимы и алиасы Альтернативные бизнес-названия для AI «выручка», «продажи», «доход» → metric: revenue

С точки зрения AI, семантический слой выполняет роль «контекста доверия»: он ограничивает пространство интерпретаций языковой модели до заранее согласованного и проверенного набора бизнес-объектов. Вместо того чтобы угадывать, какое поле означает «выручку», AI просто вызывает метрику revenue — и получает правильный результат, независимо от того, как сложно устроено хранилище под капотом.

Это принципиально отличает подход от прямого Text-to-SQL, при котором LLM генерирует произвольный SQL непосредственно к физическим таблицам. Прямой Text-to-SQL работает на демо, но разрушается в production-среде с реальными хранилищами, где десятки таблиц, сотни полей и нетривиальные правила агрегации.

Два подхода: с семантическим слоем и без него

Наглядное сравнение того, что происходит с запросом пользователя при прямом подключении AI к данным и при наличии семантического слоя.

Принципиальная разница: с семантическим слоем LLM никогда не видит сырые таблицы и не пишет произвольный SQL.

Архитектура Text-to-Semantic-SQL

Правильная архитектура AI-запросов к корпоративным данным — это не прямой Text-to-SQL, а двухшаговый процесс через семантический слой. Разберём, как это работает.

Компонент Статус Описание
Прямой Text-to-SQL Исключён из архитектуры LLM не имеет прямого доступа к сырой базе данных. Исключение прямого Text-to-SQL устраняет риск галлюцинаций, SQL-инъекций и непредсказуемых результатов. Любой запрос к данным проходит только через семантический слой.
Шаг 1: Semantic SQL AI-агент, двухшаговый механизм AI-агент генерирует высокоуровневый Semantic SQL — запрос не к таблицам, а к бизнес-объектам семантического слоя: метрикам и измерениям. Например: SELECT revenue, region FROM sales_cube WHERE period = 'Q1-2026'. На этом этапе LLM оперирует только бизнес-терминами, которые определены в семантическом слое.
Шаг 2: Компиляция Семантический слой, детерминированный Семантический слой детерминированно транслирует Semantic SQL в оптимизированный физический SQL под конкретную СУБД. Применяются все зафиксированные правила: агрегации, фильтры, JOIN-ы, вычисляемые поля. Результат всегда воспроизводим и проверяем. Вариативность LLM устранена на этапе компиляции.

Ключевое следствие этой архитектуры: ответственность за корректность бизнес-правил переносится с AI на семантический слой. AI отвечает за понимание вопроса пользователя и выбор нужных метрик — задача, с которой LLM справляется хорошо. Семантический слой отвечает за правильный расчёт — задача, с которой LLM справляется плохо.

Двухшаговый подход позволяет получить лучшее от обоих миров: гибкость и понимание естественного языка от LLM и детерминированность и надёжность от семантического слоя.

Кейс: DataForge как семантический слой для AI

В 2025–2026 году BI Consult разработал агентный AI-модуль для аналитической платформы DataForge, используя её семантическую модель как основу для работы AI-агента с корпоративными данными.

DataForge — аналитическая платформа с развитой семантической моделью, включающей три ключевых компонента для AI:

Метрики и измерения

Полный каталог бизнес-метрик с правилами расчётов, иерархиями измерений и синонимами для семантического поиска. AI-агент получает этот каталог через API и использует его для интерпретации вопросов пользователя.

RMD (Report Meta Data)

Метаданные отчётов: как исторически строились те или иные аналитические запросы, какие метрики комбинировались вместе. Для AI это ценный источник контекста: что бизнес считает «правильным» способом анализа данной предметной области.

MCP-сервер над DataForge API

Специализированный MCP-сервер предоставляет AI-агенту инструменты: поиск метрик по смыслу (семантический поиск по векторным эмбеддингам), получение схемы куба, preview-запросы для валидации, выполнение финального запроса и формирование HTML-дашборда.

Принципиальное отличие реализованного подхода от стандартного Text-to-SQL: AI-агент ищет метрики семантически, а не по именам таблиц. Когда пользователь спрашивает «покажи динамику продаж в разрезе регионов», агент не ищет таблицу с названием «sales» — он ищет в каталоге DataForge метрику, которая семантически близка к понятию «продажи», и измерение «регион», используя векторные эмбеддинги описаний метрик. Это даёт устойчивость к неточным формулировкам и профессиональному жаргону конкретной компании.

Результат: бизнес-пользователь получает ответ на вопрос на естественном языке в виде структурированного HTML-дашборда с таблицами, визуализациями и интерпретацией на русском языке — без единой строки SQL и без знания схемы базы данных.

Обзор инструментов семантического слоя

Рынок инструментов для семантического слоя активно развивается. Выбор платформы зависит от существующей data-инфраструктуры, требований к интеграции с BI и степени готовности к AI-сценариям.

Open Source

Cube (Cube.js)

Наиболее популярное open-source решение для семантического слоя. Поддерживает REST и GraphQL API, что упрощает интеграцию с LLM-агентами. Имеет встроенный кэш, поддержку pre-aggregations и интеграцию с ведущими BI-инструментами. Активно развивает AI-specific функциональность, в том числе автоматическую генерацию семантического контекста для LLM.

Open Source

dbt Semantic Layer + MetricFlow

Для команд, работающих с dbt — естественное расширение data-стека. MetricFlow позволяет определять метрики прямо в dbt-проекте и делать их доступными через Semantic Layer API. Хорошо интегрируется с современными data warehouse: BigQuery, Snowflake, Databricks. Поддержка AI-запросов развивается через партнёрства с BI-вендорами.

Enterprise

AtScale

Enterprise-решение с акцентом на виртуализацию данных и универсальный семантический слой поверх любых источников. Поддерживает MDX и SQL-интерфейсы, что обеспечивает совместимость с широким спектром BI-инструментов. Имеет специализированные возможности для AI: API для экспорта семантической модели в формат, пригодный для контекста LLM.

Российское

DataForge

Российская аналитическая платформа с полноценной семантической моделью: метрики, измерения, иерархии, RMD. Разработан и эксплуатируется в российских enterprise-компаниях. BI Consult имеет опыт построения AI-агентов поверх DataForge API с использованием MCP-протокола. Не зависит от иностранных cloud-провайдеров — критично для компаний с требованиями к суверенитету данных.

Enterprise

Denodo

Лидирующая платформа виртуализации данных с семантическими возможностями. Позволяет строить единый логический слой над разнородными источниками без физического перемещения данных. Семантические метаданные Denodo могут использоваться для контекстуализации AI-агентов. Особенно эффективен в организациях с большим количеством разнородных источников данных.

Open Source

Apache Superset + Preset

Открытая BI-платформа с зачатками семантического слоя на уровне датасетов и виртуальных метрик. Подходит как начальная точка для небольших проектов. Для полноценной AI-интеграции требует дополнительных компонентов, однако активное сообщество разрабатывает AI-расширения на базе LLM для автогенерации запросов.

Выбор инструмента — не универсальный. BI Consult проводит аудит существующей инфраструктуры и рекомендует решение, наилучшим образом вписывающееся в текущий data-стек и AI-амбиции компании.

Что делает BI Consult

Мы прошли путь от BI-консалтинга к AI-интеграции с данными — и понимаем оба мира. Это позволяет нам проектировать семантические слои, которые одинаково хорошо работают и для BI-аналитиков, и для AI-агентов.

Аудит текущего состояния семантики

Инвентаризация существующих определений метрик, выявление конфликтов и дублирований, оценка готовности data-инфраструктуры к AI-интеграции. Результат: карта семантических разрывов и дорожная карта их устранения.

Проектирование семантического слоя для AI

Разработка модели метрик и измерений с учётом требований AI-агентов: описания на естественном языке, синонимы, примеры использования. Создание семантической схемы, понятной как аналитикам, так и языковым моделям.

Интеграция с существующими DWH и BI-системами

Подключение выбранного инструмента семантического слоя к существующим источникам данных: Clickhouse, PostgreSQL, Greenplum, Oracle, 1С и другим. Синхронизация семантической модели с уже существующими BI-отчётами, чтобы AI-ответы были консистентны с дашбордами.

Подключение AI-агентов через MCP

Разработка MCP-сервера поверх семантического слоя, реализация инструментов для AI-агентов: семантический поиск метрик, получение схемы, выполнение запросов, обработка ошибок. Интеграция с Claude, GPT-4 и отечественными LLM. Настройка системного промпта с семантическим контекстом.

Документирование и передача знаний

Создание документации по семантической модели, обучение аналитической команды управлению и развитию семантического слоя. Процедуры для governance: как добавлять новые метрики, как управлять версиями, как тестировать корректность расчётов.

Мониторинг и качество AI-ответов

Настройка системы логирования AI-запросов к семантическому слою, выявление паттернов ошибок, итеративное улучшение семантической модели на основе реальных пользовательских вопросов. A/B тестирование изменений в семантической схеме.

НАШЕ РЕШЕНИЕ

DataForge — семантический слой для AI

DataForge — это платформа для проектирования хранилищ данных с встроенным семантическим слоем. Реестр показателей и измерений (РПИ) DataForge становится единым источником бизнес-логики для AI-агентов: метрики, формулы расчёта, связи между таблицами и бизнес-контекст доступны LLM через MCP-протокол.

  • Визуальное проектирование DWH и витрин данных
  • Реестр показателей с бизнес-определениями и формулами
  • MCP-сервер для безопасного доступа LLM к метаданным
  • DataForge Analyst Agent — диалоговая аналитика на естественном языке
  • On-premise развёртывание в Docker, без облака
Архитектура DataForge: семантический слой между DWH и AI Бизнес-пользователь DataForge Analyst Agent Семантический слой РПИ · Метрики · Связи MCP Gateway Безопасный доступ DWH / PostgreSQL Источники данных Ответ + Визуализация

Почему BI Consult

Семантический слой — это пересечение двух миров: традиционной бизнес-аналитики и современного AI. Большинство AI-вендоров не понимают BI. Большинство BI-интеграторов не понимают AI. Мы работаем в обоих.

Экспертиза в BI

  • Более 300 внедрений BI-систем с 2009 года
  • Глубокая экспертиза в Qlik Sense, Power BI, Tableau и российских BI-платформах
  • Авторское исследование «AI в BI. Круг Громова 2026» — первый независимый анализ AI-возможностей BI-инструментов на российском рынке
  • Практический опыт проектирования семантических моделей для крупных DWH
  • Сертификации и партнёрства с ведущими data-вендорами

Экспертиза в AI

  • Реализованные AI-агенты на базе MCP-протокола для production-систем
  • Опыт интеграции Claude, GPT-4 и отечественных LLM с корпоративными данными
  • Разработка MCP-серверов для DataForge, ERP и других enterprise-систем
  • Полное понимание ограничений LLM при работе с данными и способов их преодоления
  • Компетенции в RAG-архитектурах, context engineering и AI safety

Готовы сделать AI-аналитику надёжной?

Расскажите нам о вашей data-инфраструктуре и задаче. Мы проведём бесплатный экспресс-аудит готовности к семантическому слою и предложим конкретный план действий.

Обсудить проект