Foundation Models & Fine-tuning

Выбор, адаптация и дообучение больших языковых моделей для решения бизнес-задач: от анализа ландшафта до промышленной эксплуатации.

Обсудить проект

Ландшафт Foundation Models

Рынок больших языковых моделей стремительно развивается. Понимание ключевых игроков, их сильных сторон и ограничений -- критически важный навык для любой команды, работающей с AI.

Foundation models -- это предобученные на огромных массивах данных нейросетевые модели, которые служат фундаментом для создания AI-приложений. В отличие от традиционных ML-моделей, обучаемых с нуля под конкретную задачу, foundation models обладают широкими базовыми способностями: генерация текста, понимание контекста, логическое рассуждение, работа с кодом и мультимодальность. Ключевой вопрос для enterprise -- не «какая модель лучше», а «какая модель оптимальна для нашей конкретной задачи с учётом всех ограничений».

OpenAI OpenAI
Anthropic Anthropic
Google Google
Meta Meta
Mistral AI Mistral AI
YandexGPT YandexGPT
GigaChat GigaChat
CLOSED SOURCE

GPT-4o / GPT-4.1

Флагманские модели OpenAI. Мультимодальность (текст, изображения, аудио), широкое контекстное окно до 128K токенов. Лидер по general-purpose задачам и code generation. Доступ через API.

CLOSED SOURCE

Claude (Anthropic)

Семейство моделей Anthropic с фокусом на безопасность и длинный контекст (до 200K токенов). Отличная работа с аналитическими задачами, юридическими документами и сложными инструкциями. Поддержка tool use и agentic workflows.

CLOSED SOURCE

Gemini (Google)

Мультимодальная модель Google с нативной поддержкой текста, изображений, видео и аудио. Контекстное окно до 1M+ токенов в Gemini 1.5 Pro. Глубокая интеграция с Google Cloud и Workspace.

OPEN SOURCE

LLaMA (Meta)

Семейство открытых моделей Meta от 8B до 405B параметров. Permissive-лицензия позволяет коммерческое использование. Огромная экосистема fine-tuning инструментов. Основа для множества производных моделей.

OPEN SOURCE

Mistral / Mixtral

Европейская альтернатива: компактные, но мощные модели. Mixtral (MoE-архитектура) обеспечивает качество, сопоставимое с GPT-4, при существенно меньших вычислительных затратах. Apache 2.0 лицензия.

OPEN SOURCE

Qwen (Alibaba)

Сильное семейство открытых моделей от Alibaba Cloud. Отличная многоязычность, включая русский. Модели от 0.5B до 110B параметров. Хорошие результаты в coding и math benchmarks.

РОССИЙСКАЯ

GigaChat (Сбер)

Флагманская российская модель от Сбера. Нативная поддержка русского языка, мультимодальность, генерация изображений. Размещение на территории РФ, соответствие требованиям регуляторов.

РОССИЙСКАЯ

YandexGPT

Модели Яндекса, оптимизированные для русскоязычных задач. Глубокая интеграция с экосистемой Yandex Cloud. Варианты Lite и Pro для разных сценариев. API-доступ и возможность fine-tuning.

Мультимодельная стратегия -- новая норма. Ведущие организации используют не одну модель, а portfolio: мощную модель для сложных аналитических задач, компактную для массовых операций, и on-premise модель для работы с чувствительными данными. Такой подход оптимизирует баланс качества, стоимости и безопасности.

Критерии выбора модели

Выбор foundation model -- это инженерное решение с множеством параметров. Универсально лучшей модели не существует: оптимальный выбор зависит от конкретного контекста.

Качество генерации

Accuracy на целевых задачах, способность следовать инструкциям, уровень галлюцинаций, качество рассуждений. Оценивается на domain-specific eval sets, а не на общих бенчмарках.

Latency и throughput

Время до первого токена (TTFT) и скорость генерации (tokens/sec) критичны для real-time приложений. Batch-задачи более толерантны к latency, но требуют высокого throughput.

Стоимость

TCO включает стоимость API-вызовов (input/output tokens), инфраструктуры для self-hosted моделей, fine-tuning, и операционных расходов. Разница между моделями может составлять 10-100x.

Лицензия и IP

Коммерческая лицензия, ограничения на использование, права на производные модели. Для enterprise критичны: возможность модификации, отсутствие copyleft, чёткие условия data privacy.

Языковая поддержка

Качество работы с русским языком существенно различается. Модели, обученные преимущественно на английских данных, часто теряют до 30% качества на русскоязычных задачах.

On-premise возможность

Для регулируемых отраслей (финансы, здравоохранение, госсектор) критична возможность развёртывания на собственной инфраструктуре. Это ограничивает выбор open-source и российскими моделями.

Дерево принятия решения о выборе модели

Выбор модели Чувствительные данные? ПДн, коммерч. тайна Данные не критичны Можно в облако Да Нет On-Premise Open Source / Рос. Private Cloud VPC / Dedicated Сложные задачи Рассуждение, анализ Массовые операции Высокий объём Fine-tune нужен? Fine-tune нужен? LLaMA / Mistral LoRA / QLoRA A100/H100 GPU GigaChat / YandexGPT Prompt + RAG Claude / GPT-4o VPC Deployment + Fine-tuning API GPT-4o / Claude Gemini Pro Frontier models GPT-4o mini / Claude Haiku Cost-optimized Всегда проводите eval на ваших данных перед финальным выбором

Fine-tuning vs Prompt Engineering vs RAG

Три фундаментальных подхода к адаптации модели под бизнес-задачу. Каждый решает свой класс проблем, и часто оптимальным является их комбинация.

Прежде чем инвестировать в fine-tuning, критически важно убедиться, что более простые подходы -- prompt engineering и RAG -- не решают задачу с достаточным качеством. Fine-tuning требует значительных ресурсов (данные, вычисления, экспертиза), и его применение оправдано только когда альтернативы исчерпаны. Правило, которого мы придерживаемся: «Сначала prompt, потом RAG, потом fine-tuning».

Критерий Prompt Engineering RAG Fine-tuning
Когда использовать Модель уже знает предметную область, нужно направить поведение Нужны актуальные или приватные данные, отсутствующие в модели Нужен специфический стиль, формат или глубокие domain-знания
Время внедрения Часы -- дни Дни -- недели Недели -- месяцы
Требуемые данные Несколько примеров (few-shot) Корпус документов для индексации Сотни-тысячи размеченных примеров
Стоимость Минимальная (инженерное время) Средняя (инфраструктура + embeddings) Высокая (GPU + данные + эксперты)
Обновляемость знаний Ограничена контекстным окном Высокая -- обновление документов в реальном времени Низкая -- требует повторного обучения
Контроль поведения Средний -- зависит от модели Средний -- зависит от quality retrieval Высокий -- модель обучается на ваших паттернах
Галлюцинации Базовый уровень модели Снижаются за счёт grounding Могут усиливаться при плохих данных
Типичные сценарии Классификация, извлечение данных, простая генерация Q&A по документам, корпоративный поиск, support Медицинская терминология, юридический анализ, код
Комбинированный подход. На практике наиболее эффективна комбинация: fine-tuned модель, которая лучше понимает доменную специфику, получает актуальный контекст через RAG, а system prompt задаёт поведенческие рамки. Это позволяет достичь максимального качества при сохранении актуальности знаний.

Методы Fine-tuning

Современные методы дообучения позволяют адаптировать модели с миллиардами параметров на стандартном оборудовании без потери базовых знаний.

Эволюция методов fine-tuning радикально снизила порог входа: если ещё два года назад дообучение модели размером 70B параметров требовало кластера из восьми A100 GPU, то сегодня с помощью QLoRA это можно сделать на одном GPU с 24 ГБ VRAM. Тем не менее, качество fine-tuning определяется не только методом, но и -- в первую очередь -- качеством данных для обучения.

Full Fine-tuning

Обновление всех весов модели на новых данных. Максимальная гибкость адаптации, но требует значительных вычислительных ресурсов и большого объёма качественных данных. Риск catastrophic forgetting -- потери базовых знаний модели при некорректной настройке гиперпараметров.

Все параметры Макс. качество Высокий ресурс

LoRA (Low-Rank Adaptation)

Заморозка основных весов модели и обучение небольших low-rank матриц-адаптеров. Обучается менее 1% параметров, что снижает требования к GPU в 3-5 раз. Адаптеры можно легко подключать и переключать, используя разные для разных задач на одной базовой модели.

0.1-1% параметров Быстрое обучение Модульность

QLoRA (Quantized LoRA)

Комбинация 4-bit квантизации базовой модели с LoRA-адаптерами. Позволяет дообучать модели с 65B+ параметрами на одном GPU с 24 ГБ VRAM. Потеря качества по сравнению с full fine-tuning минимальна (обычно менее 1-2% на бенчмарках), что делает QLoRA методом выбора для большинства enterprise-сценариев.

4-bit квантизация 1x GPU Оптимальный баланс

RLHF (Reinforcement Learning from Human Feedback)

Обучение модели на основе предпочтений человека: аннотаторы ранжируют ответы модели, обучается reward model, затем политика модели оптимизируется через PPO-алгоритм. Сложный, ресурсоёмкий процесс, используемый преимущественно для alignment -- приведения поведения модели в соответствие с человеческими ценностями и ожиданиями.

Reward model PPO Alignment Ресурсоёмкий

DPO (Direct Preference Optimization)

Упрощённая альтернатива RLHF: вместо обучения отдельной reward model, модель обучается напрямую на парах «предпочтительный / нежелательный ответ». Значительно проще в реализации, стабильнее в обучении и требует меньше данных. Для большинства enterprise-задач DPO обеспечивает результаты, сопоставимые с RLHF.

Без reward model Пары ответов Стабильный

Continued Pre-training

Продолжение предобучения модели на доменном корпусе (например, медицинская литература, юридические документы). Не требует размеченных данных -- достаточно большого объёма текстов в предметной области. Эффективно расширяет знания модели в узкой сфере, обычно дополняется instruction tuning на следующем этапе.

Доменные тексты Без разметки Расширение знаний

Инфраструктура для Fine-tuning

Успешный fine-tuning требует не только правильного метода, но и подготовленной инфраструктуры: от GPU-серверов до pipeline подготовки данных.

GPU-инфраструктура

  • NVIDIA A100 (80 GB) -- стандарт для fine-tuning моделей до 30B параметров. Поддержка BF16/FP16, NVLink для multi-GPU
  • NVIDIA H100 -- next-gen ускоритель с 3x производительностью A100 на training задачах. Оптимален для моделей 70B+
  • Cloud GPU -- AWS (p4d/p5), GCP (A3), Azure (ND H100). Гибкость масштабирования, оплата по использованию
  • Consumer GPU (RTX 4090) -- 24 GB VRAM достаточно для QLoRA на моделях до 70B. Подходит для экспериментов и небольших проектов

Frameworks и инструменты

  • Axolotl -- универсальный framework для fine-tuning с поддержкой LoRA, QLoRA, full fine-tuning. YAML-конфигурация, интеграция с HuggingFace
  • Unsloth -- оптимизированный framework с 2-5x ускорением обучения и сниженным потреблением памяти. Идеален для QLoRA
  • HuggingFace TRL -- библиотека для SFT, RLHF и DPO. Часть экосистемы Transformers, широкая community-поддержка
  • LLaMA Factory -- GUI и CLI для fine-tuning с поддержкой 100+ моделей. Низкий порог входа для нетехнических пользователей
  • Weights & Biases -- мониторинг экспериментов, версионирование моделей и данных, hyperparameter sweeps

Подготовка данных

  • Формат данных -- instruction-response пары для SFT, preference pairs для DPO, raw text для continued pre-training
  • Объём -- SFT: 1K-50K качественных примеров; DPO: 500-10K пар; continued pre-training: 1B+ токенов
  • Качество > количество -- 1000 высококачественных примеров с экспертной разметкой превосходят 100K автоматически сгенерированных
  • Decontamination -- обязательная проверка на утечку данных из eval-сетов в training-данные
  • Augmentation -- генерация синтетических данных сильной моделью (GPT-4o, Claude) для расширения training set
Data-centric подход. 80% успеха fine-tuning определяется качеством данных, а не выбором метода или гиперпараметров. Инвестируйте в подготовку и курирование training-данных: привлекайте доменных экспертов, проводите ревью каждого примера, итеративно улучшайте dataset на основе ошибок модели. Один раунд fine-tuning на плохих данных может ухудшить модель по сравнению с baseline.

Российские модели: когда выбирать

Российские foundation models -- не просто «импортозамещение». В определённых сценариях они являются объективно лучшим выбором по совокупности факторов.

Рынок российских LLM активно развивается. GigaChat от Сбера, YandexGPT, T-Lite от T-Банка, mGPT от Сбера -- каждая из этих моделей имеет свои сильные стороны. Ключевые преимущества российских моделей: нативная поддержка русского языка (модели обучены на значительном корпусе русскоязычных текстов), размещение инфраструктуры на территории РФ (критично для compliance), доступ к русскоязычной техподдержке и документации. Однако по общему уровню quality на сложных задачах (mathematical reasoning, code generation, multi-step analysis) лидирующие зарубежные модели пока превосходят российские аналоги.

Когда российские модели -- оптимальный выбор:

Регуляторные требования

Государственный сектор, КИИ, обработка ПДн граждан РФ, банковская тайна -- законодательство требует или настоятельно рекомендует обработку данных на территории РФ. Российские модели с развёрнутой инфраструктурой в российских ЦОД снимают этот вопрос полностью.

Русскоязычные задачи

Генерация текстов на русском языке (маркетинговые материалы, документация, customer-facing контент), работа с русскоязычными документами, классификация обращений. Модели, нативно обученные на русском корпусе, демонстрируют лучшее качество стилистики и грамматики.

Санкционные риски

Зависимость от зарубежных API-провайдеров создаёт операционные риски: отключение доступа, изменение условий использования, ограничения на экспорт. Российские модели обеспечивают технологический суверенитет и непрерывность бизнес-процессов.

Экосистемная интеграция

Если организация уже использует экосистему Сбера или Яндекса (облачные сервисы, платёжные системы, аналитика), интеграция с GigaChat или YandexGPT обеспечивает синергию: единый биллинг, shared IAM, техподдержка на русском языке, SLA по российским стандартам.

Гибридная стратегия. Для большинства enterprise-клиентов мы рекомендуем гибридный подход: российские модели для задач с чувствительными данными и регуляторными ограничениями, зарубежные frontier-модели для задач максимальной сложности через API-шлюз с контролем данных. Это обеспечивает оптимальный баланс качества, безопасности и compliance.

Оценка дообученной модели

Без систематической оценки невозможно понять, улучшил ли fine-tuning модель или ухудшил. Eval-инфраструктура -- обязательный элемент любого проекта дообучения.

Оценка дообученной модели принципиально отличается от evaluation в классическом ML. Метрики типа accuracy или F1 применимы лишь для узких задач классификации и извлечения. Для генеративных моделей необходим комплексный подход, включающий автоматические метрики, сравнение с baseline, экспертную оценку и тестирование на adversarial-примерах. Ключевой принцип: eval-набор должен быть создан до начала fine-tuning и не должен пересекаться с training-данными.

Benchmark Comparison

Сравнение fine-tuned модели с базовой моделью и конкурентами на стандартных бенчмарках: MMLU, HumanEval, GSM8K, а также русскоязычных: MERA, ruMMLU. Позволяет убедиться, что fine-tuning не ухудшил general capabilities.

Domain-specific Eval Sets

Набор из 100-500 задач, репрезентативных для целевого use case. Включает edge cases, adversarial примеры и задачи разной сложности. Создаётся совместно с доменными экспертами и версионируется.

LLM-as-a-Judge

Использование более сильной модели (GPT-4o, Claude) для автоматической оценки ответов fine-tuned модели по критериям: релевантность, полнота, корректность, стиль. Масштабируемая альтернатива ручной экспертизе.

A/B-тестирование

Сравнение fine-tuned и baseline модели на реальном трафике с участием конечных пользователей. Золотой стандарт оценки для production-систем. Требует инфраструктуру для routing и сбора обратной связи.

Regression Testing

Проверка, что fine-tuning не ухудшил качество на задачах, которые модель решала хорошо до дообучения. Особенно важно при continued pre-training, который может приводить к catastrophic forgetting.

Safety & Alignment Eval

Тестирование на jailbreak-устойчивость, refusal accuracy, bias detection. Fine-tuning может непреднамеренно ослабить safety-механизмы базовой модели, поэтому safety eval обязателен.

Continuous Evaluation. Оценка не заканчивается после deployment. Качество модели может деградировать со временем из-за data drift, изменения паттернов использования или обновления базовой модели провайдером. Встройте automated eval pipeline в CI/CD и мониторьте ключевые метрики в production.

Готовы выбрать и адаптировать модель?

Поможем определить оптимальную foundation model для вашей задачи, выстроить pipeline дообучения и систему оценки качества.

Обсудить проект