Глоссарий по искусственному интеллекту: просто и подробно
В последние годы искусственный интеллект стал не просто модным словом, а важной частью жизни. Мы общаемся с чат-ботами, используем голосовых помощников, видим рекомендации в онлайн-магазинах и даже получаем тексты, которые написал ИИ. В этом глоссарии я расскажу, что означают ключевые термины из мира искусственного интеллекта — без жаргона, так, чтобы было понятно всем.
Искусственный интеллект и его уровни
AI (Artificial Intelligence) — это общее название всех технологий, которые позволяют компьютерам выполнять задачи, требующие человеческого интеллекта: понимать текст, видеть, слышать, принимать решения. Это может быть как простая программа распознавания лиц, так и огромная языковая модель вроде ChatGPT.
AGI (Artificial General Intelligence) — искусственный интеллект общего назначения. Это мечта многих ученых. Такой ИИ сможет учиться, рассуждать и адаптироваться так же гибко, как человек. Пока такого ИИ не существует, но исследования ведутся.
Narrow AI (Узкий ИИ) — это ИИ, который решает только одну задачу: например, распознает лица или рекомендует фильмы. Именно такой ИИ сейчас повсюду.
Superintelligence — гипотетическая форма ИИ, которая намного умнее самого умного человека. Об этом часто пишут в фантастике и обсуждают в философских кругах, особенно в контексте рисков.
Модели и обучение
AI Model — это сама обученная система. Например, ChatGPT — это модель, которая умеет понимать и генерировать текст. Модель — это, по сути, сложная программа, в которую встроены знания, полученные из данных.
Training (обучение) — процесс, во время которого ИИ изучает огромные массивы данных и учится находить в них закономерности. Например, чтобы научить модель писать тексты, её "кормят" миллиардами слов.
Fine-tuning (дообучение) — это как дополнительная подготовка ИИ после общего обучения. Например, если у вас есть ИИ, который умеет писать тексты, его можно дообучить на юридических документах — и он станет специалистом по праву.
Supervised Learning (обучение с учителем) — когда модель учится на заранее размеченных данных. Например, ей показывают картинку с подписью "кот" и она запоминает, как выглядит кот.
Unsupervised Learning (обучение без учителя) — когда ИИ сам пытается найти закономерности в данных, без заранее заданных ответов.
Reinforcement Learning (обучение с подкреплением) — когда ИИ учится через опыт, как ребенок. Он пробует действия и получает награды или штрафы, учась на своих ошибках.
Transfer Learning (трансферное обучение) — когда модель, обученная на одной задаче, используется как основа для другой. Например, ИИ, обученный понимать английский, можно дообучить на медицинских текстах.
Архитектура и механизмы
Neural Network (нейросеть) — это основа почти всех современных моделей ИИ. Она вдохновлена устройством человеческого мозга и состоит из множества узлов, которые обмениваются данными.
Transformer (трансформер) — это особая архитектура нейросетей, которая стала революцией в обработке языка. Благодаря ей ИИ вроде GPT и BERT может понимать смысл текста, контекст и даже юмор.
Weights (веса) — внутренние параметры нейросети, которые определяют, как она принимает решения. В процессе обучения веса настраиваются, и именно они содержат знания модели.
Parameters (параметры) — общее количество весов в модели. Чем больше параметров, тем теоретически умнее и сложнее модель. Например, у GPT-3 сотни миллиардов параметров.
Embedding (встраивание) — способ представить слова или объекты как числа, чтобы ИИ мог с ними работать. Например, слово "кошка" может быть превращено в массив чисел, отражающих его смысл.
Tokenization (токенизация) — процесс деления текста на кусочки, называемые токенами. Это может быть слово, часть слова или даже отдельная буква. ИИ не читает текст целиком, а работает именно с токенами.
Context (контекст) — это то, что модель "держит в голове", чтобы давать осмысленные ответы. Например, если вы в диалоге обсуждали отпуск, ИИ учитывает это при следующем ответе.
Работа модели
Inference (вывод) — это момент, когда обученная модель получает новый запрос и выдает ответ. Например, вы вводите вопрос — модель делает инференс и отвечает.
Compute (вычислительные ресурсы) — мощность, которая нужна, чтобы обучать и запускать модели. Обучение требует огромных ресурсов, особенно GPU и TPU.
GPU (графический процессор) — это видеокарта, которая хорошо справляется с параллельными вычислениями. Именно GPU стали двигателем прорыва в ИИ.
TPU (тензорный процессор) — это специальный процессор от Google, созданный специально для ИИ.
Языковые модели
LLM (Large Language Model) — большая языковая модель. Она обучена на огромных объемах текста и умеет генерировать, дополнять и анализировать тексты.
Chatbot — это ИИ, с которым можно переписываться. Он может быть простым — отвечать по шаблону, а может быть сложным, как ChatGPT.
Prompt (запрос) — то, что вы пишете ИИ, чтобы он что-то сделал. Например, "Сочини стихотворение о лете".
Prompt Engineering (инженерия запросов) — искусство правильно формулировать запросы, чтобы получить нужный ответ. Иногда, как спросишь — так и ответят.
CoT (Chain of Thought) — техника, при которой ИИ разбивает сложную задачу на шаги и рассуждает по цепочке. Это как думать вслух.
Reasoning Model — модель, которая умеет логически рассуждать и объяснять свои шаги.
Explainability (объяснимость) — важное свойство ИИ: насколько понятно, почему он принял то или иное решение.
Hallucination (галлюцинация) — это когда ИИ уверенно выдает неправду. Например, придумывает источник, которого не существует. Важно не воспринимать все ответы ИИ как истину.
Новые подходы и инструменты
RAG (Retrieval-Augmented Generation) — это модель, которая перед тем как ответить, ищет информацию в базе знаний, а потом генерирует ответ. Это снижает риск ошибок.
AI Wrapper — оболочка или надстройка, которая помогает проще использовать ИИ. Например, делает интерфейс для бизнес-пользователя.
MCP (Model Context Protocol) — это способ дать модели доступ к внешним данным: например, таблицам или базам знаний, чтобы ответ был точнее.
AI Alignment — это область, которая изучает, как сделать так, чтобы ИИ разделял человеческие ценности и действовал в наших интересах.
AI Agents (агенты ИИ) — это автономные ИИ-программы, которые не просто отвечают на запросы, а сами ставят цели, собирают данные, принимают решения. Пример — ассистент, который сам может забронировать билеты или подготовить отчет.
Vibe Coding — стиль программирования, когда вы общаетесь с ИИ на обычном языке, а он сам пишет код, дополняет его и объясняет. Это как парное программирование с умным помощником.
Другие области ИИ
Generative AI (генеративный ИИ) — ИИ, который умеет создавать новое: тексты, картинки, музыку. Сюда входят модели вроде DALL-E, Midjourney, ChatGPT.
Computer Vision (компьютерное зрение) — направление, в котором ИИ учится "видеть". Он распознаёт лица, машины, жесты, медицинские снимки и даже эмоции.
Speech Recognition (распознавание речи) — ИИ, который умеет превращать голос в текст. Пример — диктовка или голосовые ассистенты.
Natural Language Processing (обработка естественного языка, NLP) — область, которая охватывает понимание, генерацию и анализ человеческого языка.
Ground Truth (эталонная правда) — это точные данные, на которых проверяют ИИ. Например, список правильных ответов на тест. Чем точнее эти данные, тем качественнее обучение и тестирование.
Foundation Model (базовая модель) — это большая универсальная модель, которую можно адаптировать под разные задачи: от перевода текста до анализа юридических документов.
Проблемы, риски и надежность
Bias (предвзятость) — когда ИИ повторяет и усиливает стереотипы из данных. Например, если в обучающих данных женщины чаще упоминаются как учителя, модель может ошибочно предполагать, что инженер — это всегда мужчина.
Data Leakage (утечка данных) — случай, когда в обучающие данные случайно попала информация, которую модель не должна была знать. Это искажает результаты.
Overfitting (переобучение) — когда модель слишком хорошо запомнила обучающие данные и не умеет работать с новыми. Она как ученик, выучивший ответы наизусть, но не понявший суть.
Underfitting (недообучение) — когда модель слишком простая и не может уловить закономерности в данных.
Model Drift (дрейф модели) — когда поведение модели со временем становится хуже, потому что мир изменился. Например, ИИ, обученный на новостях до пандемии, может плохо понимать современные реалии.
Технологические термины и инструменты
Dataset (набор данных) — то, на чём обучают ИИ. Это может быть корпус текстов, база фотографий или таблица с транзакциями.
Pretraining (предобучение) — начальный этап, когда модель обучается на общем массиве данных до того, как её применят к конкретной задаче.
Fine-grained Control (тонкая настройка) — возможность точно управлять тем, как модель генерирует ответы. Например, можно попросить: "Пиши строго и по делу".
Zero-shot и Few-shot Learning — когда модель решает задачу без обучения (ноль примеров) или с парой примеров. Это признак мощных моделей.
Knowledge Cutoff — дата, до которой модель знает информацию. Например, ChatGPT знает события до конца 2023 года, но не позже.



