AI EngineeringLLM · Качество · Оценка

Галлюцинации LLM: механизм и инженерные меры против них

Галлюцинация — не сбой модели, а её штатный режим работы, доведённый до неудобного нам результата. Понимание механизма важнее любого списка «промптов против галлюцинаций»: оно показывает, какие меры работают, а какие создают лишь ощущение контроля.

Что происходит с технической точки зрения

Языковая модель не хранит факты в виде записей, которые можно проверить. Она предсказывает продолжение текста: на каждом шаге выбирает следующий фрагмент, опираясь на статистические закономерности, усвоенные при обучении. Правдоподобность и правдивость для этого процесса — разные вещи, и оптимизируется первая.

Поэтому «я не знаю» — статистически редкое продолжение: в текстах, на которых училась модель, на заданный вопрос почти всегда следует ответ. Модель воспроизводит эту закономерность и уверенно достраивает недостающее, как достраивает окончание слова.

Почему это называют не багом

Тот же механизм даёт полезные свойства: способность перефразировать, обобщать, работать с задачами, которых не было в обучении, достраивать смысл по неполному описанию. Модель, физически неспособная сказать ничего сверх усвоенных текстов, была бы бесполезна как ассистент.

Практический вывод не в том, чтобы смириться, а в том, чтобы перестать искать волшебную настройку и начать проектировать систему, в которой выдуманный ответ дорого выживать.

Пять типов галлюцинаций, которые ведут себя по-разному

Что действительно снижает долю выдуманного

Дать модели источник и требовать цитату

Ответ, собранный по найденным фрагментам, с обязательной ссылкой на них — базовая мера. Она не устраняет проблему, но переводит её в проверяемую форму: если цитаты нет или она не подтверждает утверждение, ответ отбраковывается до того, как его увидит человек.

Проверять существование того, что модель назвала

Номера документов, артикулы, идентификаторы, ссылки, имена таблиц — всё это можно сверить с реальными системами программно. Такая проверка ловит целый класс галлюцинаций без участия человека и стоит копейки по сравнению с последствиями.

Разрешить отказ и вознаграждать его

Система должна иметь явный путь «в источниках этого нет». Его нужно проверять специально: в наборе тестовых вопросов обязаны быть такие, на которые правильный ответ — отказ. Без них модель будет получать хорошие оценки за уверенное сочинение.

Сузить задачу

Чем шире вопрос, тем больше свободы у модели достраивать. Разбиение на узкие шаги с проверяемым результатом снижает долю выдуманного сильнее, чем любые инструкции в промпте.

Детерминированные ограничения на выходе

Формат ответа, допустимые значения, диапазоны, обязательные поля — проверяются кодом, а не просьбой к модели. Всё, что критично, должно быть невозможно нарушить, а не нежелательно нарушать.

Что создаёт лишь ощущение контроля

Как измерять

Без измерения любая мера — вопрос веры. Минимальный рабочий набор метрик на фиксированном наборе вопросов с эталонами:

Эти цифры снимаются заново при каждой смене модели, промпта или правил поиска. Поведение моделей меняется между версиями, и система, работавшая вчера, может тихо деградировать после обновления.

Как это выглядит в проекте

  1. До разработки: собрать 30–50 реальных вопросов с эталонными ответами, включая те, где правильный ответ — отказ.
  2. В архитектуре: обязательное цитирование, программная проверка идентификаторов, детерминированные ограничения формата, журнал решений.
  3. На пилоте: подтверждение человеком там, где цена ошибки высока; замер метрик на реальном потоке.
  4. В эксплуатации: регрессионный прогон набора при каждом изменении и мониторинг доли отказов — её рост обычно первый признак того, что что-то сломалось в поиске.

Частые вопросы

Можно ли полностью убрать галлюцинации?

Нет. Механизм, который их порождает, — это тот же механизм, который делает модель полезной. Реалистичная цель — снизить частоту до приемлемой для процесса и сделать так, чтобы оставшиеся ошибки были заметны и обратимы.

RAG решает проблему галлюцинаций?

Частично. Он даёт модели опору и возможность цитировать, но если поиск принёс не тот фрагмент или фрагмент обрезан посреди условия, модель уверенно достроит недостающее. Поэтому качество поиска измеряется отдельно от качества ответа.

Какая метрика качества данных сильнее всего влияет на галлюцинации?

Полнота и актуальность корпуса: если ответа в данных нет или он устарел, у системы остаётся два пути — отказаться или выдумать. Далее по влиянию идёт корректность нарезки документов: фрагмент без условия применения провоцирует достраивание.

Помогает ли мультиагентная проверка?

Только когда у проверяющего есть независимый источник истины: прогон теста, сверка с документом, пересчёт. Проверка той же моделью на тех же данных даёт согласие, а не контроль.

Чем мы помогаем по этой теме

Читать дальше

Обсудим вашу задачу

Если у вас похожая задача — расскажите, что нужно решить. Скажем прямо, если она решается проще, чем кажется.

Написать нам