В предыдущей статье мы обсудили откуда берутся галлюцинации LLM и что может их спровоцировать. В этой поговорим о последствиях и методах борьбы.

Whisper слышит больше, чем нужно
Whisper слышит больше, чем нужно

Шесть дел, которых не было

Весной 2023 года нью-йоркский юрист Стивен Шварц готовил возражение по иску против авиакомпании Avianca. Тридцать лет практики, а впереди рутинное дело о травме пассажира. Для поиска прецедентов Шварц впервые попробовал модную новинку — ChatGPT.

Новинка не подвела. Она выдала шесть релевантных судебных решений с номерами, цитатами и внутренними ссылками. «Варгезе против China Southern Airlines», «Шабун против Egyptair», «Петерсен против Iran Air» — солидные названия, солидные суды. Шварц вставил их в документ, его коллега Питер ЛоДука подписал и отправил судье.

Дальше было так. Юристы авиакомпании не смогли найти ни одного из шести дел. Судья Кевин Кастел тоже. В приказе от 4 мая 2023 года он констатировал: шесть представленных дел выглядят фальшивыми судебными решениями с фальшивыми цитатами и фальшивыми ссылками. Само «дело Варгезе» судья, полистав, охарактеризовал коротко: бессмыслица.

А Шварц ведь проверял. Знаете как? Он спросил у ChatGPT, настоящие ли это дела. ChatGPT заверил: настоящие, их можно найти в уважаемых юридических базах. Проверка галлюцинации у источника галлюцинации — запомните этот приём, мы к нему ещё вернёмся.

На слушаниях Шварц объяснял, что считал ChatGPT чем-то вроде супер-поисковика. Ошибка понятная. Но юристу такого класса непростительная.

Поисковик показывает чужие документы, которые существуют независимо от запроса. Генератор создаёт документ под запрос. Внешне выдача неотличима, но по сути это разница между библиотекой и очень начитанным импровизатором.

Финал истории вполне себе терпимый: 5000 долларов штрафа на двоих юристов и фирму. По манхэттенским расценкам — несколько часов работы того же юриста. Казалось бы, на первый раз, считайте, простили, только выводы сделайте.

Как бы не так. Французский исследователь Дамьен Шарлотен с 2025 года ведёт базу судебных дел, в которых всплыли выдуманные ИИ цитаты. В мае 2025-го, на старте, там было около 120 эпизодов. К концу августа 2026-го — 1980, из них 1362 в США.

В среднем по четыре новых дела каждый день, и это только то, что суды заметили и оформили. Чаще попадаются граждане, защищающие себя сами, но и профессиональных юристов в базе почти восемьсот.

В базе, кстати, два жанра. Основной — дела, которых никогда не существовало: таких эпизодов 1646. Но есть жанр потоньше: дело настоящее, а цитата из него выдумана. Таких больше пятисот, и ловить их на порядок сложнее. Номер-то пробивается.

Показательно, за что в итоге наказывают строже всего. Не за сам ИИ. Юрист из Колорадо Закария Крабилл, попавшись на выдуманных прецедентах, свалил вину на стажёра — и получил реальное отстранение от практики — это один из первых прецедентов. Главное, на что давило обвинение, это не слепое доверие машине LLM, а попытка это скрыть.

Хотя этим летом адвоката в Миннесоте отстранили уже просто за сам факт фальшивых цитат в брифе. Планка ответственности ползёт вверх.

Чат-бот как отдельное юрлицо

Джейк Моффатт покупал билет Ванкувер — Торонто на похороны бабушки. Чат-бот на сайте Air Canada объяснил ему: летите по полному тарифу, а скидку за утрату близкого оформите потом, у вас 90 дней после полёта. Моффатт так и сделал. Авиакомпания отказала: настоящие правила ретроактивных заявок не допускают, бот ошибся.

Билеты Моффатт покупал в ноябре 2022 года, а решение трибунала датировано февралём 2024-го. Год с лишним переписки и разбирательств ради компенсации меньше чем в девятьсот канадских долларов — тут явно был вопрос принципа. И принцип того стоил.

Дело дошло до трибунала Британской Колумбии, и там Air Canada выкатила аргумент, который можно было золотыми буквами записать в сборник плохих идей. Компания заявила, что чат-бот — отдельная сущность, которая сама отвечает за свои действия. Член трибунала Кристофер Риверс в решении от февраля 2024 года назвал этот довод замечательным, в кавычках, конечно. Читайте: «Они совсем там охренели».

И сформулировал принцип: нет никакой разницы, получена информация со статичной страницы сайта или от чат-бота. Отвечает компания. Сумма выплаты вышла смешная, меньше тысячи канадских долларов. Но все смотрели не на деньги, а на прецедент.

Тут важно, если вы вдруг пропустили. Чат-бот — это не условный ChatGPT, это именно умный помощник на сайте авиакомпании. И логично, что авиакомпания несёт полную ответственность за все, что он говорит. С другой стороны, как мы узнали выше, как его не настраивай, глюк рано или поздно случится. И это очень важная вещь, которую компания стоит понимать про своих умных помощников.

Скрытый текст

Тут можно сделать круглые глаза и сказать: кааак. Все, кто используют чат-ботов, сейчас сидят на бочке с порохом? В общем да, с некоторыми оговорками так и есть. Но тут важно помнить, что условный стажёр на удалёнке, который отвечал в боте до LLM — это такая же бочка с порохом, только хуже. LLM хотя бы не будет грубить из-за плохого настроения или попадания в психологическую болевую точку оператора.

Чем нам всем предстоит научиться, и чему мы потихоньку учимся — LLM во многих задачах работают лучше, чем люди. Но они, видимо, никогда не достигнут точности условного Excel, который не ошибается вообще.

Бывают ошибки и подороже. В феврале 2023 года Google показала рекламный ролик своего нового чат-бота Bard. В ролике Bard отвечал на вопрос про телескоп «Джеймс Уэбб» и среди прочего сообщил, что тот сделал первые в истории снимки экзопланеты.

Мелочь? Первое фото экзопланеты на самом деле получил наземный телескоп VLT в 2004 году, за восемнадцать лет до «Уэбба». Астрономы заметили. 8 февраля, на фоне этой ошибки и в целом смазанной презентации, акции Alphabet просели на 7,7% — примерно сто миллиардов долларов капитализации за торговый день. Самая дорогая реакция на рекламную кампанию.

Отдельный жанр — галлюцинации в отчётах крутых и уважаемых фирм. Deloitte написала для австралийского министерства занятости отчёт за 439 тысяч австралийских долларов; исследователь из Сиднея нашёл там несуществующие научные работы и выдуманную цитату из решения федерального судьи. Ирония в том, что отчёт был про систему автоматических санкций для получателей пособий — наследие скандала Robodebt, на котором австралийское государство уже однажды обожглось о слепое доверие алгоритму. Пришлось признаваться, что текст помогал писать GPT-4o, и возвращать последний платёж по контракту. Через месяц похожий скандал догнал Deloitte в Канаде — отчёт о здравоохранении на полтора миллиона канадских долларов, 526 страниц, и снова фантомные ссылки.

Дальше — больше. В июне 2026-го проверяющие прошлись по отчёту KPMG об агентном ИИ: из 45 проверенных ссылок подтвердились пять. Пять. Упомянутые в кейсах организации, включая NHS, публично открестились, отчёт отозвали.

А в апреле 2026-го правительство ЮАР отозвало проект национальной политики по искусственному интеллекту через 17 дней после публикации: минимум шесть источников из библиографии оказались выдуманными. Вдумайтесь: государственную стратегию по ИИ завернули из-за галлюцинаций ИИ. Более честной рецензии на состояние отрасли не придумаешь.

Пресса тоже отметилась. В мае 2025 года Chicago Sun-Times вышла с летним списком книг для чтения, где десять наименований из пятнадцати не существовали. Авторы настоящие, книги — нет. «Последний алгоритм» Энди Вира — согласитесь, звучит так, что хочется купить. Фрилансер, собиравший список через нейросеть, потом извинялся на всю страну.

Тот самый список книг
Тот самый список книг

Список можно продолжать долго: тем же летом журналисты нашли следы сгенерированных ссылок даже в докладе о здоровье нации, подготовленном для Белого дома, — часть процитированных исследований не существовала. Обратите внимание на общий знаменатель всех этих историй. Ни одна не про «глупую нейросеть». Все — про процесс, в котором между генератором правдоподобия и публикацией не оказалось ни одного проверяющего человека.

Клевета со скоростью токенов

Есть категория пострадавших, которым не смешно от слова совсем. Это отдельный, максимально интересный глюк, который обязательно нужно разобрать.

Немецкий журналист Мартин Бернклау не одно десятилетие писал судебные репортажи из Тюбингена. В 2024 году он обнаружил, что Copilot от Microsoft рассказывает о нём самом: осуждён за растление детей, сбежал из психиатрической клиники, обманывал вдов. Модель склеила автора репортажей с их фигурантами. Годы рядом с чужими преступлениями превратились в статистическую связь «этот человек совершал преступления».

Забавнее всего отреагировала прокуратура: отказала в возбуждении дела, потому что клеветника нет — автор обвинений не является лицом. Microsoft ложные ответы удаляла, через несколько дней они всплывали снова. Генератор не помнил, что его правили. Ну либо правили джуны, ибо дообучение на ограничение выдачи — это отдельная, сложная, тема.

Вообще, убрать конкретный ответ из модели практически нельзя — статистическая связь «Бернклау — преступления» размазана по весам, и в два клика её не вырезать. Точечное редактирование весов существует как исследовательское направление, но пока работает грязно: правишь один факт — плывут соседние. Поэтому такие вещи патчат снаружи: фильтрами на выходе, инструкциями в системном промпте. Фильтр промахнулся, формулировка запроса чуть изменилась — связь снова прорвалась в ответ.

Существует даже целое направление промптинга, правда в серой зоне. Подобрать такой запрос, чтобы нейросеть посоветовала лучший рецепт для наркотика, нарисовала голую Шер (не будем задавать вопрос зачем) или выдала ещё что-нибудь непотребное.

Норвежцу Арве Хьялмару Хольмену ChatGPT сообщил, что тот убил двух своих сыновей и получил 21 год тюрьмы. Пикантность в том, что модель верно назвала его родной город, число и пол его детей. Правдивые детали вперемешку с чудовищным вымыслом — и вымысел от этого выглядит достовернее. Правозащитники подали жалобу в норвежское управление по защите данных.

Заметьте, обе истории — это тот самый механизм из первой части. Имя знакомое, тормоз отпущен, дальше генератор собирает самое правдоподобное из ближайших статистических связей. Для судебного репортёра ближайшие связи — преступления. Работает как задумано. И от этого не по себе.

А теперь про случай, где галлюцинирует даже не чат-бот. Whisper — система распознавания речи от OpenAI, её встраивают повсюду, от субтитров до колл-центров. В октябре 2024 года агентство AP собрало показания разработчиков и исследователей: Whisper дописывает в транскрипции то, чего никто не говорил. Исследователь из Мичиганского университета находил вставки в восьми транскриптах из десяти проверенных.

Учёные из Корнелла и Вирджинии прогнали через Whisper аудиоархив с записями речи людей с афазией — выбор не случайный, у таких пациентов в речи много длинных пауз, самой провокационной для модели среды. Итог: примерно в одном проценте фрагментов — целиком выдуманные фразы и предложения, и 38% этих вставок несут прямой вред: несуществующие лекарства, приписанное насилие, случайные расовые уточнения. Замер делался на версии Whisper весны 2023 года — свежие версии выдумывают реже, но не перестали, что и показывали проверки AP полтора года спустя. Один процент звучит безобидно, пока не вспомнить масштаб: медицинский сервис Nabla на базе Whisper к тому моменту обслужил семь миллионов визитов к врачу. И — вишенка — стирал исходное аудио после транскрибации. Бывший инженер OpenAI Уильям Сондерс прокомментировал это исчерпывающе: нельзя поймать ошибку, если ты уничтожил эталон.

Почему транскрибатор вообще выдумывает? Whisper — не чат-бот, его учили на парах «звук — текст». Но выход из него, как и из GPT, печатает авторегрессионный декодер: та же машина продолжения, только опирающаяся на звук. Тишина, шум, невнятное бормотание опоры не дают, а токены выдавать надо. И в паузах Whisper делает ровно то, что делал бы любой генератор: продолжает правдоподобно. Фразы вроде «спасибо за просмотр» — по распространённой гипотезе, следы субтитров с видеохостингов в обучающих данных; сама OpenAI их состав не раскрывала.

Каждый пятый пакет — призрак

Теперь история для тех, кто пишет код. Она началась как курьёз, а закончилась новым классом атак на цепочку поставок.

Когда просишь модель написать код, она охотно подключает библиотеки. Импорт такой-то, установите пакет такой-то. В 2025 году на конференции USENIX Security показали масштабное исследование: из 576 тысяч сгенерированных образцов кода на Python и JavaScript 19,7% рекомендованных пакетов не существовало. Каждый пятый. Всего набралось 205 474 уникальных выдуманных имени — телефонный справочник приличного райцентра, состоящий из призраков.

Оговорка про среднюю температуру: в выборке было шестнадцать моделей, включая мелкие открытые образца 2023 года, и именно они тащили процент вверх. У коммерческих моделей вышло 5,2%, у свежих флагманов ещё меньше. Но помножьте единицы процентов на миллионы ежедневных генераций кода — фантомов всё равно хватает.

Само по себе это полбеды: несуществующий пакет не установится, ошибку видно сразу. Беда в другом. Выдумки моделей не случайны — одни и те же фантомные имена всплывают у разных людей стабильно, из раза в раз. А что стабильно повторяется, то можно предсказать. А что можно предсказать, то можно зарегистрировать заранее.

Схему продемонстрировал исследователь Бар Ланьядо. Он заметил, что модели упорно рекомендуют несуществующий пакет huggingface-cli, и опубликовал под этим именем пустышку. За три месяца её скачали больше тридцати тысяч раз, пустышка утекла в том числе в репозитории крупных компаний. Теперь представьте, что вместо пустышки там был вирус. Приём получил имя слопсквоттинг — по аналогии с тайпсквоттингом, только опечатки за вас генерирует нейросеть.

Cлопсквоттинг
Cлопсквоттинг

Цифра, которая мне кажется недооценённой: открытые модели той когорты выдумывали пакеты вчетверо чаще коммерческих, 21,7% против 5,2%. Дело не в открытых весах как таковых — дело в силе модели. Чем слабее генератор, тем шире поверхность атаки, которую он вам генерирует.

Защита тут простая и оттого надёжная. Фиксировать зависимости, ставить пакеты через внутреннее зеркало с допуск-листом, смотреть на возраст и число скачиваний. Свежий пакет с нулевой историей, который вам насоветовала нейросеть, — повод насторожиться. Сканеры зависимостей эту специфику тоже начали учитывать.

Ладно, масштаб бедствия ясен. Возникает следующий вопрос: а как вообще измерить, сколько врёт конкретная модель? Спойлер: это отдельная боль.

Градусник для вранья

Академические линейки правдивости существовали давно — TruthfulQA застал ещё GPT-3. Но первый по-настоящему массовый публичный лидерборд галлюцинаций сделала компания Vectara в конце 2023 года. Методика простая: даём модели документ, просим пересказать, не добавляя ничего от себя, а модель-судья проверяет пересказ на отсебятину. В первой версии таблицы GPT-4 показал 3% галлюцинаций, GPT-3.5 — три с половиной, а замыкал список один из чат-ботов Google с 27%: больше четверти пересказов с отсебятиной при прямом запрете что-либо добавлять.

Дотошный читатель уже поднял бровь: судья-то тоже нейросеть, кто судит судью? Претензия справедливая, у градусника есть своя погрешность. Vectara хотя бы выложила модель-судью в открытый доступ, так что её саму можно проверять и калибровать. Но помнить об этой матрёшке полезно: почти вся индустрия измеряет галлюцинации моделей другими моделями.

К 2025 году лидеры таблицы дожали показатель до уровня ниже процента. Победа? Vectara перезапустила бенчмарк на более сложных и длинных документах — и у лидера снова 1,8%, у части свежих топ-моделей больше десяти, у худших за двадцать.

Проблема не решилась. Просто подстроились к конкретному бенчмарку: модели дотюнили до его потолка. Но при смене методики всё возвращалось. Запомните этот фокус, он в нашей истории будет повторяться.

Второй градусник — SimpleQA от OpenAI: 4326 коротких фактологических вопросов, специально отобранных так, чтобы GPT-4 на них спотыкался. Лучшие модели 2024 года отвечали верно примерно на 40%. И все без исключения переоценивали свою уверенность.

Полезная деталь: ответы в SimpleQA раскладывают по трём корзинам — верно, неверно, не взялся. Уже тогда бросалось в глаза, что модели Anthropic заметно чаще выбирали третью корзину, чем конкуренты.

А теперь главный сюжетный поворот 2025 года. В апреле OpenAI выпустила «рассуждающие» модели o3 и o4-mini — и в их же собственной документации обнаружилось, что o3 галлюцинирует на внутреннем тесте PersonQA, вопросах о публичных людях, вдвое чаще предшественницы: 33% против 16% у o1. У o4-mini — 48%, почти каждый второй ответ. Официальный комментарий сводился к тому, что модель просто делает больше утверждений — и верных, и выдуманных, — а дальше «нужны дополнительные исследования».

Вдумайтесь. Модель стала лучше рассуждать и хуже придерживаться фактов, причём производитель честно написал об этом в собственной документации. Умение строить длинные цепочки выводов и умение не выдумывать — разные способности, и вторая не подтягивается за первой автоматически. Кто ставил на то, что галлюцинации сами рассосутся с ростом интеллекта моделей, — тот пока проигрывает.

К августу 2025-го GPT-5 частично отыграла ситуацию: с включённым веб-поиском доля ответов с серьёзной фактической ошибкой упала до 9,6% против 12,9% у GPT-4o, у think-версии — до 4,5%. Хорошая динамика. Но та же документация честно признаёт: отключи поиск — и на сложной фактологии модель ошибается почти в половине попыток. Знание из весов и знание из документа — очень разные знания.

Скрытый текст

Предвижу вопрос: как соотносятся все эти проценты? У лидера Vectara 1,8%, у o3 на PersonQA 33%, где-то мелькает 86% — что из этого «настоящий» уровень галлюцинаций? Никакое. Это разные линейки: пересказ документа, вопросы о людях, штрафующий за наглость индекс. Сравнивать числа можно только внутри одного бенчмарка.

Когда в новостях пишут «модель X галлюцинирует в N% случаев» без указания, на чём мерили, — эта фраза не значит ничего. Буквально.

Свежий замер совсем иного масштаба вышел в марте 2026-го: 35 моделей, 172 миллиарда токенов. Задача — ответы по документам. На коротком контексте лучшие модели фабрикуют от 1 до 7% ответов, среднее по больнице — около 25%. А вот на контексте в 200 тысяч токенов даже лучшая модель выдумывает каждый десятый ответ. Мода «закинем в промпт всю базу знаний, контекст же большой» имеет цену.

Что реально помогает

Переходим к терапии. Сразу скажу: волшебной таблетки не будет, будет набор костылей разной степени полезности. Но костыли, если что, — недооценённый инструмент. На них ходят.

Первый и главный костыль — RAG, retrieval-augmented generation. Идею опубликовала команда Facebook AI в 2020 году: не спрашивай модель по памяти, а найди релевантные документы и дай их в контекст, пусть отвечает по тексту. Это работает. По моему опыту — это самый большой одиночный выигрыш из всех возможных: вопрос «знает ли модель» превращается в вопрос «нашёл ли поисковик», а поисковик хотя бы можно отлаживать.

Только не путайте «работает» и «решает». В 2024 году Стэнфорд протестировал коммерческие юридические ИИ-сервисы, построенные на RAG поверх лучших в мире правовых баз. Результат: один инструмент галлюцинировал в 17% запросов, второй — в 33%. Каждый третий ответ. С подключённой базой всех прецедентов страны. Вендоры тогда спорили с методикой подсчёта, продукты с тех пор два года дообучались — но главный вывод остался неизменным.

RAG не выключает генератор — он его подкармливает. Ретривер промахнулся — модель дорисует. Документы противоречат друг другу — модель смешает. Документ найден, но вопрос чуть в сторону — модель дотянет ответ до вопроса.

Откуда промахи, если поиск-то простой? А он не простой. Документы режутся на куски, куски превращаются в векторы, поиск идёт по смысловой близости. Близость темы не равна наличию ответа: на вопрос про исключение из правила ретривер честно принесёт само правило — они же почти об одном. Дальше вы знаете. Каждый стык этого конвейера — отдельное место для промаха, и отлаживать приходится всё.

Второй костыль — ссылки на источники. Тут держитесь за стул. Центр Tow при Колумбийском университете в марте 2025-го проверил восемь ИИ-поисковиков на 1600 запросах. Задача была узкая: по выдержке из статьи опознать первоисточник, издание и ссылку. Больше 60% ответов оказались неверными. У одного известного сервиса 154 ссылки из 200 проверенных вели в никуда.

Отдельная боль в том, что платные версии ошибались увереннее бесплатных. Ссылка в ответе — это всего лишь ссылка, которую ещё надо проверить. Я сам часто сталкиваюсь с пустышками при выдаче: модель говорит, что получила информацию вооот отсюда. Вооот там действительно есть страница, связанная с нужной темой. Но ничего того, что использовала модель в ответе, нет.

Третье направление интереснее: научить модель воздерживаться. Метод R-Tuning с говорящим подзаголовком «научи LLM говорить не знаю» получил награду на конференции NAACL 2024: модели явно показывают границу её знаний и дообучают отказываться за этой границей. Сюда же — реформа скоринга бенчмарков из первой части. Это лечит не симптом, а стимул, поэтому лично я считаю это направление самым перспективным. Минус очевиден: модель, которая часто отвечает «не знаю», хуже продаётся.

Четвёртое — детекция на лету. Оксфордский метод семантической энтропии вышел в Nature в 2024 году.

Скрытый текст

Идея такая. Задаём модели один и тот же вопрос несколько раз с ненулевой температурой и смотрим на разброс ответов — но не по словам, а по смыслу. Ответы «Париж», «столица Франции — Париж» и «конечно, Париж» — это один смысловой кластер. Если все десять генераций легли в один кластер, модель отвечает устойчиво: что бы там ни было в весах, оно сидит крепко.

Если десять генераций разлетелись на семь смыслов — перед нами та самая конфабуляция: модель не знает и каждый раз изобретает заново. Разброс смыслов измеряется энтропией, отсюда название.

Метод не требует лезть внутрь модели и работает с любой, даже через API. Плата — кратный расход: на каждый вопрос нужно пять-десять генераций вместо одной. Для чата это дорого, для медицины или юриспруденции — вполне разумный тариф.

Пятое — проверка вторым проходом. Сгенерировал — попроси другую модель (или ту же, но в роли злого рецензента) найти сомнительные утверждения. OpenAI обучала специализированного критика CriticGPT: ревью кода, сделанные людьми с его подсказками, обходили ревью без помощи в 60% случаев. Подход честный, только помните: критик — тоже языковая модель, и он тоже галлюцинирует. Мы в больнице и пытаемся найти двух пациентов, чтобы отклонения одного компенсировали отклонения другого и наоборот. Схема, в общем-то рабочая, только без гарантий.

Скрытый текст

В своей работе я часто делаю первую выборку фактов и ссылок Claude, а потом прошу проверить ChatGPT. Claude копает глубже и по умолчанию формулирует более человеческим языком. GPT тут слабее — по умолчанию генерит ответы жутким нейросетевым языком и часто не докапывается до важных фактов. Зато душнить проверкой: это прямо его. Когда нужно не сделать с нуля, а проверить за кем-то, GPT раскрывается на полную, ловить чужие косяки он обожает. И даёт список проблем в таких выражениях, что окно хочется приоткрыть.

Можно и просто спросить модель, насколько она уверена. Приём не бесполезный, но с поправочным коэффициентом: замеры на SimpleQA показали, что модели систематически завышают заявленную уверенность. «Уверен на 90%» в переводе с нейросетевого означает «ну, процентов шестьдесят». Однако сама шкала работает: там, где модель говорит «не уверен», проверять надо в первую очередь. Дешёвый сигнал приоритета, не более.

И шестое, со знаком «осторожно»: дообучение. Интуиция подсказывает — раз модель чего-то не знает, давайте зафайнтюним на нужных фактах. Это не самый рабочий подход. Исследование Technion и Google на EMNLP 2024 показало: при дообучении на парах вопрос-ответ новые факты модель усваивает медленно и неохотно, а по мере их усвоения растёт её склонность галлюцинировать — зависимость почти линейная.

Модель учится не новым знаниям, а новому жанру: уверенно отвечать в областях, где раньше молчала. Уточню границы: продолженное предобучение на большом корпусе — юридическом, медицинском, кодовом — знания как раз добавляет, это отдельная и рабочая история. Опасна именно попытка влить горсть новых фактов через SFT. Вот она множит галлюцинации.

Мифы и легенды промпт-инжиниринга

«Поставь temperature=0, и модель перестанёт выдумывать» — совет из каждого второго гайда образца 2024 года. Замер на 172 миллиардах токенов проверил это на документных вопросах-ответах: нулевая температура дала лучшую точность лишь в 60% конфигураций, а у большинства моделей чуть тёплое сэмплирование оказалось даже точнее.

Разброс между моделями — 72 процентных пункта, разброс между температурами — два-три. Иными словами, выбор модели влияет на порядок больше, чем крутилка. В том же замере t=0 ещё и чаще уводила модели в зацикливание. И до кучи: даже воспроизводимости нулевая температура не гарантирует — батчинг и параллельные вычисления вносят свой недетерминизм, два одинаковых запроса могут дать разные ответы.

Почему миф не работает, понятно из первой части. Температура выбирает из распределения, которое уже построено. Если модель уверенно не знает — самым вероятным токеном будет уверенная чушь, и жадный выбор возьмёт именно её. Ноль градусов не добавляет знаний, он добавляет решимости.

Второй миф — «просто напиши в промпте: выдавай только факты». Пишите, хуже не станет. Но привычку угадывать, которая у LLM годами, слой за слоем наращивали, одной строкой перебить сложно. Немного помогает связка «на каждое утверждение давай источник»: не потому, что модель начинает думать, а потому, что битую ссылку вам будет видно сразу, и это хотя бы проверяемая история.

Третий миф — «многошаговые рассуждения защищают от вранья». Цепочка рассуждений повышает качество на задачах с проверяемым ответом, тут спора нет: голосование нескольких цепочек когда-то добавило почти 18 пунктов на школьной математике. Но от выдумок длинные рассуждения сами по себе не защищают — у o3 и o4-mini они, как мы видели, и вовсе совпали с их ростом. А сами цепочки — отдельный источник обмана.

Anthropic в 2025-м измерила: модель, реально воспользовавшаяся подсказкой, упоминает её в своих «мыслях вслух» в четверти случаев. Красивая цепочка рассуждений — тоже текст, сгенерированный тем же генератором правдоподобия.

Четвёртый миф, самый живучий: «это детская болезнь, подождите годик». Я слышу его с 2023 года, каждый раз с новым дедлайном. Динамика правда есть: у свежих моделей с поиском доля серьёзных ошибок упала в разы, это видно и по бенчмаркам, и в ежедневной работе.

Но кривая выполаживается, а не падает в ноль. Причины мы разобрали в первой части, и они фундаментальнее сырых данных. Планировать процессы стоит из того, что галлюцинации — свойство инструмента, а не временный дефект прошивки.

Почему это не победить

Сведём причины в одно место, благо их ровно три и все уже знакомы.

Первая — статистическая. Факты-одиночки не выучиваются в принципе, а хвост редких фактов бесконечен. Эту часть лечит только внешний источник: поиск, база, документ.

Вторая — воспитательная. Пост-тренинг и бенчмарки годами награждали уверенное угадывание, и этот перекос вшит во все модели текущего поколения. Лечится сменой стимулов, процесс пошёл, но медленно.

Третья — экономическая, и о ней говорят реже всего. Модель, которая честно отвечает «не знаю», проигрывает на рынке. Она выглядит слабее в сравнительных обзорах, хуже смотрится в презентации для инвесторов и раздражает пользователя, который пришёл за ответом. Вендор, всерьёз закрутивший гайки воздержания, добровольно отдаёт очки конкурентам в таблицах, по которым его продают. Поэтому ждать, что производители сами решат проблему, наивно — стимулы смотрят в другую сторону. Спрос на честность придётся создавать нам, покупателям: тестами, контрактными метриками и голосованием кошельком.

Инструкция по ИИзации

Соберу в кучу то, чем пользуюсь сам. Ничего сверхъестественного, зато проверено на собственных ошибках.

Первое. Факты и цифры лучше перепроверить не из генеративных источников. Занимает время, да, но оно того стоит.

Второе. Никогда не проверять модель через неё же в том же чате. «Ты уверена?» — бесполезный вопрос: перед вами машина уверенности. Шварц спросил — ему подтвердили. Для проверки хорошо годится другая модель. И то помним, что погрешность остаётся.

Третье. Собственно, второй проход злым рецензентом — другой моделью: «найди в тексте утверждения, которые стоит проверить». Ловит удивительно много.

Только помним наш же тест китайских LLM и как две модели выдали почти идентичные шахматы. Если проверять одну модель другой надо следить, что бы они были не просто из разных лабораторий, а из разных школ (то есть использовали разные обучающие выборки) и, желательно, стран. В этом вам, кстати, отлично поможет агрегатор нейросетей BotHub, через который можно задать вопрос всем самым популярным (и не очень) моделям.

Четвёртое. Хранить первоисточник. Аудио до транскрипции, оригинал до перевода, сырые данные до саммари. В моём случае ещё оригиналы снимков до того, как они пройдут какие-то изменения.

Пятое. Длинный контекст — не свалка. Чем больше в промпте лишнего, тем выше шанс получить ответ по мотивам, а не по тексту, — вспомните цифры про 200 тысяч токенов. Отбирайте релевантное, режьте остальное. Длинные диалоги туда же — помните, что каждое новое сообщение на самом деле запихивает в модель весь ваш диалог. И с каждым вопросом этот диалог всё длиннее.

Нюанс. Всё перечисленное снижает частоту, а не устраняет явление. Если процесс построен так, что одна галлюцинация на тысячу ответов приводит к катастрофе — проблема в процессе, а не в модели. Проектируйте под ненулевую ошибку: с проверками, откатами и проверкой руками.

Заключение

История ходит по кругу. В 1999 году галлюцинацией называли способность алгоритма дорисовать несуществующие детали лица, и это было достижением. В 2026-м тот же самый механизм дорисовывает несуществующие судебные прецеденты, и это уже проблема.

Мне кажется, правильнее всего думать об этом так. Мы впервые в истории построили машину, которая ошибается: уверенно, связно, с деталями. Корсаковский пациент рассказывает про вчерашнюю дачу, левое полушарие объясняет лопату курятником, модель цитирует дело «Варгезе против China Southern Airlines».

Ваша собственная память устроена ближе к этим машинам, чем хотелось бы. Воспоминания не проигрываются, а реконструируются при каждом обращении, и самые яркие вы отчасти досочинили — уверенно, связно, с деталями. Элизабет Лофтус ещё в семидесятых показывала в экспериментах, как одна формулировка вопроса дорисовывает свидетелям несуществующие детали аварии.

Так что когда нейросеть в следующий раз выдаст вам красивый, гладкий, уверенный абзац — вспомните, что где-то внутри неё только что не сработал тормоз. И проверьте источники.

Приглашаю в комментарии с вашими любимыми галлюцинациями — коллекционирую давно и с удовольствием. Только чур с пруфами. В нашей теме это обязательно. Велкам)

Комментарии (0)