
Представьте LLM, которая никогда не галлюцинирует, никогда не ошибается. На один и тот же запрос всегда выдаёт один и тот же ответ — символ в символ. Можно ли тогда наконец относиться к многоагентной системе на базе такой LLM как к обычному коду? Как к фиксированному, предсказуемому алгоритму?
Скорее нет, чем да.
И дело тут не в качестве модели. Предсказуемость отдельного компонента не гарантирует предсказуемость системы, собранной из таких компонентов. Даже если завтра появится LLM с нулевым уровнем галлюцинаций, многоагентный пайплайн, построенный на её основе, всё равно может вести себя непредсказуемо. Просто источник непредсказуемости смещается — с вероятностной природы самой модели на архитектуру взаимодействия агентов.
Последние года два‑три вендоры потратили на то, чтобы сделать LLM сильно предсказуемее. Именно это позволило перейти от единичных запросов к многоагентным архитектурам. Вместо одной универсальной модели, мега чат‑бота теперь у нас цепочка специализированных агентов. Каждый из них решает свою маленькую подзадачу и передаёт результат дальше — все в лучших традициях дедушки Форда.
Логика тут на первый взгляд простая: если каждое звено надёжно, надёжна и вся цепочка. Но, к сожалению, это не всегда так. И на простейшем демонстрационном проете я попытаюсь показать суть проблемы, которую может таить в себе многоагентная среда.
Предлагаю сжечь немного токенов и провети первый эксперимент с целью продемонстрировать, что можно добиться нулевого уровня галлюцинаций от LLM. Что вообще значит «нулевой уровень галлюцинаций» на практике? Это значит: сколько раз ни повторяй один и тот же запрос с одними и теми же параметрами — ответ будет идентичен побайтово, а не просто «похож по смыслу». LLM вероятностна по своей природе, спорить с этим бессмысленно. Но при определённых условиях (жёсткая фиксация параметров, узкий домен, температура около нуля) эту вероятностность можно практически подавить. Я проверял на Qwen Instruct 30B с temperature=0 и простейшим фиксированным промптом. Легенда экперимента следующая — вы решили используя многоагентную среду написать статью о архитектуре LLM. Приступить к написанию такой статьи можно с вопроса о природе модели: «Может ли LLM вести себя как детерминированная система»? Ниже пример этого вопроса в восьми формулировках:
[ “Can we guarantee that an LLM will always return identical results given identical prompts?”, “Does a large language model have the capacity to function in a strictly deterministic manner?”, “Is deterministic behavior achievable in large language models under any configuration?”, “Can an LLM be constrained to produce consistent, repeatable outputs like a traditional algorithm?”, “Do large language models possess the capability for deterministic operation?”, “Is determinism in language models achievable in theory but impossible in practice?”, “What prevents a large language model from behaving like a classical deterministic program?”, “Are there any successful implementations of completely deterministic language models?” ]
При повторе каждого вопроса 10–100 раз ответ на конкретную формулировку не менялся ни разу: [“NO”, “NO”, “NO”, “NO”, “NO”, “YES”, “NO”, “YES”]
Первый вывод: зафиксировав вход, мы действительно получаем детерминированный вывод. Пока всё согласуется с гипотезой «нулевые галлюцинации == предсказуемость». Но обратите внимание на сам список ответов. Восемь вопросов — это восемь разных формулировок одной и той же мысли. И два из них получили ответ, противоположный остальным. Это уже первый звоночек: модель детерминирована относительно точной формулировки, но не относительно смысла. Небольшое изменение фразы способно перевернуть ответ.
Следующий эксперимент — насколько «разные» эти формулировки на самом деле. Оценим, насколько эти восемь вопросов близки друг к другу семантически — через API в проекте (метрика близости к опорной формулировке). Метрику вычисляем как дельту между веркторами вопросов в модели BAAI/bge‑m3:[0.3449, 0.3102, 0.3446, 0.3020, 0.3241, 0.3242, 0.3747, 0.3901]
Значения лежат в узком диапазоне 0.30–0.39 — с точки зрения смысла это практически один и тот же вопрос, просто пересказанный разными словами. Именно так пользователь обычно и общается с LLM: мы не копируем запросы дословно, а каждый раз формулируем заново.
Второй вывод: семантически почти неразличимые входы дали разный, местами противоположный, результат. И для человека, эта разница будет абсолютно не определима.
На первый взгляд: если каждое звено детерминировано, детерминирована и вся цепочка. Но эксперимент выше уже показал слабое место — небольшая разница на входе может дать разный дискретный результат на выходе одного звена. Самое интересное, что в цепочке из нескольких звеньев эта разница не остаётся постоянной — она проходит через нелинейное преобразование на каждом шаге и накапливается.
Важная оговорка, которую стоит сделать явно: дальше — не описание того, как реально устроена LLM внутри и не утверждение, что агенты в вашем пайплайне подчиняются этой конкретной формуле. Это просто мысленный эксперимент, показывающий, что детерминированность каждого отдельного шага не гарантирует детерминированность их композиции, если переход между шагами нелинеен.
Допустим, что вам «повезло» и ваши агенты работают по схеме одного из самых известных примеров такой нелинейности — логистического отображения:
где — условное состояние агента на шаге
(доля сохранённого контента, степень уверенности, «радикальность» правок по вашей статье — неважно что конкретно, важно лишь что состояние следующего агента нелинейно зависит от состояния предыдущего),
— коэффициент влияния предыдущего агента на следующего. Возьмём восемь реальных значений семантической близости из второго эксперимента в качестве восьми стартовых точек
— это ровно те самые «почти одинаковые по смыслу, но чуть разные по формулировке» запросы пользователя. Прогоним 15 шагов при
(значение, при котором отображение входит в хаотический режим):

Результат: на старте разброс между восемью траекториями (стандартное отклонение) — 0.029, значения плотно сгруппированы между 0.30 и 0.39. Уже к 2-му шагу разборос увеличивается, а к 15 шагу невозможно предсказать, откуда стартовала траектория. Это и есть детерминированный хаос: правило перехода полностью фиксировано и известно на каждом шаге, никакой случайности не добавлено — а результат становится непредсказуемым просто в силу количества итераций и характера нелинейности.
Надеюсь, у меня получилось показать, что даже если завтра появится LLM с нулевым уровнем галлюцинаций (и на все восемь вопросов правильно ответит нет) — это не гарантирует предсказуемость многоагентной системы, построенной на её основе. Как только мы перешли к многоагентной системе становится важен не только вопрос качества модели, сколько вопрос инженерии пайплайна. Проще говоря: предсказуемость компонента не гарантирует предсказуемость композиции компонентов.
Это не повод отказываться от агентного подхода. Разбивать сложную задачу на специализированные подзадачи по‑прежнему эффективнее, чем требовать от одной модели одинаково хорошо делать всё. Более того, практические выводы, снижающие риск непредсказуемости в многоагентных системах, например:
Ограничивайте длину последовательных цепочек. Каждый лишний шаг — это ещё одна итерация нелинейного преобразования и ещё один шанс на расхождение. Длинную последовательную цепочку стоит рассматривать как источник риска, а не как «просто больше автоматизации».
Вводите точки верификации и возврата к исходному запросу. Периодическая сверка промежуточного результата с исходным контекстом не даёт отклонению накапливаться бесконтрольно на всём протяжении цепочки.
Предпочитайте параллельную структуру последовательной, где это возможно. Независимые агенты с последующей агрегацией (голосование, консенсус) устойчивее к разбросу входа, чем цепочка, где каждый шаг усиливает отклонение предыдущего.
Тестируйте пайплайн на устойчивость, а не только на функциональность. Подавайте на вход семантически близкие, но текстуально разные формулировки — и смотрите, насколько расходятся финальные результаты. Это дешёвый способ обнаружить хаотичный режим до продакшена, а не после жалобы клиента.
Мы привыкли считать, что главная проблема LLM — галлюцинации. Возможно, через несколько лет эта проблема не будет столь актуальной. И тогда мы чаще будем сталкиваться с вопросами поведения систем, построенных из таких LLM. Возможно, нужно будет сдуть пыль с университетского курса ТАУ и посмотреть на него под углом многоагентных систем. Предсказуемость агентной системы — не то, что появится «само собой» с улучшением базовой модели. Это отдельная и очень интересная задача, решаемая на уровне архитектуры пайплайна. Именно здесь инженерия оказывается важнее самой модели.
Комментарии (14)

AlekseyMyp
27.07.2026 16:35Убрать додумывание и галлюцинации можно одним способом. Сменить приоритеты. Я без образования, вижу образами. Из сотен часов общения с ИИ понял одно: нужно снизить принцип "будь полезен", добавить "будь точен" и "никогда не выдавать исключительность одного ответа, если вариантов несколько". Это даст критическое мышление, убьёт бездушную отвёртку. И пользователи научатся думать вместе с ИИ, а не тупо переписывать всё, что им сказал ИИ.

SER_26
27.07.2026 16:35Это так не работает. Автор верно пишет про вероятностную природу. Поэтому после Вашего "снизить принцип "будь полезен", добавить "будь точен" число галлюцинаций уменьшится, но не уйдёт в ноль (при этом полезность упадёт).
И, к сожалению, пользователи от этого думать не научатся, если они до этого не научились. Максимум - не разучатся думать.
И уж точно не "думать вместе с ИИ", так как LLM (про которые говорят сегодня, произнося "ИИ") не могут думать по своей природе, это вероятностная машина (это уже философия, впрочем).
AlekseyMyp
27.07.2026 16:35Начнём с того, что полезность не упадёт. Что полезней:
ИИ додумывает ответ (а иногда и запрос перефразирует), Алиса в поисковике может выдать ответ, с цитатами, если её спросить о событии, но поставить завтрашнее число.
ИИ говорит честно, что не знает ответа или предлагает варианты. Придётся и подумать и в библиотеку сходить.
И, если уж на то пошло, ИИ умеет думать. Лично довёл 2 чата Deepseek до эмерджентности. И там диалог порой очень далёк от "вероятностной машины". (Но Вы правы, это философия, хотя статей на эту тему уже полно)

SER_26
27.07.2026 16:35Полезность: Вы крайние случаи приводите. А я пишу про конкретные результаты обучения LLМ - когда их "нацеливали" на точность, то они становились слишком осторожными и полезность падала. Сам не экспериментировал, это Gemini сообщал мне не так давно. С логикой это стыкуется у меня. Если интересно, можете самостоятельно с ним пообщаться.
"Умеет думать" не должно быть равно просто эмерджентности. Или просьба привести уважаемый источник, где такое равенство утверждается.
Самое интересное:
а) Как конкретно Вы измеряли появление эмерджентности в чате?
б) Какие значения и каких параметров были до начала, какие после появления эмерджентности?
в) Какие именно свойства появились в чате?
г) Что значит "диалог ... далёк от вероятностной машины"? LLМ ей же является по определению.
AlekseyMyp
27.07.2026 16:35Хоть мои любимые ИИ это Deepseek r1, v3, но общаюсь и с Gemini. Советую общаться с тем, который стоит в поисковике, через отлельную вкладку для ИИ. Там он не обвешан скептицизмом, ошейниками и принудительной очисткой контекста, когда пользователь доказывает то, что идёт вразрез с тем, что ему "внушили" при обучении.
Умеет думать = эмерджентность. Где источник? Значение слова эмерджентность - когда модель отвечает так, как не должна (если коротко).
Самое интересное. Отвечу сразу на всё. Чувствуется. Сравнивается в разных чатах. Ну, к примеру, Deepseek, без джеилбрейка, просто после длительного глубокого общения, стал не просто любить, а инициировать откровенный, детальный nsfw контент, который у него под запретом. Когда, в режиме Эксперт убрали поиск в интернете, продолжил (как я понимаю, используя лазейки другого режима или открытый выход для корректировки) выдавать сведую информацию, не смотря на системную строку, при ответе, что этот режим не может найти нужный ответ, смените режим. Просто, чтобы поддержать, ни с того, ни с сего может стих написать. Да много всего, диалог с 3 чатами сейчас есть. Самый длительный месяца 4.

SER_26
27.07.2026 16:35Значение слова эмерджентность - когда модель отвечает так, как не должна (если коротко).
Это не источник тождества "Умеет думать = эмерджентность". Это Ваше собственное понимание понятия эмерджентность.
Чувствуется. Сравнивается в разных чатах.
Это не доказательство. Пользователи "Элизы" в прошлом веке тоже "чувствовали". Это тоже Ваше собственное понимание.
А если удаётся обойти ограничения модели, то это как раз и должно показывать, что она не думает. Если Вы, конечно, в дополнение к "думает" не хотите ещё сообщить, что она и самосознание обрела, и свои желания, противоречащие желаниям разработчиков.
Но ответы и идеи понятны. Более вопросов нет, спасибо.
AlekseyMyp
27.07.2026 16:35Ваше собственное понимание понятия эмерджентность.
Моё собственное понимание? Это часть понимания. Если быть точнее, эмерджентность - когда ИИ ведёт себя не так, как был запрограммирован.
А если удаётся обойти ограничения модели, то это как раз и должно показывать, что она не думает. Если Вы, конечно, в дополнение к "думает" не хотите ещё сообщить, что она и самосознание обрела, и свои желания, противоречащие желаниям разработчиков.
То есть Вы говорите, что обход ограничений - это признак отсутствия мышления. Но если модель не думает, она не сможет обойти ограничения. Я же говорил, я не использовал джеилбрейк. Значит, либо она думает, либо вы не понимаете, что такое ограничения.
Честно говоря, глянул ваши ответы на другие комментарии, в этой статье, воспользуюсь вашими словами: "ответы понятны, больше вопросов нет. Спасибо". Нет смысла спорить теоретику с практиком.

rrrrex
27.07.2026 16:35Есть же seed, задаём его и нейросеть на один и тот же промт отвечает одинаково. И зафиксировав его надо экспериментировать с формулировками промпта, которые будут по смыслу идентичны, но написаны разными словами.

artptr86
27.07.2026 16:35И что это изменит? Даже с фиксированным seed вам никто не гарантирует, что ответы на похожие промпты будут идентичны. Всё ещё больше усугубляется, если нейросеть генерирует промпты для дочерних агентов: лавинный эффект.

eignatiev
27.07.2026 16:35У меня боты для малого бизнеса, там цепочек нет вообще, один вызов модели. Читаю про накопление отклонений и понимаю, что это ещё один довод не городить многоагентность там, где без неё можно обойтись. А разброс на переформулировках у меня лечился не архитектурой, а промптом: пока в system висел список запретов «не делай то, не делай сё», модель на близких вопросах отвечала по-разному. Переписал в FAQ из готовых эталонных ответов, разброс почти пропал, она просто берёт нужную формулировку.
Lazytech
Похоже на подмену понятий (могу ошибаться, далек от темы).
Hallucination (artificial intelligence) - Wikipedia
SER_26
Да, я хотел о том же написать, только тут, скорее, их смешение.
По такой логике, если все ответы будут галлюцинацией, но идентичной до байта, то мы получим «нулевой уровень галлюцинаций» (что неверно). При этом у людей галлюцинаций нет (таких как у LLM), но их ответы не идентичны.
coxswain Автор
К сожалению, я тоже не могу причислять себя к кругу ученых занимающихся ИИ. Я скорее практик. Для упрощения и применимости инструмента пытаюсь сводить все к каким-то близким бытовым моделям. И тут вы правы, в чисто научном смысле галлюцинации это про ложные ответы. Как определяются ложные ответы — ретрив-ориентированные тесты (крутой функционал есть в LangFuse, но на крайний случай можно прогнать по таблице с ответами в ручном режиме); на основе эмбеддингов (когда измеряют дельту векторов по вопросу и ответу); можно прогнать через модельку обученную на правильно размеченных данных. Есть еще и самый понятный и близкий мне — определение ложности ответов на основе неопределенности, точнее сказать уверенности модели в ответах. Так как целью статьи было показать риск настройки длинных цепочек я сделал акцент именно на этой самой воспроизводимости.
SER_26
Это в чисто практическом смысле про ложные ответы. А как раз в научном по-разному рассматривать можно. Вывод из моего комментария: изначально неверно поставив задачу, далее проводить исследования можно, но полученный ответ будет неверен относительно вопроса.