Почему ChatGPT иногда может ответить мгновенно, а иногда заставляет смотреть на надпись Thinking почти минуту?

На первый взгляд кажется, что модель стала умнее и теперь действительно размышляет перед ответом. А раз уж она размышляет, может модель обрела… самосознание? Конечно, это не так, модель не думает в привычном понимании, она строит несколько гипотез, находит и отбрасывает неудачные варианты и предоставляет пользователю ответ.

Этот процесс сегодня называют Reasoning.

Урощенная схема работы Reasoning моделей
Урощенная схема работы Reasoning моделей

Как психолог случайно спроектировал мыслящую LLM

Дэниел Канеман(автор книги «Думай медленно… решай быстро») в своей работе описывает два когнитивных механизма, которые определяют то, как люди принимают решения. Он назвал их системами.

Система 1 представляет собой быстрый и интуитивный инструмент, который обрабатывает информацию автоматически без необходимости намеренных усилий. Она отлично справляется с распознаванием паттернов и мгновенными реакциями, однако склонна к систематическим ошибкам, так как ей не хватает логической глубины и критического анализа.

Спросите у ребенка: «В корзине было 4 ?яблока и 3 ?огурца, 2 ?огурца забрали - сколько осталось фруктов?». Скорее всего он на автомате ответит неправильно, потому что не подумал о том, что огурцы не фрукты. Об этом он мог задуматься, если бы начал декомпозировать задачу и анализировать ее по частям. Таким образом, шаблонная задача на счет стала бы задачей на смекалку и внимательность. Но Система 1 не дремлет, а выдает шустрый(хоть и не правильный) ответ.

В противовес ей Система 2 является медленной и рассудительной. Этот механизм требует сознательной концентрации и задействуется для сложных вычислений или решения нетривиальных задач, когда автоматических реакций становится недостаточно.

Почему обычной LLM оказалось недостаточно

Первые большие языковые модели вроде GPT-3 и стандартные версии GPT-4 работали преимущественно в режиме первой системы. Они достойно справлялись с генерацией текста, переводом и другими задачами, где ответ можно построить, предсказывая следующий токен. Каждый новый токен генерировался в результате прохода через модель с учетом всего текущего контекста.

Их основная архитектурная задача заключалась в предсказании следующего токена на основе статистических закономерностей, накопленных при обучении.

Такие модели тратили фиксированный объем вычислительной мощности на каждый токен вне зависимости от сложности вопроса, что создавало фундаментальное ограничение. Они интуитивны и быстры, но часто терпели неудачу в задачах с многошаговой логикой, поскольку выдавали ответ сразу, не имея возможности «минутку подумать».

Однако таких моделей не хватало при решении задач, требующих многоэтапного анализа, логических выводов, математических вычислений или написания сложного кода. Модель тратила одинаковое количество вычислений на лёгкий вопрос и на олимпиадную задачу.

Как будто есть очевидное решение –  увеличить мощность моделей! Больше вычислительных ресурсов, больше данных и ещё больше параметров. До какого-то времени так и делали, но исследования показали, что увеличение числа параметров модели уже не обеспечивает прежнего прироста качества, а дальнейшее масштабирование требует огромных вычислительных ресурсов

Проанализировав более 400 моделей, от небольших в 20 миллионов параметров до более крупных в 7 миллиардов, был выявлен эффект sub-scaling – замедление прироста производительности по мере роста модели. Две основные причины явления – это высокая плотность данных и неоптимальное распределение вычислительных ресурсов между размером модели и объёмом данных модели.

На графиках отлично видно, что закон масштабирования хорошо работает при 5 миллиардах токенов, но по мере увеличения их числа кривая потерь (loss) искривляется сильнее, а точность аппроксимации значительно снижается.

Кривая потерь отклоняется от ожидаемого scaling law при росте объёма данных
Кривая потерь отклоняется от ожидаемого scaling law при росте объёма данных

На практике это означает, что эффект “чем больше, тем лучше” перестает работать. Даже у LLaMA 3 с продвинутым обучением прирост качества к LLaMA 2 замедляется по мере роста вычислительных затрат. Посмотрите на второй график.

Сравнение кривых качества LLaMA 2 vs LLaMA 3 — рост затрат перестаёт пропорционально покупать качество
Сравнение кривых качества LLaMA 2 vs LLaMA 3 — рост затрат перестаёт пропорционально покупать качество

Когда требования выросли в 2,8–4,4 раза, а отдача — нет, исследователи начали искать новые подходы к развитию языковых моделей. Одним из их подходов стало появление reasoning-моделей.

Развитие LLM пошло по пути имитации второй системы через внедрение цепочек рассуждений. Сначала это достигалось с помощью простого промптинга. В 2022 году исследователи Google представили метод Chain of Thought Prompting, повышающий качество решения математических и логических задач. Инструкция для модели звучала как :«Думай шаг за шагом» — и модель вынуждена была выдавать промежуточные шаги токенами, которые хранят промежуточные переменные и данные (прямо как человек на бумаге).

Данный подход позволил перенести часть нагрузки с этапа обучения на этап генерации ответа, открыв новую ось развития технологий под названием масштабирование вычислений во время инференса.

Позже появились более развитые подходы Self-Consistency и Tree of Thoughts, которые позволяли модели рассматривать несколько вариантов решения вместо одной линейной цепочки рассуждений.


Первая думающая LLM

Впервые же концепция LRM (Large Reasoning Model) была представлена OpenAI в сентябре 2024 года вместе с моделями o1-preview и o1-mini. Разработчики заявили, что новая модель способна рассуждать над более сложными задачами, на которых предыдущие модели сыпались как карточный домик. А способна ли на самом деле?

Согласно опубликованным тогда (ныне это уже из разряда ретро) бенчмаркам способна. В анонсе было показано, что подход reasoning-моделей значительно повышает качество выполнения сложных задач, связанных с логикой, математикой и программированием.

Сравнение моделей в разных сферах
Сравнение моделей в разных сферах

Раньше почти все вычисления приходились на этап обучения модели, но reasoning-модели умеют увеличивать объем вычислений уже во время генерации ответа. Вместо того чтобы постоянно увеличивать число параметров, модель может дольше думать над сложной задачей. Она генерирует множество траекторий рассуждений, а алгоритм вознаграждает те траектории, которые приводят к подтвержденным правильным ответам. Надпись Thinking лишь индикатор того, что системе выделен дополнительный вычислительный бюджет а Reasoning является внутренним техническом механизм, который стоит за этим индикатором. 


Long/Short Chain of Thought. Что это за звери?

Разберем два гланых подхода размышлений у моделей: Short Chain of Thought (Short CoT) и Long Chain of Thought (Long CoT).

Хотя они оба заставляют ИИ думать вслух, но по сути представляют собой принципиально разные когнитивные механизмы.

Short Chain of Thought  – зародился как метод промпт-инжиниринга для стандартных моделей, таких как GPT-3 или GPT-4. Это классический Chain-of-Thought prompting с 2022 года. Он характеризуется поверхностным процессом рассуждения и минимальным исследованием альтернативных путей. Вывод делается последовательно, часто с опорой на ограниченное число логических узлов.

Это превращало процесс генерации из быстрого интуитивного ответа (Система 1) в некое подобие осознанного процесса (Система 2)

Long Chain of Thought — это характеристика думающего поколения моделей, таких как OpenAI o1 и DeepSeek-R1, которые обучены думать перед тем, как говорить. В отличие от коротких цепочек, генерируемых по просьбе пользователя, Long CoT является внутренним и естественным состоянием модели. Процесс обучения таких моделей строится на масштабном обучении с подкреплением, где модель поощряется за нахождение правильного пути решения через тысячи проб и ошибок, а не за простое подражание.

Фундаментальная разница между ними заключается в способности к самокоррекции и поиску. В Short CoT модель обычно движется линейно, если она совершила ошибку на первом шаге, то, скорее всего, придет к неверному результату, не заметив подвоха. Long CoT умеет проверять свои же действия, возвращаться на шаг назад ( это называется backtracking) и менять стратегию прямо в процессе размышления.

Исследователи DeepSeek зафиксировали так называемый «aha moment». Модель в процессе размышления внезапно приходила к озарению, когда она в процессе генерации Long CoT внезапно понимает свою ошибку и начинает решать задачу заново, приходя к верному ответу.

На рисунке ниже выделены три основные характеристики Long CoT.

Из чего состоит Long CoT
Из чего состоит Long CoT

Long CoT поощряет исследование неочевидных, неопределённых или неизвестных логических узлов. Вместо того чтобы двигаться по прямой, от мысли к мысли, как в Short CoT, модель генерирует несколько параллельных путей рассуждения. Это особенно важно для задач с неполной информацией или множеством возможных решений.

Как обучают модели для рассуждений?

Процесс обучения LRM схож с процессом обучения LLM, но дьявол, как всегда, кроется в деталях.

Первый этап – контролируемая настройка с использованием наборов данных цепочек мыслей Supervised Fine-Tuning (SFT). На этом шаге модель обучают на относительно небольшом количестве высококачественных примеров, содержащих не только вопросы и ответы, но и подробные цепочки рассуждений. Роль SFT заключается в том, чтобы дать модели фундамент и обучить ее базовым навыкам логики, правильному форматированию и способности разбивать/декомпозировать сложные задачи на подпункты.

Однако на одном лишь SFT далеко не уедешь. Если просто заставлять модель копировать человеческие тексты, её возможности будут ограничены качеством этих примеров, и она не научится выходить за пределы обучающих паттернов

Следующий этап обучения — это Reinforcement Learning. Здесь модель начинает эволюционировать. Она генерирует тысячи различных путей решения одной и той же задачи и получает награду, если приходит к верному ответу. Исследователи обнаружили, что в процессе именно такого обучения у моделей самопроизвольно возникают удивительные способности(которым ее целенаправленно не обучали), такие как самокоррекция (Self-Correction) и возврат на шаг назад (Backtracking).

Как оценить ответ модели

Наиболее распространенными методами оценки являются два подхода:

Outcome Reward Model (ORM). Самым очевидным способом будет посмотреть на финальный ответ модели. Если он правильный – дать пряник, если нет – наказать. Недостатком модели является обратная связь только по конечному результату, т.е. если она пришла к правильному ответу случайно или допустила ошибки в промежуточных рассуждениях, но получила верный итог, то система не сможет определить, где и на каком этапе возникла проблема.

Чтобы преодолеть этот барьер, был придуман Process Reward Modeling (PRM). А здесь оценивается каждый отдельный шаг рассуждения. Модель получает поощрение или штраф за каждое своё действие по ходу решения задачи. Такой подход дает в разы лучшую обратную связь. Еще до самого ответа можно оценить был ли он шаг ошибочным, бесполезным или все-таки правильным. Внутренне PRM могут быть дискриминационными, когда модель просто вычисляет скалярный балл правильности шага, или генеративными, когда ИИ сначала генерирует текстовую критику, а затем на её основе выставляет оценку.

Однако PRM требует размечать не только итоговые ответы, но и каждый промежуточный шаг рассуждения, что увеличивает объем человеческой работы и вычислений.

А как модель понимает, что ей нужно остановиться?

Вопрос о том, когда нужно перестать думать и выдать окончательный вердикт, является одной из самых сложных задач для моделей рассуждений. LRM ведут внутренний диалог, который теоретически может длиться бесконечно.

Как мы уже говорили ранее, во время обучения модель поощряется не за сам процесс раздумий, а за нахождение правильного ответа в задачах. Постепенно ИИ понимает, что длинная цепочка токенов — это не самоцель, а инструмент. Когда модель находит решение, которое с высокой вероятностью принесет ей пряник, она сразу генерирует закрывающий тег, который заставляет сразу переходить к ответу.


Горе от ума

Конечно, reasoning-модели не идеальны, ведь дополнительные рассуждения действительно могут повысить качество ответа, однако вместе с этим появляются новые ограничения.

Рассуждения дорогая штука. Чем длиннее цепочка мыслей, тем больше токенов, времени и денег уходит на каждый запрос. Часто это бывает излишним, поэтому разумные системы используют режим рассуждений только для действительно сложных задач, а на всё остальное отвечают быстро и дёшево.

Исследования 2025 года показали, что зависимость между временем раздумий и точностью ответа часто имеет инвертированную U-образную форму. На определенном этапе удлинение цепочки рассуждений перестает приносить пользу, и точность начинает падать. Это явление часто называют «иллюзией мышления». Модель может тратить тысячи токенов на тривиальные задачи вроде «2+2», создавая избыточные, повторяющиеся и бессмысленные логические циклы

Зависимость между временем размышлений и точностью ответа
Зависимость между временем размышлений и точностью ответа

Вот сейчас мы и поговорим про проблему overthinking.

Overthinking проявляется в нескольких паттернах:

  • Рекурсивная избыточность: Модель многократно перефразирует условие задачи или повторяет одни и те же проверочные шаги, не продвигаясь к решению.

  • Галлюцинации в рассуждениях: Длинные цепочки мыслей увеличивают риск «убедительных ошибок» (в исследованиях - persuasive errors). Модель выстраивает детальную, логически связную, но базирующуюся на ложной предпосылке теорию, что делает ошибку труднее детектируемой для человека.

    Масштабирование времени вывода улучшает некоторые результаты, но увеличивает операционные издержки
    Масштабирование времени вывода улучшает некоторые результаты, но увеличивает операционные издержки
  • Нетерминация: ИИ попадает в цикл бесконечных сомнений, когда он уже нашел верный ответ, но продолжает проверять его до тех пор, пока сам себя не запутает и не выдаст неверный итог. Сейчас ведутся активные исследования на тему решения этой проблемы

Также присутствует проблема с действительно сложными задачами. Apple показали, что после определенного порога сложности качество решения задач резко падает практически до нуля. LRM демонстрируют преимущество только в задачах средней сложности.

  1. На низкой сложности стандартные модели (LLM) часто работают эффективнее, так как рассуждающие модели тратят лишние ресурсы на разжевывание очевидного.

  2. На высокой сложности наступает полный коллапс точности. Модели рассуждений демонстрируют странный предел масштабирования. Количество токенов растет вместе со сложностью лишь до определенной точки, после чего оно начинает снижаться, несмотря на наличие свободного лимита токенов. Это говорит о фундаментальной неспособности моделей применять последовательные алгоритмы на экстремальных масштабах

Сравнение точности моделей с режимом рассуждений (Claude 3.7 Sonnet с Extended Thinking и DeepSeek-R1) с их стандартными версиями (Claude 3.7 Sonnet и DeepSeek-V3) на всех наборах головоломок и при разной сложности задач.
Сравнение точности моделей с режимом рассуждений (Claude 3.7 Sonnet с Extended Thinking и DeepSeek-R1) с их стандартными версиями (Claude 3.7 Sonnet и DeepSeek-V3) на всех наборах головоломок и при разной сложности задач.

Какие выводы?

У технологии, конечно, хватает недостатков... Reasoning увеличивает стоимость вычислений, не всегда улучшает качество ответа и остается предметом активных исследований, но все же именно она задает направление развития современных ИИ.

Жаль, что не существует универсальной таблетки от всех бед. На ранних этапах Reasoning казался такой таблеткой, но увы. Результаты не такие сказочные.

Комментарии (2)


  1. Vorono4ka
    30.07.2026 14:42

    Одна из лучших статей на хабре, что я вообще читал за последнее время, мне очень, очень понравился слог. Понимал подсознательно, как это устроено, но теперь знаком и с терминами, получил подкрепление фундаменту. Спасибо большое!


  1. Ka463
    30.07.2026 14:42

    У технологии, конечно, хватает недостатков... Reasoning увеличивает стоимость вычислений, не всегда улучшает качество ответа и остается предметом активных исследований, но все же именно она задает направление развития современных ИИ.

    Вот честно сказать сомневаюсь в том что Reasoning задает направление развития, думаю что агентские системы это то куда все будет развиваться, тут все логично, например, вычисление MD5 не какой режим рассуждения не даст вам правильного ответа, агентская система без рассуждений даст, я провел несложные тесты, прогнал модель 12b на бенче ARC-AGI-1 выбрал 10 заданий из 400 где модель показана нулевой результат без режима рассуждений, включил рассуждения, и прогнал на этих же 10 задачах, результат остался нулевым, далее, использовал агента на этой же модели, результат 8/10 задач решено, вывод очевиден