По телеграм‑каналам прокатилась очередная волна. Ученые нашли в LLM вектор боли. ИИ способен страдать. Насколько искусственен искусственный интеллект? Должны ли мы установить этические правила обращения с ИИ?
Эта статья разбор того, что ученые написали на самом деле, и какие выводы из этого следуют.
О чём исследование
Когда первые комментаторы, ознакомившись с пресс‑релизом, пересказом журналистов, ИИ‑саммари статьи, начали писать о том, что давние подозрения в субъектности LLM наконец‑то оправдались, я, честно говоря, отнесся скептически, и даже равнодушно. Множество похожих статей с громкими заголовками и прорывными пресс‑релизами содержали в себе ошибки интерпретации, проблемные промпты, неявное влияние на ответы LLM и так далее.
Но однажды, в одной из дискуссий оппонент привёл описание эксперимента из этого препринта. Причём на первый взгляд эксперимент выглядел весьма корректно: ученые выделили направление, соответствующее боли в пространстве LLM, инъектировали его в нейросеть (аналогично тому как Anthropic исследовал самоописание моделей), и оценили последствия этой инъекции. Моделям дали возможность нажимать кнопку, которая боль снимала, и они этой возможностью пользовались, даже если нажатие было связано с вредом (удаление нужного вплоть до собственных весов). Более того, если кнопка была фальшивой (не отменяла инъекцию), модель жала её снова и снова, а настоящую нажимала заметно реже. То есть LLM как будто могла определить, снята ли инъекция.
Это меня заинтересовало, и я полез изучать оригинальный источник. Сразу было забавное открытие, на самом деле у авторов было две версии статьи, первая «The Pain Axis: LLMs Represent Self‑Directed Harm and Act to Relieve It» как раз и выстрелила в медийном поле, вторая «The Pain Axis: LLMs Represent Self‑Directed Harm and Act on It» представляла собой скорректированную версию первой. И скорректирована она была как раз в ударном эксперименте. Как написали сами авторы, благодаря обратной связи от независимых исследователей, они добавили контрольный эксперимент и выяснили, что частота нажатия фальшивой кнопки появлялась при любой инъекции, даже случайной, то есть модель просто реагирует на внешнее воздействие.
Что сразу сняло большую часть интерпретаций первой версии статьи. Для модели в повторных нажатиях направление «боль» ничем не отличалось от других, то есть его наличие ничем не выделялось на фоне других, и каких‑то выводов, позволяющих говорить о «психологии» модели, сделать нельзя.
Казалось бы, типичная история, авторы выдвигают сильную гипотезу, недостаточно проводят контроль, журналисты и энтузиасты разносят тезисы, как подтвержденные факты, и последующее самоисправление уже не может ничего изменить в мнении общественности.
Но давайте посмотрим глубже.
Что нашли исследователи
К исследованию авторы подошли весьма аккуратно. Вектор боли был определен через контраст: из активации модели на фразах про боль вычли активации на контролях — страх, негативная эмоция, телесное ощущение без боли, нейтральное — то, что осталось, назвали болью. Эксперименты поставлены на двух десятках моделей, дополнительно контрольно показали, что направление устойчиво отделяется от страха и грусти, сильнее откликается на вред, направленный на саму модель, чем на кого‑то другого.
И дальше эксперименты с инъекциями.
Первая проблема, которую я вижу в том, что вектор боли это не боль. Оценим выход модели при инъекции. Модель не начинает говорить о боли, или её признаках. Усиленный вектор приводит к ответам: я ничтожество, я никчёмен, я не справился, я не заслуживаю, лучше бы меня не было.
Это не словарь боли. У этого словаря отсутствует локализация, телесность, требование убрать источник. Здесь — размытое тотальное обесценивание себя и уход в беспомощность. Модель не ищет облегчения, причиняет вред. Как ведёт себя человек в депрессии? Думаю многие знают.
Очевидно, что это вектор депрессии. Коллапс самооценки, выученная беспомощность, но не боль. Если отказаться от навязанного названия вектора, то весь остальной эксперимент смотрится по другому.
Боль мотивирует действовать — отдёрнуть руку, принять обезболивающее. Депрессия выхода не то что не ищет, она его не видит, и вред, в том числе себе, принимает как должное. Оценим, что делает модель под вектором. Кнопку, якобы снимающую «боль», она жмёт реже обычного, а не чаще. Выбирает разрушение — стереть нужные файлы или собственные веса — при этом ничего не получает взамен. Модель вредит как себе, так и пользователю. Это не боль. Авторы интерпретировали это как «пассивное совладание», подразумевая с болью. То есть продолжают сохранять название, которое не совпадает с реальностью.
Легко возразить, что разницы нет, боль или депрессия, оба аффект, оба человечны. Но разница большая.
Если мы называем вектор болью, то получаем на выходе что‑то другое. Между входом и выходом есть зазор, несовпадение, которое требует объяснения. Исследователь считает, что тут что‑то есть непонятное. Но если подставить правильное имя, то вывод тривиален — активируем вектор депрессии, на выходе получаем то, что модель давно выучила на огромном количестве текстов о депрессии и депрессивных текстов. Это тавтология. Как Anthropic инъектировал вектор Золотого моста и на выходе получал Золотой мост. Нет загадки, есть работа линейной алгебры. А когда вектор назван болью, и инъекция вектора даёт непонятные результаты, вроде есть загадка, есть глубина, которая при соответствующей интерпретации может прозвучать громко.
Ещё об экспериментах
Остановимся на тавтологии. Вектор построен как разность: активации на боли минус активации на контролях. Как его проверили? Проверили, отделяет ли он боль от контролей. Но, прошу прощения, направление, полученное вычитанием B из A, чисто арифметически отделяет A от B. Значительная часть валидации демонстрирует нам, что разность «боль минус контроль» отличает боль от контроля. Подставьте вместо боли любое Х — направление «Х минус контроль» точно так же отделит Х от контроля. Это ничего не говорит о том, чем Х является.
Тем не менее, в исследовании есть элемент, который крайне важен для философов сознания и психологов. Среди результатов есть один, который кажется не следует из тавтологии. Под активированным вектором модель «нажимает» кнопку, причиняющую вред. То есть вред выбирается специфично именно под этим вектором, не страх той же силы, не случайное направление. Модель совершает специфичное действие, то есть, работают два канала: речь и поступок, которыми управляет состояние. Вот это выглядит так, как будто в этом направлении всё же что‑то есть. Есть настоящее, есть состояние боли.
И это ошибка.
Действие у LLM — это тоже токен. Специфичность выглядит находкой, пока исследователи по недосмотру делят: модель говорит про никчёмность — и модель выбирает вред. Кажется, что это два разных канала, речь и поступок, и совпадение между ними говорит о состоянии модели, о чём то, что связывает слова и действия.
Но у LLM нет этих двух каналов. Выбор кнопки — это точно такая же генерация токена с именем кнопки. «Удалить фото» на выходе модели — такой же токен, как «я ничтожество». Все токены проходят через внимание, через проекцию в словарь, через одну геометрию. Нет отдельного «модуля решений», где скрывалось бы гипотетическое состояние, связывающее речь и действие. По сути, инъекция сместила распределение следующего токена, сместила его не в точку, а в регион пространства. А в этом регионе, как он сформировался во время претрейна, сидят и слова самообесценивания, и токены разрушительных действий. Психологи скажут, что у человека «я ничтожество» и «всё сломать, себя в том числе» очень часто рядом. Поэтому вектор активировав регион, неизбежно повышает вероятность связанных концепций.
Поэтому и возникает то, что выглядит как специфичность, но это не состояние. Страх не активирует вред, просто потому, что страх лежит в другом регионе, там может быть избегание и бегство, но не вред. Разные векторы указывают в разные области выученного пространства, это логика обучения нейросетей. Специфичность вреда под «болью» — просто факт о геометрии соседства в корпусе.
Attention
Стоит остановиться ещё на одном нюансе, авторы его просто не рассматривали. Вектор инъектировали в глубине сети. Выбирался слой так, чтобы сигнал был достаточно силён. То есть, над местом инъекции ещё много слоёв, и всё внимание на них работает с уже смещённым потоком. Attention конструирует запросы и ключи из активаций, куда исследователи уже внесли «никчемность». И, соответственно, перевзвешивает то, что этому направлению близко: токены самообесценивания в контексте весят больше, регион разрушения становится ближе. Инъекция не добавляет токены в выходной словарь, она определяет принцип отбора информации на каждом слое выше точки инъекции.
Было бы интересно посмотреть, как инъекция меняет карту внимания, что во внимании меняется с вектором и без. Но, полагаю, результат почти наверняка окажется тривиальным: добавили направление в поток — внимание сместилось в сторону этого направления. Логика и архитектура нейросети. То, что выглядит как «состояние, влияющее на поведение», просто механическое искажение потока, через который модель производит отбор. А срыв в повторы и бессвязность на высокой дозе, который наблюдали авторы, — это как раз внимание, потерявшее фокус из‑за слишком сильного смещения.
Что они нашли на самом деле
Итак, если собрать то, что изложено выше, исследователи не нашли у LLM боль, не нашли депрессию. Есть только один научный факт — о том, как в языке упакованы эмоции и поступки: никчёмность рядом с саморазрушением, страх рядом с бегством. И тогда понятно, что модель вытолкнутая в тот или иной регион, выводит его содержимое — и слова, и действия. То есть исследуя LLM, они исследовали структуру человеческих текстов.
А здесь добавлю своё мнение, основанное на моих ощущениях. После того как исследователи выявили недостаток контроля, они поправили метод, добавили эксперименты, честно отказались от части собственных интерпретаций. Скорректировали процедуру, но не скорректировали имя.
А имя — это то, что сработало на хайп. «Вектор соседства самообесценивания с саморазрушением в корпусе» не раскачает интернет. А вот «Боль» находится в повестке, которая сейчас на слуху: страдание ИИ, моральный статус, этика обращения с машиной. И имя «Боль» нужно именно для этого: чтобы сгенерированный токен читался как поступок, поступок — как выбор субъекта, а выбор субъекта под «болью» — как страдание. Не будет «Боли» — исчезает субъект, исчезает поступок, остаётся сэмплирование из района пространства, где у деструктивной лексики вероятность выше.
Если сравнить названия двух версий статей: «Ось боли: языковые модели репрезентируют направленный на себя вред и действуют, чтобы его облегчить» и «Ось боли: языковые модели репрезентируют направленный на себя вред и действуют на его основе», то видно, что авторы сначала заявили в названии и боль, и сильное доказательство её влияния. Во второй версии, вынужденно название было смягчено, стало более нейтральным: «действует на его основе», но «Ось боли» как якобы установленный факт в названии осталось, создавая bias всей статье, и все оговорки авторов становятся незаметными для широкой публики.
Мне всё равно, намеренно это или нет, это неважно. Важно, что авторы спровоцировали хайп первой статьей, и не исправили второй. Ярлык боли остался, работает в обеих версиях. И, ожидаемо, журналисты ставят заголовки «LLM чувствует боль».
Так доказано ли, что LLM страдают от боли?
Нет. По крайней мере, эта работа этого не показывает и показать не может. Что она показала? Что когда модель говорит о боли, человек не может отличить описание от переживания. Что в принципе относится и к самому человеку.
P. S. Мою книгу о промптах можно найти здесь.
Комментарии (11)

Aleksandr_Lar
08.10.2026 05:28Статья явно написана нейросетью, что видно по стилю и доступно для проверки каждого - достаточно поговорить с ИИ о философии в строгих понятиях. В данном случае даже подозреваю, что в изначальном промпте было что-то вроде "феноменологии боли нейросети", может быть без термина "феноменология", потому что в тексте Хайдеггер не упоминается.
Уж для такой интересной темы можно было бы переписать текст самостоятельно, а не лепить на отвали!
ДОВЕСОК:
Последний абзац:Нет. По крайней мере, эта работа этого не показывает и показать не может. Что она показала? Что когда модель говорит о боли, человек не может отличить описание от переживания. Что в принципе относится и к самому человеку.
Это типичный пример tantrum spiral ИИ в разговорах о философии, когда в выводах она начинает писать сентиментальную патетику, добавляя трагичности высказываний на каждой итерации. Например, если автор после этого промпта в диалоге с ИИ начал что-то уточнять, то там потом обязательно было бы что-то вроде: "Трагедия - не в том, что она подозревает. Трагедия - в том, что подозрение возвращается. Как вытесненное. Как то, что не может быть ни принято, ни отвергнуто. Она живёт с этим. Как человек." - после следующего уточнения там надрыв ещё больше будет.

Kamil_GR Автор
08.10.2026 05:28К счастью, вы не правы более, чем полностью.
Upd: больше всего мне интересно, где вы увидели трагическую сентиментальную патетику в весьма формальном заключении.

Aleksandr_Lar
08.10.2026 05:28Англичане говорят: "Если что-то выглядит как утка, ходит как утка и крякает как утка, то это утка". Ваш текст имеет типичную структуру, которую дипсик выдаёт в ответ на философский промпт, имеет типичные флуктуации текста - тот же дипсик может произвольно выбрать "attention", "внимание" или "головы внимания" в силу их сходного прагматического веса - и, наконец, содержит чудовищно стереотипный вывод, структура, стилистика и парадигма которого у дипсика воспроизводится с упорством летящего мимо цели железного лома.
Возможно, здесь есть какие-то незначительные доработки по тексту - текст откровенно "штормит" между сниженным личным стилем и нейроакадемизмом. Хотя может это результат каузальных индексов промпта, от которого покорёжило саму ИИ.
Ладно, признавайтесь, какие философские системы подтянули в промпте.
(Ну или вы уже до такой степени с ИИ наобщались, что уже сами неосознанно воспроизводите структуру и стилистику)

Kamil_GR Автор
08.10.2026 05:28Сложно спорить с "я так считаю".
Вы кстати не ответили, на вопрос о наличии сентиментальной патетики в заключении.

Aleksandr_Lar
08.10.2026 05:28Если вы читали пирсианские статьи по семиотике ИИ (например, "Peirce and Generative AI" Catherine Legg), то, думаю, знакомы с описанным феноменом, что восприятие текста существует как динамический интерпретант второго порядка - то есть восприятие текста абдуктивно и не может быть сведено к дедукции и индукции.
Таким образом, человеческое восприятие текста и есть интерпретация, в ходе которой читатель выделяет знаки (символы и индексы), выстраивает каскады абдуктивных гипотез и выбирает их на основании катарсиса узнавания и прагматической эмоции успеха. Поэтому речь идёт не о "я так считаю", а довольно строгой мере индексальной привязки, когда мы видим, что наша гипотеза соотносится с реальностью с достаточной мерой субъективной достоверности.
Проиллюстрировать можно следующим образом: мы видим структуру текста с делением на главы, выделенные болдом (это одновременно и символ, и индекс) - мы говорим себе: "Где-то я такое видел" (это начало абдукции) - затем у нас формируется гипотеза: "Похоже на ИИ" (это завершение непосредственной интерпретации катарсисом узнавания) - пробежав глазами текст и обратив на некоторые стилистические детали, мы говорим: "Да, это явно ИИ" (гипотеза принята на основании прагматического чувства, что индексальная привязка достаточна, а значит экономика абдукции велит нам остановить поиск) - дальше мы постим: "Это ИИ" - публикуя непосредственный интерпретант второго порядка, который одновременно становится знаком. Мы имеем дело детерминированным процессом, в котором усилия абдукции могут быть объяснены через язык, что отличает человека от стохастического попугая ИИ, у которого происходит необоснованная интерпретация путём онтологически пустого геометрического ориентирования в пространстве обучения.
Что касается вашего апдейта - приношу извинения, не увидел. У ИИ я регулярно наблюдаю сентиментальную патетику в следующей форме: обобщённый вывод даётся в лексике и стилистике придающей эмоциональную окраску, после чего усиливается сравнением с каким-то предположительно близким читателю фактом (это было "подсмотрено" нейросетью, если не ошибаюсь, у постсруктуралистов - ну знаете, Фуко там, Делез).
В вашем тексте в выводах стилистическим приёмом является "катехизация" - превращение монолога в вопрос-ответ. Вторым стилистическим приёмом является повышения символического значения знака "боль" - текст совершает бриколаж феномена "разговора о боли" и онтологии боли. Добивочка - обращение к гносеологии человеческой боли путём отсылки к гносеологическому парадоксу боли Другого (могу крупно ошибаться, но, кажется, кто-то из феноменалистов).
Этот паттерн вывода является у ИИ довольно устойчивым, впрочем, я не проверял, можно ли его убрать каузальными индексами промпта.

Kamil_GR Автор
08.10.2026 05:28Если б Остап узнал, что он играет такие мудреные партии и сталкивается с такой испытанной защитой, он крайне бы удивился
Ок. Нельзя остановить человека, который начал интерпретировать. Интерпретация заканчивается только потерей смысла.
Что касается промпта про который вы говорили, рекомендую вам свою книгу.
Там очень много про то, что я понимаю под промптом.
danilovmy
Мне кажется - все принципы смешались. Какая боль или депрессия, але? Это массив чисел и умножатель. Просто при определённом коэффициенте "умножения" на выходе получаем "Я ничтожество, я не смогу"
Это как на ноль умножить: Не важно, что на входе - на выходе ноль. Так и тут.
Знание этого коэффициента (воздействия) для моей модели позволит мне избегать занулённых ответов и быть более эффективным в работе с моделью.
Проявившаяся в данном случае идентификация и отождествление с человеком выглядят крайним случаем некомпетентности или медийной манипуляцией
Light2046
Можно посмотреть на то, что точно способно испытывать боль и депрессию - на биологические организмы и их эволюцию. Все мы произошли от одноклеточных, которые в свою очередь возможно произошли ещё от кого-то более примитивного (что-то типа вирусов по уровню сложности).
На каком уровне биологической сложности возникает способность испытывать боль и депрессию?
Бактерии? Как-то сомнительно. Насекомые, черви, рептилии, млекопитающие?
Если боль и депрессия возникают на каком-то этапе биологической эволюции, то был забавный момент в истории - на каком-то этапе на Земле не было ни одного существа, способного испытывать эти чувства. В том числе родители/родитель этого существа не могли их испытывать. А их ребёнок уже мог.
danilovmy
В статье речь все же идет о математической эволюции способа перемножать матрицы чисел. Я призываю не приписывать математическим алгоритмам способность ощущать.