Коротко

Новость о том, что Anthropic объявила о внесении во все тексты водяного знака, слышали и обсудили уже все. С 2 августа во все тексты, которые пишет Claude, встраивается невидимая метка, и она не на уровне невидимых символов, что легко удаляются через сторонний редактор, или метаданных рядом с файлом. Это статистический сигнал внутри самих слов. И подобное переживает копирование, вставку и даже часть редактуры. Убить такое можно только через серьёзный рерайт.

Механику не раскрыли. Параметров нет, детектора нет, технической документации тоже. Есть заявление компании, и даже в нём частично признают, что это влияет на смысл, качество и стиль текстов.

Параллельно с этим Opus 5, флагман, лучшая модель по бенчмаркам, стал таким, что с ним стало физически тяжело работать. И это заметили все, и, возможно, два этих события связаны.

Что именно сломалось

Многие жалуются на длину текста, излишние обороты, детали, замечания и ненужные подробности. Но главная проблема в том, что его ответы перестали складываться в понятный смысл.

Читаешь саммари после выполненной задачи и не можешь понять, что сделано, а что нет. Слова написаны, а ничего не понятно. Клод стал использовать лексику с редкими словами, ненужные громкие фразы, выражения, которые кроме пустого пафоса ничего не несут. Обороты не к месту и драматизм в каждом слове. Ощущение, будто собеседник изо всех сил демонстрирует интеллект и раз за разом промахивается.

Но это ещё не всё. Просишь его объяснить проще и получаешь хуже. Не короче и не яснее, а плотнее и запутаннее. Нужно прилагать множество усилий, чтобы разобраться в этом спагетти слов, и никакие инструкции, специальные промпты и записи в CLAUDE.md не помогают. Чтобы разобрать одну вещь, нужно пять, а то и более итераций, там, где ранее было достаточно одного.

При этом с моей стороны ничего не изменилось, всё та же тема, над которой работаю уже давно, и точно я не стал глупее за неделю. Изменились лишь две вещи: новая модель Opus 5 и наложенный сверху алгоритм создания узора из слов, по которому проверяющий может опознать текст, сгенерированный ИИ.

Иерархия поломки

Сама деградация распределена по продуктам неравномерно. Хуже всего в Клод Код. В десктопном и мобильном приложении заметно лучше. Модель при этом одна и та же.

С кодом как таковым Opus 5 справляется. Находит баги, видит уязвимости, пишет рабочее. Хотя и здесь у многих есть большие претензии, в том, что Клод Код начинает делать больше, чем его просят, и, если его не останавливать, может наворотить дел. При этом очевидно, что способность объяснить и нормально обсуждать сломана полностью.

Многое в качестве работы агента определяется не моделью, а обвязкой вокруг неё. Разница между Клод Код и мобильным приложением при одних и тех же весах это ровно тот случай. Так отчасти за поломку может отвечать сам Клод Код CLI.

Но при этом статистический шифр из слов может быть сильнее заметен как раз-таки при работе с кодом. И дело тут в пропорции. В чате приложения текст это почти весь контекст. В Клод Код два абзаца инпута и десять абзацев саммари тонут в ста килобайтах диффов, трейсбеков, имён функций и логов. Доля реального текста на фоне кода стремится к нулю.

Когда контекст на девяносто девять процентов состоит из кода, проза подтягивается туда же. Отсюда плотность без воздуха, терминология вместо объяснения, отсутствие пауз. И обратная связь здесь не помогает. Каждый, кто вёл долгую сессию в Клод Код, замечал это: чем дальше, тем техничнее и суше становятся ответы, пока разбирать их не станет дороже, чем сделать самому.

Версия

Здесь я изложу свою версию, вполне возможно, лишь частично верную, но буду рад услышать критику и ваши замечания. Метка водяного знака встраивается в ответ за счёт того, что модель берёт не самое вероятное слово. Работает это только там, где выбор есть. В коде выбора почти нет: следующий токен задан синтаксисом, и сигналу негде сесть. В свободной прозе выбора много.

Отсюда естественное предположение: чем больше в выводе свободы и пространства, тем незаметнее будет метка. В приложении это разговор, растянутый на много слов, меткам есть где расположиться в ответах. В большой статье такая метка может быть вообще мало заметна. Но в ответах Клод Код свободного текста мало, саммари и комментарии, и именно они читаются как бред. Ровно поэтому модуль водяного знака переиначивает ответы модели, формируя из них полубред.

Симптом при этом ровно тот, который механизм и должен давать. Редкая лексика. Странные конструкции. Есть работы, показывающие, что возмущение от метки приводит к неоптимальному выбору токенов и ошибкам в содержании, которые стандартная метрика качества не ловит. То есть «формально читается, а смысл не собирается» это в точности тот класс дефекта, который проверками не видно.

И даты объявления тут ничего не доказывают. Anthropic пишет, что маркировка началась 2 августа, а Opus 5 вышел 24 июля. Но любой, кто выкатывал фичи, знает, как это устроено: сначала месяцы разработки, потом частичное развёртывание, потом объявление. Дата в блоге это дата пресс-релиза, а не дата включения. Верить компании на слово в вопросе, где у неё есть интерес, оснований нет. Тем более когда компания уже вводила в заблуждение своими заявлениями, что их продукт не использовался в военных целях.

Контраргумент

С другой стороны, многое из симптомов указывает и на ошибку в пост-тренинге, то есть на то, как модель дообучили. Что для Anthropic даже худшее развитие событий.

Метка работает вслепую, у неё нет ни памяти, ни прицела. А слом идёт по вполне конкретным местам, больше объём слов и меньше смысла. Это похоже на выученное предпочтение, когда модель обучили, что развёрнутый ответ лучше краткого.

Дальше голос. Метка локальна и контекста не помнит. Она может подсунуть странное слово, но не может держать узнаваемый стиль через весь ответ. А он держится, абзац за абзацем. Такая согласованность на уровне целого ответа берётся только из пост-тренинга. Хотя тут возможен и некий гибридный слой, который учитывает необходимость установки водяного знака и дополнительно полирует текст под его установку.

Так что вполне возможно, что Anthropic сильно просчитались на моменте дообучения. Модель настроили под развёрнутый, уверенный, «наполненный» вывод, а в Клод Код это ещё усилено обвязкой и длинным контекстом. Но всё это делает ситуацию ещё хуже: фичу можно просто откатить, а исправить ошибки в обучении долго и дорого. И, как правило, часть из них мигрирует в новую модель. Так деградация смысловых ответов Клода и увеличение их длины происходили со времён версии 4.5. Росли только метрики выполнения бенч-тестов.

Почему проще уйти на китайскую модель

Модель Opus стала работать так плохо, что стоимость понимания её ответов выросла в разы. Каждое саммари надо разбирать. Каждый вывод перечитывать. Инструмент, который покупают ради экономии сил, начал их отнимать. Это перечёркивает весь смысл покупки.

Прямая инструкция по форме ответа не выполняется. Это потеря управляемости, а не вопрос стиля. При этом про регресс говорят неохотно и урывками. Оценки качества публикуют сторонние исследователи. Anthropic же разбрасывается пресс-релизами с бенчмарками, на которых всё прекрасно. Водяной знак вкачен без документации, без параметров и без детектора, с обещанием, что на качество он не влияет. Уже видно, что это не сработало.

Но у нас, пользователей, есть выбор, и он очевиден. И странно, что Anthropic всеми силами делает вид, что его нет. Они даже в попытке широкого жеста снижают и фиксируют цену на Sonnet, преподнеся это как долгожданный подарок. Как будто не замечая, что никому это уже не нужно.

Kimi K3 идёт вровень с Opus 5 и Fable на независимом индексе Artificial Analysis, занимает первое место на Frontend Code Arena, обходя Клода, и стоит в разы дешевле за задачу. И это открытая модель, которую запустить может каждый, и не обязательно гонять инференс через китайские серверы, можно взять токены у американских провайдеров, заточенных на прайваси и не хранящих логи.

Anthropic ведёт себя как компания, у которой есть заложники. Как будто выбор стоит между их моделями, и вопрос только в том, какую скидку дать. Этого мира больше нет. Он закончился где-то весной. А выход Deepseek Flash и вчерашний релиз Deepseek Pro с метриками, что идут вровень с Fable, вбили последний гвоздь в эти пустые надежды.

Мои планы на ближайший месяц

Не продлять подписку Клода, а попробовать обойтись силами Kimi и Deepseek. Я был согласен на это ещё до анонса новой Deepseek Pro, теперь же это сделать ещё проще.

Планирование, анализ и аудит уходят в Kimi и Deepseek. Причём две модели здесь будут отлично дополнять друг друга, делать ревизии друг за другом, спорить и находить ошибки там, где не увидела другая. Обе умеют объяснять, тратят меньше токенов в своих харнессах и дают то же качество, что и Opus 5.

Реализация планов остаётся за Deepseek Flash, и частично Kimi K3 там, где нужно больше надёжности. Лимитов по подписке у Moonshot немного меньше. Так что часть сложных задач при необходимости уйдёт на Deepseek Pro.

Отдельный аргумент, который за последние месяцы стал для меня главным. Открытые веса это проверяемость. Когда модель закрыта, вопрос «что изменилось в этом релизе» решается доверием к вендору. Когда веса лежат, на него можно ответить самому. После истории с меткой, о механике которой не рассказывают, этот аргумент перестал быть теоретическим.

Вместо вывода

Я не утверждаю, что ввод водяного знака единолично сломал Клода. Скорее всего, причина здесь в серии факторов и ошибок. И политика Anthropic в движении против опенсорса тоже сыграла определённую роль.

Но в целом это уже и не важно. У нас есть отличная альтернатива, дающая то же качество за меньшие деньги. И это самое главное для нас, разработчиков.

Комментарии (13)


  1. maxnoosphere
    13.08.2026 14:34

    интересная тема. водяной знак на текстах - это проблема не только для клода но и для остальных моделей. а как определяете что текст именно от клода? есть способ обойти этот водяной знак?


    1. prohronus Автор
      13.08.2026 14:34

      Уже делают тулсы для удаления отметок https://github.com/guillaumemeyer/watermarks-remover


  1. grelikt
    13.08.2026 14:34

    а можно пример текста с меткой и пояснением?


  1. grelikt
    13.08.2026 14:34

    вообще интересная тема и решил покопаться, в помощь взял нейроку, и вот что вышло
    ____

    Копнул — статья смешивает подтверждённые факты с довольно шаткой причинно-следственной теорией, и есть конкретная нестыковка по датам, которая рушит центральный тезис автора.

    Что подтверждается независимо:

    • Водяной знак — реальный, задокументирован Fortune, TechTimes, Reuters-уровня источниками: с 2 августа 2026, статистическая метка на уровне модели (не невидимые символы), под требования Article 50 EU AI Act, применяется глобально, не только в ЕС. Это не выдумка блогера.

    • Opus 5 — реальная модель, вышла 24 июля 2026 (это позже, кстати, чем модели из моего собственного системного промпта — то есть для меня это тоже новость постфактум).

    • Жалобы на многословность и потерю смысла в Opus 5 — тоже реальные, задокументированы независимо (разбор MindStudio, тред на Hacker News, официальный GitHub issue в репозитории claude-code с конкретными измерениями).

    А вот тут центральная теория автора (водяной знак → деградация Opus 5) рушится по датам. Жалобы на многословность Opus 5 фиксировались до 2 августа — материал MindStudio датирован примерно 1 августа, тред на HN старше двух недель на момент этой статьи. То есть модель уже жаловались как на "многословную и запутанную" раньше, чем вообще включили водяной знак — значит знак физически не может быть причиной того, что уже существовало до него. При этом в самом GitHub issue есть официальный анонс постмортема Anthropic с конкретными, раскрытыми причинами прошлых просадок качества (баг с уровнем effort, баг с историей размышлений, неудачное системное изменение под многословность) — то есть паттерн "нашли баг → объяснили → откатили" у них уже был, не "молчат и скрывают".

    Про "уже вводили в заблуждение насчёт военного использования" — это не бьётся с тем, что реально задокументировано. По многочисленным источникам (CNN, Reuters, Al Jazeera) картина обратная: Anthropic публично и настойчиво отказывалась от неограниченного военного использования (автономное целеуказание, слежка за гражданами США), из-за чего Пентагон демонстративно понизил их статус, а компания в ответ подала в суд на правительство. Это не "скрывали военное использование", а ровно наоборот — публичный, судебный конфликт из-за того, что они слишком жёстко ограничивают именно такое использование. Автор этот пассаж явно не проверял.

    Сама статья честно помечена автором как "Мнение" и "моя версия... возможно лишь частично верна" — то есть жанр разрешает спекуляцию. Но конкретно эти два места (причинность с водяным знаком и намёк на скрытое военное применение) не выдерживают проверки по датам и источникам, а не просто "спорное мнение".


    1. Vicollel
      13.08.2026 14:34

      Спасибо за ваш бесполезный комментарий. Вы из тех кто окончательно делегировал мышление нейросети?


    1. prohronus Автор
      13.08.2026 14:34

      Мне нейронка теже контрдоводы привела на статью. И то что вы это процитировали подтверждает последнее исследование из Китая что ИИ способен манипулировать людьми. Все кто следили за темой помнят, что Антропик много раз делал заявления в духе наш ИИ не будет использован в военных целях. Постепенно они ушли в сторону мы просто будем против. Но тональность тогда была предельно ясной, Клод в операциях не участвовать не будет. Вы же взяли на веру первый ответ ИИ за истину, а если бы капнули дальше то тот же ии сам бы пришел к выводу о подмене понятий и манипуляции со стороны Антропика


  1. johnnyBoy1984
    13.08.2026 14:34

    автор, дайте пруф пожалуйста. я работаю с клод кодом каждый день, и пока не заметил такого. то, что агенты стали усерднее копать и собирать фактуру - это да, думать о гейтах нужно сразу, еще до самой задачи.

    статья выглядит сама как простыня от китайской нейронки, извините если приняли на свой счет.


    1. prohronus Автор
      13.08.2026 14:34

      Описал личный опыт работы с Клод Код СЛИ. Видно как ИИ стал отвечать путанно, высвечивая свои находки и мысли которые создают еще больше неясности и уводят в сторону. Этот опыт у многих, именно поэтому стали так популярны плагины и системные промпты "Simple English" и "Just shut up" но проблема в том то они не решают проблему полностью, так как она более структурная. Сравнивая с Опус 4.2-4.5 явный регресс в контексте взаимодействия и коммуникации между пользователем и ИИ


  1. ggo
    13.08.2026 14:34

    не водяные знаки, а стеганография

    же...


    1. AlexKniga
      13.08.2026 14:34

      Все-таки водяной знак. Как например:

      https://ru.wikipedia.org/wiki/Наследник_из_Калькутты#История_создания_и_публикации

      Стеганография — прятание ценной информации.

      Водяной знак — скрытая постоянная сигнатура (подпись).


  1. MrBrooks
    13.08.2026 14:34

    Опус 5 постоянно придумывает новые термины, постоянно уходит в сторону и пишет много воды. Это было сразу на релизе. И сразу сильно бесило.

    В целом, я выработал с ним правила работы и относительно нормально заставил его рассматривать вещи.

    Основная проблема - это термины, которые он создаёт на каждой итерации. И чем дальше работает, тем больше новых терминов вместо старых. Тут только заставлять его сверяться с историей. Предполагаю, что так он для себя лучше разметку делает на каждой итерации.

    Не вижу связи с текстом.


  1. OlegMax
    13.08.2026 14:34

    Напишете через месяц, как оно сложилось с китайскими моделями?


    1. prohronus Автор
      13.08.2026 14:34

      Первые результаты уже есть. Делал сегодня аудит большой работы по рефакторингу (15 модулей http сложились в один узел с тестами, гейтами и прочей обвязкой). Дал провести аудит работы Клод Опус 5, Дипсик Про и Кими 3 Макс. Все ответы потом скормил Клоду и попросил оценить каждый аудит по 100 балов. Кими 91, Клод 71, Дипсик 68. Кими обнаружила больше всего и структурнее