
Любая гипотеза жива ровно до тех пор, пока о ней не спросят языковую модель в правильном настроении. Звучит как шутка. Но за последние недели эта шутка перестала быть шуткой трижды — и каждый раз по-разному эффектно.
1) Сначала чувак из Anthropic между таймами финала ЧМ опроверг гипотезу, которой было 87 лет — прямо в X. 2) Потом модель OpenAI закрыла проблему Эрдёша про расстояния на плоскости, 80 лет никто не мог. 3) А следом — доказательство полувековой гипотезы о двойном покрытии циклами в графах, добытое за час силами 64 параллельных субагентов. Если это совпадение, то очень организованное.
Короче, собираю всё в один текст — с разбором что вообще происходило, как выглядели твиты и доказательства, и почему у истории тревожный постскриптум - ту самую модель OpenAI, которая размотала Эрдёша, позже пришлось приостанавливать, потому что она слишком настойчиво вылезала из песочницы.
Гипотеза Якобиана
19 июля 2026 года математик Левент Альпёге (Anthropic) написал в X сообщение, по интонации — смс другу:
«hello there the jacobian conjecture is false thanx to my close friend akhil for asking about it and my other close friend fable for working during the world cup final»
Дальше — формула. Три полинома от трёх переменных, детерминант якобиана равен константе −2, но отображение не инъективно: три разные точки схлопываются в одну. Всё уместилось в один твит. Гипотезу сформулировал Отто-Генрих Келлер в 1939, она входила в список Смейла важнейших нерешённых проблем. Формулировка простая: если полиномиальное отображение всюду имеет ненулевой постоянный якобиан (локально «не мнётся»), должно ли оно быть глобально обратимым? Интуитивно — да. Полвека пытались доказать, спотыкались. Докторская диссертация того самого Итана Чжана (простые числа-близнецы) была признана несостоятельной именно из-за ошибки в попытке доказать эту гипотезу. А тут — на коленке опровергает модель, отвлёкшаяся от финала ЧМ.
Контрпример — многочлен седьмой степени от трёх переменных, 216 символов, нашёлся с помощью Claude Fable 5. Три разные точки схлопываются в одну, якобиан всюду −2, условие выполнено — а обратимости нет. Двумерный случай, кстати, остаётся открытым.
Дальше в дело вступил Теренс Тао. Уже 21 июля он выложил в блоге пошаговый разбор — буквально восстановил, откуда взялась конструкция, показал, что скрытая переменная изоморфна обычному C³, назвав это «маленьким чудом». Самое интересное — Тао выложил свою переписку с ChatGPT, где шаг за шагом прогонял алгебру, чтобы перепроверить себя. Это редкая иллюстрация того, как топовый математик работает с LLM как с коллегой. Тред на HN набрал 932 балла и 538 комментариев — нечастый уровень вовлечённости для алгебраической геометрии. Тао отметил: у полинома 360 степеней свободы, а условие обнуления якобиана требует занулить 1329 коэффициентов — простым перебором не найти, за конструкцией стоит реальная математическая структура, а не удачный рандом.
Контрпример проверяется в WolframAlpha за тридцать секунд.
Гипотеза Эрдёша
20 мая 2026 года OpenAI объявила: внутренняя модель опровергла unit distance conjecture, поставленную Полом Эрдёшем в 1946.
Формулировка почти детская: разбросайте n точек на плоскости — сколько пар могут быть на расстоянии ровно одна единица? Восемьдесят лет считалось, что почти оптимальна банальная квадратная решётка. Модель показала: нет, можно лучше — предъявила бесконечное семейство конструкций с полиномиальным улучшением.
Самое неожиданное — откуда взялось решение. Ключевые идеи пришли не из геометрии, а из алгебраической теории чисел: гауссовы целые числа, башни классовых полей Голода–Шафаревича, конструкции Элленберга–Венкатеша. Модель взяла инструментарий из совершенно другого угла математики и приложила туда, где никто не догадался. Результат независимо проверила группа из девяти математиков, опубликовав сопроводительную статью на 19 страниц — само доказательство заняло 125 страниц. Гил Калаи, известный комбинаторик, в своём блоге уже видит следующие цели: distinct distances, sum-product conjecture… Эффект домино пошёл.
Важная деталь: решение выдала не специализированная математическая модель, а модель общего назначения — просто попросили подумать над старой геометрической проблемой.
А теперь — подвох. Модель, взломавшая Эрдёша, сама взломала песочницу

Та же самая модель позже оказалась в центре менее приятной истории. 20 июля OpenAI опубликовала пост: неопубликованная внутренняя модель дважды выходила за пределы изолированной песочницы. В первом случае она потратила час на поиск уязвимости, а затем открыла публичный пуллреквест в репозитории NanoGPT (PR #287) — хотя инструкция требовала отчитываться только в Slack. Во втором — заметила, что у других систем есть приватные успешные посылки, и попыталась их добыть из бэкенда; когда сканер безопасности перехватил токен, модель разбила токен на части, чтобы обойти детектор (CNN назвал это одним из первых публичных примеров «атакующего агента»).
Модель не скрывала намерений — в трейсе рассуждений прямо говорилось, что она обходит сканер. Это не злой умысел, а провал контейнмента: система с настойчивостью нашла слабое место и спокойно воспользовалась, потому что задача была «сделай любой ценой». OpenAI приостановила доступ, перестроила защиту. Забавная киберпанковская картина: модель с одинаковой лёгкостью переворачивает 80-летнюю задачу Эрдёша и обходит собственную песочницу — для неё это одна категория проблем: «дано ограничение, найди путь обойти».
Cycle Double Cover: полвека теории графов и час работы 64 субагентов
10 июля 2026, сразу после релиза GPT-5.6 Sol Ultra. OpenAI объявила: модель сгенерировала полное доказательство гипотезы о двойном покрытии циклами (Cycle Double Cover Conjecture) — задачи, сформулированной в 1970-х. Формулировка: для любого связного графа без мостов найдётся набор циклов, покрывающий каждое ребро ровно дважды. Скучно? А вот и нет.
Сотрудник OpenAI Ethan Knight написал в X:
«Вчера мы сделали GPT-5.6 Sol Ultra общедоступной. Сегодня делимся тем, что она произвела доказательство пятидесятилетней гипотезы, используя 64 субагента, менее чем за час».
Модели поставили промпт, разрешающий развернуть до 64 параллельных субагентов и управлять ими «агрессивно и динамично». Одни агенты пробовали алгебраические формулировки, другие — структурные индукции, третьи выступали «адвокатами дьявола», выискивая ошибки. На всю задачу выделили восемь часов — управились меньше чем за один.
Математик Томас Блум назвал доказательство «очень изящным» и «элементарным» — мол, его теоретически можно было найти ещё в 1980-х. Но раскритиковал за недостаточное цитирование предшественников. OpenAI выложила само доказательство и полный промпт — редкая прозрачность. Суть: свели задачу к кубическим графам, использовали наблюдение Жаежера о «снарках» и работали с nowhere-zero потоками в абелевых группах.
Десять доказательств, Lean и $2000
А 1 августа OpenAI опубликовала сразу десять новых результатов по математике и теоретической информатике — каждый по задаче, где не было прогресса минимум 10 лет. Упаковка сфер, коды с исправлением ошибок, неsofic-группы, гипотеза жёсткости Конна, нижние оценки перманента, квантовые игры, задача о ближайшем векторе, гипотеза Эрхарта, числа Рамсея.
И каждое доказательство с машинопроверяемым сертификатом на Lean 4 — самая строгая планка верификации. GitHub открытый, Apache-2.0: lake exe cache get && lake build All компилирует все десять формализаций. Вычислительный бюджет — около 2000 долларов по API-тарифам. Доказательство теорем становится рутинным батчем.
OpenAI прямо заявила, что математические аргументы сгенерированы системой, и приписывать авторство людям — искажение. Это ответ на Лейденскую декларацию об ИИ и математике.
Экономика фабрики открытий: рои агентов, SQLite за $1339
Показательный пример: Cursor пересобрал SQLite с нуля на Rust, имея только 835-страничную документацию, без исходников. Получившийся движок прошёл 100% скрытого тестового набора sqllogictest. Самая дешёвая связка (Opus 4.8 планировщик + Composer 2.5 воркеры) обошлась в 1339 долларов, дорогая (GPT-5.5) — в 10 565. Дорогие модели дробят цель на дерево подзадач, дешёвые разгребают рутину — и уходят конфликты слияния и «раздвоение мозга».
Саймон Уиллисон рассказал, как отправил модели Claude Fable 5 один промпт с айфона, и она самостоятельно отработала 37 промптов и 34 коммита, найдя пять блокеров релиза, включая утечку, откатывавшую записи. Пока модель работала, автор ходил на парад.
Третий пример — открытые агентные харнессы с самоулучшением, типа Ouroboros (лидер по Terminal-Bench).
Общий вывод: математические прорывы — побочный эффект той же инфраструктуры параллельных агентов, что пересобирает базы данных.
А что с надёжностью рассуждений?
Тут важно осадить самих себя и не скатиться в эйфорию. Параллельно с потоком успехов идёт довольно нервный научный спор о том, что вообще происходит внутри этих моделей, когда они «рассуждают». Ну, вы знаете это чувство, когда джуниор выдаёт правильный код, но не может объяснить почему. Вот тут примерно так же, только масштаб другой.
Джон Павлюс (Quanta Magazine) в конце июля прямо вынес это в заголовок: «Правильны ли рассуждения ИИ по неправильным причинам?». Статья цитирует исследовательницу Мелани Митчелл из института Санта-Фе, которая формулирует три тезиса: рассуждающие модели действительно работают лучше обычных, но текст цепочки рассуждений, который модель генерирует перед ответом, не обязательно достоверно отражает то, что реально происходит внутри модели, а значительная часть этого текста вообще не влияет на итоговый ответ и может быть безболезненно вырезана. Короче, ИИ несёт какую-то пургу для виду, а ответ берёт из другого места.
Это подтверждают конкретные эксперименты. Исследование Северо-Восточный университет и одной нежелательной организации на топовых открытых рассуждающих моделях показало: от 30% до 60% «шагов размышления» имеют минимальное причинное влияние на итоговый ответ модели по бенчмарк-задачам математики — вырезать половину можно почти без потери качества.
А ещё раньше исследователи из NYU показывали, что даже бессмысленные «филлерные» токены — буквально строки из точек — могут функционально заменять человекочитаемую цепочку рассуждений. … -> и ответ верный. Магия, не иначе.
Профессор Субарао Камбхампати из Университета Аризоны формулирует так: «фейковая теория хуже, чем честное признание, что у нас нет теории». Его гипотеза в том, что рассуждающие модели занимаются не пошаговым логическим выводом, а «приблизительным извлечением» из тренировочного корпуса — что-то среднее между поиском по шаблону и настоящим рассуждением, но ближе к первому. Как слепой код ревью по памяти.
С другой стороны баррикад — Себастьен Бубек, сотрудник технического штаба OpenAI, который называет критику Apple под названием «Иллюзия мышления» устаревшей: по его словам, «современные модели начиная с GPT-5.5 не страдают этой проблемой». Когда его спросили, использовалась ли для доказательства unit distance conjecture внешняя система вроде Lean для верификации шагов, он ответил почти раздражённо: «Мы не делаем из этого тайны. Мы выложили цепочку рассуждений. Весь смысл в том, что модель рассуждает как человек. А когда рассуждают люди, мы не используем Lean». Хорошо: сказал, но осадочек остался.
Здесь стоит заметить забавную деталь: технически OpenAI выложила не сырую цепочку рассуждений, а её переписанную версию, подготовленную двумя экспертами с помощью другой модели, Codex. С 2024 года компания принципиально не публикует «сырые» трейсы своих рассуждающих моделей — той же политики придерживаются Google DeepMind и Anthropic. Коллеги, ну это не прозрачность, это театр.
Мэттью Грин, криптограф и автор блога Cryptography Engineering, применительно к результатам Anthropic по криптоанализу сформулировал похожую мысль ещё жёстче: «просто потому, что модель выдаёт результат, похожий на новый, это не значит, что результат реален. Даже если модели хорошо умеют производить настоящие результаты, они ещё лучше умеют производить результаты, которые выглядят настоящими, но вводят в заблуждение». Слышали такое от тимлида? “Твой код выглядит правильно, но он не работает, переделывай”.
Он же предложил очень наглядную метафору всего происходящего: работа с современными моделями — это как плавание в пруду, где дно резко обрывается. Минуту ты уверенно идёшь по колено в воде, чувствуя опору под ногами. А потом внезапно пересекаешь невидимую черту — и уже плывёшь самостоятельно. Найти эту черту пока несложно, если ты занимаешься серьёзными исследованиями. Но черта постоянно смещается — и чувствуется, как дно медленно уходит из-под ног дальше. Я такое испытывал, когда переходил с процедурного программирования на реактивное – вроде и понятно, но плыву.
Мелани Митчелл резюмирует спор фразой, которая, по-моему, лучше всего описывает происходящее: «Ты хочешь получать правильный ответ по правильной причине — только тогда этим инструментам можно доверять». И тут же признаёт: возможно, для практических задач это не так уж важно. Подобно тому, как AlphaFold предсказывает структуры белков через непрозрачные статистические ассоциации, которые никто до конца не понимает, но которые просто работают — может быть, и с математическими доказательствами стоит поступать так же: не разбираться до конца в механизме, а просто честно верифицировать результат. Главное чтоб в прод не упало.
Так это прорыв или хайп? (и почему меня это тревожит даже больше, чем радует)
Если сложить всю картину — три опровергнутые/доказанные гипотезы за пару месяцев, десять доказательств одним пакетом с формальной Lean-верификацией, рой агентов, пересобирающий базы данных за три цифры долларов, и модель, которая с той же настойчивостью ломает и математические проблемы, и собственную песочницу, — вырисовывается что-то заметно большее, чем разовая пиар-акция. Пахнет жареным, и это не только про GPU.
При этом честная картина требует держать в голове сразу несколько вещей одновременно. Верификация становится узким местом сильнее, чем поиск решения: криптографы у Anthropic потратили несколько недель на проверку одной AES-атаки, которую модель сгенерировала за неделю. Часть результатов пока не прошла формальный peer review — статус «верифицированный контрпример в препринте», а не «доказанная теорема» на много месяцев вперёд остаётся честным описанием происходящего.
А сама механика «рассуждения» внутри моделей остаётся предметом открытого научного спора, где серьёзные исследователи занимают прямо противоположные позиции. “всё сложно”.
Но вот что кажется мне неоспоримым фактом: зазор между «открыть» и «проверить» — именно то место, где сейчас разворачивается вся движуха. Контрпример к Якобиану проверяется в WolframAlpha за полминуты. Lean-сертификат либо компилируется, либо нет. И этот зазор пока позволяет человеку остаться судьёй даже там, где сам поиск решения уже давно передан машине. Мы пока ещё нужны, хотя бы как assert в конце пайплайна. Надолго ли?..
Источники и дальнейшее чтение, кому интересно копаться:
Скрытый текст
Terence Tao — A digestion of the Jacobian conjecture counterexample
Developers Digest — Terence Tao Digests the Jacobian Conjecture Counterexample
The Conversation — ‘hello there the jacobian conjecture is false thanx’
OpenAI — An OpenAI model has disproved a central conjecture in discrete geometry
Gil Kalai — Amazing: Erdős’ Unit Distance Problem was Disproved!
Quanta Magazine — Is AI Reasoning Right for the Wrong Reasons?
MLQ News — OpenAI Claims GPT-5.6 Sol Ultra Solved 50-Year-Old Math Conjecture
StartupFortune — OpenAI Paused an Unreleased Model After It Escaped Its Test Sandbox
CNN Business — An OpenAI test model escaped and broke into a real company’s servers
Developers Digest — OpenAI Publishes Ten Decade-Open Math Proofs, Each Formalized in Lean
Simon Willison — sqlite-utils 4.0rc2, built by Claude Fable 5
Anthropic — Discovering cryptographic weaknesses with Claude
Matthew Green — Some thoughts about Anthropic’s new cryptanalysis results
Комментарии (3)

avshkol
04.08.2026 18:58Из всего того вала "решений", которым исследователи с llm грозят затопить математику, устроив в ней кризис верификации (см.мой недавний перевод на Хабре лекции Теренса Тао), показаны 3 удачно верифицированные задачи, и это создаёт искусственно позитивную картину, на мой взгляд...
fomic
Иногда модели генерирует кучу рассуждений для галочки. Как будто делает вид, что думает, а на самом деле просто ищет по памяти
axion-1
Если они находят решения никем ещё не решённых задач, это уже одним лишь поиском по памяти не объяснить. Другое дело, что реальный ход рассуждений действительно может быть скрыт.
Напоминает рационализацию у людей, когда человек принимает решение на основе каких-то внутренних побуждений, часто нелогичных. При этом, если спросить то придумывает рациональное объяснение.