ИИ активно используется не только в коммерческом, но и в научном программировании, для анализа и визуализации данных. Как и в других сферах, генеративный ИИ множит как все хорошее, так и все плохое, что характерно для сложившейся системы. Он ускоряет создание кода и расчеты, то есть появление первых результатов исследований. Но дальше запускается сложная цепочка проверки и распространения результата. А ее так легко масштабировать с помощью ИИ уже не получается.
Перспектива неприятная: мы пытаемся производить результаты исследований гораздо быстрее, чем проверять, какие из них вообще имеют смысл. Один некорректный фрагмент кода может породить график, статистику, вывод, статью, а потом и десятки новых работ, которые будут ссылаться на первую публикацию. На каждом следующем этапе результат будет выглядеть все более «научным» (вспоминаем индекс цитируемости).
В итоге, если мы не поменяем схему распространения научного знания, то рискуем все чаще пропускать некорректные выводы, а может и свалиться в лженауку. Что в конечном счете не ускорит, а только замедлит прогресс.

В чем проблема
«Код работает» и «код правильно решает поставленную задачу» — два разных состояния.
В простых случаях коммерческой разработки эти понятия почти тождественны: код запускается, выдает результат, значит все хорошо. Но как только задача становится чуть сложнее, например, надо учесть высокие нагрузки, не любой запускающийся код с ней справится.
А в научной сфере вполне можно написать программу, которая без единой ошибки отработает до конца — построит красивый график или выдаст требуемые цифры после запятой. Только при этом будет решать совсем не ту задачу, использовать не тот метод, вывалится за границы применимости модели и тому подобное. Среда разработки, увы, подсвечивать такие ошибки не умеет.
Проблема существовала задолго до генеративного ИИ. Ученые — не сверхлюди: они ошибаются, неверно интерпретируют результаты, выбирают неподходящие методы, а иногда и сознательно фальсифицируют данные. А проверка усложняется тем, что правильный результат расчетов зачастую неизвестен.
В качестве метода контроля научный мир придумал рецензирование (или пир-ревью). Если сильно упростить, у научной работы есть несколько шансов отправиться на доработку по пути к бессмертию. Сначала ее может не принять редактор научного журнала, потом ее под лупой рассмотрят рецензенты. После публикации другие исследователи будут обращать внимание на ошибки, пытаться воспроизвести результат или обнаружить противоречия с собственными данными.
Система никогда не претендовала на роль идеала. Рецензент тоже человек, а значит, вполне способен не заметить ошибку. Примеров можно вспомнить массу. Чего стоит один только Пилтдаунский человек.
В 1912 году палеонтолог Артур Смит Вудворд и археолог-любитель Чарльз Доусон объявили о находке «переходного звена» между обезьяной и человеком — Пилтдаунского человека. Находку изучали десятилетиями, она фактически вошла в научный обиход. Хотя подлинность останков с самого начала подвергали сомнениям (найденные позже в других регионах кости не были похожи на представленные Доусоном), только в 1950-х окончательно выяснилось, что это подделка: человеческий череп был скомбинирован с челюстью орангутана, кости искусственно состарены, зубы подпилены. Выявить подлог помогли современные методы датировки, а история теперь известна как Пилтдаунская мистификация.
Более свежий пример из области физики — Ян Хендрик Шен. В конце 1990-х — начале 2000-х он опубликовал большое количество работ по физике органических материалов и сверхпроводимости, даже успел получить несколько научных наград, и ему прочили Нобелевку. Коллеги посчитали, что в 2001 году у него выходила одна статья раз в восемь дней — необычайная продуктивность для ученого. Однако позже его уличили в фальсификации результатов: он подтасовывал экспериментальные данные, чтобы оправдать свои прогнозы. Другие научные группы не смогли повторить описанные им процессы, а позже в публикациях, посвященных разным экспериментам, нашли одни и те же графики. Статьи отозвали, ученого уволили из Bell Labs.
Таких историй очень много. Каждый раз после таких скандалов с новой силой разгорались обсуждения того, насколько вообще система рецензирования работ справляется с поставленной задачей. Критики было много, но никто не смог предложить ничего лучше, потому что главный принцип все-таки работает. Он заключается в том, что исследователь не должен быть единственным человеком, который решил, что его результат правильный.
Генеративный ИИ меняет правила игры. Он помогает писать код или анализировать данные быстрее, а значит, за короткое время выходить на этап публикации. Но если армия редакторов и рецензентов не очень справлялась с потоком работ и раньше, то кто будет все это проверять, когда публикаций станет в 10 раз больше?

А количество публикаций уже активно растет! С 2020 по 2025 год их ежегодное число удвоилось. Всплеск отмечают после публичного релиза ChatGPT. Из-за недостатка рецензентов это увеличило временной лаг между сдачей текста и публикацией с нескольких месяцев до года, и это, похоже, не предел.
Давайте ответственно подойдем к самопроверке? Нет!
Исследователи из Университета Мичигана, Университета Теннесси и Sandia National Laboratories проанализировали использование ИИ в науке. Для этого они в 2025 году собрали свободные ответы 527 участников (исследователей преимущественно из университетов США) о том, как они применили ИИ. Ответы не были исчерпывающими — каждый описывал только один свежий эпизод использования моделей: какую задачу он решал, как использовал свой основной ИИ-инструмент и что сделал, чтобы проверить результат. Кроме того, исследователи спрашивали, насколько участник уверен в своих силах, в способностях ИИ выполнить задачу и в получившемся результате.
Свободные ответы исследователи закодировали по двум направлениям: какую задачу ученый делегировал ИИ и каким способом оценивал результат. После этого сопоставили получившиеся категории с опытом программирования, научной областью и уровнем уверенности участников.
Выводы получились любопытные.
Какие задачи делегировали
Выборка получилась довольно подкованной. Медианный опыт научного программирования составил шесть лет, а 84% опрошенных писали код как минимум раз в неделю. Самыми популярными языками оказались Python и R.
Вот какие задачи отдавали ИИ.
Данные — 23,9%. Очистка, преобразование, объединение таблиц, работа с форматами и тому подобное.
Визуализация — 19,8%. Графики, их оформление и настройка.
Отладка — 17,4%. Поиск причин ошибок и исправление кода.
Математические и научные вычисления — 11,7%. Уравнения, модели, симуляции, численные методы.
Статистический анализ — 10,9%. Регрессии, статистические тесты, ML-пайплайны и тому подобное.
Вместе эти пять категорий составили 76% ответов с явно указанным сценарием использования.
Как проверяли результат
Самое забавное, что код толком почти никто не проверял. Самой распространенной стратегией проверки оказалось просто запустить код. Ее упомянули 52,8% участников. Еще 22,5% рассказали, что смотрели на полученный результат. 19,4% читали сам сгенерированный код. 16,2% проверяли визуализацию. Вроде бы ничего страшного, но тестирования и проверки коллегами практически не было. Автоматические тесты или тестовые наборы были упомянуты примерно в 2,8% случаев. Проверка коллегой — около 2%. Ручная математическая проверка — 1,2%. Сравнение с другой ИИ-моделью — 0,4%.
Громко бить тревогу рано. Во-первых, для разных задач проверка может быть разной. Кое-где тестирование действительно неуместно. Во-вторых, в ответах встречалось сравнение результатов с известными значениями, запуск кода на маленьких наборах данных с заранее известным ответом или сопоставление с предыдущей реализацией. Это вполне корректный способ получить независимое суждение. Однако эти упоминания оказались слишком редкими. В большинстве случаев проверка все-таки оставалась внутри связки «человек — ИИ».
Помогает ли тут опыт
Еще исследование показало, что чем больше у разработчика опыта, тем меньше он в целом доверяет ИИ, но количество описанных способов проверки результата при этом заметно не увеличивается.
Забавен и такой момент: чем меньше у разработчика опыта, тем больше он доверяет ИИ. Но если так подумать, чем меньше человек понимает в программировании, тем сложнее ему самостоятельно заметить, что ИИ-помощник сделал что-то не то.
Получается неприятная вещь: значительная часть ответственности за обнаружение ошибок, которые не заметил сам исследователь, ложится на последующие фильтры, в том числе на рецензирование. Рецензенту придется вникать и осознавать, насколько корректен выбранный метод, достаточно ли обоснованы выводы и можно ли доверять полученным результатам.
Очевидную чушь отсеять легко, но что делать со статьями, результаты в которых выглядят правдоподобно (а это суперсила ИИ)?
Фантазируем о будущем
С таким ростом количества публикаций мы очень быстро упремся в возможности рецензентов — количество часов в сутках у них не меняется. Значит, больше неверных результатов будет опубликовано.
Их можно было бы отфильтровать, повторно проведя эксперимент, но такие ресурсы тоже не безграничны. Получается, что объем опубликованных, но еще не опровергнутых неверных результатов будет только расти.
Идут разговоры о том, чтобы автоматизировать рецензирование: несколько научных групп разрабатывают агентов, которые ускорили бы проверку статей. Но к этой задаче надо будет подходить не как в работе выше, а со всей осторожностью, обучая эдакого «агента-рецензента» только на проверенных результатах. Ему нужны независимые способы проверки: тестовые данные, эталонные результаты, альтернативные реализации, воспроизводимые вычисления, проверяемые математические свойства и, в идеале, доступ к исходному коду и данным. Иначе мы получим прекрасного специалиста по рецензированию, который очень быстро и убедительно подтвердит то, что уже успел навайбкодить предыдущий ИИ. Так весь научный мир пойдет не туда.
RomanAlexan
Уважаемая компания МТС, вы когда ИИ для текстов на русском используете, можете читать для разнообразия?
"Как и в других сферах, генеративный ИИ множит как все хорошее, так и все плохое, что характерно для сложившейся системы". Вы тут свойство с признаком перепутали? Множитель не может характеризовать систему.
"сложная цепочка проверки и распространения результата. А ее так легко масштабировать с помощью ИИ уже не получается."
Видимо, про Automated Reasoning вы решили ничего не знать)
"если мы не поменяем схему распространения научного знания"
А у нас она есть? Или из-за того, что ИИ способен оформить красиво статью и автоматизировать во многом формальное доказательство следует, что у нас есть схема?
"Но к этой задаче надо будет подходить не как в работе выше, а со всей осторожностью, обучая эдакого «агента-рецензента» только на проверенных результатах."
Вы же понимаете, что научная статья, она про что-то новое? Какие-то тогда "проверенные результаты"? Старые в смысле?
Может быть вы не будуете все-таки использовать ИИ для написания текста про ИИ?