Представим ситуацию. Продажи мороженого и число утоплений летом растут одновременно — статистика, что графики почти совпадают. Но мороженое никого не топит: оба показателя зависят от третьей переменной — жары. Корреляция показывает, что показатели движутся вместе, но не объясняет причину. Но часто это путают. В научной статье или ее пересказе корреляции легко превращают в объяснение причины. Рассказываю, как часто авторы публикаций допускают такой скачок и что добавляет от себя ИИ.

Ученые из Университета Пенсильвании проанализировали с помощью LLM заголовки и аннотации 194,6 тысяч статей по социальным наукам за 1980–2024 годы. Они отобрали работы с кросс-секционными данными: в таких исследованиях ученые сравнивают людей, организации или другие объекты в один момент времени, а не наблюдают за их изменениями.

Так можно обнаружить связь, но обычно нельзя установить ее причину. Например, если люди, довольные работой, чаще занимаются спортом, это еще не значит, что спорт повышает удовлетворенность работой. Возможно, довольные сотрудники находят больше сил для тренировок. Или и то и другое связано с более удобным графиком.

Тем не менее в 46,3% отобранных статей авторы использовали формулировки, которые прямо или косвенно указывали на причинность. Речь именно о заголовках и аннотациях к статьям. С 2000 по 2024 год доля таких публикаций выросла примерно с 20% до более 60%. В 2024 году в работах по бизнесу она достигла 84%, по экономике — 67%.

Ежегодная доля статей, основанных на данных поперечных исследований и содержащих формулировки, указывающие на причинно-следственные связи, — среди всех статей (черный цвет) и в разрезе дисциплин (цветные линии).
Ежегодная доля статей, основанных на данных поперечных исследований и содержащих формулировки, указывающие на причинно-следственные связи, — среди всех статей (черный цвет) и в разрезе дисциплин (цветные линии).

Читатели тоже склонны видеть причину там, где показана только связь. В эксперименте с 1105 участниками ученые предложили людям прочитать аннотацию научной статьи и кратко пересказать ее. Одни получили исходный текст с причинными формулировками, другие — версию, в которой говорилось только о взаимосвязях. В пересказах первой группы причинные утверждения встречались в 71,3% случаев, второй — в 49,6%. Более точный язык помог, но почти половина читателей все равно добавила причинное объяснение от себя.

При пересказе с помощью ИИ проблема может усиливаться. Авторы протестировали пять языковых моделей. Когда их просили упростить научный текст или объяснить его практическую пользу, все пять чаще выдавали причинные утверждения без оговорок, чем авторы исходных аннотаций. Модели могли убрать осторожные формулировки или превратить «связано с» в «приводит к».

В отдельном эксперименте с GPT-4.1 причинные утверждения появлялись в 99,3% пересказов исходных аннотаций. Когда к ним добавляли пояснение об ограничениях метода и комментарий с разбором ошибок интерпретации, показатель снижался до 30,3%. То есть дополнительный контекст заметно помогал, хотя и не устранял проблему полностью. Эти цифры относятся к конкретным условиям эксперимента, а не ко всем научным пересказам GPT-4.1.

Авторы рассматривают эту проблему как один из случаев narrative license — вольностей, которые ученые допускают, когда рассказывают о результатах. Ради стройной истории можно преувеличить эффект, сделать слишком широкое обобщение, опустить противоречащие данные или представить корреляцию как причинную связь.

Почему это происходит? Авторы предлагают несколько возможных объяснений: при найме и продвижении ученых учитывают число и престиж публикаций, журналы отбирают «новые и важные» результаты, а организации, выдающие гранты, ждут общественно значимого эффекта. Все это может подталкивать исследователей к более громким заявлениям. Но сами причины такого поведения в этой работе не проверяли — это предположения авторов.

Получается, преувеличение может появиться уже в научной статье, еще до журналистского заголовка или пересказа нейросети. А при дальнейших пересказах оговорки могут исчезнуть окончательно: читатель увидит уверенное «X вызывает Y» и не узнает, что ученые обнаружили лишь связь. Так корреляция постепенно превращается в «факт», который уже невозможно отличить от доказанной причинности.

Поэтому при чтении научных новостей стоит смотреть не только на цифры и статистическую значимость. Не менее важно понять, как ученые получили данные и позволяют ли эти данные утверждать, что одно явление вызывает другое.

Комментарии (1)


  1. Sdima1357
    18.09.2026 17:06

    склонны видеть причину там, где показана только связь



    Да, и это очень раздражает ... Причем это свойственно не только журналистам, но и многим "ученым"