Как я обещал в прошлой статье, пора проверить, что стоит за баллами из сравнительной таблицы. Взял три свежие научные работы с Google Scholar — русскую, английскую и узбекскую  и прошёл с ними весь путь проверяющего в обеих системах: загрузка, ожидание, отчёт, каждый источник руками. Спойлер: в конце — эксперимент со вставкой текста от Claude Fable 5 в курсовую 2017 года. Обошлось мне всё это в 4300 рублей, так что читайте внимательно. 

Если нет времени читать
  • Взял три свежие научные работы из Google Scholar — на русском, узбекском и английском — и прогнал каждую через Антиплагиат и Руконтекст.

  • Проценты оригинальности разошлись на 7–18 пунктов в двух системах по каждому языке.

  • Главные различия систем  — в механике отчётов: доступность источников для просмотра, обращение с библиографией, работа со спорными срабатываниями.

  • Эксперимент с ИИ: вставил в курсовую сгенерированный текст — оригинальность выросла в обеих системах. Антиплагиат генерацию не обнаружил, Руконтекст пометил ≈11,58% текста как вероятно сгенерированный.

Зачем я это делал

В прошлой статье я сравнил Антиплагиат, Turnitin и Руконтекст и по пяти критериям. Руконтекст обогнал Антиплагиат на 0,6 балла. Цифра для таблицы — но что она означает для человека, который завтра сядет проверять реальную работу?

Поэтому в этот раз без критериев и весов. Беру случайные живые документы, прохожу с ними полный путь пользователя в обеих системах — загрузка, ожидание, краткий отчёт, полный отчёт, работа с источниками — и записываю, что вижу на каждом шаге.

Turnitin в этом раунде не участвует — причины разбирал в прошлый раз: ограничения доступа для российских организаций плюс морфологический барьер на русскоязычных текстах ну и с ним стоимость эксперимента увеличилась бы вдвое... Так что сравниваю двух ярких отечественных разработчиков антиплагиата.

Шаг 1. Ищу подопытных

Правила простые. Захожу в Google Scholar, вбиваю базовые запросы по трём широким темам — биология, философия, физика. Ставлю сортировку по дате, скачиваю первые свежие работы, которые выпали. Никакого отбора «под результат».

Выдача Google Scholar по запросу «Биология» 
Выдача Google Scholar по запросу «Биология» 

Языков получилось три, и это удачно: русский — основной рынок, английский — проверка кросс-языкового поиска и как вишенка на торте – узбекский.

Итого в выборке: русская статья по онкологии (терапия рака лёгкого с мутацией BRAF), узбекская по электротехнике (fuzzy-логика в управлении распределительными сетями) и английская по философии (моральная ответственность в буддийской доктрине не-я) ?. Плюс четвёртая проверка — эксперимент со вставкой сгенерированного текста, о нём отдельно в конце.

Шаг 2. Загружаю

С загрузкой проблем нет ни там, ни там: обе системы принимают PDF, Word и, судя по спискам поддерживаемых форматов, даже презентации. Скачал файлы — русскую и английскую работы в PDF, узбекскую в DOCX, — загрузил, нажал кнопку проверки.

Загрузка работы в Антиплагиат
Загрузка работы в Антиплагиат
Загрузка в Руконтекст 
Загрузка в Руконтекст 

Момент с загрузкой

Руконтекст проверил русскую работу за 38 секунд — время отображается прямо в списке проверок.

Руконтекст: проверка заняла 38 секунд 
Руконтекст: проверка заняла 38 секунд 

Антиплагиат при запуске показывает ожидаемое время проверки. Фактически документ проверялся около пяти минут.

Антиплагиат: таймер до конца проверки 
Антиплагиат: таймер до конца проверки 

Шаг 3. Проверка на оригинальность: 88,68% против 70,72%

Проверка закончилась — смотрю краткие результаты в личных кабинетах.

Краткий отчёт Антиплагиата 
Краткий отчёт Антиплагиата 
Краткий отчёт Руконтекста 
Краткий отчёт Руконтекста 

У Антиплагиата — панель с круговыми диаграммами по категориям и три отдельные плашки: наличие ИИ-генерации, маскировка заимствований, детектор дубликатов. У Руконтекста — строка в списке проверок с итоговым процентом, детали открываются кнопкой.

И сразу главное расхождение всего теста: Антиплагиат оценил оригинальность работы в 88,68%, Руконтекст — в 70,72%. Восемнадцать пунктов на одном и том же файле.

Если бы я был автором этой статьи, я бы хотел понять, какая из цифр — моя. А если бы был студентом с дипломом на руках — выбор системы для предзащитной самопроверки стал бы вопросом сугубо практическим: 88% и 70% в протоколе выглядят по-разному.

Откуда 18 пунктов: считаем вместе с системами

Первое, что я сделал, — открыл детальные категории обеих проверок:

Категория (русская работа)

Антиплагиат

Руконтекст

Оригинальность

88,68%

70,72%

Совпадения

9,76%

5,35%

Цитирования

1,56%

0%

Библиография

категории нет

23,93%

Каждый столбец складывается ровно в 100%. Разница — в составе слагаемых: «оригинальность» в двух системах — не одна и та же величина.

Руконтекст размечает библиографию отдельной категорией — в этой работе она заняла 23,93% текста — и не включает её в оригинальность, категорию можно исключить из подсчёта. В Антиплагиате категории «библиография» нет: список литературы обсчитывается на общих основаниях, отдельного отключения для него в отчёте не предусмотрено — исключать можно только отдельные фрагменты.

Куда именно попадает библиография у Антиплагиата, если отдельной категории нет, — на этой работе не видно. Ответ обнаружится ниже, на узбекском документе, и он окажется важнее, чем я думал.

Шаг 4. Полный отчёт: два способа добраться до источника

Дальше — детальная информация о проверке. В Антиплагиате она открывается вкладкой «Полный отчёт», в Руконтексте — кнопкой «Просмотреть».

Полный отчёт Антиплагиата 
Полный отчёт Антиплагиата 
Полный отчёт Руконтекста 
Полный отчёт Руконтекста 

В обоих отчётах видно текст работы с подсветкой найденных фрагментов, список источников, разбивку по видам — заимствования, цитирования, библиография (у РК). Дальше начинаются различия в механике.

В Руконтексте фрагменты в тексте кликабельны: нажимаешь на подсвеченный участок — открывается источник и сам найденный текст, оттуда можно перейти по ссылке на источник. В Антиплагиате фрагменты в тексте не кликабельны, кликнуть можно на номер фрагмента в углу подсветки — тогда система подсветит соответствующий источник в правой колонке. То есть путь в АП идёт через список источников, путь в РК — прямо из текста.

Шаг 5. Проверяю источники руками

Кликаю по первому источнику в списке Антиплагиата — это самый крупный вклад в совпадения, 4,47%. Открывается страница закрытой платформы с формой входа: скачать документ или прочитать текст нельзя. Что именно совпало и в каком контексте — проверить не получается.

Первый источник Антиплагиата — вход только по логину 
Первый источник Антиплагиата — вход только по логину 

Для полноты картины: второй источник в том же списке открывается и скачивается без проблем. По моим наблюдениям, большинство источников Антиплагиата раскрываются — но часть остаётся закрытой, и по ним ознакомиться с текстом невозможно.

Перехожу по первым источникам Руконтекста — открывается страница источника с возможностью скачать текст. Дополнительно система указывает страницу, на которой находится совпавший фрагмент: у одного из источников это страница 117. Скачал журнал, открыл страницу 117 — совпавший текст там.

Источник из отчёта Руконтекста: журнал с полным текстом 
Источник из отчёта Руконтекста: журнал с полным текстом 

Номер страницы позволяет посмотреть совпадение в контексте публикации — о чём идёт речь вокруг этого фрагмента.

Ещё одна деталь механики: при переходе по внешней ссылке Антиплагиат показывает предупреждение о том, что не несёт ответственности за содержимое внешнего сайта. В Руконтексте промежуточного предупреждения нет.

Что лежит в источниках: статьи не о том

Возвращаюсь к списку источников Антиплагиата по русской работе. Напомню её тему: лечебная тактика при раке лёгкого с мутацией BRAF. Среди источников заимствований — «Псориатический артрит: стратегии для трудных случаев», «Макрофаги в коже: роль в физиологических процессах» и исследование препарата для терапии простатита.

Совпадения здесь — на уровне типовых формулировок научного текста: стандартные обороты описания методов и результатов встречаются в работах по любой медицинской теме. Каждое такое совпадение вносит свой вклад в процент, а решать, относится ли источник к делу, остаётся проверяющему.

«Подозрительный документ»: маскировка, которой не было

В кратком отчёте Антиплагиата по этой же работе стоит отметка «В документе обнаружена маскировка заимствований». Проваливаюсь в раздел «Подозрительный документ» — тип вставки указан как «разделение слов на части». Смотрю подсвеченные места, где система это обнаружила: подсвечены обычные пробелы между словами.

«Подозрительный документ» в Антиплагиате 
«Подозрительный документ» в Антиплагиате 

На итоговый процент эта отметка не повлияла. Сама по себе пометка о маскировке — утверждение о намеренной попытке обойти проверку.

Симметричный случай: Руконтекст и шапка статьи

Чтобы два раза не вставать — эпизод с другой стороны. В отчёте Руконтекста по той же русской работе как заимствование подсвечена шапка статьи: название, автор, институт.

Я ткнул в этот фрагмент, чтобы понять основание. Основание есть: статья опубликована, её выходные данные проиндексированы, и такой заголовок действительно существует в базе — с точки зрения алгоритма это обычное совпадение с источником. Дальше это вопрос обращения с отчётом: служебные фрагменты при проверке исключают вручную, система пересчитывает результат.

Остальные два раунда: анализ оригинальности на узбекском и английском

Теперь две оставшиеся работы. Сначала — итоговые цифры всех трёх проверок:

Работа

Тематика

Антиплагиат

Руконтекст

Разница

Русская (PDF)

Онкология: терапия рака лёгкого с мутацией BRAF

88,68%

70,72%

18 п.п.

Узбекская (DOCX)

Электротехника: fuzzy-логика в управлении сетями

86,7%

79,81%

6,9 п.п.

Английская (PDF)

Философия: буддийская этика

97,89%

88,33%

9,6 п.п.

Узбекская и английская работы в Антиплагиате 
Узбекская и английская работы в Антиплагиате 
Узбекская и английская работы в Руконтексте 
Узбекская и английская работы в Руконтексте 

Узбекская работа. На первый взгляд картина такая: Антиплагиат нашёл 13,3% совпадений и почти три десятка источников, Руконтекст — 0,95% совпадений плюс 19,23% в категории «библиография». Выглядит как большая разница в поиске.

Отчёт Антиплагиата по узбекской работе 
Отчёт Антиплагиата по узбекской работе 

Отчёт Руконтекста по узбекской работе 

А теперь открываю источники Антиплагиата по одному. Первый фрагмент — почти 5% совпадений — это список литературы. Второй — ещё около 2% — снова список литературы. Прохожу дальше: почти все 13,3% совпадений на этом документе — библиография, засчитанная как заимствование.

То есть обе системы нашли одно и то же — список литературы. Разница в том, куда они его записали: Руконтекст — в отдельную категорию, Антиплагиат — в общий процент совпадений.

Остаётся вопрос, что нашлось в самом тексте работы, если библиографию вынести за скобки. У Антиплагиата таких источников два — примерно по 0,7% каждый. У Руконтекста — четыре, их видно в отчёте отдельной строкой «заимствования». Индексные базы у систем разные, наборы найденных источников по одному документу отличаются регулярно — но история про «13,3% против 0,95%» на поверку оказалась историей не про поиск, а снова про подсчёт.

Английская работа. Антиплагиат: оригинальность 97,89%, три источника — и все три помечены как «переводные заимствования по коллекции Интернет в русском сегменте»: русскоязычная страница о буддийской этике и две русские юридические статьи — о злоупотреблении гражданскими правами и об общей теории права.

Отчёт Антиплагиата по английской работе 

Механика видна прямо в названиях коллекций: иностранный текст обрабатывается через перевод, поиск идёт по русскоязычной базе. Отсюда юридические статьи в источниках работы по философии буддизма.

Руконтекст на той же работе: 5,55% совпадений, источники англоязычные — тематические страницы Википедии, статьи с DOI, публикации научных архивов. 

Отчёт Руконтекста по английской работе 

Делать из одной работы выводы о границах обоих подходов не возьмусь. Перевод в принципе применим к любому языку — вопрос в том, какие источники в итоге попадают в отчёт. Поиск по языку оригинала на этой работе дал профильные источники — но проверял я его только на трёх языках, и как обе системы поведут себя, например, на казахском или китайском, этот тест не показывает.

Показывает ли антиплагиат ИИ: эксперимент с курсовой 2017 года

Финальный тест, и к нему — предыстория: методику я собирал дольше, чем проводил сам эксперимент.

Первая мысль была очевидной — вставить сгенерированный текст в одну из трёх работ выборки. От неё я отказался по двум причинам. Техническая: все три скачаны в PDF, врезать в них текст, не разломав документ, затруднительно. Но главная — другая. Эти статьи написали реальные люди, под работами стоят их имена. Публиковать скрины, где в их статье «обнаружен сгенерированный текст» после моих врезок, — сомнительная услуга авторам, которые к ИИ отношения не имеют. Репутационные эксперименты ставим не на людях.

Поэтому — машина времени. Мне нужен документ, в котором сгенерированного текста не может быть по определению. Выбрал 2017 год: архитектура, на которой стоят сегодняшние языковые модели, тогда только вышла в виде научной статьи, а слово «трансформеры» для нормальных людей всё ещё означало кино про роботов. Любой студенческий текст 2017 года написан человеком — других вариантов тогда не существовало.

Скачал случайную курсовую 2017 года из открытого доступа — Word-формат, оборотные средства предприятия, ничего особенного. То, что надо.

https://www.bibliofond.ru/download.aspx?id=893856

Дальше взял самую сильную модель Claude Fable 5, загрузил в неё файл курсовой целиком и поставил задачу: предложи, как вписать в эту работу сгенерированный текст. Нейронка разобрала документ и предложила три варианта врезок. 

Скриншот из диалога с Claude Fable 5
Скриншот из диалога с Claude Fable 5

Fable 5 шикарен и сам полностью незаметно вставил текст в документ после генерации. Все три я и использовал: сгенерированные фрагменты встали в текст, из этого получилась финальная пара файлов — kursovaya_DO, оригинал, и kursovaya_POSLE, с врезками. Обе версии ушли в обе системы. 

Контрольная точка: чистую курсовую обе системы узнали почти целиком — 0% оригинальности у Антиплагиата, 2,01% у Руконтекста. За девять лет в открытом доступе работу успели проиндексировать обе — а значит, прирост оригинальности после вставки будет эффектом вставленного текста.

Курсовая работа

Антиплагиат

Руконтекст

До вставки: оригинальность

0%

2,01%

После вставки: оригинальность

13,35%

18,34%

После вставки: ИИ-детекция

не обнаружена (0%)

≈11,58%

Загруженные курсовые с ИИ и без в Руконтексте 
Загруженные курсовые с ИИ и без в Руконтексте 
Загруженные курсовые с ИИ и без в Антиплагиате
Загруженные курсовые с ИИ и без в Антиплагиате

Разбираю, что произошло. В Антиплагиате оригинальность документа выросла с 0% до 13,35%, плашка ИИ-генерации показывает «не обнаружена». Вставленный сгенерированный текст система не нашла ни в одном источнике — что верно, он уникален, — и записала его в оригинальный. Никаких дополнительных отметок на документе не появилось.

В Руконтексте оригинальность тоже выросла — с 2,01% до 18,34%: для поиска заимствований сгенерированный текст точно так же нов. Но параллельно сработал детектор: плашка «≈11,58% текста, вероятно, сгенерировано ИИ» прямо в списке проверок, а в отчёте — пять фрагментов с указанием количества слов в каждом, суммарно 927 слов. Фрагменты подсвечены в тексте, каждый можно исключить из оценки, документ при этом получает отметку «подозрительный», которую можно снять переключателем.

Руконтекст: фрагменты, помеченные как сгенерированные 
Руконтекст: фрагменты, помеченные как сгенерированные 

Две детали формулировок. Руконтекст пишет «вероятно, сгенерировано» — стопроцентной гарантии детектор не даёт и это, кстати, правильно. Я разбирал во второй статье, любой ИИ-детектор балансирует между пропусками и ложными срабатываниями. Чувствительность настраивается — с её ростом растут и находки, и ложные срабатывания. Какая именно модель генерировала текст, система не определила.

Сколько мне это стоило

Калькуляция эксперимента. В Антиплагиате проверка одного документа стоит 690 руб, в тариф входит ИИ-детекция и лимит до 200 тысяч знаков. Пакет из трёх проверок под мои статьи обошёлся около 2000 руб., четвёртую — под эксперимент с курсовой — докупал отдельно за те же 690 руб. Срок действия проверок на витрине тарифов не указан: он виден уже после покупки, при наведении на баланс — у моих это конец января 2027-го, то есть около полугода.

В Руконтексте тариф собирается конфигуратором: выбираешь тип работ (я взял вариант для дипломов и диссертаций), объём в знаках и количество проверок. Для сопоставимости взял те же 200 тысяч знаков, вышло 5 проверок на 24 часа за 1600 руб.

Итого: около 2000 ₽ за пакет Антиплагиата, 690 ₽ за докупку, 1600 ₽ за тариф Руконтекста — примерно 4300 ₽ кровных за весь тест. Хотел оставить здесь кошелёк для благодарностей, но на Хабре собирать донаты нельзя. Так что если материал сэкономил вам такой же эксперимент — просто напишите мне в личку)

Что я увезу с этого полигона

Процент оригинальности из двух разных систем — несопоставимые величины. Одна и та же работа получила 88,68% и 70,72% в первую очередь не из-за разницы в качестве поиска, а из-за разных правил подсчёта. Библиографию учитывают обе системы. Руконтекст размечает её отдельной категорией: она снижает оригинальность, при этом категория видна в отчёте, и её можно исключить из подсчёта. В Антиплагиате отдельной категории для библиографии нет, и в двух проверках она попала в разные категории: на русской работе список литературы занимает около четверти текста, а совпадений отмечено 9,76% — то есть большая его часть вошла в оригинальность; на узбекской тот же список литературы вошёл в совпадения. Отсюда и разрыв 13,3% против 0,95% на одном документе: значительная часть этой разницы приходится на список литературы. 

Содержательные различия видны в отчётах, и каждое можно проверить по скринам выше: доходит ли проверяющий до первоисточника по каждой находке, что именно попадает в источники, что можно сделать со спорным срабатыванием. Ответы на эти три вопроса у систем разные — и именно они, а не итоговый процент, описывают, как пройдёт реальная проверка.

И отдельная строка — про ИИ. Сгенерированный текст уникален, поэтому классический поиск заимствований засчитывает его в оригинальность. В моём эксперименте вставка подняла процент в обеих системах,  одна пометила ≈11,58% текста как вероятно сгенерированный, вторая генерацию не обнаружила. Высокий процент оригинальности сегодня — это ещё и вопрос, чем он набран.

Кому какая механика важнее — зависит от задачи. Для самопроверки студента решает итоговая цифра. Для нормоконтроля и диссертационной экспертизы решает возможность верифицировать каждую находку — потому что итоговую цифру там всё равно пересчитывают после разбора отчёта.

Эксперимент с курсовой оставил открытым главный вопрос: сколько сгенерированного текста детекторы пропускают? Одна система из двух не увидела вставку вовсе. В следующий раз возьму ту же курсовую с теми же врезками — и прогоню через все ИИ-детекторы, до которых дотянусь. Посмотрим на результаты. Какие системы взять на проверку?

Комментарии (0)