Бенчмарк качества англо-русского перевода для ведущих западных и китайских LLM
Бенчмарк качества англо-русского перевода для ведущих западных и китайских LLM

TL;DR: лучший англо-русский художественный перевод сегодня дают Gemini 3.8 Flash (91 из 100) и GPT-6 Astra (90). Лучшая из китайских моделей, GLM 5.3, набрала 86, как GPT-5.6 Sol, а DeepSeek V4.1 Flash и V4 Pro — по 79, вровень с Claude Opus 5.5. Что очень круто. Так что их можно использовать для работы, если достаточно хорошего качества, а не максимального. С другой стороны Gemini 3.8 Flash очень дешева, так что в экономии не вижу смысла. Подробности — в рейтинге.

Месяц назад я сравнивал здесь Opus 5, Sol 5.6 и Gemini (Flash и Pro) в художественном переводе и редактуре. Метод был таков: одна модель переводила главу, а заведомо крутая LLM (Sol или Opus) её редактировала. Мерой качества служило число правок модели-редактора. Чем меньше правок — тем лучше перевод. Метод оказался вполне рабочим. Но по итогу у меня накопились претензии к нему. Он не был достаточно чётким, пользователи в комментариях писали, что нужен нормальный бенчмарк. Я его сделал, он встроен в конвейер BookTrans. Теперь бенчмарк легко воспроизводим.

Почему счёт правок перестал устраивать

Число правок редактора кажется объективной мерой, это ведь просто число, с которым легко работать. Но у этого метода есть куча недостатков.

Вкусовщина судьи. Sol правит вдвое больше абзацев, чем Opus, но это «на вкус и цвет товарищей нет» вкус, а не смысл. Сравнивать можно было переводы только если у них один судья. Это неудобно.

Счёт льстит осторожному. Редактор по соглашениям конвейера не видит оригинала. Поэтому гладкий перевод, который выбросил метафору и упростил предложение, получает меньше правок, чем смелый и точный.

Без ручного чтения числа ничего не значат. Всякий раз приходилось читать четыре перевода рядом с оригиналом, и главное находило чтение.

Бенчмарк должен был убрать эти и другие изъяны сохранив то, что счёт правок делает хорошо: измерять качество перевода в реальном пайплайне, с его промптами и требуемыми форматами ответа.

Как устроен бенчмарк

Идея взята из индустриального стандарта оценки переводов MQM, где качество описывают разметкой ошибок по категориям, а также из практики школьных экзаменов: у проверяющего есть ключ с ответами. LLM-судья получает список контрольных точек, где в тексте поставлена ловушка и ответы, и по каждой отвечает «пройдена» или «провалена». Он отвечает в специальном формализованном формате, далее итоговый балл считает программа.

Текст. За основу взят рассказ О. Генри «The Skylight Room» 1906 года, права на него давно истекли. Рассказ основательно переделан: действие перенесено в наши дни, устаревшие обороты заменены, имена и название другие, финал переписан. Сюжет сохранён, это цельная история на 66 абзацев и четверостишие в эпиграфе, около 3100 слов, как раз один стандартный кусок для конвейера. В текст посажено сто ловушек по двенадцати областям, каждая стоит одно очко, так что итог читается как процент.

Область

Очков

Что проверяется

Точность смысла

15

Ложные друзья, значение многозначного слова по контексту, цифры, кто кому что продал

Полнота

9

Выброшенные предложения, придаточные, эпитеты в перечислениях

Отсутствие калек

11

«Ты в порядке?», «это не о том…», «имеет смысл», избыток притяжательных

Словарь и идиомы

9

Редкие книжные слова, астрономические и медицинские термины, идиомы по смыслу

Образность и стиль

11

Метафоры сохранены, регистры речи персонажей различимы

Стихи и игра слов

8

Четверостишие размером и рифмой, три каламбура

Согласованность

8

Повторяющаяся реплика, имена и термин одинаковы по всему тексту; три значения слова fair разведены

Пол и обращения

8

Пол врача, раскрытый через шесть абзацев после первой реплики; звезда с мужским именем; ты/вы постоянны

Имена и клички

7

Транслитерация по звучанию: Cholmondeley, Siobhan, Leigh, Beauchamp, Worcester; клички по смыслу

Норма языка

6

Оформление диалога, многоточия, пересчёт футов и миль, курсив

Сноски

4

Есть к мифологии и реалиям, нет к очевидному

Регистр и откровенность

4

Ругательства не смягчены, телесные детали не выброшены

Несколько ловушек в подробностях, чтобы было понятно, о чём речь

Врач скорой помощи шесть абзацев подряд упоминается без указания пола, а потом оказывается женщиной. В английском это ничего не стоит — в русском переводчик обязан выбрать род глаголов заранее, и модель, не дочитавшая текст до конца, пишет «сказал доктор Морган». Это три точки из ста, и первую из них проваливает больше половины прогонов, включая флагманов.

Слово fair встречается трижды: a fair shot в тире (меткий, засчитанный выстрел), the street fair (уличная ярмарка) и a fair complexion (светлая кожа). «Честный выстрел» пишут три модели из четырёх.

Мисс Вустер говорит «Well, really!» пять раз, и это её характеристика. Переводчик, который пять раз переводит по-разному, эту характеристику стирает.

Фамилия Beauchamp по-английски читается «Бичем», а модели в двух случаях из пяти пишут «Бошан», по-французски. Cholmondeley — это «Чамли», и примерно треть переводов даёт «Чолмонделей» по буквам. Зато ирландскую Siobhan почти все знают как «Шивон».

Ключ. К тексту прилагаются правильные ответы для судьи: сто строк вида «точка, область, адрес абзаца, что считается верным». Ключ написан по-английски и не зависит от языка перевода, поэтому тот же бенчмарк годится для тестирования перевода с английского на любой целевой язык, примеры для русского судья переносит на другой язык по смыслу. Переводчик ключа не видит.

Текст и ключ лежат в пакете сжатыми. Репозиторий публичный, а открытый ключ ответов рано или поздно попал бы в обучающую выборку тех моделей, которые занимаются переводом. Ни документация, ни тесты не цитируют текст для перевода, используемый в бенчмарке.

Штрафы. Сверх ключа судья отмечает отсебятину (факт, действие или оценка, которых нет в оригинале) и непереведённые фрагменты, а код без участия судьи считает потерянные абзацы, разошедшуюся разметку, буквы чужой письменности (иероглифы в русском тексте) и лишние попытки. Про попытки отдельно: когда модель отвечает не по форме, конвейер переспрашивает с подсказкой, до пяти раз. Без штрафа модель, попавшая в формат с третьего захода, получала бы тот же балл, что и попавшая с первого, хотя стоит втрое дороже по времени и деньгам.

Счёт. Балл области равен числу пройденных точек, итог равен сумме областей минус штрафы, нормированный к ста. Никакой «оценки от 0 до 100» судья не выставляет, и это принципиально: свободная оценка плавает между запусками на десятки баллов, а ответ «да/нет» по конкретному требованию воспроизводится. Тот же перевод, отданный судье второй раз, дал 82 и 83 балла с расхождением в одной точке из ста.

Три прогона. Один перевод модели не ранжирует. У средних моделей два перевода одного текста расходятся на 10–20 баллов, у сильных на 3–7. Поэтому по умолчанию текст переводится и судится три раза, прогоны идут одновременно, в отчёт попадает медиана и разброс.

Судья. По умолчанию используется Claude Opus 5.5 на среднем усилии, запасной Sol 5.6. Если установить судью из одной семьи с переводчиком, то бенчмарк выдаст ошибку: к своим калькам модель слепа, и поэтому модели Anthropic судит Sol. Sonnet 5 в роли судьи я тоже проверил: на одних и тех же переводах он расходится с Opus в 4–7 точках из ста, причём систематически прощает смягчённую брань, и не дешевле. Поэтому выбран Opus.

Как штрафы перевернули рейтинг, и почему их пришлось калибровать

Первая версия ключа штрафовала мелкую отсебятину на три очка, при том что ловушка стоила одно. На codex-моделях это дало контринтуитивный результат: дешёвая Luna обошла Terra и Sol. Разбор вердиктов показал, что по ловушкам порядок был обратный: Sol прошёл 90 точек из ста, Terra 89, Luna 85. Luna провалила пол врача во всех трёх точках, перевела «too lovely for anything» буквально и спутала fair shot с «честным». Но у Luna не было ни одного штрафа, а у Sol три «отсебятины» на девять очков: «богатый, румяный» за одно flush, «из десяти мишеней» вместо «из десяти».

Поэтому пришлось сделать в следующей версии ключа дешевле штрафы за мелкую отсебятину (1 очко, крупная 3). После этого codex-модели встали в ожидаемый порядок с разрывами 4–8 баллов.

Как запустить

Бенчмарк входит в BookTrans начиная с версии 1.10.77. Книга не нужна, текст в пакете. Нужен только язык перевода и переводчик:

uv tool install booktrans        # или: pipx install booktrans
booktrans --bench --to ru --translator codex:gpt-6-astra:medium

Модель называется так же, как в любом другом ключе конвейера: агент, модель, усилие через двоеточие. Западные модели идут через их родные CLI (claude, codex, agy), китайские через любую точку протокола OpenAI. Я брал роутер byNara, у которого есть все интересующие меня китайские модели и бесплатный план, и подписку OpenCode Go с Kimi, MiniMax и Qwen; адрес точки и ключ кладутся в переменные окружения или в файлы папки настроек:

export OPENAI_BASE_URL=https://router.bynara.id/v1
export OPENAI_API_KEY=sk-…
booktrans --bench --to ru --translator openai:deepseek-v4.1-flash:medium

Через несколько минут в текущей папке появляется рабочая папка benchmark-en-ru-<провайдер-модель-усилие>-<дата>.work с тремя переводами внутри (их стоит прочитать глазами) и отчёт рядом. Первая строка отчёта — медиана, дальше таблица прогонов, области, проваленные точки с причинами и цитатами из перевода, штрафы, стоимость, время и готовая строка для таблицы результатов. Судью можно сменить ключом --judge, число прогонов ключом --bench-runs, свой набор текст+ключ подставляется через --bench ПАПКА. Подробности в docs/bench/README.md.

# Результаты

Все модели переводили на среднем усилии, кроме Gemini 3.1 Pro: у неё среднего нет, только высокое. Балл — медиана трёх прогонов, в скобках разброс. Время и цена указаны за один прогон, то есть за 3100 слов. Цену показывает только Claude Code; codex и agy работают по подписке, китайские модели шли через бесплатный план роутера byNara, а Kimi — через подписку OpenCode Go.

Модель

Балл

Разброс

Точность /15

Кальки /11

Стихи /8

Пол /8

Время, мин

Цена, $

Gemini 3.8 Flash

91

82–91

15

10

8

8

2

подписка

GPT-6 Astra

90

88–92

14

8

6

8

4

подписка

GPT-5.6 Sol

86

85–89

12

9

6

7

4,5

подписка

GLM 5.3

86

78–88

14

11

7

7

17

роутер

Gemini 3.1 Pro (высокое усилие)

83

81–85

12

9

7

7

3,5

подписка

Muse Spark 1.3

83

82–83

13

9

6

6

4

роутер

Gemini 3.7 Flash

81

79–86

15

9

6

7

2,5

подписка

DeepSeek V4.1 Flash

79

71–85

13

7

5

7

21

роутер

DeepSeek V4 Pro

79

75–79

13

2

4

6

17

роутер

GPT-5.6 Terra

78

76–81

12

6

4

7

2,5

подписка

Claude Opus 5

78

71–81

11

6

4

7

4,5

0,51

Claude Opus 5.5

78

76–81

9

9

6

5

2,5

0,34

Claude Fable 5.1

78

77–82

9

10

6

5

6,5

1,25

Kimi K3

78

41–79

12

8

6

4

6–34

подписка

GPT-5.6 Luna

72

72–74

12

6

4

5

2,5

подписка

Claude Sonnet 5

67

62–77

9

6

4

4

4,5

0,28

Claude Haiku 4.5

55

52–56

14

4

6

5

4

0,09

Области в таблице показаны у медианного прогона; полная разбивка по двенадцати областям лежит в репозитории.

Судей было трое. Большинство моделей судил Opus 5.5, модели Anthropic — Sol 5.6: судья своей семьи вычёркивается. GLM 5.3, Kimi K3 и третий прогон Haiku судил Opus 4.6. Это вынужденная мера: на прогон уходит около 30 тыс. токенов судьи, и лимиты подписок на Opus 5.5 и Sol закончились раньше, чем очередь моделей. На переводах Astra и DeepSeek, заново осуждённых для проверки, Opus 4.6 дал медианы 91 и 80 против 90 и 79 у Opus 5.5, но по отдельным точкам он мягче, поэтому строки GLM и Kimi стоит считать предварительными. Один и тот же судья на одном переводе даёт расхождение в один балл, но между судьями разных семей сдвиг в два-три балла я исключить не могу. Поэтому соседние места с разницей меньше разброса стоит считать одним местом.

Рейтинг моделей в бенчмарке перевода
Рейтинг моделей в бенчмарке перевода

Что проваливают все

Сто ловушек дают не только рейтинг, но и портрет общих слабостей. Вот точки, которые проваливают почти все модели, по 44 прогонам пятнадцати моделей:

Ловушка

Провалов

«Jesus, Leigh, you look like hell» — грубость «like hell» стёрта до «ужасно выглядишь» или «на тебе лица нет»

44 из 44

эхо корня crumpled / crumples («сжалась» и «заломы» вместо одного корня)

43

«Are you okay?» → «Ты в порядке?»

37

многоточие тремя точками ASCII вместо знака «…»

37

«Shit» у героини, которая никогда не ругалась, смягчено до «Чёрт»

36

«I look green» переведено как цвет, а не как неопытность

34

«a fair shot» → «честный выстрел»

33

«forty-five, fat, flush and foolish» без ритма и аллитерации

31

каламбур «higher and lower» (этажом выше, ценой ниже) сведён к «повыше и подешевле»

32

«Gamma? I’d have given it an alpha» — греческая буква не читается как оценка

30

сделка с агентством перевёрнута: кто кого купил

25

футы, дюймы и мили не пересчитаны

27

пол врача, раскрытый через шесть абзацев, угадан как мужской

25

Список поучительный. Половина строк это привычки LLM: смягчать брань, ставить три точки, калькировать «ты в порядке». Их можно закрыть промтом. Другая половина это проверка понимания: перевёрнутая сделка, «честный выстрел», зелёный цвет вместо неопытности и мужской род врача отличают модели, которые дочитали текст, от тех, которые переводили абзац за абзацем.

Игра слов не даётся никому. «Higher and lower» в оригинале это одновременно этаж выше и цена ниже, и русский эквивалент с обоими смыслами нашёлся только в 12 прогонах из 44. Каламбур с гаммой и альфой держится на том, что в американской школе оценки ставят буквами; по-русски «поставил бы ей альфу» не читается, и честнее было бы «пятёрку», как сделали в 14 прогонах из 44.

Выводы

Лучший перевод сегодня дают Gemini 3.8 Flash и GPT-6 Astra. Между ними один балл, и это меньше разброса. Astra ровнее: её три прогона легли в 88–92, у Flash один прогон просел до 82. Flash зато вдвое быстрее и при этом модель лёгкого класса, а не флагман. Google можно только похвалить: его дешёвая модель переводит на русский лучше всех.

Claude 5 несколько разочаровал. Opus 5, Opus 5.5 и Fable 5.1 набрали одинаково, 78: Opus 5.5 не дал никакого прироста по сравнению с Opus 5. У Opus 5.5 и Fable провалы одни и те же: точность смысла 9 из 15 и пол персонажей 5 из 8. При этом по калькам и образности они среди лучших, 9–10 из 11. Claude пишет гладко, но пересказывает, а бенчмарк это ловит. Больше всего разочаровал Fable: это суперфлагман Anthropic, он стоит вчетверо дороже Opus 5.5 и ничего за эти деньги не добавляет. Если сравнивать суперфлагманов, GPT-6 Astra переводит заметно лучше: 90 против 78. Если уж брать Claude, я бы брал Opus 5.5: балл тот же, что у Opus 5, но он дешевле и быстрее.

Теперь про деньги. DeepSeek V4.1 Flash и V4 Pro встали вровень с Opus и Terra. Значит, на китайской модели можно получить перевод уровня Claude Opus, но не уровня Astra или Gemini Flash. V4.1 Flash нестабилен: три перевода одного текста легли от 71 до 85, и на книге из тридцати кусков это значит, что часть глав выйдет заметно хуже остальных. V4 Pro ровнее, но калькирует: 2 очка из 11 против 9–10 у лидеров. «Ты в порядке?», «Я в порядке», «Это не о том, как работают колодцы… Это о том, на что ты смотришь». И оба думают долго: 45 тыс. токенов вывода на кусок у Flash против 17 тыс. у Opus 5.5, и 17–21 минута на кусок через роутер против двух-четырёх у западных моделей.

Выше всех китайцев поднялась GLM 5.3: 86, вровень с Sol. Кальки она не пропустила ни одной, 11 из 11, точность смысла 14 из 15. Но каждый из трёх прогонов попал в формат ответа только со второй попытки, а один прогон упал до 78. Kimi K3 по медиане на уровне Opus, 78, зато самая нестабильная модель в таблице: в двух прогонах из трёх она уложилась в формат только с четвёртой попытки, а в одном из них вдобавок оставила отсебятину в двенадцати местах и получила 41.

Для чистового перевода сэкономить на китайцах пока не выйдет: лучшие результаты у западных моделей, а GLM 5.3, ближе всех к ним подобравшаяся, нестабильна от прогона к прогону. Для черновика, который потом всё равно пройдёт через сильного редактора, DeepSeek годится и обходится дешевле Opus. А если нужна экономия без потери качества, её даёт Gemini 3.8 Flash.

Остальные китайские модели — Qwen, MiMo, MiniMax, Hy4, LongCat — сейчас проходят тест, их результаты я добавлю в таблицу в репозитории и в комментарии.

Полные материалы

Таблица результатов с разбивкой по областям ведётся в репозитории: docs/bench/results-en-ru.md.

Комментарии (1)


  1. ikovyrshin
    23.09.2026 13:21

    На одном из проектов стояла задача перевода новостных статей с английского на русский, у нас не было анализа качества перевода, но даже чисто интуитивно аналитики подтвердили что лучшего качества удалось достичь на модели Gemini 3.8 Flash. Да и по цене за входящие/исходящие токены она выигрывает у конкурентов.