С развитием нейросетей неизбежно пришли две вещи: их интеграция во всё, куда можно (например, в телефон, робот-пылесос и холодильник), и связанный с этим вопрос контроля качества.

Рано или поздно возникнет логичный вопрос: а как вообще оценивать работу ИИ за пределами очень обобщенного вопроса «вот тут ответ нейронки неверный, а вот там она долго думает над ответом»? Нейросети, как показала практика, например, социальной сети Илона Маска, нельзя пускать к людям без тщательной проверки, иначе всё это превратится для пользователей в балаган из смешных ответов, а для продакшн-команды в катастрофу. И что очевидно, способов это не допустить достаточно, только вот всё с нюансами.

И в этом материале предлагаю посмотреть на совершенно новый метод оценки ИИ, который представили эксперты Сё Кавано, Цзэхан Ричард Ли и Пол А. Паркер в научной работе под названием «Prediction-Powered Smoothing and Validation for Disaggregated AI Evaluation».. Разберем, как устроен этот подход под капотом, как он «заимствует силу» у смежных задач и почему именно он становится главным фундаментом для безопасных и экономически оправданных релизов современных нейросетей.

Сначала посмотрим, какие методы оценки существуют и что с ними не так.

Какие методы оценки существуют и в чем их проблема

Если коротко, то вот такая картина получается:

Проверка по жестким правилам. Ее суть заключается в том, что мы сравниваем ответ модели с заранее заготовленным эталоном по жестким правилам. Тем самым «эталоном» зачастую выступает… просто правильный ответ, точное совпадение слов, метрик или кода.

Ручной аудит живого человека. Развитие идеи проверки по жестким правилам. Главное в данном методе — люди с высочайшим уровнем усидчивости и внимательности. Нет эталона, но есть человеческий фактор. Берем ответ ИИ, вычитываем его на соответствие контексту и вручную выставляем оценки.

LLM-as-a-Judge или по-русски «автосудья». Исходя из названия — нейросеть проверяет другую нейросеть. На практике выглядит так: ответ одной LLM отдаем на проверку по заданному промпту LLM получше или мощнее (ответ DeepSeek проверяет ChatGPT 4-й версии, для наглядности).

И снова, привет нюансы: одной средней цифры часто недостаточно. Условный ChatGPT может показывать 95% точности в целом, но заметно хуже работать на редких типах задач. А если разбить результаты на десятки или сотни небольших групп, то в некоторых из них может оказаться слишком мало примеров, чтобы полученная цифра была надёжной.

Источник

Проблемы у каждого метода оценки свои. У метода по жестким правилам проверка очень легко ломается о такие банальные вещи как слова синонимы и смысл текста как таковой. Если модель написала идеальный ответ другими словами или решила задачу альтернативным кодом, алгоритм поставит 0 баллов, что мягко говоря неверно. Для живых диалогов и сложных рассуждений этот метод не годится. Да, можно перейти на проверку живым человеком, но там  история про запредельно дорого и очень медленно. Проверить руками сотни тысяч диалогов из продакшена невозможно физически — бюджет на такие работы быстро превысит стоимость разработки самой модели.

Отдать проверку на растерзание другой LLM тоже не всегда вариант - так или иначе назначенный судья может откровенно фантазировать, завышая оценки собственным ответам или длинным текстам. Из-за этих скрытых сдвигов метрикам нельзя слепо доверять.

А теперь к методу, который кажется готов перевернуть игру.

Что такое Prediction-Powered Smoothing 

Prediction-Powered Smoothing (он же PP-S) — говоря языком терминов, это статистический метод, который позволяет узнать реальную точность нейросети в десятках узких тем и задач, когда бюджет на ручную проверку людьми сильно ограничен.

Этот метод был представлен не так давно в исследовательской группой статистиков, куда входили: Сё Кавано, Цзэхан Ричард Ли и Пол А. Паркер в научной работе «Prediction-Powered Smoothing and Validation for Disaggregated AI Evaluation».

Основа метода лежит в не указанном мной выше способе под названием Prediction-Powered Inference. По своей сути он представляет собой смесь способов оценки живым человеком и ИИ. При разработке PP-S учитывали главную проблему — PP-I ломается, когда нужно оценивать узкие категории, те, где мало данных для исследования.

Источник

Главная же задача метода очень проста — преодолеть ключевой тупик оценки моделей: дилемму между разорительной ручной проверкой и недостоверным автосудейством.

Почему прямо сейчас все следят за его развитием?Есть нюансы, но насколько ли критичные

PP-S умеет оценивать в тех местах, где почти нет данных. В сравнении с ним обычные математические формулы сходят с ума, если живой эксперт проверил всего 1–2 примера в узкой теме (например, в редком диалекте или сложном вопросе по налогам). Оценку начинает откровенно штормить «все ужасно» до «все идеально». PP-S страхует такие ситуации и удерживает показатели в разумных границах.

Метод умеет заимствовать. Тут проще показать наглядно. Например, вы хотели бы проверить, как ИИ справляется с проверкой правильности написанного кода на языке программирования RUST, но для ручной проверки не хватает заранее подготовленных правильных ответов. PP-S при выполнении проверки сверится с тем, как нейросеть выполняет ту же задачу, но с другим языком программирования, и подгонит логику ответов под ваш запрос. Вы проверяете LLM на то как она справляется с код ревью программ на RUST и вам не хватает объективных данных. PP-S посмотрит в сторону как модель-судья ошибается в близких темах, например у кода на C++» и автоматически исправит оценку для Rust.

Источник

PP-S дает гораздо более адекватный разбег по оценке. Вместо одной голой цифры метод позволяет получить оценку и своеобразный запас неопределенности, который в экспериментах оказался заметно уже у ряда прямых оценок. Принять окончательное решение по оценке с такими данными человеку сильно проще.

Метод умеет проверять сам себя. Авторы встроили в алгоритм механизм внутренней самопроверки (DB-CV). Он выбирает самую формулу расчета без необходимости нанимать отдельную команду людей, что будут делать это вручную.

Получается: предсказания ИИ + человеческая проверка → сравнение → статистическое сглаживание = более надежная оценка качества по группам.

Что это дает и как выглядит на практике? Наглядно: для первичной оценки будет взят результат работы ИИ-судьи. Из результатов отбирается процентов 10-30 и проводим ручной аудит человеком, разделяя результаты на субъективные (оценки от LLM) и объективные (результаты аудита живым человеком). Далее сопоставляем результаты путем математического выпрямителя (разницу между эталонной оценкой эксперта и предсказанием модели на контрольной выборке) и из этого вычленяем вектор систематического искажения — те самые «шумы», где ИИ ошибается на фоне ручной проверки. А уже дальше PP-S стягивает эти искажения к общему знаменателю и «сглаживает» ошибки на основании заимствования из смежных запросов. На выходе мы получаем относительно точную цифру в оценке.

Другими словами, метод не пытается улучшить саму нейросеть, как это делает, например, ручная проверка человеком. PPS — это больше история про ответ на вопрос, насколько хорошо в принципе работает ИИ в тех категориях, где мало исходных данных для проверки.

Пытается ответить на вопрос: «Насколько хорошо модель работает в каждой конкретной категории, если прямых человеческих проверок мало?»

Есть нюансы, но насколько ли критичные

У PP-S есть два довольно сомнительных момента: он требует тщательно выстроенного дерева данных и при чрезмерном сглаживании рискует замаскировать уникальные проблемы для конкретной модели ИИ.

Но тут стоит понимать: метод в целом не про полную автоматизацию, человек все еще нужен, пусть и в меньшем объеме. Без качественной контрольной выборки живых экспертов весь математический контур (та самая живая «отбраковка», другими словами) просто не запустится, так как ему будет не от чего калибровать ошибки автосудьи.

Все-таки нужно учитывать, что это не волшебная кнопка, которая сделает ваш ИИ-агент круче, чем у других, а точный инженерный инструмент: он требует грамотной структуры данных и понимания математики. А никаким инструментом без знания «базы» пользоваться не получится при всем желании.

Комментарии (0)