GPT-OSS 120B и другие дешёвые модели судят доказательства не хуже Claude Opus 4.7
Проверка математических доказательств, написанных естественным языком, постоянная статья расходов при оценке систем математического рассуждения: для этого обычно нужны дорогие топовые LLM-судьи. Авторы работы задались вопросом, могут ли дешёвые модели с открытыми весами судить не хуже.
На выборке из 200 примеров валидационной части бенчмарка IMO-GradingBench три дешёвые модели, GPT-OSS 120B, DeepSeek-V4 Flash и Gemma-4 31B, выносили решение (засчитывать доказательство или нет), сверяясь с эталонным доказательством и критериями оценки человека. Их согласие с решениями людей оказалось статистически неотличимо от согласия топовых судей Claude Opus 4.7 и Gemini 3.1 Pro, при этом дешёвые модели обходятся до 100 раз дешевле.
Авторы ожидали, что голосование большинством среди трёх дешёвых моделей даст лучший бюджетный результат. Это не подтвердилось: большинство голосов сравнялось с топовыми судьями, но не превзошло лучшую из трёх моделей по отдельности.
Затем анализ расширили на весь бенчмарк IMO-GradingBench (1000 примеров) и проверили разные правила консенсуса между тремя дешёвыми моделями. Лучший результат, по точности согласия с человеком (accuracy) и по точности (precision), дало требование единогласия: доказательство засчитывается, только если все три модели согласны. Это же правило на четырёх повторных прогонах показало наименьший разброс результатов между прогонами.
Главный вывод авторов: дешёвые модели-судьи конкурентоспособны с топовыми при затратах на один-два порядка ниже. В качестве готового к внедрению правила по умолчанию они рекомендуют единогласие всех трёх моделей, с оговоркой, что само правило было выявлено постфактум, по результатам экспериментов, и нуждается в независимой проверке на других данных.
Ключевые факты
- Три дешёвые открытые модели, GPT-OSS 120B, DeepSeek-V4 Flash, Gemma-4 31B, на 200 примерах IMO-GradingBench согласились с решениями человека статистически неотличимо от топовых судей Claude Opus 4.7 и Gemini 3.1 Pro
- Дешёвые модели обходятся до 100 раз дешевле топовых на этой выборке
- Голосование большинством среди трёх моделей не улучшило результат: оно сравнялось с топовыми судьями, но не превзошло лучшую из трёх моделей по отдельности
- На полном бенчмарке из 1000 примеров лучшую точность согласия и точность (precision), а также наименьший разброс на четырёх повторных прогонах дало правило единогласия, доказательство засчитывается, только если согласны все три модели
- Авторы рекомендуют единогласие как правило по умолчанию, но оговаривают: правило выявлено постфактум и требует независимой проверки
Почему это важно
Проверка доказательств моделью-судьёй, обязательный и дорогой шаг при оценке любой системы математического рассуждения, а топовые LLM-судьи (Claude Opus 4.7, Gemini 3.1 Pro) стоят дорого при масштабной оценке. Работа показывает, что для этой конкретной задачи дешёвые открытые модели дают такое же согласие с решениями человека, что и топовые, при затратах на один-два порядка ниже.
Кому это важно
Исследователям и лабораториям, которые строят и прогоняют бенчмарки математического рассуждения и вынуждены раз за разом оплачивать проверку тысяч доказательств; разработчикам инфраструктуры оценки (evaluation pipelines), которым нужен дешёвый, но надёжный автоматический судья вместо ручной проверки или дорогого топового судьи.
Как это применить
Вместо одного дорогого судьи авторы предлагают конкретный готовый рецепт: прогнать доказательство через три дешёвые модели (GPT-OSS 120B, DeepSeek-V4 Flash, Gemma-4 31B) и засчитывать его, только если все три модели независимо согласны, что оно верно. Это правило единогласия на полном бенчмарке из 1000 примеров дало лучшую точность согласия с человеком и наименьший разброс между четырьмя повторными прогонами.
Можно ли доверять
Источник, препринт на arXiv, конкретные цифры точности и согласия в открытом тексте (аннотации) не приведены, только формулировка «статистически неотличимо» и относительные множители экономии. Само правило единогласия авторы называют найденным постфактум (по результатам уже проведённых экспериментов), а не заранее заданным, и прямо пишут, что оно нуждается в независимой проверке на других данных.
Риски и подводные камни
Правило, подобранное постфактум под конкретный бенчмарк IMO-GradingBench, может не воспроизвестись на других наборах математических доказательств или других моделях-судьях. В открытых материалах нет ни абсолютных цифр стоимости, ни точных процентов согласия ни для одной модели, судить о размере эффекта можно только по относительным множителям экономии. Наконец, единогласие трёх моделей по конструкции консервативнее одиночного судьи и может занижать долю засчитанных верных доказательств там, где хотя бы одна из трёх дешёвых моделей ошибается систематически.