Last Translation Benchmark: тест, который ломает системы машинного перевода

Vilém Zouhar с соавторами представили Last Translation Benchmark (LTB), бенчмарк для машинного перевода, который должен решить проблему насыщения существующих тестов. По мере роста моделей стандартные наборы для оценки перевода перестают показывать разницу между системами: модели уже справляются с большинством привычных примеров. Авторы также указывают на два других изъяна текущей практики оценки: автоматические метрики перевода ненадёжны, уязвимы к «накрутке» под метрику (reward-hacking) и не дают действенной обратной связи, а эталонная оценка людьми, хоть и считается золотым стандартом, часто страдает от невоспроизводимости, необъективности и плохо масштабируется на большие объёмы.
LTB, это набор примеров текста, изображений, аудио и видео, которые написаны людьми и прошли рецензирование, а не сгенерированы автоматически. Каждый пример подобран так, чтобы вскрывать конкретные слабые места ведущих систем машинного перевода. Ключевое новшество, не только сами примеры, а новый способ их проверки: к каждому примеру прилагаются вручную составленные правила верификации, которые описывают, как именно выглядит провал перевода именно на этом примере. Это должно сделать оценку по бенчмарку воспроизводимой и практически применимой, в отличие от общих баллов автоматических метрик.
LTB задуман как живой, постоянно пополняемый датасет: авторы принимают новые примеры от сообщества на постоянной основе. Текущий релиз, LTBv1, включает все вклады, принятые до 1 сентября 2026 года; последующие версии будут выходить по мере накопления новых данных, но точный график будущих релизов в материале не указан. Число примеров в LTBv1 или в датасете в целом, а также результаты каких-либо конкретных моделей на бенчмарке в тексте не приводятся.
Ключевые факты
- Last Translation Benchmark (LTB), новый бенчмарк для машинного перевода в ответ на насыщение стандартных тестов
- Примеры (текст, изображения, аудио, видео) написаны людьми и прошли рецензирование, а не сгенерированы автоматически
- К каждому примеру прилагаются вручную составленные правила проверки конкретных провалов перевода
- Это решает две проблемы разом: ненадёжность автоматических метрик и невоспроизводимость ручной оценки людьми
- LTB, живой датасет с постоянным приёмом новых примеров; текущий релиз LTBv1 включает вклады, принятые до 1 сентября 2026 года
Почему это важно
Стандартные бенчмарки машинного перевода перестают быть полезными: по мере роста моделей они приближаются к насыщению и уже не показывают, какая система лучше. Одновременно ломаются оба привычных способа измерить качество перевода, автоматические метрики (уязвимы к накрутке, не дают действенной обратной связи) и ручная оценка людьми (плохо воспроизводится, субъективна, не масштабируется). LTB предлагает третий путь: примеры, специально подобранные людьми так, чтобы вскрывать слабые места моделей, плюс формализованные правила проверки для каждого случая.
Кому это важно
В первую очередь, исследователям и разработчикам систем машинного перевода, которым нужен инструмент, показывающий реальные различия между моделями, а не одинаково высокие баллы на насыщенном тесте. Полезно и тем, кто строит оценку качества переводов на базе больших языковых моделей в целом: подход с ручными правилами верификации приложим шире одного лишь перевода.
Как это применить
LTB собран как живой датасет: он принимает новые примеры от сообщества на постоянной основе, а не выпускается разовым фиксированным набором. Текущая версия, LTBv1, в неё вошли вклады, принятые до 1 сентября 2026 года; следующие релизы будут выходить по мере накопления новых примеров. В материале не указано, сколько именно примеров входит в LTBv1 и как измеряются результаты конкретных моделей на бенчмарке, это можно уточнить только по самому датасету.
Можно ли доверять
Работа опубликована на arXiv и описывает методологию открыто: примеры написаны людьми и прошли рецензирование, а не сгенерированы автоматически. В то же время в тексте не названы организации, стоящие за проектом (известен лишь автор, Vilém Zouhar с соавторами), а также не сказано, кто именно пишет и рецензирует примеры и по каким критериям, эти детали остаются за рамками аннотации.
Риски и подводные камни
Поскольку LTB, живой, постоянно пополняемый датасет, а не фиксированный тест, сравнение результатов разных моделей во времени осложняется: набор примеров, на котором измерялось качество перевода, может со временем меняться. Также в источнике нет ни конкретных чисел (сколько всего примеров, какие модели и с каким результатом уже проверены), ни точного графика будущих релизов, судить о зрелости и охвате бенчмарка на данный момент можно только по самому датасету, а не по аннотации к статье.
«По мере того как модели становятся сильнее, стандартные бенчмарки машинного перевода приближаются к насыщению.»
— из статьи о Last Translation Benchmark