Qwen2.5-14B ответила на 67% из 530 тысяч вопросов Jeopardy! за 41 год
В 2011 году система IBM Watson (движок DeepQA) обыграла сильнейших людей-чемпионов в телевикторине Jeopardy!. Знания, которые ей это позволили, хранились в специально собранном корпусе из миллиарда документов и работали на кластере серверов POWER7, зафиксированные на момент сборки, их нельзя было ни перенести, ни скопировать.
Авторы новой работы показывают, что такой же снимок знаний, того, что культура способна знать, сегодня умещается в один файл и достаётся почти бесплатно. Они прогнали одну открытую 9-гигабайтную модель Qwen2.5-14B в 4-битном квантовании через полный открытый датасет вопросов Jeopardy!, 529 939 карточек за все 41 сезон шоу с 1984 по 2025 год. По утверждению авторов, это первый случай, когда модель прогоняют через весь корпус целиком.
По строгому протоколу принудительного ответа (с точным и нечётким сопоставлением ответа) модель верно отвечает на 67,0% всех вопросов, а на вопросах фактологических категорий её точность превышает 85%.
Авторы отдельно оговаривают: утечка тренировочных данных в тестовый набор, проблема, общая для обеих систем, а не изъян, уникальный для языковых моделей. Более того, случай Watson они называют даже более крайним: его корпус собирался специально под ответы Jeopardy! и настраивался на прошлых вопросах, поэтому он в принципе не мог ответить ни на что за пределами этого курированного набора. Решающая проверка, способна ли модель отвечать на вопросы, которых не существовало на момент её создания. На вопросах, вышедших в эфир уже после обучения, локальная модель держит 65%, Claude Opus 4.8, 95%, а Watson по построению, ноль: его база знаний зафиксирована на 2011 году и структурно не может покрывать ничего более позднего.
Вывод авторов: способность отвечать на вопросы общей эрудиции переехала из серверной в файл, который буквально можно закатать в капсулу времени, и, в отличие от Watson, она не заморожена в своём моменте создания.
Ключевые факты
- Одну открытую 9-гигабайтную модель Qwen2.5-14B (4-бит) впервые прогнали через весь открытый датасет Jeopardy! целиком, 529 939 вопросов за 41 сезон, 1984, 2025 годы
- Итоговая точность, 67,0% по всем вопросам под строгим протоколом принудительного ответа с точным и нечётким сопоставлением; на фактологических категориях, свыше 85%
- На вопросах, вышедших в эфир после обучения модели: локальная модель, 65%, Claude Opus 4.8, 95%, IBM Watson, ноль по построению, поскольку его корпус зафиксирован на 2011 годе
- Авторы называют случай Watson более крайним примером утечки тренировочных данных: его корпус специально собирался под ответы Jeopardy! и настраивался на прошлых вопросах шоу
- В 2011 году сопоставимая способность требовала кластера серверов POWER7 и корпуса на миллиард документов; теперь она умещается в один 9-гигабайтный файл
Почему это важно
Работа впервые прогоняет модель через исторический корпус Jeopardy! целиком, а не через выборку, и напрямую сталкивает символ эпохи кураторских систем (Watson) с современной открытой моделью на 9 гигабайт. Главный тезис, не в том, что модель отвечает лучше человека, а в том, что способность общей эрудиции стала переносимой: раньше для неё нужен был кластер серверов и специально собранный корпус, теперь достаточно файла, который можно скачать и запустить локально, и который при этом не заморожен на дату сборки.
Кому это важно
Тем, кто оценивает компактные открытые модели для локального развёртывания без серверной инфраструктуры; исследователям, которые строят и валидируют бенчмарки на утечку тренировочных данных; всем, кто сравнивает системы кураторского поиска ответов (как Watson) с генеративными языковыми моделями, методология статьи даёт для такого сравнения конкретную числовую опору.
Как это применить
Для задач общей фактологической эрудиции офлайн-квантованная 14-миллиардная модель, рабочий вариант: 9 гигабайт умещаются на обычном диске, а точность выше 85% на фактологических категориях. Протокол оценки авторов, принудительный ответ с точным и нечётким сопоставлением, можно взять как шаблон для собственной проверки открытых моделей на вопросно-ответных задачах, не полагаясь только на многовариантные тесты.
Можно ли доверять
В тексте не указаны ни авторы работы, ни их институциональная принадлежность, ни дата публикации, это ограничивает возможность проверить контекст исследования независимо. Сравнение с Watson на вопросах после обучения, не результат живого повторного прогона Watson, а логический вывод «по построению»: раз корпус Watson зафиксирован на 2011 годе, он структурно не мог покрывать более поздние вопросы, отсюда ноль. Детали самого протокола оценки, как именно устроено «нечёткое сопоставление» и что считается фактологической категорией, в тексте не раскрыты, как и дата обучения ни локальной модели, ни Claude Opus 4.8.
Риски и подводные камни
Часть вопросов Jeopardy!, особенно из ранних сезонов, с высокой вероятностью попадала в обучающие данные современных моделей, авторы признают эту утечку прямо и переводят её в аргумент (утечка есть у обеих систем), но она всё равно осложняет прямое чтение итоговых 67% как чистой оценки рассуждения по новому материалу. Разбивки точности по отдельным категориям вопросов, кроме единой цифры для «фактологических категорий», текст не даёт, как и данных о стоимости или требованиях к железу сверх размера файла в 9 гигабайт.