Google Research: GPT-5 и Gemini 3 знают факты, но не могут их вспомнить

Google Research: GPT-5 и Gemini 3 знают факты, но не могут их вспомнить

Исследователи Google Research Нитай Кальдерон и Гал Йона опубликовали 12 августа 2026 года работу «Empty Shelves or Lost Keys? Recall Is the Bottleneck for Parametric Factuality» («Пустые полки или потерянные ключи? Вспоминание, узкое место параметрической фактологии»). Их вопрос: когда модель отвечает на фактический вопрос неверно, это потому что факт вообще не был усвоен, или потому что он усвоен, но модель не может его достать? Обычные метрики точности не различают эти два случая, хотя лечатся они по-разному: пробел в знаниях лечится увеличением модели и данных, а неспособность вспомнить, методами дообучения и работы на этапе вывода (например, рассуждением перед ответом).

Авторы предложили метод «профилирования знаний» (knowledge profiling), который для каждого факта определяет один из пяти статусов: факт не закодирован; закодирован, но не вспоминается; вспоминается напрямую; вспоминается только с рассуждением (thinking, то есть с промежуточными шагами вывода); либо ответ выводится логически без явного кодирования факта. Для проверки построен бенчмарк WikiProfile, 2150 фактов, извлечённых из Википедии полностью автоматизированным конвейером на базе Gemini-2.5-Pro с рассуждением, с финальной ручной проверкой. К каждому факту привязано 10 заданий: два, на проверку кодирования, четыре, на прямое вспоминание, ещё четыре, на распознавание правильного ответа среди вариантов. Проверено 13 языковых моделей, каждая, с включённым и выключенным рассуждением, с восемью ответами на задание; итоговый автоматически размеченный набор, около 4,5 млн ответов, оценённых другими промпт-моделями-разметчиками.

Главный результат: у передовых моделей, Gemini-2.5-Pro, Gemini-3-Pro и Flash, GPT-5, кодирование фактов близко к насыщению, а вот вспоминание, нет. У Gemini-3-Pro и GPT-5 закодировано 95, 98% проверенных фактов, но напрямую вспомнить модели не могут 26, 34% из них. Даже включив рассуждение, они всё равно ошибаются на 11, 12% фактов. Иначе говоря, у передовых моделей фактические ошибки всё чаще возникают не из-за отсутствия знаний, а из-за того, что знание есть, но недоступно, узкое место сдвигается от накопления знаний к их использованию. На семействе моделей Gemma 3 та же картина: с ростом размера модели ошибок кодирования становится заметно меньше, а ошибки вспоминания остаются существенными и занимают всё большую долю среди оставшихся ошибок.

Отдельно авторы показывают, что вспоминание тесно связано с тем, в каком виде факт встречался модели при обучении. Для редких (long-tail) фактов кодирование почти не отстаёт от популярных фактов, разрыв там небольшой, а вот разрыв во вспоминании заметно больше: редкие факты часто присутствуют в параметрах модели, но труднодоступны. Так же объясняется и «проклятие обратимости» (reversal curse), известный эффект, когда модель знает «A, это B», но не может ответить на вопрос «Что такое B?». В открытом вспоминании обратные вопросы стабильно тяжелее прямых, но в тесте с вариантами ответа (распознавании) обратные вопросы не тяжелее прямых, а часто даже легче. Значит модель способна узнать верный ответ среди вариантов, но не может его сгенерировать, если направление вопроса расходится с тем, в каком виде она встречала факт при обучении, то есть проклятие обратимости тоже оказывается проблемой вспоминания, а не отсутствия знаний.

Авторы также проверили, что помогает вернуть недоступное знание. В моделях, оптимизированных под рассуждение, включение thinking восстанавливает примерно 40, 65% фактов, которые закодированы, но не вспоминаются напрямую, и заметно меньше помогает там, где факт вообще не закодирован. Это говорит о том, что рассуждение работает прежде всего как механизм, облегчающий доступ к уже усвоенным фактам, а не как способ вывести ответ через сложную многошаговую логику. При этом рассуждение не бесплатно: оно требует вычислений, и пока неясно, как заранее определить, когда модели стоит его включать. Вывод авторов: раз кодирование фактов у топовых моделей уже близко к насыщению, дальнейший рост точности вряд ли даст простое увеличение размера модели или объёма данных, скорее его дадут методы, которые учат модель лучше использовать уже накопленные знания.

Ключевые факты

  • Google Research предложила «профилирование знаний», метод, который отделяет ошибки из-за отсутствия факта в памяти модели от ошибок из-за неспособности вспомнить уже закодированный факт
  • Для проверки построен бенчмарк WikiProfile: 2150 фактов из Википедии, по 10 заданий на факт, проверено 13 моделей, собрано около 4,5 млн ответов
  • У Gemini-3-Pro и GPT-5 закодировано 95, 98% фактов, но напрямую вспомнить модели не могут 26, 34% из них; даже с рассуждением ошибка держится на 11, 12%
  • «Проклятие обратимости» (модель знает «A, это B», но не отвечает на «Что такое B?») объяснили не пробелом в знаниях, а тем же провалом вспоминания: в тесте с вариантами ответа обратные вопросы не тяжелее прямых
  • Включение рассуждения (thinking) восстанавливает 40, 65% фактов, которые закодированы, но не вспоминаются напрямую, то есть помогает добраться до уже имеющегося знания, а не выводит новое

Почему это важно

Работа переопределяет, где именно у современных LLM находится узкое место точности. До сих пор рост фактологической точности связывали в основном со scaling, увеличением модели и объёма данных. Google Research показывает: у передовых моделей кодирование фактов уже близко к насыщению (95, 98%), а значит дальнейшее наращивание размера и данных даст всё меньшую отдачу. Настоящий резерв, это извлечение уже усвоенных знаний, а его улучшают другие инструменты: дообучение и методы на этапе вывода, в частности рассуждение перед ответом.

Кому это важно

Разработчикам и исследователям, которые строят и оценивают факт-чекинг, RAG-системы и любые приложения, где важна точность ответов LLM: результат меняет, какие методы стоит вкладывать в улучшение точности, не только более крупная модель или больше данных, но и техники, помогающие модели «достать» уже усвоенное знание. Полезно и тем, кто занимается бенчмарками и оценкой моделей, методология WikiProfile даёт более информативную диагностику, чем обычная точность по вопросам.

Как это применить

Из результатов следует практический вывод: там, где модель ошибается на фактическом вопросе, включение режима рассуждения (thinking, chain-of-thought) может восстановить значительную часть ответов, 40, 65% случаев, когда факт закодирован, но не вспоминается напрямую. Это же объясняет, почему проверка «узнаёт ли модель факт среди вариантов ответа» (multiple-choice) даёт более оптимистичную картину знаний модели, чем просьба ответить открытым текстом, особенно для обратных формулировок вопроса.

Можно ли доверять

Источник, официальный блог Google Research с указанием авторов (Нитай Кальдерон, Гал Йона) и подробным описанием методологии: состав бенчмарка WikiProfile, конвейер его построения, число моделей и ответов, способ автоматической разметки другими промпт-моделями. Пост не называет все 13 проверенных моделей (только примеры), не указывает конференцию или журнал публикации и не раскрывает институциональную принадлежность авторов за пределами «Google Research», эти детали в тексте отсутствуют.

Риски и подводные камни

Ответы моделей в бенчмарке размечены другими промпт-моделями-разметчиками, а не людьми, источник не приводит данных о согласии этой разметки с человеческой оценкой. Сам эффект от рассуждения не бесплатен: авторы прямо пишут, что оно требует дополнительных вычислений, и пока неясно, как заранее определить, когда модели стоит его включать. Источник также не сравнивает численные результаты с прежними бенчмарками кодирования/вспоминания, только качественно ссылается на предыдущие работы.