DiG-bench: топовые ИИ-модели решают 20% сложнейших задач, люди, 100%

469-й выпуск авторской рассылки Import AI (о разработках в области ИИ) собрал четыре истории, от нового бенчмарка на самостоятельное открытие правил игры до критики стратегического эссе главы Meta.
Главная история, DiG-bench (Discovery in Games), новый бенчмарк из 70 игр, который проверяет не выученные знания модели, а способность понять скрытые правила и цель незнакомой среды через исследование, а не по подсказке. Авторы бенчмарка, исследователи из организации Thinking About Thinking, Оксфордского и Принстонского университетов, Университета имени короля Абдаллы (KAUST), Швейцарской лаборатории ИИ, Inria и MIT; один из авторов, Юрген Шмидхубер. Бенчмарк разбит на семь уровней сложности (от первого, самого лёгкого, до седьмого, самого трудного), 21 из 70 игр выложены в открытый доступ, остальные держатся закрытыми, чтобы модели не могли на них обучаться. Число доступных на каждом шаге действий в разных играх, от 2 до 34. Каждую игру хотя бы один человек прошёл полностью, но многие участники называли их трудными. На седьмом, самом сложном уровне хоть какие-то задачи смогли решить только Opus 5 и Fable 5, и лишь на 20% (в тексте указано значение 0.2); модели Opus 5, GPT-5.5 и Kimi K3 справлялись с частью задач шестого уровня при наличии инструментальной среды вроде Claude Code, а GLM-5.2 и Gemini 3.1 Pro доходили до части уровней четвёртого. Для сравнения, отдельные люди проходили тесты со 100%-ным результатом. Автор дайджеста расценивает DiG-bench как приближение к тому, что нужно для креативности и самостоятельного открытия нового, и предполагает, что человеческий уровень на бенчмарке может быть достигнут к середине 2027 года, и именно тогда, по его личному прогнозу, стоит ждать серьёзного разгона рекурсивного самоулучшения ИИ.
Отдельно дайджест указывает на браузерную игру от студии Paradigm Research, симулятор компании, которая разрабатывает ИИ-системы вплоть до состояния рекурсивного самоулучшения. В игре нужно балансировать инвестиции в исследователей и вычислительные мощности, решать, когда лицензировать данные, и так далее; автор дайджеста называет её трудной, как и саму разработку по-настоящему передовых ИИ-систем.
Третья история, препринт стартапа Inherent про модель Faraday, которая должна научиться исследовательскому «вкусу»: чутью на правильные научные вопросы. Компания построила управляющий слой поверх крупных проприетарных моделей, небольшую модель Faraday на 27 миллиардов параметров, дообученную поверх Qwen-3.6-27B, которая использует агент для написания кода (OpenAI Codex) в качестве инструмента и курирует работу более крупных моделей при научных задачах. Для обучения и проверки авторы собрали датасет Replica, 100 научных статей по машинному обучению и ИИ для науки, опубликованных между 1990 и 2026 годами; из них сделали 310 задач на восстановление недостающих результатов, для каждой задачи модель Claude Opus 4.7 по мета-критерию генерирует рубрику оценки, а отдельная модель-судья на основе Codex начисляет награду и распределяет вес по шагам для обучения Faraday по модифицированной версии алгоритма GRPO. По собственной рубрике авторов, Faraday с Codex обходит стандартные модели Opus 4.8 и GPT-5.5 на 73% внутривыборочных задач по машинному обучению и на 60% задач за пределами обучающей выборки, по научным дисциплинам, где данных не было. Сами авторы пишут, что навыки, которые позволяют Faraday восстанавливать недостающие детали эксперимента, могут быть теми же навыками, что нужны, чтобы самостоятельно спроектировать новый эксперимент.
Четвёртая тема, эссе Марка Цукерберга «The Future is for Everyone» («Будущее, для всех»), которое дайджест описывает как манифест того, как Цукерберг и Meta подходят к развитию ИИ. Центральная идея эссе, максимально широко распространить возможности ИИ среди всех людей, чтобы не допустить концентрации власти в руках немногих; Цукерберг пишет, что каждый получит личного агента, инструменты для творчества и запуска бизнеса, персонального наставника уровня доктора наук и бесплатный или доступный доступ к этим инструментам. Автор дайджеста называет эту идею в целом разумной, но указывает: эссе обходит стороной вопрос, чего сама сверхразумная система, способная изобретать новое, захочет делать, ведь её цели не обязаны совпадать с целями людей, которых она должна расширять.
Ключевые факты
- DiG-bench, новый бенчмарк из 70 игр на самостоятельное открытие скрытых правил, разбит на семь уровней сложности; 21 игра выложена в открытый доступ, число действий на шаг в играх, от 2 до 34.
- На самом сложном, седьмом, уровне бенчмарка задачи решили только Opus 5 и Fable 5, с результатом 20%, тогда как отдельные люди проходят тест со 100%-ным результатом.
- Стартап Inherent обучил модель-супервизора Faraday (27 млрд параметров, поверх Qwen-3.6-27B), которая на датасете Replica (100 статей, 310 задач) обходит Opus 4.8 и GPT-5.5 на 73% внутривыборочных и 60% внешних задач, по собственной рубрике авторов.
- Paradigm Research выпустила браузерную игру-симулятор компании, которая разрабатывает ИИ до состояния рекурсивного самоулучшения.
- Марк Цукерберг опубликовал эссе «The Future is for Everyone» о распространении сверхразума среди всех людей; дайджест указывает, что эссе не отвечает на вопрос, чего захочет сама сверхразумная система, способная изобретать.
Почему это важно
Тесты вроде DiG-bench проверяют не выученные знания моделей, а способность самостоятельно понять правила незнакомой среды через исследование, качество, которое автор дайджеста называет предпосылкой креативности. Он прямо связывает прогресс на этом тесте с рекурсивным самоулучшением: по его личному прогнозу, человеческий уровень на DiG-bench может быть достигнут к середине 2027 года, и именно тогда стоит ждать серьёзного разгона рекурсивного самоулучшения ИИ. Та же тема прослеживается в работе Inherent: модель Faraday курирует крупные модели при научных задачах, по формулировке дайджеста, это версия проблемы масштабируемого надзора (scalable oversight), ориентированная на рост возможностей, а не только на контроль над ними. Наконец, эссе Марка Цукерберга задаёт стратегическую рамку одной из крупнейших лабораторий, Meta, на то, как распространять сверхразум, не концентрируя власть в руках немногих.
Кому это важно
Инженерам и исследователям, которые оценивают модели по бенчмаркам на самостоятельное открытие и рассуждение, а не только по выученным знаниям. Специалистам по безопасности ИИ и по проблеме масштабируемого надзора (scalable oversight), которых напрямую касается подход Faraday, небольшая модель контролирует работу более крупной. Всем, кто следит за стратегическими заявлениями крупных лабораторий и Meta о том, как должно распространяться будущее превосходство ИИ.
Как это применить
21 из 70 игр DiG-bench выложены в открытый доступ вместе с лидербордом на сайте digbench.ai, там же можно поиграть самому и на практике почувствовать, где спотыкаются модели; описание бенчмарка и материалы к нему доступны на GitHub и в PDF. Препринт про Faraday и датасет Replica выложены на arXiv. Симулятор Paradigm Research (RSI Simulator), отдельная браузерная игра, доступная для игры онлайн. Источник не называет ни цену, ни лицензию ни на один из этих продуктов, поэтому судить о стоимости или условиях доступа по нему нельзя.
Можно ли доверять
Источник, авторский дайджест Import AI, который сочетает пересказ чужих материалов (страница и репозиторий DiG-bench, препринт Inherent на arXiv, эссе Цукерберга) с личными оценками и прогнозами самого автора, эти два слоя стоит различать. Цифры по DiG-bench и Faraday/Replica взяты из первоисточников и в целом проверяемы по указанным ссылкам. Результат Faraday (73% и 60%) получен по собственной, придуманной самим Inherent рубрике оценки, то есть это самооценка компании, а не независимая проверка третьей стороной. Дайджест не называет ни автора самого текста Import AI, ни даты публикации ни одного из четырёх материалов, ни данные о финансировании или штате Inherent и Paradigm Research.
Риски и подводные камни
Прогноз автора Import AI о достижении человеческого уровня на DiG-bench к середине 2027 года и последующем разгоне рекурсивного самоулучшения, личная догадка автора, а не результат исследования или заявление разработчиков бенчмарка. Сами авторы работы о Faraday признают: навыки, которые позволяют модели дополнять недостающие результаты чужих экспериментов, могут быть теми же навыками, что нужны для самостоятельной постановки новых экспериментов, то есть шагом к автономным ИИ-исследователям. Дайджест отдельно указывает, что эссе Цукерберга обходит стороной вопрос, чего захочет сама сверхразумная система, способная изобретать, если её возможности выйдут за рамки инструмента, который лишь расширяет людей, а не преследует собственные цели.
«Главные вопросы нашей эпохи, у кого будет доступ к сверхразуму и на что мы его направим.»
— Марк Цукерберг, эссе «The Future is for Everyone»
Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.