GPT-6 Astra обошла MolmoAct2 в тесте на пространственное мышление

Новый робототехнический бенчмарк StationeryBench сравнил GPT-6 Astra от OpenAI с MolmoAct2 от Ai2 на пяти типах задач с предметами со стола: например, снять колпачок с маркера, высыпать скрепки или передать линейку из одной руки робота в другую. Обе модели управляли одинаковыми двурукими роботами YAM, всего было проведено 200 испытаний.
По итогам Astra полностью довела до конца 7 задач из 100, тогда как MolmoAct2 не завершила ни одной. По медианному баллу прогресса (шкала от 0 до 100) Astra набрала 46 очков против 12 у MolmoAct2. Все результаты, включая видеозаписи каждой попытки и код, команда StationeryBench выложила в открытый доступ на GitHub.
Astra также прокомментировал Йоав Арци, исследователь ИИ в Корнеллском университете и Google DeepMind: он назвал её «качественным скачком в пространственном мышлении». По его словам, на ещё не опубликованном бенчмарке REMAP GPT-6 Astra показывает точность, близкую к человеческому уровню, впрочем, сам Арци уточнил: «даже Astra не дотягивает до уровня человека в других сценариях».
Арци предполагает, что за результатом стоит обучение модели на большом массиве трёхмерных данных, например сценах, сгенерированных в Blender; по наблюдению The Decoder, это согласуется с тем, что Astra особенно заметно прибавила именно в задачах с трёхмерным восприятием сцены. У OpenAI есть долгосрочные планы по выпуску собственных потребительских роботов.
Ключевые факты
- StationeryBench, новый бенчмарк, сравнил GPT-6 Astra от OpenAI и MolmoAct2 от Ai2 на пяти типах задач с предметами со стола на одинаковых двуруких роботах YAM; всего прошло 200 испытаний.
- Astra полностью выполнила 7 задач из 100, MolmoAct2 не завершила ни одной; медианный балл прогресса составил 46 против 12 из 100.
- Йоав Арци, исследователь ИИ в Корнеллском университете и Google DeepMind, назвал Astra «качественным скачком в пространственном мышлении», но отметил, что даже Astra не дотягивает до уровня человека в других сценариях.
- На ещё не опубликованном бенчмарке REMAP GPT-6 Astra показывает точность, близкую к человеческой.
- Арци связывает успех с обучением на большом массиве трёхмерных данных вроде сцен из Blender; у OpenAI есть долгосрочные планы выпустить собственных потребительских роботов.
Почему это важно
Пространственное мышление и манипулирование реальными предметами, область, где, по всей видимости, GPT-6 Astra совершила большой шаг вперёд. Результат StationeryBench даёт этому конкретную числовую опору: Astra полностью выполнила 7 задач из 100 против нуля у MolmoAct2, и оценку «качественный скачок в пространственном мышлении» самой Astra дал не сам OpenAI, а внешний исследователь Йоав Арци. Это тем более заметно на фоне долгосрочных планов OpenAI по собственным потребительским роботам: такие устройства как раз и упираются в способность модели понимать трёхмерное пространство и точно манипулировать объектами.
Кому это важно
В первую очередь, командам, которые разрабатывают роботов-манипуляторов и модели для управления ими: StationeryBench даёт стандартизированный набор задач с предметами со стола, на котором можно напрямую сравнивать разные модели на одинаковых роботах. Важен результат и для тех, кто следит за OpenAI: помимо работы с текстом и экраном, компания заявляет долгосрочные планы на собственных потребительских роботов, и это открытый числовой результат о том, как её модели справляются именно с физическими манипуляциями. Наконец, результат интересен Ai2 и конкурентам: MolmoAct2 в этом тесте не завершила полностью ни одной из 100 задач.
Как это применить
Само событие не продуктовый релиз, а результат теста, поэтому «применение» здесь не про покупку или подписку, а про методику. Команда StationeryBench выложила на GitHub все данные испытаний: видео каждой попытки и код, так что разработчики роботов-манипуляторов могут прогнать через тот же набор задач собственную модель и сравнить результат напрямую с Astra и MolmoAct2 на одинаковых роботах YAM.
Можно ли доверять
Кто именно проводил тест StationeryBench, источник не уточняет, зато независимую оценку результата дал Йоав Арци, исследователь из Корнеллского университета и Google DeepMind, а не из OpenAI или Ai2: саму Astra (7 против 0 полных выполнений, 46 против 12 по медианному баллу) он назвал качественным скачком, но отдельно уточнил, что даже Astra не дотягивает до уровня человека в других сценариях, то есть не превратил результат в безоговорочную похвалу. Результаты, видео и код бенчмарка открыты на GitHub, так что цифры можно перепроверить независимо от того, кто их публиковал. Слабее задокументирован второй тест, REMAP: он ещё не опубликован, и вместо числовой оценки в источнике есть только качественная формулировка «точность, близкая к человеческому уровню», без методики и самой цифры. Объяснение причин скачка (обучение на 3D-сценах из Blender) тоже личное предположение Арци, а не подтверждённый факт от OpenAI.
Риски и подводные камни
Скачок пока подтверждён одним новым тестом от одной команды: источник не сообщает о независимых повторных прогонах StationeryBench другими лабораториями. Сама Astra по абсолютным цифрам ещё далека от надёжного результата: полностью выполнены только 7 задач из 100, а медианный балл 46 из 100 говорит скорее о частичном прогрессе, чем о решённой задаче; сам Арци подчёркивает, что «даже Astra не дотягивает до уровня человека в других сценариях». Второй тест, REMAP, на который ссылается разбор, ещё не опубликован и не имеет численной оценки: судить по нему можно только на слово. Наконец, версия о причине скачка (обучение на 3D-сценах из Blender) это предположение стороннего исследователя, а не подтверждённые детали от OpenAI, так что реальная причина результата может быть иной.
«Качественный скачок в пространственном мышлении»
— Йоав Арци, исследователь ИИ в Корнеллском университете и Google DeepMind