GPT-6 Astra от OpenAI научился находить ошибки в сборке мебели IKEA

Исследовательская организация Epoch AI использует тест Furniture Assembly Benchmark (FAB): на фотографиях запечатлена сборка трёх предметов мебели IKEA с намеренно допущенными ошибками, и модели должны сравнить снимки с инструкцией, найти неточность и описать, что пошло не так. В ноябре 2025 года лучший результат показала Claude Opus 4.5, 28% точности. Спустя десять месяцев модель OpenAI GPT-6 Astra набрала уже 80%, затрачивая на анализ одного фото около трёх минут. Следом идут Claude Fable 5.1 с результатом 70% и Claude Opus 5 с 61%. Китайские открытые модели вроде Kimi K3 отстают от лидеров минимум на семь месяцев. Из-за скорости обработки (три минуты на фото) технология пока не годится для помощи в реальном времени во время сборки, но, по словам исследователей, в перспективе может пригодиться для ремонта автомобилей или бытовой техники. Авторы материала отмечают, что прогресс, особенно у Astra, заметен на фоне того, что ещё недавно модели не справлялись с гораздо более простыми визуальными задачами; кроме того, Astra хорошо показывает себя и в визуальных задачах для роботов.
Ключевые факты
- Epoch AI проверяет модели на способности находить ошибки сборки мебели IKEA по фотографиям (тест FAB)
- В ноябре 2025 года лучший результат, 28% у Claude Opus 4.5
- Десять месяцев спустя GPT-6 Astra от OpenAI набрала 80%, тратя около трёх минут на фото
- Claude Fable 5.1 показала 70%, Claude Opus 5, 61%, китайские открытые модели вроде Kimi K3 отстают минимум на семь месяцев
- Скорость обработки пока исключает применение в реальном времени, но исследователи допускают использование для ремонта техники и авто в будущем
Почему это важно
Скачок с 28% до 80% всего за десять месяцев показывает, насколько быстро прогрессируют модели в задачах визуального рассуждения, распознавании пространственных ошибок на фото, которые ещё недавно были моделям не под силу.
Кому это важно
Результат интересен разработчикам систем компьютерного зрения и робототехники, а также тем, кто следит за прогрессом ИИ в задачах, требующих сопоставления изображения с инструкцией и пошагового рассуждения.
Как это применить
Практического применения пока нет: обработка одного фото занимает около трёх минут, что слишком медленно для подсказок в реальном времени во время сборки. По словам исследователей, в перспективе технология может помочь с диагностикой при ремонте автомобилей или бытовой техники.
Можно ли доверять
Данные приводятся со ссылкой на независимый тест Epoch AI, известной организации, занимающейся бенчмарками ИИ-моделей. Источник не уточняет точную дату, когда GPT-6 Astra получила свой результат, известно лишь, что это произошло через десять месяцев после ноября 2025 года, а методология подсчёта ошибок в источнике не раскрывается подробно.
Риски и подводные камни
Тест узкоспециализированный, оценивает распознавание ошибок только на трёх предметах мебели IKEA, и высокий результат не обязательно означает, что модель так же хорошо справится с другими визуальными задачами или реальным ремонтом. Скорость обработки (три минуты на фото) остаётся серьёзным ограничением для практического использования.