GPT-6 Astra от OpenAI научился находить ошибки в сборке мебели IKEA

GPT-6 Astra от OpenAI научился находить ошибки в сборке мебели IKEA

Исследовательская организация Epoch AI использует тест Furniture Assembly Benchmark (FAB): на фотографиях запечатлена сборка трёх предметов мебели IKEA с намеренно допущенными ошибками, и модели должны сравнить снимки с инструкцией, найти неточность и описать, что пошло не так. В ноябре 2025 года лучший результат показала Claude Opus 4.5, 28% точности. Спустя десять месяцев модель OpenAI GPT-6 Astra набрала уже 80%, затрачивая на анализ одного фото около трёх минут. Следом идут Claude Fable 5.1 с результатом 70% и Claude Opus 5 с 61%. Китайские открытые модели вроде Kimi K3 отстают от лидеров минимум на семь месяцев. Из-за скорости обработки (три минуты на фото) технология пока не годится для помощи в реальном времени во время сборки, но, по словам исследователей, в перспективе может пригодиться для ремонта автомобилей или бытовой техники. Авторы материала отмечают, что прогресс, особенно у Astra, заметен на фоне того, что ещё недавно модели не справлялись с гораздо более простыми визуальными задачами; кроме того, Astra хорошо показывает себя и в визуальных задачах для роботов.

Ключевые факты

  • Epoch AI проверяет модели на способности находить ошибки сборки мебели IKEA по фотографиям (тест FAB)
  • В ноябре 2025 года лучший результат, 28% у Claude Opus 4.5
  • Десять месяцев спустя GPT-6 Astra от OpenAI набрала 80%, тратя около трёх минут на фото
  • Claude Fable 5.1 показала 70%, Claude Opus 5, 61%, китайские открытые модели вроде Kimi K3 отстают минимум на семь месяцев
  • Скорость обработки пока исключает применение в реальном времени, но исследователи допускают использование для ремонта техники и авто в будущем

Почему это важно

Скачок с 28% до 80% всего за десять месяцев показывает, насколько быстро прогрессируют модели в задачах визуального рассуждения, распознавании пространственных ошибок на фото, которые ещё недавно были моделям не под силу.

Кому это важно

Результат интересен разработчикам систем компьютерного зрения и робототехники, а также тем, кто следит за прогрессом ИИ в задачах, требующих сопоставления изображения с инструкцией и пошагового рассуждения.

Как это применить

Практического применения пока нет: обработка одного фото занимает около трёх минут, что слишком медленно для подсказок в реальном времени во время сборки. По словам исследователей, в перспективе технология может помочь с диагностикой при ремонте автомобилей или бытовой техники.

Можно ли доверять

Данные приводятся со ссылкой на независимый тест Epoch AI, известной организации, занимающейся бенчмарками ИИ-моделей. Источник не уточняет точную дату, когда GPT-6 Astra получила свой результат, известно лишь, что это произошло через десять месяцев после ноября 2025 года, а методология подсчёта ошибок в источнике не раскрывается подробно.

Риски и подводные камни

Тест узкоспециализированный, оценивает распознавание ошибок только на трёх предметах мебели IKEA, и высокий результат не обязательно означает, что модель так же хорошо справится с другими визуальными задачами или реальным ремонтом. Скорость обработки (три минуты на фото) остаётся серьёзным ограничением для практического использования.