BDH-CQ бьёт рекорд эффективности по цене на ARC-AGI-1

BDH-CQ бьёт рекорд эффективности по цене на ARC-AGI-1

Авторы представили BDH-CQ, модель для рассуждений, которая объединяет обучение в контексте (in-context learning) с рекуррентным латентным рассуждением. Входные данные, поступающие во время вывода, непрерывно обновляют рекуррентную память модели; после этого модель решает задачу через итеративные вычисления в многомерном латентном пространстве, не проговаривая промежуточные шаги рассуждения словами.

Модель проверили на публичном оценочном наборе бенчмарка ARC-AGI-1, а также на контролируемых вмешательствах в духе ARC-задач, чтобы понять, что модель извлекает из демонстрационных примеров, насколько последовательно она применяет выведенное из них преобразование и какие понятия остаются для неё сложными.

Конфигурация с 150 млн параметров показала 29,5% pass@2 при расчётной стоимости вывода $0,0007 за задачу. По утверждению авторов, эта рабочая точка выходит за пределы ранее зафиксированной границы Парето «цена/точность» для ARC-AGI-1, то есть устанавливает новый рекорд эффективности по стоимости на этом бенчмарке.

В тексте нет имён авторов и их аффилиаций, нет сравнения с конкретными конкурирующими моделями (только с ранее зафиксированной границей Парето для бенчмарка), нет данных о сроках работы и подробностей устройства рекуррентной памяти сверх сказанного, а также нет результатов для конфигураций модели, кроме версии на 150 млн параметров.

Ключевые факты

  • BDH-CQ, модель для рассуждений, сочетающая обучение в контексте с рекуррентным латентным рассуждением; промежуточные шаги не проговариваются словами, а решаются итеративно в латентном пространстве
  • Модель проверили на публичном оценочном наборе ARC-AGI-1 и на контролируемых ARC-подобных вмешательствах, смотрели, что она извлекает из демонстраций и насколько последовательно применяет выведенное преобразование
  • Конфигурация на 150 млн параметров: 29,5% pass@2 при стоимости вывода $0,0007 за задачу
  • Авторы заявляют, что это выводит модель за пределы прежней границы Парето «цена/точность» на ARC-AGI-1, новый рекорд эффективности по стоимости на этом бенчмарке
  • Имена авторов, аффилиации, сравнение с конкретными конкурентами и подробности архитектуры в тексте не указаны

Почему это важно

Результат бьёт не точность саму по себе, а соотношение цены и точности: модель на 150 млн параметров решает часть задач ARC-AGI-1 за $0,0007, и по заявлению авторов это отодвигает известную границу Парето «цена/точность» для бенчмарка дальше, чем удавалось раньше. Это сигнал, что для части задач рассуждение в скрытом (латентном) пространстве, без пословного проговаривания шагов, может быть на порядки дешевле привычных подходов с развёрнутым текстовым рассуждением.

Кому это важно

Прежде всего исследователям, которые работают над архитектурами рассуждающих моделей и над снижением стоимости вывода, в первую очередь тем, кто следит за бенчмарком ARC-AGI как мерилом абстрактного рассуждения. Также интересно тем, кто оценивает экономику инференса: маленькая модель (150 млн параметров) достигает результата на бенчмарке за копейки на задачу.

Как это применить

Текст описывает исследовательский результат на конкретном бенчмарке, а не готовый продукт или инструмент, применить его напрямую вне контекста ARC-AGI-1 нельзя: в источнике нет ни кода, ни деталей архитектуры сверх общего описания, ни данных о доступности модели.

Можно ли доверять

Источник, краткое описание работы на странице Hugging Face Papers, без имён авторов и их аффилиаций, без независимой проверки заявленного результата и без сравнения с конкретными именованными конкурирующими моделями, только с ранее сообщённой границей Парето для бенчмарка. Заявление о новом рекорде эффективности принадлежит самим авторам работы.

Риски и подводные камни

Результат приведён для одной-единственной конфигурации модели (150 млн параметров) и одного бенчмарка (ARC-AGI-1); данных о том, как модель ведёт себя на других задачах или при другом размере, в тексте нет. Нет и прямого сравнения с конкретными современными моделями-конкурентами, только с абстрактной «ранее зафиксированной границей Парето», что затрудняет независимую проверку масштаба прорыва.