Фреймворк на цепочках правил решил более 95% задач ARC-AGI-2
ARC (Abstraction and Reasoning Corpus, «корпус абстракции и рассуждений»), тест на когнитивное обобщение: способность вывести абстрактное правило из нескольких примеров и применить его к новой задаче. Новая работа предлагает многоступенчатый фреймворк, который решает задачи ARC не одной сквозной моделью, а цепочкой правил, объединяющей рассуждение на символьном, структурном и концептуальном уровнях.
Внутри фреймворка работают три модуля. Первый, модуль детерминированного поиска правил: он выводит атомарные преобразования, анализируя геометрию фигур, цвет и объекты на сетке. Второй, модуль сборки паттернов: он восстанавливает результат, объединяя блоки, находя повторы и применяя пространственные эвристики. Третий, уровень структурной абстракции: он находит иерархические и вложенные связи между элементами сетки. Модули запускаются последовательно: если предыдущий не находит решения, включается следующий, более общий, и при этом использует след рассуждений предыдущего шага, это должно одновременно повышать обобщение (способность решать новые задачи) и интерпретируемость (возможность понять, почему получен именно такой ответ).
Результаты авторы приводят по трём наборам задач. На тренировочном наборе фреймворк прошёл 995 задач из 1000. На дополнительном наборе из 120 задач в тексте сказано только, что систему «оценили» на 105 из них, не уточняется, значит ли это, что 105 задач были решены, или что проверка шла на подмножестве в 105 задач: соседние формулировки для обучающего и тестового наборов используют глаголы «прошёл» и «решил», а здесь употреблён другой, более нейтральный. На тестовом наборе, который в тексте прямо назван ARC-AGI-2, фреймворк решил 230 задач из 240. Отдельно авторы отмечают «устойчивое покрытие» детерминированных, композиционных и абстрактных категорий задач и итоговую точность выше 95%, без разбивки этой цифры по категориям или по конкретному набору (обучающему, дополнительному или тестовому).
Главный тезис работы, такая архитектура наводит мост между символьным рассуждением и синтезом паттернов и даёт интерпретируемое представление о когнитивном обобщении: в отличие от одной непрозрачной модели, можно проследить, через какой из трёх модулей и какое правило прошло решение. Авторы делают вывод, что цепочки правил и иерархическая композиция способны продвинуть машинное рассуждение к прозрачной, понятной человеку абстракции, и без точечной настройки под каждую отдельную задачу.
Ключевые факты
- Фреймворк решает задачи ARC тремя последовательными модулями: поиск атомарных правил по геометрии, цвету и объектам, сборка паттернов через слияние блоков, повторы и пространственные эвристики, и структурная абстракция иерархических и вложенных связей в сетке.
- Каждый следующий модуль включается, только если предыдущий не решил задачу, и переиспользует его след рассуждений, так авторы одновременно повышают обобщение и интерпретируемость решения.
- На тренировочном наборе фреймворк прошёл 995 задач из 1000, на дополнительном наборе из 120 задач был «оценён» на 105 (глагол в тексте не уточняет, решены они или это лишь подмножество проверки), а на тестовом наборе решил 230 задач из 240, прямо названных в тексте ARC-AGI-2.
- Итоговая точность, по словам авторов, превышает 95% при устойчивом покрытии детерминированных, композиционных и абстрактных категорий задач, без разбивки цифры по категориям или по набору.
- В тексте нет ни сравнения с другими системами или лидербордом ARC-AGI, ни данных об авторах, организации и дате публикации, ни архитектурных деталей фреймворка сверх названия трёх модулей.
Почему это важно
ARC, тест именно на когнитивное обобщение: способность вывести абстрактное правило из нескольких примеров и применить его к новой задаче. Разбираемая работа решает эти задачи не одной сквозной моделью, а цепочкой из трёх детерминированных, символьных модулей (поиск правил → сборка паттернов → структурная абстракция), где каждый следующий уровень явно переиспользует рассуждение предыдущего. По утверждению авторов, такое устройство даёт сразу две вещи: интерпретируемость (видно, через какое правило и какой модуль прошло решение) и точность, 230 из 240 задач теста ARC-AGI-2 решены, итоговая точность выше 95%, причём без точечной настройки под каждую отдельную задачу. Если эти цифры подтвердятся при независимой проверке (в тексте её нет), это будет весомый аргумент в пользу детерминированных, объяснимых архитектур на задачах абстрактного рассуждения, как альтернативы менее прозрачным подходам.
Кому это важно
Прежде всего, исследователям, которые работают с ARC/ARC-AGI и соседними бенчмарками на абстрактное и композиционное рассуждение, а также тем, кто занимается нейросимвольными методами и синтезом программ. Важно и разработчикам интерпретируемых систем рассуждения, там, где нужен не только правильный ответ, но и объяснение, почему он именно такой: разбор ошибок, обучение самой системы, области с повышенными требованиями к прозрачности решений. Менее прямо, но всё же касается тех, кто оценивает, насколько задачи абстрактного мышления обязательно требуют больших предобученных моделей, работа показывает конкурирующий, полностью детерминированный маршрут.
Как это применить
Готового продукта или кода в тексте нет, это исследовательский фреймворк, проверенный на конкретных наборах задач ARC. Переносимая идея, которую можно забрать без деталей реализации, сама архитектура: запускать сначала самый узкий и дешёвый детерминированный решатель, при неудаче переходить к более общему модулю сборки паттернов, а затем, к структурному анализу, и на каждом шаге передавать следующему модулю след рассуждений предыдущего, а не начинать заново. Такой порядок, от дешёвого и прозрачного к дорогому и общему, с передачей контекста между уровнями, применим не только к сеточным головоломкам ARC, но и к любой задаче, которую можно разложить на «сначала проверить очевидное → скомпоновать известные паттерны → разобрать структуру, если ничего не подошло». Воспроизвести именно этот фреймворк по тексту не выйдет: архитектурных деталей, кода и параметров в источнике нет.
Можно ли доверять
Перед нами препринт на arXiv: в тексте не названы ни авторы, ни организация, ни дата публикации или подачи, поэтому оценить квалификацию и репутацию создателей по этому материалу нельзя. Цифры результатов конкретны, 995 из 1000 на обучении, 105 из 120 на дополнительной проверке, 230 из 240 на тесте ARC-AGI-2, итоговая точность выше 95%, что выгодно отличает работу от чисто качественных заявлений. Но в тексте нет ни одного сравнения с другими системами или с публичным лидербордом ARC-AGI, поэтому нельзя понять, это результат на уровне лучших решений, отстающий от них или превосходящий их. Нет и разбивки итоговой точности по категориям задач (детерминированные/композиционные/абстрактные) или по конкретному набору, а также архитектурных и параметрических деталей фреймворка сверх названия трёх модулей и данных о вычислительных затратах, то есть независимо проверить или воспроизвести заявленное по одному этому тексту невозможно.
Риски и подводные камни
Главный пробел, отсутствие сравнения: без данных о других системах или о позиции в публичном лидерборде ARC-AGI непонятно, эта точность выше 95%, прорыв, обычный уровень или отставание от нейросетевых решений на том же тесте. Формулировка для среднего набора («оценили на 105 из 120») в тексте отличается от параллельных «прошёл»/«решил» для обучающего и тестового наборов, и неясно, значит ли это, что решены именно 105 задач, эту цифру стоит воспринимать с осторожностью. Не указано и то, относится ли обучающий набор из 1000 задач и дополнительный набор из 120 задач к ARC-AGI-2 или к более раннему корпусу ARC, в тексте версия ARC-AGI-2 названа явно только для тестовых 240 задач. Наконец, заявленная точность выше 95% не разбита по категориям задач, поэтому неизвестно, распределён ли успех равномерно или его вытягивает одна, самая простая категория, а отсутствие деталей архитектуры и вычислительных затрат не даёт оценить сложность и стоимость подхода в сравнении с обычной нейросетевой моделью.