DeepSeek V4 Flash 0731: 89% на ARC-AGI-1, 61,4% на ARC-AGI-2

DeepSeek V4 Flash 0731: 89% на ARC-AGI-1, 61,4% на ARC-AGI-2

ARC Prize опубликовала верифицированные результаты модели DeepSeek V4 Flash 0731 (дата релиза, 31 июля 2026 года) на бенчмарке ARC-AGI, который проверяет способность моделей к абстрактному рассуждению. У модели три варианта уровня усилия рассуждений: Max, High и Low.

При максимальном усилии (Max) модель набрала 89,0% на ARC-AGI-1 (выборка Semi-Private) при стоимости $0,02 за задачу и 61,4% на более сложном ARC-AGI-2 (Semi-Private) при $0,04 за задачу. Вариант High показал 87,0% на ARC-AGI-1 и 56,0% на ARC-AGI-2; вариант Low, 84,0% и 46,0% соответственно. Стоимость за задачу для вариантов High и Low на странице не приведена, цена указана только для Max.

Оценки по ARC-AGI-3 отсутствуют: во всех трёх вариантах в таблице стоит прочерк. Отдельно указано, что публичный оценочный набор (Public Eval) ARC-AGI-2 включает 120 задач. Страница не содержит данных об архитектуре модели, числе параметров, сравнения с результатами других моделей или места в рейтинге, а также не поясняет разницу между выборками Semi-Private и Public Eval.

Ключевые факты

  • DeepSeek выпустила V4 Flash 0731 (релиз 31 июля 2026) с тремя уровнями усилия рассуждений, Max, High, Low.
  • При Max модель набрала 89,0% на ARC-AGI-1 (Semi-Private) при цене $0,02 за задачу.
  • На более сложном ARC-AGI-2 (Semi-Private) результат при Max, 61,4% при $0,04 за задачу.
  • High и Low дают более низкие показатели: 87,0%/56,0% и 84,0%/46,0% соответственно; цена за задачу для них не раскрыта.
  • Оценки по ARC-AGI-3 не приведены (прочерк для всех вариантов); публичный набор ARC-AGI-2 (Public Eval) включает 120 задач.

Почему это важно

Результаты показывают заметный разрыв между сложностью бенчмарков: на ARC-AGI-1 модель при максимальном усилии подтверждённо набирает 89,0%, тогда как на более сложном ARC-AGI-2, только 61,4%. Это иллюстрирует, что даже у моделей с сильными результатами на первой версии бенчмарка абстрактное рассуждение по методике второй версии даётся заметно хуже. Дополнительно указана цена: при Max-варианте задача на ARC-AGI-1 обходится в $0,02, на ARC-AGI-2, в $0,04.

Кому это важно

Разработчикам и исследователям, которые выбирают модели для задач, требующих абстрактного рассуждения, и сопоставляют варианты по соотношению точности и уровня усилия рассуждений (Max/High/Low).

Как это применить

У модели три настраиваемых уровня усилия рассуждений. Max даёт наивысшую точность (89,0%/61,4%) и единственный вариант, для которого раскрыта цена за задачу, $0,02 на ARC-AGI-1 и $0,04 на ARC-AGI-2. High (87,0%/56,0%) и Low (84,0%/46,0%) точнее не описаны по стоимости, страница её не приводит.

Можно ли доверять

Результаты опубликованы и верифицированы ARC Prize, организацией, которая ведёт бенчмарк ARC-AGI и независимо проверяет заявленные модели скоры на официальной странице результатов.

Риски и подводные камни

На странице нет оценки модели по ARC-AGI-3 (все три варианта помечены прочерком), нет данных об архитектуре или числе параметров модели, нет сравнения с результатами других моделей или места в общем рейтинге, не раскрыта цена за задачу для вариантов High и Low, и не пояснено, чем отличаются выборки Semi-Private и Public Eval.