Стелс-модель big-pickle обошла всех, кроме Claude, в тесте SWE Atlas на понимание кода

На GitHub опубликован независимый прогон бенчмарка SWE Atlas от Scale AI (категория Codebase QnA: модель должна отвечать на вопросы о реальной кодовой базе) для big-pickle, бесплатной стелс-модели, доступной через сервис OpenCode Zen. Из 124 задач модель решила 63, показав долю решённых задач 50,8%. Тест провели 11 августа 2026 года с помощью того же официального открытого инструментария, набора задач и модели-судьи, которые Scale AI использует для собственного официального рейтинга (обновлён 28 июля 2026 года).
big-pickle оценивали в общем «весовом классе», агентском каркасе (scaffold) mini-swe-agent, минимальной обвязке на bash-командах, которую Scale AI использует для сторонних моделей без собственной «фирменной» интеграции с бенчмарком (в отличие, например, от Codex у OpenAI или Claude Code у Anthropic). Именно в этом классе big-pickle обошла по доле решённых задач всех участников официального рейтинга, включая GPT-модели на каркасе Codex. Выше big-pickle оказались только две модели Claude, но они выступали на каркасе Claude Code, так что прямое сравнение с ними уже не совсем равные условия.
Методику постарались повторить как можно точнее: инструментарий Harbor версии 0.18.0 с песочницами Modal, каркас mini-swe-agent версии 2.4.6, тот же лимит в 250 шагов и та же система оценки по критериям, что в официальном протоколе. Модель-судья, Claude Opus 4.5 (точный технический идентификатор claude-opus-4-5-20251101, как требует протокол Scale AI), доступ к ней получили через совместимый с OpenAI API-эндпоинт Anthropic. Сама big-pickle бесплатна в свой стелс-период, доступ к ней, через совместимый с OpenAI API OpenCode Zen. На весь прогон из 124 задач ушло 674 млн входных и 4,3 млн выходных токенов; вычисления в облаке Modal обошлись примерно в $70 (при заявленных для задач 16 ядрах CPU и 16 ГБ памяти вышло бы в 2, 3 раза больше, ресурсы песочницы сознательно урезали до 4 ядер и 8 ГБ, чтобы уложиться в личный бюджет), ещё около $25 ушло на API Anthropic за работу модели-судьи.
У результата есть существенные оговорки. Тест не проводила и не проверяла сама Scale AI, это самостоятельный, самостоятельно опубликованный прогон. Вместо официальных трёх попыток на задачу с усреднением сделали одну, из-за чего стандартная ошибка результата, около ±4,5 процентного пункта, что сопоставимо с ±5 п.п. официальной погрешности самого рейтинга. Урезанные ресурсы песочницы теоретически могли только ухудшить результат big-pickle, через таймауты команд или аварийные завершения по нехватке памяти, а не завысить его, и проверка всех 124 траекторий агента не нашла ни одного такого случая: ни одна команда не подошла ни к пределу в 900 секунд, ни к пределу памяти. Происхождение модели официально не подтверждено: по косвенным признакам, ошибкам провайдера и особенностям ответов API, предполагают, что за big-pickle стоит инфраструктура DeepSeek, но это не доказанный факт, и модель под этим псевдонимом может незаметно смениться в любой момент. У двух решённых задач часть критериев осталась без оценки: после восьми попыток ответ модели-судьи не удалось разобрать (5 из 11 критериев по одной задаче, 1 критерий, по другой); по правилам бенчмарка неоценённые критерии просто не учитываются при подсчёте. Если же признать оба случая провалом, результат снижается до 61 из 124 задач (49,2%), и это всё равно выше любой другой записи в классе mini-swe-agent.
OpenCode прямо предупреждает: запросы к big-pickle в период бесплатного доступа могут использоваться для улучшения модели, а значит, содержимое задач бенчмарка (публичное, но помеченное скрытой меткой Scale для отслеживания) неизбежно ушло на сторону поставщика модели. Дата окончания бесплатного периода и цена после него нигде не названы. При этом все данные для независимой проверки выложены в открытом доступе: полные логи модели-судьи по каждой задаче и каждому критерию, конфигурации запуска и инструкции по воспроизведению, код и результаты лицензированы по MIT. Сами создатели SWE Atlas просят относиться к бенчмарку как к независимому индикатору прогресса, а не как к цели, под которую стоит целенаправленно обучать модели.
Ключевые факты
- big-pickle, бесплатная стелс-модель на OpenCode Zen с официально неподтверждённым происхождением, набрала 50,8% (63 из 124) в бенчмарке SWE Atlas (категория Codebase QnA) от Scale AI.
- В своём классе, агентском каркасе mini-swe-agent, результат выше любой записи официального рейтинга, включая GPT-модели на каркасе Codex; выше оказались только две модели Claude, но они работали на другом каркасе, Claude Code.
- Тест не проводила и не проверяла сама Scale AI: прогон сделали один раз на задачу вместо официальных трёх попыток, из-за чего стандартная ошибка результата, около ±4,5 процентного пункта (у самого рейтинга заявлена погрешность ±5 п.п.).
- Ресурсы песочницы урезали до 4 ядер CPU и 8 ГБ памяти вместо заявленных 16 и 16, но проверка всех 124 траекторий агента не нашла ни одного таймаута или аварийного завершения по памяти.
- У двух решённых задач часть критериев осталась без оценки из-за нечитаемого ответа модели-судьи; при самом строгом подсчёте (неоценённое = провал) результат снижается до 61 из 124 (49,2%), и всё равно остаётся выше любой другой записи в классе mini-swe-agent.
Почему это важно
История интересна не столько цифрой, сколько тем, кто её показал. big-pickle, модель без подтверждённого происхождения, доступная бесплатно через сторонний сервис OpenCode Zen, а не флагманский релиз крупной лаборатории. Тем не менее в своём классе она обошла по доле решённых задач все модели официального рейтинга SWE Atlas, включая GPT-модели, и уступила лишь двум версиям Claude, которые к тому же выступали на более благоприятном для себя каркасе, собственном Claude Code, а не универсальном mini-swe-agent. Это подтверждает: сильные модели для работы с кодом всё чаще появляются вне списка привычных лабораторий, под псевдонимами, в стелс-режиме и иногда бесплатно, пока их происхождение официально не раскрыто.
Кому это важно
Разработчикам, которые выбирают модель для агентов, работающих с кодом, и хотят понять, насколько бесплатные малоизвестные варианты отстают от именитых. Инженерам по оценке ИИ, как пример методичного самостоятельного прогона с полным набором логов для проверки, включая разбор того, как урезанные ресурсы и однократные попытки влияют на итоговый балл. Пользователям OpenCode Zen, которые уже могут бесплатно опробовать big-pickle. И всем, кто следит за стелс-релизами моделей и пытается угадать, какая компания стоит за очередным псевдонимом, в данном случае косвенные признаки указывают на инфраструктуру DeepSeek.
Как это применить
big-pickle доступна бесплатно прямо сейчас через совместимый с OpenAI API-эндпоинт OpenCode Zen (маршрут openai/big-pickle через litellm), можно опробовать модель на своих задачах без затрат на токены, пока длится стелс-период. Все конфигурации прогона, полные логи модели-судьи по каждой задаче и инструкции по воспроизведению выложены в открытый репозиторий на GitHub и лицензированы по MIT, тест можно повторить самостоятельно или расширить на другие категории SWE Atlas (Test Writing, Refactoring), конфигурации для которых уже подготовлены, но пока не прогонялись. Сами создатели SWE Atlas просят не превращать бенчмарк в цель обучения моделей, а использовать его как независимый индикатор прогресса, стоит держать это в уме при оценке любого высокого балла, включая этот.
Можно ли доверять
С осторожностью. Тест не проводила и не проверяла сама Scale AI, это самостоятельный прогон стороннего разработчика. Вместо официальных трёх попыток на задачу с усреднением сделали одну, при 124 задачах это даёт стандартную ошибку около ±4,5 процентного пункта, что сопоставимо с ±5 п.п. официальной погрешности самого рейтинга: реальный результат может пересекаться с соседними позициями таблицы. Происхождение big-pickle официально не подтверждено, на инфраструктуру DeepSeek указывают лишь косвенные признаки (ошибки провайдера, особенности ответов API), а не доказанный факт, и модель под этим псевдонимом может незаметно смениться в любой момент, так что результат, снимок на конкретную дату (11 августа 2026 года), а не постоянная характеристика. У двух решённых задач часть критериев осталась без оценки из-за сбоя модели-судьи; авторский пересчёт по самому жёсткому сценарию (61 из 124, 49,2%) всё равно держит big-pickle выше всех остальных записей класса mini-swe-agent, и это в пользу устойчивости результата. Главный компенсирующий фактор, открытость: полные логи по каждому критерию каждой задачи и воспроизводимые конфигурации выложены для независимой проверки, что не отменяет самопровозглашённый статус оценки, но заметно снижает риск чистой выдумки.
Риски и подводные камни
OpenCode прямо предупреждает: запросы к big-pickle в период бесплатного доступа могут использоваться для улучшения модели, а значит, содержимое задач бенчмарка (публичное, но помеченное скрытой меткой Scale для отслеживания) неизбежно ушло на сторону поставщика модели. Дата окончания бесплатного периода и цена после него нигде не названы, так что модель, которую сегодня можно использовать бесплатно и без ограничений, завтра может подорожать или вовсе исчезнуть. Неподтверждённое происхождение, это не только вопрос доверия к цифрам, но и практический риск: неясно, к какой юрисдикции и политике обработки данных привязан сервис, который в реальности стоит за псевдонимом big-pickle. Наконец, сама методика, единичный прогон вместо усреднённых трёх, урезанные ресурсы песочницы, делает высокий балл поводом присмотреться к модели, но не основанием считать её точно сильнее конкретных именованных конкурентов без дополнительной проверки.