Claude Opus 5 обошёл GPT в новом бенчмарке электроники EEBench

Команда стартапа atopile выпустила бенчмарк EEBench после того, как OpenAI показала на презентации, как модель GPT-6 Astra работает в программе для проектирования плат KiCad. Авторы решили проверить не то, умеет ли модель кликать по интерфейсу CAD-программы, а то, работает ли схема, которую она выдаёт на выходе.
Вместо графического редактора агент в EEBench работает с электроникой через декларативный код atopile: описывает компоненты, соединения и электрические ограничения текстом, может менять схему, собирать её и запускать симуляцию, не выходя из проекта. По словам авторов, так тестируется именно электроника, а не умение модели пользоваться компьютером.
Пример открытой задачи, счётчик электроэнергии. Когда пропадает питание 5 В, схема должна ещё 20 мс поддерживать процессор, чтобы тот успел сохранить накопленные показания; при этом напряжение на защищённой шине не должно опускаться ниже порога отключения процессора в 3,0 В. Большинство моделей верно предлагают поставить конденсатор, но дальше начинаются нюансы: керамический конденсатор под напряжением реально даёт заметно меньше ёмкости, чем указано на нём, у деталей есть допуски, а слишком большая ёмкость увеличивает стоимость, занимает больше места и замедляет восстановление напряжения после возврата питания. EEBench обрезает питание в симуляции и измеряет, что происходит с напряжением, эффективной ёмкостью в рабочей точке и восстановлением схемы. В более сложной аналоговой задаче агенту нужно рассчитать многопетлевой (multiple-feedback) фильтр низких частот на операционном усилителе, подобрать соотношения резисторов и конденсаторов под нужные полюса и удержать усиление, частоту среза и добротность в допусках даже в худшем сочетании отклонений номиналов деталей.
Проверка полностью детерминированная: система собирает схему, строит список компонентов, прогоняет набор SPICE-симуляций и сверяет каждое измерение с заданным пределом. При этом EEBench использует реальные детали от производителей с параметрами из даташитов, так что агенту нужно не просто попасть в формулы, а выбрать компоненты, которые реально существуют, доступны для заказа и разумны по цене; экономия по стоимости засчитывается только после того, как схема уже работает.
По результатам на 1 сентября в 13 задачах EEBench V1 лидирует Claude Opus 5 с результатом 61,6%. Второе место у Grok 4.6, 57,1%, третье у Claude Fable 5.1, 56,4%. Модели OpenAI идут заметно ниже: GPT-5.5 набрала 42,3%, GPT-5.6 Sol, 39,4%; результата для самой GPT-6 Astra, чья демонстрация и запустила проект, у авторов пока нет. Отдельно xAI включила EEBench в карточку модели Grok 4.6, в раздел про ускорение инженерной работы, и привела там собственный прогон на 60,0%, это получено в режиме расширенных рассуждений xhigh и отличается от 57,1%, которые для того же Grok 4.6 намерили сами авторы EEBench. По словам xAI, Grok 4.6 обучали на инженерных данных высокого качества и дообучали с подкреплением в средах, включающих системы автоматизированного проектирования, авторы EEBench считают, что результат модели этому соответствует.
Авторы подчёркивают, что EEBench V1 проверяет только цикл требований, проектирования и верификации через симуляцию, не разводку платы, не производство и не физический запуск готового устройства; эти этапы планируется добавить позже. Они также упоминают, что Илон Маск анонсировал модель Grok 4.7 «в течение нескольких недель» после дополнительного обучения на данных SpaceX с прицелом на инженерные задачи, но точной даты и гарантии сроков нет.
Ключевые факты
- EEBench создала команда стартапа atopile после того, как OpenAI показала на презентации, как GPT-6 Astra работает в программе для проектирования плат KiCad.
- Агент работает с электроникой через декларативный код atopile, а не через графический интерфейс: меняет схему, собирает её и запускает SPICE-симуляцию внутри проекта.
- Пример задачи: при исчезновении питания 5 В схема должна ещё 20 мс держать процессор живым, не давая напряжению на защищённой шине упасть ниже порога отключения 3,0 В.
- По результатам на 1 сентября в 13 задачах EEBench V1: Claude Opus 5, 61,6% (1-е место), Grok 4.6, 57,1%, Claude Fable 5.1, 56,4%, GPT-5.5, 42,3%, GPT-5.6 Sol, 39,4%; результата для GPT-6 Astra пока нет.
- xAI в карточке модели Grok 4.6 привела собственный прогон EEBench на 60,0% (режим рассуждений xhigh), это отличается от 57,1%, которые для того же Grok 4.6 получили сами авторы бенчмарка.
Почему это важно
Демонстрация GPT-6 Astra, работающей в KiCad, показала, что модели уже пробуют проектировать электронику, но не ответила на вопрос, насколько хороша получающаяся схема. EEBench даёт для этого объективную проверку: не оценку «на глаз», а результат симуляции по реальным физическим пределам, напряжениям, допускам деталей, устойчивости в худшем случае.
Кому это важно
Разработчикам инженерных ИИ-агентов и командам, которые встраивают модели в проектирование электроники, бенчмарк даёт им единую метрику вместо субъективных демо. Лабораториям вроде OpenAI и xAI, способ показать инженерные возможности модели через независимую проверку: xAI уже сослалась на EEBench в карточке модели Grok 4.6. Инженерам-практикам, ориентир, для каких классов схем ИИ-помощь уже осмысленна, а для каких пока рано.
Как это применить
EEBench и лежащий в его основе инструмент atopile, публичные: методология и обозреватель примерных результатов открыты, и любой желающий может прогнать свою модель через 13 задач или попробовать сам atopile на собственной плате. Командам, которые занимаются оценкой моделей или их дообучением, авторы предлагают отдельно обсудить более крупные наборы задач и обучающие среды на основе тех же SPICE-проверок.
Можно ли доверять
Материал написан самой командой, которая строит и продаёт EEBench как продукт, это стоит учитывать при чтении рейтинга. При этом технические проверки в EEBench детерминированные: результат определяется симуляцией по фиксированным физическим пределам, а не мнением жюри. Показателен и открыто указанный источниками разнобой: собственный прогон xAI для Grok 4.6 (60,0%, с усиленным режимом рассуждений) отличается от 57,1%, которые для той же модели получила сама EEBench, то есть даже здесь методика прогона заметно влияет на итоговый процент.
Риски и подводные камни
EEBench V1 проверяет только требования, проектирование и верификацию через симуляцию, не разводку платы, не производство и не запуск готового устройства; сами авторы говорят, что не стали бы доверять ИИ проектирование, скажем, кардиостимулятора и слепо собирать то, что он выдал. Набор пока ограничен 13 задачами, а лидирующий результат в 61,6% означает, что даже у лучшей модели ощутимая часть требований в задачах не выполняется.
«Мы бы всё ещё не стали доверять ИИ проектирование кардиостимулятора и слепо собирать то, что он выдал.»
— команда EEBench (atopile)