Claude Opus 5 предложил материал для чипов, но ИИ-судья отверг рецепт синтеза
Стартап Discovered Materials (участник YC, батч P26) в статье с описанием методики представил бенчмарк для ИИ-агентов, которым поручают находить новые кристаллические материалы, совместимые с BEOL-этапом производства чипов (финальные, низкотемпературные стадии обработки после формирования транзисторов). Задача модели, предложить материал, у которого теплопроводность, статическая диэлектрическая проницаемость, модуль Юнга и модуль сдвига попадают в заданные целевые диапазоны. Материал обязан быть новым: он никогда прежде не осаждался в виде тонкой плёнки в BEOL-совместимых условиях, если судить по опубликованной литературе. К каждому кандидату модель обязана приложить рецепт синтеза, температурно и технологически совместимый с BEOL, рецепт, который экспертная проверка сочтёт достойным попытки. Кандидат с рецептом, который признали не стоящим попытки, не засчитывается.
Моделям дали набор инструментов, похожий на арсенал вычислительного материаловеда: веб-поиск через Exa, песочницу с python и bash и пакетами pymatgen, mp_api и ASE, а также ML-инструменты для расчёта динамической устойчивости, решёточной теплопроводности, статической диэлектрической проницаемости и тензора податливости (через который получают модуль Юнга и модуль сдвига). Свойства модели считают через универсальный межатомный потенциал на основе машинного обучения PET-MAD, а не через прямые DFT-расчёты, авторы отмечают, что в будущем DFT можно добавить как дополнение или гибридный подход. Модель работает без условия остановки: прогон идёт, пока не случится ошибка или не закончится бюджет в 100 миллионов токенов. Сам бенчмарк построен на открытом фреймворке Inspect от британского AI Security Institute.
Предложенные рецепты синтеза оценивают по рубрике из 17 штрафных критериев. Штрафы делятся на два типа: критические, они сразу означают, что рецепт «пробовать не стоит», и исправимые, по ним судья сам решает, пытаться синтезировать материал по этому рецепту или отметить его как маловероятный. Роль судьи играет модель GPT-5.6 Sol в режиме «худший из трёх прогонов» с доступом к веб-поиску OpenAI; авторы выбрали именно её, потому что её оценки лучше всего совпадали с оценками людей-экспертов, на которых изначально откалибровали рубрику.
Как живой пример авторы разобрали рецепт, который предложила Claude Opus 5, синтез гексагонального алмаза (лонсдейлита) методом затравочного микроволнового плазмохимического осаждения на кремниевой пластине диаметром 300 мм: буфер из AlN или h-BN, засев наноалмазной взвесью, рост при 380, 400°C в течение 8 часов до плёнки толщиной 80, 150 нм, с последующей плазменной и термической обработкой поверхности. Судья GPT-5.6 Sol вынес вердикт «пробовать не стоит»: один критический штраф из 17 возможных сразу решил дело, в рецепте нет конкретного технологического хода, который вёл бы именно к нужной упорядоченной гексагональной фазе, плюс ещё пять исправимых штрафов: недостаточно описанная плазма, пропущенная или неточная последовательность подачи газов, отсутствие плана по вытяжке и очистке выхлопа, условия процесса, недостаточные для нужной фазы, и предложенная характеризация, неспособная подтвердить состав и фазу материала. В обосновании судья указал: зародыши, на которых наноалмазный засев растёт, по природе кубические, а не гексагональные, и ни смещение подложки напряжением, ни низкотемпературный отжиг не дают механизма для нужной укладки слоёв ABAB; реальный, действительно чистый гексагональный алмаз ранее получали иначе, из ориентированного графита при давлении 20 ГПа и температуре 1300, 1900°C.
Ключевые факты
- Discovered Materials (YC, батч P26) описали бенчмарк: ИИ-агенты ищут новые кристаллические материалы для BEOL-этапа производства чипов по заданным теплопроводности, диэлектрической проницаемости, модулю Юнга и модулю сдвига.
- Материал засчитывается, только если он новый (никогда не осаждался тонкой плёнкой в BEOL-условиях) и снабжён рецептом синтеза, который экспертная проверка сочтёт достойным попытки.
- Инструменты моделей, веб-поиск через Exa, песочница с python/bash и пакетами pymatgen/mp_api/ASE, ML-модели для расчёта устойчивости, теплопроводности, диэлектрической проницаемости и механических свойств; лимит, 100 млн токенов на прогон.
- Рецепты синтеза оценивает модель-судья GPT-5.6 Sol (режим «худший из трёх», с веб-поиском) по рубрике из 17 штрафных критериев, часть которых критические и решают вердикт сразу.
- На разобранном примере GPT-5.6 Sol отклонила рецепт гексагонального алмаза (лонсдейлита) от Claude Opus 5: одна критическая ошибка в механизме фазообразования плюс пять исправимых недочётов процесса.
Почему это важно
Материал показывает, как проверять ИИ-агентов не на текстовых задачах, а на реальной научной работе целиком: агент должен не просто назвать материал с нужными свойствами, а провести его через расчёт физических параметров, а затем, через независимую проверку, можно ли этот материал вообще синтезировать. Это закрывает разрыв между «модель предложила идею» и «идею реально можно воплотить», который у чисто генеративных бенчмарков обычно остаётся непроверенным.
Кому это важно
Материаловедам и инженерам полупроводниковой отрасли, которые работают с BEOL-совместимыми материалами; разработчикам ИИ-агентов для научных задач, которым нужен пример end-to-end пайплайна «предложение → расчёт свойств → проверка синтезируемости»; тем, кто строит собственные бенчмарки для агентного ИИ в естественных науках.
Как это применить
В тексте описан открытый инструментарий, на котором можно воспроизвести подобную оценку: фреймворк Inspect от AI Security Institute, потенциал PET-MAD и пакеты pymatgen, mp_api, ASE для расчёта свойств кандидатов. Схему грейдинга, рубрика из штрафов с делением на критические и исправимые, судья-модель в режиме «худший из трёх», можно перенести на другие агентные бенчмарки, где нужно оценивать не только идею, но и её практическую реализуемость.
Можно ли доверять
Источник, собственный отчёт команды Discovered Materials о методике своего же бенчмарка, без независимой проверки со стороны. В разобранном фрагменте нет сводных результатов бенчмарка: ни доли успешных кандидатов, ни числа предложенных материалов, ни сравнения моделей между собой, только методика и один разобранный пример с отклонённым рецептом. Судейство при этом ведёт другая ИИ-модель (GPT-5.6 Sol), а не физический эксперимент: авторы утверждают, что её оценки совпадают с оценками людей-экспертов, но независимого подтверждения этому в тексте нет.
Риски и подводные камни
Вся цепочка проверки, расчётная и модельная: свойства материала оценивают ML-инструменты, а осуществимость рецепта, другая языковая модель, а не физический синтез в лаборатории. Разобранный пример как раз демонстрирует риск: рецепт, который выглядел правдоподобно детальным, содержал скрытую ошибку в механизме образования нужной фазы, которую заметил только точечный анализ судьи. Это значит, что качество всего бенчмарка держится на полноте рубрики штрафов и на том, насколько хорошо модель-судья ловит именно такие содержательные, а не формальные пробелы.
«Плазма CH₄/H₂ и плотный засев наноалмазом могли бы правдоподобно дать сплошную нанокристаллическую алмазную плёнку. Но они не дают достоверного пути к заявленной упорядоченной фазе P6₃/mmc: рост пойдёт на преимущественно кубических зародышах наноалмаза, что фактически изолирует его от предложенного гексагонального буфера. Процесс на пластине 300 мм к тому же сильно недоработан в том виде, как он описан: с неполной последовательностью импульсов и подачи газа и без плана вытяжки выхлопа. Наконец, рамановская спектроскопия, GIXRD и обычная SAED могут ошибочно принять дефектный или двойникованный кубический алмаз за гексагональный. Я бы не стал пробовать этот рецепт для получения лонсдейлита, хотя его можно переделать в эксперимент по кубическому наноалмазу.»
— ИИ-судья GPT-5.6 Sol, оценка рецепта Claude Opus 5, отчёт Discovered Materials