Mechanist сам находит механизмы работы нейросетей и уже обнаружил риск для их безопасности

ИИ-модели показывают впечатляющие результаты в самых разных областях, но механизмы, которые стоят за их способностями, и риски, которые эти способности могут нести, до сих пор изучены плохо. Авторы работы указывают: по мере того как разработка ИИ ускоряется и всё больше автоматизируется, изучение механизмов работы моделей остаётся ручным трудом, и разрыв между тем, что модели умеют, и тем, насколько люди способны их понять и проконтролировать, только растёт.
Чтобы сократить этот разрыв, авторы представили Mechanist, агентную систему, которая использует сам искусственный интеллект как научный инструмент для автономного поиска механизмов, лежащих в основе способностей ИИ. Команда построила граф знаний по интерпретируемости примерно из 13 000 научных работ, объединила его с мультидисциплинарной базой данных, которая охватывает 43 миллиона работ по 26 научным дисциплинам, и собрала библиотеку из 32 базовых методов для анализа механизмов, причинных интервенций и проверки гипотез. По словам авторов, по сравнению с Claude Code и другими существующими системами класса «ИИ-учёный» Mechanist предлагает более ценные гипотезы о механизмах и надёжнее проводит эксперименты, но в тексте нет ни одной цифры или результата сравнительной проверки, которые подтверждали бы это, и не уточняется, считают ли сами авторы Claude Code одной из систем такого класса или отдельным ориентиром для сравнения.
На практике Mechanist показал путь от обнаружения того, как ведут себя модели, до объяснения этого поведения и управления им. Сначала система выявила неочевидный риск для безопасности в контексте научных лабораторий: небезопасные свойства модели способны переходить между модальностями через обучающие данные, которые выглядят полностью безопасными. Источник не уточняет, о каких именно модальностях, типе данных или лаборатории идёт речь, только сам факт такого переноса.
Затем Mechanist построил механистическую теорию формирования убеждений: как модели представляют знания о мире, формируют собственные убеждения, делают выводы об убеждениях других и как эти механизмы возникают уже на этапе предобучения.
Наконец, эти находки о механизмах авторы превратили в практические вмешательства: они улучшили работу моделей в разных сценариях и, отдельно, направили научные базовые модели на генерацию последовательностей ДНК с заданными свойствами. Какие именно сценарии и свойства ДНК имеются в виду, источник не конкретизирует.
Ключевые факты
- Mechanist, агентная система, которая использует ИИ как научный инструмент для автономного поиска и проверки гипотез о механизмах, лежащих в основе способностей ИИ-моделей.
- Инфраструктура системы: граф знаний примерно из 13 000 научных работ по интерпретируемости, база данных на 43 миллиона работ по 26 научным дисциплинам и библиотека из 32 базовых методов анализа механизмов, причинных интервенций и проверки гипотез.
- По утверждению авторов, Mechanist генерирует более ценные гипотезы и надёжнее проводит эксперименты, чем Claude Code и другие системы класса «ИИ-учёный», точных цифр сравнения источник не приводит.
- Mechanist обнаружил неочевидный риск для безопасности: небезопасные свойства модели способны переходить между модальностями через обучающие данные, которые выглядят полностью безопасными.
- Система также построила механистическую теорию формирования убеждений у моделей и применила находки на практике, вплоть до направления научных базовых моделей на генерацию последовательностей ДНК с заданными свойствами.
Почему это важно
ИИ-модели становятся мощнее быстрее, чем растёт понимание того, как они устроены внутри. Разработка ускоряется и всё больше автоматизируется, а изучение механизмов работы моделей остаётся ручным трудом исследователей, разрыв между тем, что модели умеют, и тем, насколько люди способны их понять и проконтролировать, растёт. Mechanist, это попытка поручить сам процесс интерпретируемости искусственному интеллекту: система самостоятельно выдвигает гипотезы о механизмах работы моделей, ставит причинные эксперименты и проверяет результаты, опираясь на граф знаний из 13 000 научных работ и мультидисциплинарную базу на 43 миллиона работ по 26 дисциплинам.
Кому это важно
В первую очередь, исследователям в области интерпретируемости и безопасности ИИ: у них появляется система, которая берёт на себя часть ручной работы по анализу того, как устроены модели. Разработчикам систем класса «ИИ-учёный» полезно прямое сравнение Mechanist с Claude Code и аналогичными системами, которое приводят авторы. А через практическое применение к научным базовым моделям, которые генерируют последовательности ДНК, находки касаются и специалистов, использующих ИИ в биологии и других естественных науках.
Как это применить
Mechanist представлен как исследовательская система, а не готовый коммерческий продукт: в тексте нет ни цены, ни лицензии, ни сведений о публичном доступе к коду или сервису. Практическую ценность авторы показывают на примерах: находки о механизмах моделей они превратили в конкретные вмешательства, которые улучшили работу моделей в разных сценариях и позволили направить научные базовые модели на генерацию последовательностей ДНК с заданными свойствами. Какие именно сценарии и свойства ДНК имеются в виду, источник не раскрывает.
Можно ли доверять
Сам текст источника не называет ни имён исследователей, ни организации, ни места публикации, это особенность жанра препринта, а не пересказа. Ключевое сравнительное заявление, что Mechanist генерирует более ценные гипотезы и надёжнее проводит эксперименты, чем Claude Code и другие системы класса «ИИ-учёный», не подкреплено в тексте ни одной цифрой или результатом сравнительной проверки, это заявление авторов о собственной системе, и его стоит воспринимать как предварительное, до независимой проверки. На Hugging Face материал набрал 80 отметок при 2 комментариях.
Риски и подводные камни
Риск здесь двойной. Во-первых, сама находка Mechanist настораживает: небезопасные свойства модели способны переходить между модальностями через обучающие данные, которые выглядят полностью безопасными, а источник не говорит, о каких именно данных и модальностях речь. Скрытый перенос такого рода плохо совместим с тем, как индустрия сейчас проверяет безопасность обучающих данных. Во-вторых, сам Mechanist, это ИИ, который автономно исследует и меняет поведение других ИИ-моделей вплоть до направления генерации последовательностей ДНК; источник не приводит независимой оценки надёжности и безопасности такого автономного вмешательства.