ИИ проверяет соответствие методов и заявлений в научных статьях
Число заявок на научные конференции растёт быстрее, чем число рецензентов, поэтому языковые модели всё чаще привлекают в помощь при рецензировании. Существующие автоматические оценщики новизны обычно сверяют заявленный в статье вклад с прежними публикациями, по сути ищут, не изобретено ли это уже кем-то другим, и при этом молча предполагают, что заявленный вклад действительно реализован методами самой статьи. Но рецензенты-люди часто отклоняют работу по другой причине: не потому что похожая идея уже существует, а потому что представленные в статье методы попросту не подтверждают заявленную новизну. Это внутреннее рассогласование между обещаниями во введении и содержанием раздела методов существующие системы почти не проверяют. Авторы предлагают методику «проверки заявлений внутри статьи»: языковая модель сначала вычленяет из введения заявления о новизне, затем находит в тексте статьи методологические свидетельства, относящиеся именно к этим заявлениям, и наконец оценивает, действительно ли методы их подтверждают, результатом становится структурированный комментарий в стиле рецензента. Критерии такой оценки выведены не кабинетно, а индуктивно, из реальных рецензий, собранных по 182 статьям ICLR 2025, поэтому система учитывает типичные претензии людей к новизне, методологии и ясности изложения. Методику проверили на сбалансированной выборке принятых и отклонённых статей, сравнив её замечания с замечаниями настоящих рецензентов тех же работ. Оценка людьми показала заметное совпадение между находками системы и претензиями реальных рецензентов, особенно по вопросам новизны. Дополнительно метрика BERTScore показала: система отличает правильно сопоставленные пары «рецензент-человек, рецензия ИИ» от случайно перепутанных контрольных пар, то есть улавливает содержательно те же проблемы, что видят люди.
Ключевые факты
- Новая методика, «проверка заявлений внутри статьи»: ИИ сверяет, подтверждают ли методы статьи заявленную во введении новизну, а не просто ищет совпадения с прежними работами
- Критерии оценки выведены из реальных рецензий, собранных по 182 статьям ICLR 2025, и отражают типичные претензии рецензентов к новизне, методологии и ясности изложения
- Методику проверили на сбалансированной выборке принятых и отклонённых статей, сравнив её замечания с замечаниями настоящих рецензентов
- Оценка людьми показала заметное совпадение замечаний системы с замечаниями реальных рецензентов, особенно по вопросам новизны
- Метрика BERTScore подтвердила: система отличает верно сопоставленные пары человек-ИИ рецензий от случайно перепутанных
Почему это важно
Число заявок на научные конференции растёт быстрее, чем число рецензентов, поэтому языковые модели всё активнее привлекают в помощь при рецензировании. Существующие автоматические оценщики новизны в основном сверяют заявленный вклад статьи с прежними работами и при этом молча предполагают, что этот вклад действительно реализован методами самой статьи. Рецензенты-люди же часто отклоняют статью по другой причине: не потому что похожая идея уже существует, а потому что представленные методы попросту не подтверждают заявленную новизну. Это внутреннее рассогласование между тем, что обещано во введении, и тем, что показывает раздел методов, действующие системы почти не проверяют.
Кому это важно
Авторам, которые готовят статьи для конференций уровня ICLR и хотят заранее увидеть нестыковки между введением и методами до того, как их заметит рецензент. Организаторам конференций и самим рецензентам, которые ищут способ автоматизировать часть рутинной проверки и снизить нагрузку при растущем потоке заявок. Разработчикам ИИ-инструментов для научного рецензирования, методика показывает конкретный тип проверки, которого не хватает существующим сервисам оценки новизны.
Как это применить
Система работает в три шага. Сначала языковая модель вычленяет из введения статьи заявления о новизне, то, что авторы называют своим вкладом. Затем она находит в тексте статьи методологические свидетельства, относящиеся именно к этим заявлениям. Наконец, она оценивает, действительно ли эти методы подтверждают заявленную новизну, и формирует структурированный комментарий в стиле рецензента. Сами критерии оценки выведены индуктивно из реальных рецензий, собранных по 182 статьям ICLR 2025, а не придуманы авторами кабинетно, так методика учитывает типичные претензии людей к новизне, методологии и ясности изложения.
Можно ли доверять
Авторы проверили методику на сбалансированной выборке принятых и отклонённых статей, сравнив её замечания с замечаниями настоящих рецензентов тех же работ. Оценка людьми показала заметное совпадение между находками системы и претензиями реальных рецензентов, особенно в вопросах новизны. Дополнительно метрика BERTScore показала, что система отличает правильно сопоставленные пары «рецензент-человек, рецензия ИИ» от случайно перепутанных контрольных пар, а значит, улавливает содержательно те же проблемы, что видят люди.
Риски и подводные камни
Это исследовательская работа, а не готовый сервис: методику проверяли только на статьях ICLR 2025, и не факт, что она так же хорошо перенесётся на другие конференции и научные области. Система проверяет только внутреннюю согласованность, заявления против методов, и не заменяет проверку новизны относительно всей научной литературы, это дополнение к существующим инструментам, а не замена им. В тексте нет данных о том, какая именно языковая модель используется, о стоимости прогона или о доле ложных срабатываний, так что итоговое решение по-прежнему остаётся за рецензентом-человеком.