EEGAgentBench: бенчмарк проверил 29 языковых моделей на анализе ЭЭГ
Анализ электроэнцефалограмм (ЭЭГ) постепенно уходит от классификации коротких фрагментов к интерпретации длинных записей. Для этого нужно шаг за шагом накапливать свидетельства, рассуждать в несколько этапов и согласованно применять специализированные инструменты обработки сигналов. Большие языковые модели уже показали потенциал в роли автономных агентов для ЭЭГ, но, по словам авторов статьи, существующие оценки таких агентов разрозненны: они охватывают мало задач, узкие временные горизонты, используют несогласованные протоколы и не дают полной картины рассуждений, работы с инструментами и построения рабочих процессов.
Чтобы закрыть этот пробел, авторы предлагают EEGAgentBench, единый бенчмарк для систематической оценки языковых агентов на коротких и длинных задачах анализа ЭЭГ. Он охватывает шесть типичных ЭЭГ-задач: от вопросов на знание предметной области до разметки стадий сна. Длительность сигналов, от 2 секунд почти до 23 часов, а целевые ответы бывают разными: от меток классов до интервалов событий и последовательностей по эпохам. Такая конструкция позволяет единообразно оценивать рассуждение на основе знаний, интерпретацию коротких записей, обнаружение событий на длинных записях и понимание последовательностей.
Агентам дают 10 детерминированных инструментов анализа ЭЭГ, которые выдают только измерения сигнала, относящиеся к задаче. Поэтому агент должен сам выбирать инструменты, поэтапно накапливать свидетельства и строить многошаговые процессы.
В эксперименте авторы проверили 29 передовых языковых моделей из 15 семейств. По их выводам, бенчмарк хорошо различает возможности агентов независимо от размера модели и стоимости вывода. Одновременно результаты показывают существенные ограничения нынешних агентов в анализе длинных ЭЭГ-записей, прежде всего в устойчивом накоплении свидетельств и многошаговых рассуждениях.
Ключевые факты
- EEGAgentBench, единый бенчмарк для оценки языковых агентов на коротких и длинных задачах анализа ЭЭГ.
- Охватывает шесть типичных ЭЭГ-задач, от вопросов на знание предметной области до разметки стадий сна; длительность сигналов, от 2 секунд почти до 23 часов.
- Агентам доступны 10 детерминированных инструментов анализа ЭЭГ, выдающих только измерения, относящиеся к задаче: выбирать инструменты и строить процесс нужно самостоятельно.
- Проверены 29 передовых языковых моделей из 15 семейств.
- Главный вывод авторов: у современных агентов есть существенные ограничения на длинных записях, особенно в накоплении свидетельств и многошаговых рассуждениях.
Почему это важно
Анализ ЭЭГ смещается от классификации коротких отрезков к интерпретации длинных записей, а оценки ИИ-агентов в этой области, по словам авторов, разрознены: разные задачи, узкие горизонты, несогласованные протоколы. Единый бенчмарк с общими условиями даёт возможность сравнивать агентов между собой и видеть, где именно они проваливаются.
Кому это важно
Исследователям, которые строят агентов для анализа ЭЭГ и других длинных биосигналов, и командам, оценивающим языковые модели на многошаговых задачах с инструментами. Также интересно тем, кто разрабатывает методики оценки агентов.
Как это применить
Бенчмарк можно использовать как общую схему проверки: шесть задач, записи от 2 секунд до почти 23 часов и набор из 10 детерминированных инструментов, из которых агент выбирает сам. В описании статьи не сказано, опубликованы ли код и данные, поэтому доступность стоит проверить на странице работы.
Можно ли доверять
Это аннотация статьи на arXiv, то есть заявления самих авторов. В тексте нет названий моделей, числовых результатов и рейтингов, поэтому вывод о «существенных ограничениях» нельзя проверить по цифрам. Утверждение о том, что бенчмарк различает агентов независимо от размера модели и стоимости вывода, тоже подано без конкретных данных.
Риски и подводные камни
Выводы об ограничениях агентов даны качественно, без количественных оценок, а состав 15 семейств моделей и данных для шести задач в аннотации не раскрыт. Результаты относятся к конкретному набору из 10 инструментов, предоставленных бенчмарком, и не обязательно переносятся на другие настройки.