EEGAgentBench: бенчмарк проверил 29 языковых моделей на анализе ЭЭГ

Анализ электроэнцефалограмм (ЭЭГ) постепенно уходит от классификации коротких фрагментов к интерпретации длинных записей. Для этого нужно шаг за шагом накапливать свидетельства, рассуждать в несколько этапов и согласованно применять специализированные инструменты обработки сигналов. Большие языковые модели уже показали потенциал в роли автономных агентов для ЭЭГ, но, по словам авторов статьи, существующие оценки таких агентов разрозненны: они охватывают мало задач, узкие временные горизонты, используют несогласованные протоколы и не дают полной картины рассуждений, работы с инструментами и построения рабочих процессов.

Чтобы закрыть этот пробел, авторы предлагают EEGAgentBench, единый бенчмарк для систематической оценки языковых агентов на коротких и длинных задачах анализа ЭЭГ. Он охватывает шесть типичных ЭЭГ-задач: от вопросов на знание предметной области до разметки стадий сна. Длительность сигналов, от 2 секунд почти до 23 часов, а целевые ответы бывают разными: от меток классов до интервалов событий и последовательностей по эпохам. Такая конструкция позволяет единообразно оценивать рассуждение на основе знаний, интерпретацию коротких записей, обнаружение событий на длинных записях и понимание последовательностей.

Агентам дают 10 детерминированных инструментов анализа ЭЭГ, которые выдают только измерения сигнала, относящиеся к задаче. Поэтому агент должен сам выбирать инструменты, поэтапно накапливать свидетельства и строить многошаговые процессы.

В эксперименте авторы проверили 29 передовых языковых моделей из 15 семейств. По их выводам, бенчмарк хорошо различает возможности агентов независимо от размера модели и стоимости вывода. Одновременно результаты показывают существенные ограничения нынешних агентов в анализе длинных ЭЭГ-записей, прежде всего в устойчивом накоплении свидетельств и многошаговых рассуждениях.

Ключевые факты

  • EEGAgentBench, единый бенчмарк для оценки языковых агентов на коротких и длинных задачах анализа ЭЭГ.
  • Охватывает шесть типичных ЭЭГ-задач, от вопросов на знание предметной области до разметки стадий сна; длительность сигналов, от 2 секунд почти до 23 часов.
  • Агентам доступны 10 детерминированных инструментов анализа ЭЭГ, выдающих только измерения, относящиеся к задаче: выбирать инструменты и строить процесс нужно самостоятельно.
  • Проверены 29 передовых языковых моделей из 15 семейств.
  • Главный вывод авторов: у современных агентов есть существенные ограничения на длинных записях, особенно в накоплении свидетельств и многошаговых рассуждениях.

Почему это важно

Анализ ЭЭГ смещается от классификации коротких отрезков к интерпретации длинных записей, а оценки ИИ-агентов в этой области, по словам авторов, разрознены: разные задачи, узкие горизонты, несогласованные протоколы. Единый бенчмарк с общими условиями даёт возможность сравнивать агентов между собой и видеть, где именно они проваливаются.

Кому это важно

Исследователям, которые строят агентов для анализа ЭЭГ и других длинных биосигналов, и командам, оценивающим языковые модели на многошаговых задачах с инструментами. Также интересно тем, кто разрабатывает методики оценки агентов.

Как это применить

Бенчмарк можно использовать как общую схему проверки: шесть задач, записи от 2 секунд до почти 23 часов и набор из 10 детерминированных инструментов, из которых агент выбирает сам. В описании статьи не сказано, опубликованы ли код и данные, поэтому доступность стоит проверить на странице работы.

Можно ли доверять

Это аннотация статьи на arXiv, то есть заявления самих авторов. В тексте нет названий моделей, числовых результатов и рейтингов, поэтому вывод о «существенных ограничениях» нельзя проверить по цифрам. Утверждение о том, что бенчмарк различает агентов независимо от размера модели и стоимости вывода, тоже подано без конкретных данных.

Риски и подводные камни

Выводы об ограничениях агентов даны качественно, без количественных оценок, а состав 15 семейств моделей и данных для шести задач в аннотации не раскрыт. Результаты относятся к конкретному набору из 10 инструментов, предоставленных бенчмарком, и не обязательно переносятся на другие настройки.