Ai2 открыла модель AstaBrief 8B для научных отчётов с цитатами

Ai2 открыла модель AstaBrief 8B для научных отчётов с цитатами

Ai2 (Allen Institute for AI) объявила об открытии AstaBrief 8B, небольшой модели, обученной специально для генерации научных отчётов. Она получает вопрос исследователя и найденные отрывки из литературы и превращает их в отчёт со ссылками на источники. В платформе Asta, которую Ai2 называет агентной платформой для научной работы, AstaBrief уже доступна в функции «Generate a report» как быстрый режим (Fast mode) рядом с режимом Thinking на базе Claude. Вместе с моделью Ai2 открывает и обучающие данные, чтобы другие могли изучать, воспроизводить и развивать подход.

Главный результат, скорость. По данным Ai2, на всём конвейере Asta быстрый режим тратит в среднем 51,1 секунды на отчёт, а режим Thinking, 178,5 секунды, то есть примерно в 3,5 раза дольше. Отдельно компания пишет, что время генерации отчёта сократилось почти на порядок по сравнению с проприетарными моделями, которые она отслеживала. Это другое сравнение, чем 3,5 раза между режимами. Ускорение достигнуто за счёт переработанного конвейера: модель пишет весь отчёт за один проход, а не раздел за разделом, и обходит дорогие этапы суммаризации отрывков и их кластеризации, которые использует режим на Claude. По словам Ai2, это удалось сделать без потери качества.

Модель стартовала с Qwen3-8B; основные усилия ушли на данные для дообучения, оценку и обвязку вокруг генерации отчётов. Вместо обучения с подкреплением (RL), которое Ai2 называет нестабильным и дорогим, выбрали более простой рецепт: контролируемое дообучение (SFT) плюс прямую оптимизацию предпочтений (DPO). Ставка сделана на качество данных.

Данные для SFT взяли из реальных запросов пользователей Asta. После фильтрации (убрали трафик бета-тестеров и ботов, слишком короткие запросы, а LLM-проход отсёк неанглийские, ненаучные запросы и запросы с персональными данными) осталось 90 тыс. исследовательских запросов. Целевые отчёты по ним сгенерировал многошаговый конвейер ScholarQA на смеси проприетарных систем, Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini и GPT-4.1. После фильтрации качества получилось 47 тыс. обучающих примеров.

Для DPO нужны пары отчётов. Один отчёт по запросу давал конвейер ScholarQA (обычно на Claude 3.5 или 3.7 Sonnet), конкурирующий, o3, o4-mini, DeepSeek-V3 или DeepSeek-R1 на тех же найденных отрывках. Победителя выбирали две модели-судьи, GPT-4.1 и DeepSeek-R1; оставляли только пары, где судьи согласны. Согласие судей с человеческими предпочтениями, 95%. Итоговый набор DPO, около 6 тыс. примеров.

Основная оценка шла на SQABench-CS2 (200 написанных пользователями вопросов по информатике) по четырём метрикам: охват нужного содержания (rubric score), релевантность абзацев вопросу (answer precision), поддержка каждой ссылки утверждением (citation precision) и полнота подкрепления утверждений ссылками (citation recall). Дополнительно, DeepScholarBench (63 запроса, составлены по свежим статьям ArXiv) и два попарных сравнения с отчётами конвейера на Claude: оценка LLM-судьёй и небольшое исследование с участием людей. Первые SFT-запуски улучшили общее качество содержания, но по точности ответа и качеству цитирования отставали от конвейера на Claude, поэтому команда занялась фильтрацией данных: проверяла четыре статистических фильтра слабых синтетических примеров, среди них отношение длины вывода к входу, релевантность цитируемых работ и плотность цитирования.

Отдельно Ai2 подчёркивает, что открытые веса нужны, когда вопросы исследователя раскрывают чувствительную или неопубликованную работу: учреждения смогут запускать модель на своей инфраструктуре. Вместе с весами выпущен пример рабочего процесса для генерации отчётов по собственным PDF.

Ключевые факты

  • AstaBrief 8B, небольшая открытая модель Ai2: по вопросу и найденным отрывкам литературы пишет отчёт со ссылками. Модель и обучающие данные открыты; в Asta она работает как Fast mode рядом с Thinking mode на Claude.
  • Скорость на всём конвейере Asta: в среднем 51,1 с на отчёт против 178,5 с у Thinking mode (примерно в 3,5 раза быстрее); по сравнению с отслеживаемыми проприетарными моделями Ai2 говорит о сокращении времени почти на порядок.
  • Модель стартовала с Qwen3-8B и обучена по схеме SFT + DPO без обучения с подкреплением; отчёт пишется за один проход, без суммаризации и кластеризации отрывков.
  • Данные: 90 тыс. отфильтрованных реальных запросов, 47 тыс. примеров для SFT и около 6 тыс. пар для DPO, в которых совпали оценки двух судей (GPT-4.1 и DeepSeek-R1).
  • Вместе с весами выпущен пример рабочего процесса для отчётов по собственным PDF; Ai2 оговаривает, что оценка в основном сделана в 2025 году и не перезапускалась на нынешних передовых моделях.

Почему это важно

Научные отчёты со ссылками, ресурсоёмкая задача: ответ должен опираться на источники, не расширять выводы исследований и поддаваться проверке. Ai2 проверила, может ли небольшая открытая модель, обученная именно на такой задаче, сравняться по качеству с проприетарными моделями, которые компания использовала, но при этом быстрее и дешевле в обслуживании. Практический итог: в Asta появился быстрый режим, а модель и данные доступны для изучения и воспроизведения. Заметный технический вывод Ai2: можно писать отчёт за один проход, минуя суммаризацию и кластеризацию отрывков, и не терять в качестве.

Кому это важно

Исследователям, которые пользуются Asta и хотят получать предварительные отчёты быстро, а затем уточнять их в следующих запросах. Научным и учебным организациям, которым нужно работать с чувствительными или неопубликованными вопросами: открытые веса позволяют запускать модель на собственной инфраструктуре. Командам, которые строят открытые модели для науки или хотят повторить рецепт: Ai2 открыла и обучающие данные, а в описании подробно разобраны сбор и фильтрация примеров.

Как это применить

В Asta модель доступна сейчас: в функции «Generate a report» выбирается быстрый режим (Fast mode) либо режим Thinking на Claude. Для локального запуска Ai2 выпускает веса и пример рабочего процесса, который можно адаптировать для отчётов по собственным PDF. Условия лицензии и адрес загрузки в доступной части материала не указаны. Тем, кто строит похожие системы, пригодится рецепт: SFT на 47 тыс. отфильтрованных примеров плюс DPO на около 6 тыс. пар с согласием двух судей, с упором на фильтрацию данных, а не на более сложный метод оптимизации.

Можно ли доверять

Это публикация самой Ai2 о собственной модели, независимой проверки в тексте нет. Цифры скорости (51,1 против 178,5 с) относятся ко всему конвейеру Asta, а формулировка «почти на порядок», к другому сравнению, с отслеживаемыми проприетарными моделями; их нельзя путать. Сама Ai2 оговаривает: большая часть обучения и оценки была в 2025 году, поэтому проприетарные модели для сравнения отражают передовой уровень того времени, полная оценка на нынешних передовых моделях не перезапускалась, а результаты стоит читать как свидетельство в пользу конкретных проверенных решений. Итоговые метрики качества модели, результаты сравнения с LLM-судьёй и исследования с людьми в доступной части материала не приведены, так что утверждение о сопоставимом качестве здесь подтвердить нельзя.

Риски и подводные камни

Ai2 признаёт, что её метрики разработки в основном измеряли релевантность, охват и обоснованность цитат, но не то, сохраняют ли утверждения масштаб и силу выводов исходных работ. Модель может процитировать правильную статью и всё же сделать утверждение сильнее, чем подтверждено: превратить вывод по конкретной выборке в общий вывод по популяции, перевести результат из прошедшего времени в настоящее или превратить описательный вывод в рекомендацию. Первые SFT-запуски отставали от конвейера на Claude по точности ответа и качеству цитирования, и для их исправления понадобилась отдельная фильтрация данных. Обучающие данные получены из пайплайна на проприетарных моделях, а отчёты проверялись судьями-моделями, так что результат зависит от качества этих оценок (согласие с человеком, 95%).