Spark-to-Paper: ИИ-система сама пишет научную статью, от идеи до готовых иллюстраций

Превратить исследовательскую идею в законченную статью, больше, чем просто сгенерировать текст: система должна найти нужную литературу, спланировать и провести эксперименты, поправить утверждения рукописи под полученные доказательства, подготовить иллюстрации, пригодные для публикации, и удержать согласованность на протяжении всего, по словам авторов, долгого, процесса генерации. Именно для этого авторы представляют Spark-to-Paper: систему сквозной генерации научных статей, реализованную как тринадцать модульных навыков внутри уже существующего ассистента для программирования, без отдельной агентной платформы или сервиса оркестрации; какой именно ассистент имеется в виду, в тексте не указано.
В основе конструкции, два разделения. Во-первых, субъективная оценка модели отделена от детерминированных операций, которые можно выполнить и проверить напрямую. Во-вторых, планирование эксперимента отделено от отчёта о нём: какие доказательства понадобятся для утверждения, система определяет заранее, до запуска эксперимента, а затем правит утверждения рукописи под то, что эксперимент реально показал. Чтобы сохранять надёжность на длинной исследовательской траектории, Spark-to-Paper сочетает детерминированные проверки целостности с самокритикой и ограничивает отдельно названный сбой, «цикл самоопровержения» (Self-Refutation Loop): состояние, при котором эксперимент за экспериментом продолжают отвергать исходную цель исследования. Числового порога для этого ограничения в тексте не приведено, сказано только, что оно есть.
Иллюстрации система делает редактируемыми и векторными: графики по результатам экспериментов строятся программно, а схемы предложенного метода не рисуются как готовые изображения, а пересобираются из кода.
На восьми контрольных исследовательских темах Spark-to-Paper показала 99,5% достоверных цитат и 96,4% редактируемых иллюстраций. Отдельный контролируемый абляционный эксперимент измерил вклад именно защитного контура: выявление фабрикаций поднялось с 14% у черновика, написанного в один проход, до 92% с полным контуром проверки целостности и ревью, а состязательная проверка достигла точности 74%. Это сравнение внутреннее: статья не сопоставляет Spark-to-Paper с другими системами генерации статей или внешними ориентирами.
В тексте прямо указано, что полный прогон системы занимает в среднем 3,2 часа, это единственная из итоговых цифр с такой пометкой. Стоимость в $8,1 за рукопись и расход в 11,9 млн токенов на всю систему такой пометки не имеют: неясно, это усреднённые показатели, сумма по всей проверке или цифры одного представительного прогона. Авторы делают вывод: сквозную генерацию научных статей можно реализовать как лёгкий модульный рабочий процесс внутри уже существующих ассистентов для программирования, не теряя при этом главного, экспериментальные доказательства остаются центральным критерием того, принимается утверждение, правится оно или отбрасывается. В тексте не названы ни авторы статьи, ни организация, ни площадка и дата публикации.
Ключевые факты
- Spark-to-Paper работает как тринадцать модульных навыков внутри уже существующего ассистента для программирования, без отдельной агентной платформы или сервиса оркестрации.
- На восьми контрольных исследовательских темах система показала 99,5% достоверных цитат и 96,4% редактируемых иллюстраций.
- Абляционный эксперимент поднял выявление фабрикаций с 14% у черновика в один проход до 92% при полном контуре проверки целостности и ревью; состязательная проверка достигла точности 74%.
- Полный прогон стоит $8,1 за рукопись, занимает в среднем 3,2 часа и расходует 11,9 млн токенов на систему в целом.
- Система ограничивает цикл самоопровержения, сбой, при котором эксперимент за экспериментом продолжают отвергать исходную цель исследования, хотя числовой порог этого ограничения в статье не назван.
Почему это важно
Системы, которые сами пишут научные статьи, упираются в один и тот же вопрос доверия: связный, грамотно написанный текст может содержать выдуманные результаты и несуществующие ссылки, и по гладкости слога это не отличить. Вклад Spark-to-Paper, не в мощности модели, а в архитектуре: система отделяет субъективную оценку модели от детерминированных, проверяемых операций и заранее, до запуска эксперимента, фиксирует, какие доказательства нужны для утверждения, а затем правит текст рукописи под то, что эксперимент реально показал. Система работает не как отдельная агентная платформа, а как тринадцать модульных навыков внутри уже существующего ассистента для программирования, это делает конструкцию лёгкой, без своей инфраструктуры. Самое наглядное подтверждение того, что архитектура имеет значение, абляционный эксперимент: полный контур проверки целостности и ревью поднимает выявление фабрикаций с 14% у черновика в один проход до 92%.
Кому это важно
Прямая аудитория, команды, которые строят агентные инструменты для науки поверх ассистентов для программирования: Spark-to-Paper даёт готовый чертёж, тринадцать модульных навыков и конкретный контур проверки целостности, плюс опубликованные цифры, с которыми можно сверять другие подобные системы. Не менее важна работа для всех, кто оценивает, можно ли доверять рукописям, написанным ИИ: именно фабрикация результатов и правдоподобных, но не подтверждённых доказательствами ссылок, центральная забота статьи, и ровно она беспокоит эту аудиторию.
Как это применить
Spark-to-Paper работает не как отдельная агентная платформа, а как тринадцать модульных навыков поверх уже существующего ассистента для программирования (какого именно, в тексте не указано). В тексте прямо указано, что полный прогон занимает в среднем 3,2 часа; стоимость в $8,1 за рукопись и расход в 11,9 млн токенов на всю систему такой пометки не имеют, усреднённые это цифры, сумма по всей проверке или показатели одного прогона, не уточняется.
Можно ли доверять
Заглавные цифры получены на восьми контрольных исследовательских темах: 99,5% достоверных цитат и 96,4% редактируемых иллюстраций у полной системы. Самое сильное доказательство того, что работают именно защитные механизмы, абляционный эксперимент, который выделяет вклад контура проверки целостности и ревью отдельно: выявление фабрикаций поднимается с 14% у черновика в один проход до 92% с полным контуром, а состязательная проверка даёт точность 74%. Это сравнение внутреннее, статья не тестирует Spark-to-Paper против других систем генерации статей или внешних ориентиров.
Риски и подводные камни
Даже с полным контуром проверки выявление фабрикаций доходит только до 92%, а не до 100%, а точность состязательной проверки в 74% оставляет место для ошибок в обе стороны, и пропущенных фабрикаций, и ложных срабатываний. Цикл самоопровержения, состояние, когда эксперимент за экспериментом продолжают отвергать исходную цель исследования, в статье назван лишь «ограниченным»: числового порога или предела для этого ограничения не приведено. Разбивки 3,2 часа по этапам (эксперименты, написание текста, ревью) в тексте тоже нет. Наконец, в тексте не названы ни авторы, ни организация, ни площадка и дата публикации, ни конкретный ассистент для программирования, внутри которого работают все тринадцать навыков.
«Сбой, который мы называем циклом самоопровержения: эксперимент за экспериментом продолжают отвергать исходную цель исследования»
— авторы статьи