Модель Astra от OpenAI решила 10 старых математических задач и вызвала экзистенциальный кризис у математиков

Модель Astra от OpenAI решила 10 старых математических задач и вызвала экзистенциальный кризис у математиков

Материал, это выпуск подкаста Decoder издания The Verge: ведущий подкаста разговаривает с Робертом Хартом, лондонским корреспондентом The Verge по теме ИИ, который какое-то время общался с одними из самых видных математиков современности о том, как ИИ меняет их дисциплину. Поводом стал опубликованный за несколько недель до записи блог-пост OpenAI под названием «10 Advances in Mathematics and Theoretical Computer Science» («10 достижений в математике и теоретической информатике»): компания заявила, что её новейшая модель Astra решила 10 давно не поддававшихся задач по математике и теоретической информатике, от квантовой теории игр до упаковки сфер в пространствах размерности больше трёх. Публикацию сопроводили документацией на несколько сотен страниц.

Это не первый такой случай. Ещё в мае этого года некая внутренняя, никак не названная модель OpenAI опровергла 80-летнюю гипотезу о единичном расстоянии (unit distance conjecture), известную нерешённую задачу комбинаторной геометрии. Харт предполагает, что за этим результатом тоже стояла Astra, но это его личная догадка: OpenAI не подтвердила её, когда он спросил напрямую.

Публикация «10 достижений» произвела в математическом сообществе эффект разорвавшейся бомбы. По словам Харта, опрошенные им математики подчёркивали: это не второстепенные, подобранные под возможности ИИ задачи, а проблемы, которыми серьёзные учёные годами занимались всерьёз. Опрошенные им математики говорили, что решение даже одной из этих десяти задач обеспечило бы человеку-исследователю академическую карьеру, а если бы человек решил все десять сразу, в это, по их словам, никто бы не поверил.

Одновременно возник спор об атрибуции. Изначально в блог-посте OpenAI утверждалось, что по этим 10 задачам не было прогресса последние 10 лет, но в одной из приложенных научных работ прямо сказано, что модель опиралась на более ранние результаты двух конкретных исследователей. Позже формулировку про «10 лет без прогресса» тихо, без отдельного объявления, поправили. Часть опрошенных Хартом учёных осталась недовольна тем, что компания использовала более ранние результаты, но изначально не признала это прямо. При этом один из исследователей, чьё имя всё же фигурирует в работах OpenAI, отнёсся к истории двойственно.

Сам Харт, лично прочитавший научные работы (по оценке одного из его собеседников, вникать в них настолько подробно во всём мире станут около 50 человек), считает, что о плагиате речи не идёт, скорее о неудачно составленном пресс-релизе. По его словам, за более чем десять лет работы научным журналистом он много раз видел, как пресс-релизы преувеличивают новизну и значимость открытий, и здесь, на его взгляд, произошло то же самое. В целом, по его наблюдению, реакция математиков была скорее восторженной, чем скептической.

Главный вопрос выпуска, не техническая точность конкретных доказательств, а то, что происходящее запустило в математическом сообществе кризис самоопределения: чем в таком случае занимаются математики и зачем нужны гранты и программы подготовки новых учёных, если передовые модели способны сами отвечать на открытые вопросы дисциплины? Отдельно в разговоре звучит и более циничная версия: не является ли всё это внимание к математике просто маркетинговым ходом лабораторий, которым, по сути, всё равно, что будет с одной из старейших академических дисциплин.

При этом Харт подчёркивает: та же модель по-прежнему плохо справляется с элементарными вещами. Он сам проверял давний анекдот о том, что ИИ не умеет посчитать, сколько раз буква r встречается в английском слове strawberry («клубника»), и говорит, что сейчас модели с этим справляются (в шутку предполагая, что ответ просто зашит в них напрямую). А вот с днями недели и временем всё ещё плохо: по словам Харта, его молодой человек недавно жаловался, что модель упорно считает, будто сегодня среда, хотя это не так; ChatGPT, по данным опубликованной несколько месяцев назад статьи коллеги Харта по The Verge Элиссы Уэлле, не умел определять время, и, по словам Харта, это по-прежнему так. Отдельные математики также называют топологию областью, где ИИ пока слаб, но сам Харт говорит, что не может это лично проверить: это не его специализация.

Харт сравнивает происходящее с тем, что несколько лет назад пережила разработка программного обеспечения: там аналогичный кризис из-за ИИ растянулся примерно на пять лет, а в математике похожий скачок возможностей, от «плохо» до «на уровне сильного профессионала», произошёл всего за полгода-год. По его наблюдению, ИИ увереннее всего прогрессирует там, где задачу можно чётко сформулировать и формально проверить решение, а там, где нужны интуиция и знание о реальном мире, модели пока буксуют. Сама беседа на этом фрагменте не заканчивается: последний заданный в подкасте вопрос, можно ли повторить подобный результат ещё раз, остаётся в расшифровке без ответа.

Ключевые факты

  • OpenAI опубликовала блог «10 Advances in Mathematics and Theoretical Computer Science»: по её словам, новая модель Astra решила 10 давних нерешённых задач по математике и теоретической информатике (квантовая теория игр, упаковка сфер в пространствах выше трёх измерений и другие), подкреплённых документацией на несколько сотен страниц.
  • Ещё в мае этого года внутренняя, не названная модель OpenAI опровергла 80-летнюю гипотезу о единичном расстоянии; журналист Роберт Харт предполагает, что это тоже была Astra, но OpenAI это не подтвердила.
  • Возник спор об атрибуции: OpenAI сперва заявила, что по этим задачам 10 лет не было прогресса, хотя одна из её же научных работ прямо ссылается на более ранние результаты двух исследователей; формулировку позже тихо поправили, часть математиков осталась недовольна тем, как компания об этом сообщила.
  • Опрошенные Хартом математики в целом впечатлены: по их словам, решение даже одной из этих задач сделало бы карьеру человеку-исследователю; сам Харт, изучив работы лично, считает произошедшее не плагиатом, а неудачным пресс-релизом.
  • История запустила в математическом сообществе спор о будущем профессии, нужны ли гранты и программы подготовки новых математиков, если модели сами отвечают на открытые вопросы, при этом те же модели остаются слабы в базовых вещах вроде счёта времени и дней недели.

Почему это важно

Это первый случай, когда лаборатория ИИ разом предъявила сразу десять решений задач, которые математики считают настоящими, а не подобранными под возможности модели. Раньше прорывы были единичными и точечными, например, майское опровержение 80-летней гипотезы о единичном расстоянии; залпом из десяти результатов и документацией на несколько сотен страниц OpenAI перевела разговор в другую плоскость, это уже не «модель решила одну красивую задачу», а заявка на то, что модель способна системно двигать саму математическую науку вперёд. Показательно и то, где именно ИИ прорвался: там, где решение можно формально проверить (доказательство либо верно, либо нет), а не там, где нужны интуиция и общее знание о мире, в разработке ПО похожий процесс занял около пяти лет, а здесь уместился в куда более короткий срок.

Кому это важно

Прежде всего, самим математикам и научным руководителям: если модель способна закрывать открытые вопросы дисциплины, встаёт вопрос о смысле грантов и программ подготовки новых учёных. Важно это и другим лабораториям ИИ, которые почти наверняка предъявят похожие заявления следующими, и научным журналистам, которым придётся отделять реальный результат от эффектной формулировки пресс-релиза. Шире это касается любой академической области, где результат можно формально проверить: похожая история рано или поздно повторится не только в математике.

Как это применить

Прямого продукта или доступа со стороны здесь нет, Astra описана как внутренняя модель OpenAI, и в разговоре не упоминается, что её можно как-то попробовать самому. Практический вывод скорее методологический: для университетов и грантодателей это повод заранее продумать, как встраивать проверку ИИ-доказательств в работу, раз решение можно верифицировать формально, то же свойство позволяет использовать модели и как инструмент проверки гипотез. Для журналистов и читателей это повод свериться с самими научными работами, а не только с формулировкой пресс-релиза, именно так Харт и обнаружил историю с незаметно исчезнувшим упоминанием «10 лет без прогресса».

Можно ли доверять

Частично, и с оговорками. Харт лично прочитал научные работы OpenAI и не нашёл в них плагиата, но нашёл преувеличение в первоначальной версии блога: заявление «10 лет без прогресса» противоречило собственной работе компании, которая ссылалась на двух конкретных предыдущих исследователей, формулировку тихо поправили уже после публикации. Реакция математиков, с которыми говорил Харт, в основном положительная по существу результатов, но часть из них недовольна тем, как поначалу была подана заслуга. Отдельно стоит помнить: то, что Astra стояла и за майским опровержением гипотезы о единичном расстоянии, личное предположение Харта, которое OpenAI не подтвердила.

Риски и подводные камни

Главный риск, расхождение между эффектной формулировкой пресс-релиза и тем, что действительно написано в научных работах: именно это уже произошло с заявлением «10 лет без прогресса». Второй риск, обесценивание вклада живых исследователей, чьи результаты легли в основу «прорыва» ИИ-лаборатории, если этот вклад не признают вовремя и явно. Третий, соблазн обобщить: способности Astra резко выросли в узких, формально проверяемых областях, но та же модель, по словам Харта, всё ещё плохо считает и путает дни недели и время, а топологию некоторые математики называют областью, где ИИ пока слаб (сам Харт эту оценку лично проверить не может). Наконец, есть структурный риск для дисциплины: если гранты и кафедры начнут сокращать финансирование исходя из способности моделей отвечать на открытые вопросы, это ударит по подготовке новых математиков ещё до того, как станет ясно, насколько устойчивы нынешние результаты.

«Если бы кто-то из исследователей решил хотя бы одну из этих задач, это, скорее всего, обеспечило бы ему академическую карьеру.»

— несколько математиков в разговоре с Робертом Хартом (The Verge)