Mistral и Австрийская академия наук выпустили ИИ-модель Apollo для древнегреческого

В среду Австрийская академия наук вместе с французской ИИ-лабораторией Mistral и технологической фирмой Sail Reply представляет Apollo, модель, которую называют первой развитой языковой моделью для древнегреческого языка. Apollo обучена примерно на 600 миллионах слов исторического греческого текста, собранных из рукописей, папирусов и надписей. Модель бесплатна для академических пользователей и доступна через интерфейс чат-бота.
Проблема, которую решает Apollo: в библиотеках по всему миру хранятся сотни тысяч фрагментов древнегреческих папирусов, многие из которых повреждены настолько, что смысл текста, вероятно, утрачен навсегда. Остальные учёные могут восстановить, методично подбирая пропущенные слова или фразы, но это трудоёмкая работа. Сложность в том, что в древнегреческом письме не было пробелов между словами: прежде чем восстанавливать текст, специалисту нужно самому определить границы слов, датировать документ, учесть социально-политический контекст эпохи и свериться со справочными материалами, чтобы подобрать подходящие слова для пропусков. По словам Стивена Колвина, профессора классической филологии и исторической лингвистики Университетского колледжа Лондона, людей, которые действительно хорошо разбираются в греческой истории на таком уровне, в мире очень мало. Apollo вбирает в себя эту специализированную экспертность: как объясняет Анна Долганов, историк и папиролог Австрийской академии наук, увидев текст Гомера, модель подстраивается под гомеровский греческий, а встретив надпись на дорийском диалекте, использует дорийский диалект.
Профессор классических языков и литературы Оксфордского университета Арман Д'Ангур, Оксфорд хранит крупнейшую в мире коллекцию античных папирусов, называет проект «очень воодушевляющим»: если машина подскажет три возможных слова для пропуска, это заметно ускорит работу. При этом Колвин предупреждает: Apollo вряд ли изменит общее понимание античного мира, потому что многие папирусы до сих пор не восстановлены именно из-за своей обыденности, это личные письма, брачные контракты, документы гражданской службы, а не утраченные пьесы Софокла. Д'Ангур добавляет: каждый восстановленный фрагмент всё же добавляет крупицу знания об античном мире.
Чтобы вероятностная модель не засорила исторический источник собственными ошибками, Apollo устроена так, что не выдаёт готовый текст, а предлагает учёному на выбор несколько вариантов слов для пропуска, решение остаётся за человеком. «Принципиально важно, чтобы человеческая компетентность сохранялась», говорит Долганов, добавляя, что полная зависимость от ИИ-транскрипций и интерпретаций исторического материала, это именно та точка, с которой начинаются проблемы.
Партнёр Sail Reply Дмитрис Влитас говорит, что ещё год назад раскрыть знания таким способом было «немыслимо». По его словам, в случае успеха ту же методику можно будет применить и к другим древним языкам, например, латыни или египетскому, а также к любой другой научной области, которой пригодилась бы обработка и индексация большого массива материала. Статья приводит и другие примеры того же тренда, не связанные с Apollo напрямую: по словам OpenAI, её модели решили математическую задачу, остававшуюся нерешённой 200 лет, а Google DeepMind с помощью ИИ собрала обширный набор данных о том, как генетические мутации влияют на молекулярную биологию.
Ключевые факты
- Австрийская академия наук, Mistral и Sail Reply выпускают Apollo, первую крупную языковую модель для древнегреческого языка; доступ для академических пользователей бесплатный, через чат-бота.
- Модель обучена примерно на 600 миллионах слов исторического греческого текста из рукописей, папирусов и надписей.
- Apollo нацелена на трудоёмкую задачу восстановления повреждённых папирусов: в древнегреческом письме нет пробелов между словами, а специалистов, способных вручную определять границы слов и датировать документы, в мире очень мало.
- Модель подстраивается под стиль текста, например, различает гомеровский греческий и дорийский диалект надписей, и предлагает учёному несколько вариантов слова на выбор, а не готовый текст, чтобы не засорить исторический источник ошибками.
- Эффект оценивают сдержанно: большинство ещё не восстановленных папирусов, обыденные документы, а не утраченные литературные произведения, но в случае успеха методику планируют распространить на другие древние языки и научные области.
Почему это важно
Восстановление древнегреческих текстов, редкая экспертиза: специалисту нужно вручную определять границы слов (в древнегреческом письме их не было), датировать документ, учитывать исторический контекст и подбирать слова из справочников. Apollo, обученная на 600 миллионах слов исторического греческого, берёт на себя черновую часть этой работы и подстраивается под стиль конкретного текста, от Гомера до дорийских надписей, что должно ускорить обработку сотен тысяч фрагментов, скопившихся в библиотеках по всему миру.
Кому это важно
В первую очередь, классическим филологам, историкам античности и папирологам, которые получают Apollo бесплатно через чат-бот-интерфейс. Именно они формулируют и ожидания, и ограничения проекта: Стивен Колвин (Университетский колледж Лондона) и Арман Д'Ангур (Оксфордский университет, хранящий крупнейшую в мире коллекцию папирусов) видят в модели инструмент, ускоряющий рутинную часть работы, а не замену собственной экспертизы.
Как это применить
Apollo работает как чат-бот: учёный передаёт модели фрагмент с пропусками, и она предлагает несколько наиболее вероятных вариантов недостающих слов или фраз, опираясь на контекст, диалект и стиль текста. Дальше выбор остаётся за специалистом, модель не заменяет верификацию, а сокращает время на подбор кандидатов, освобождая учёных для анализа смысла документов, а не механического восстановления текста.
Можно ли доверять
Разработчики закладывают проверку в саму архитектуру: Apollo выдаёт набор вариантов, а не единственный «правильный» ответ, и окончательное решение принимает человек. «Принципиально важно, чтобы человеческая компетентность сохранялась», говорит Анна Долганов (Австрийская академия наук), предупреждая, что полная зависимость от ИИ-интерпретаций исторического материала и есть та точка, где начинаются проблемы. Колвин добавляет отрезвляющий контекст: модель не приведёт к сенсационным открытиям вроде новых пьес Софокла, потому что большинство ещё не восстановленных папирусов, это обыденные документы.
Риски и подводные камни
Главный риск явно назван в самом материале: языковая модель оперирует вероятностями, и если довериться её выводу без проверки, в исторический источник можно внести ошибки, которые потом будут восприниматься как факт. Именно поэтому Apollo намеренно не выдаёт готовый текст, а оставляет выбор специалисту. В статье не приводится ни технических подробностей об архитектуре модели, ни данных о конкретной календарной дате релиза или стоимости доступа за пределами академического сообщества, это открытые вопросы, на которые пока нет ответа.
«Принципиально важно, чтобы человеческая компетентность сохранялась.»
— Анна Долганов, историк и папиролог Австрийской академии наук