NVIDIA Nemotron адаптировали под греческий язык: точность ответов выросла до 66,9%

Современный греческий язык отсутствует и в поисковых моделях Nemotron от NVIDIA, и в большинстве крупных многоязычных бенчмарков для retrieval, хотя он важен для retrieval-augmented generation (RAG, генерации с опорой на найденные документы) в юридической, энергетической, финансовой и медицинской сферах. В работе представлена сквозная адаптация стека Nemotron под греческий язык: сбор корпуса текстов, синтетическая разметка для обучения, тренировка модели поиска (retrieval), адаптация реранкера и дообучение модели-читателя (reader), а также новый бенчмарк HERA.
Показано, что простой бейзлайн BM25 без параметров обходит несколько готовых многоязычных dense-моделей поиска на специализированных греческих корпусах. После дообучения на 65 773 греческих парах "запрос-документ" эмбеддер Nemotron 1B поднял метрику nDCG@10 с 0,362 до 0,835 и значительно опередил неадаптированную версию той же модели. Выученная языковая компетенция переносится и на общедоменные греческие тексты, хотя преимущество над BM25 зависит от домена. Отдельно адаптирован кросс-энкодер реранкер, который дал стабильный прирост качества на всех специализированных доменах.
Наконец, методом LoRA дообучена модель-читатель Nemotron 30B-A3B (mixture-of-experts, смесь экспертов) для генерации ответов с опорой на найденные документы: доля ответов, признанных верными при оценке, выросла с 29,4% до 66,9%, а достоверность (faithfulness) и качество цитирования источников заметно улучшились. HERA заявлен как первый крупный греческий бенчмарк для RAG-систем; адаптированные модели и сам бенчмарк выложены в открытый доступ для дальнейших исследований греческого RAG.
Ключевые факты
- Греческий язык отсутствует в Nemotron и в основных многоязычных бенчмарках поиска, несмотря на важность для RAG в юридической, энергетической, финансовой и медицинской сферах
- BM25 без параметров обходит несколько готовых многоязычных dense-моделей поиска на специализированных греческих корпусах
- После дообучения на 65 773 греческих парах эмбеддер Nemotron 1B поднял nDCG@10 с 0,362 до 0,835
- LoRA-дообучение ридера Nemotron 30B-A3B (смесь экспертов) подняло долю верных ответов с 29,4% до 66,9%, улучшив достоверность и цитирование источников
- Представлен HERA, первый крупный греческий бенчмарк для RAG; адаптированные модели и бенчмарк выложены в открытый доступ
Почему это важно
Большие многоязычные модели поиска и бенчмарки для RAG почти не учитывают греческий язык, хотя именно в специализированных сферах, юриспруденции, энергетике, финансах, медицине, точный поиск нужного документа перед генерацией ответа особенно критичен. Работа закрывает этот пробел сквозной адаптацией целого стека: от сбора корпуса до дообученного ридера, а не точечным патчем одной модели.
Кому это важно
В первую очередь, командам, которые строят RAG-системы для греческого языка: юридическим и финансовым сервисам, энергетическим компаниям, медицинским информационным системам в Греции и на Кипре. Также результат интересен исследователям многоязычного retrieval, показан воспроизводимый рецепт адаптации retrieval-стека под язык с недостаточной ресурсной базой.
Как это применить
Авторы выложили в открытый доступ адаптированные под греческий модели (эмбеддер, реранкер, ридер) и сам бенчмарк HERA, так что готовые компоненты можно переиспользовать напрямую вместо обучения с нуля. В источнике нет данных о лицензии, цене или конкретных ссылках на веса, только факт релиза для дальнейших исследований.
Можно ли доверять
Это исследовательская работа с количественными метриками (nDCG@10, доля верных ответов) и явно описанным пайплайном, от сбора данных до дообучения LoRA. При этом в тексте не названы ни конкретные авторы, ни их организации, ни используемые для сравнения готовые dense-модели, ни детали состава самого бенчмарка HERA, оценка результатов пока опирается только на данные самих авторов, без независимой проверки.
Риски и подводные камни
Преимущество дообученных dense-моделей над простым BM25 оказалось доменно-зависимым, в части задач BM25 остаётся конкурентным даже после адаптации. В источнике не раскрыто, как именно оценивалась "верность" ответов ридера и какого размера получился сам бенчмарк HERA, что затрудняет независимую оценку того, насколько результаты обобщаются за пределы протестированных доменов.