NVIDIA Nemotron адаптировали под греческий язык: точность ответов выросла до 66,9%

NVIDIA Nemotron адаптировали под греческий язык: точность ответов выросла до 66,9%

Современный греческий язык отсутствует и в поисковых моделях Nemotron от NVIDIA, и в большинстве крупных многоязычных бенчмарков для retrieval, хотя он важен для retrieval-augmented generation (RAG, генерации с опорой на найденные документы) в юридической, энергетической, финансовой и медицинской сферах. В работе представлена сквозная адаптация стека Nemotron под греческий язык: сбор корпуса текстов, синтетическая разметка для обучения, тренировка модели поиска (retrieval), адаптация реранкера и дообучение модели-читателя (reader), а также новый бенчмарк HERA.

Показано, что простой бейзлайн BM25 без параметров обходит несколько готовых многоязычных dense-моделей поиска на специализированных греческих корпусах. После дообучения на 65 773 греческих парах "запрос-документ" эмбеддер Nemotron 1B поднял метрику nDCG@10 с 0,362 до 0,835 и значительно опередил неадаптированную версию той же модели. Выученная языковая компетенция переносится и на общедоменные греческие тексты, хотя преимущество над BM25 зависит от домена. Отдельно адаптирован кросс-энкодер реранкер, который дал стабильный прирост качества на всех специализированных доменах.

Наконец, методом LoRA дообучена модель-читатель Nemotron 30B-A3B (mixture-of-experts, смесь экспертов) для генерации ответов с опорой на найденные документы: доля ответов, признанных верными при оценке, выросла с 29,4% до 66,9%, а достоверность (faithfulness) и качество цитирования источников заметно улучшились. HERA заявлен как первый крупный греческий бенчмарк для RAG-систем; адаптированные модели и сам бенчмарк выложены в открытый доступ для дальнейших исследований греческого RAG.

Ключевые факты

  • Греческий язык отсутствует в Nemotron и в основных многоязычных бенчмарках поиска, несмотря на важность для RAG в юридической, энергетической, финансовой и медицинской сферах
  • BM25 без параметров обходит несколько готовых многоязычных dense-моделей поиска на специализированных греческих корпусах
  • После дообучения на 65 773 греческих парах эмбеддер Nemotron 1B поднял nDCG@10 с 0,362 до 0,835
  • LoRA-дообучение ридера Nemotron 30B-A3B (смесь экспертов) подняло долю верных ответов с 29,4% до 66,9%, улучшив достоверность и цитирование источников
  • Представлен HERA, первый крупный греческий бенчмарк для RAG; адаптированные модели и бенчмарк выложены в открытый доступ

Почему это важно

Большие многоязычные модели поиска и бенчмарки для RAG почти не учитывают греческий язык, хотя именно в специализированных сферах, юриспруденции, энергетике, финансах, медицине, точный поиск нужного документа перед генерацией ответа особенно критичен. Работа закрывает этот пробел сквозной адаптацией целого стека: от сбора корпуса до дообученного ридера, а не точечным патчем одной модели.

Кому это важно

В первую очередь, командам, которые строят RAG-системы для греческого языка: юридическим и финансовым сервисам, энергетическим компаниям, медицинским информационным системам в Греции и на Кипре. Также результат интересен исследователям многоязычного retrieval, показан воспроизводимый рецепт адаптации retrieval-стека под язык с недостаточной ресурсной базой.

Как это применить

Авторы выложили в открытый доступ адаптированные под греческий модели (эмбеддер, реранкер, ридер) и сам бенчмарк HERA, так что готовые компоненты можно переиспользовать напрямую вместо обучения с нуля. В источнике нет данных о лицензии, цене или конкретных ссылках на веса, только факт релиза для дальнейших исследований.

Можно ли доверять

Это исследовательская работа с количественными метриками (nDCG@10, доля верных ответов) и явно описанным пайплайном, от сбора данных до дообучения LoRA. При этом в тексте не названы ни конкретные авторы, ни их организации, ни используемые для сравнения готовые dense-модели, ни детали состава самого бенчмарка HERA, оценка результатов пока опирается только на данные самих авторов, без независимой проверки.

Риски и подводные камни

Преимущество дообученных dense-моделей над простым BM25 оказалось доменно-зависимым, в части задач BM25 остаётся конкурентным даже после адаптации. В источнике не раскрыто, как именно оценивалась "верность" ответов ридера и какого размера получился сам бенчмарк HERA, что затрудняет независимую оценку того, насколько результаты обобщаются за пределы протестированных доменов.