Modele Nemotron nauczyły się greckiego - RAG dla prawa, energetyki i medycyny
Autorzy z NVIDIA dostosowali modele Nemotron do nowoczesnego języka greckiego, obejmując wyszukiwanie, reranking i generowanie odpowiedzi. Przy okazji stworzyli pierwszy duży benchmark RAG dla greki - HERA.
👁 115 przeczytań
Ayoub Kirouane i Christos Petrocheilos opublikowali 5 sierpnia 2026 roku pracę opisującą kompleksowe dostosowanie stosu Nemotron firmy NVIDIA do nowoczesnego języka greckiego. Dokument liczy 15 stron, 10 rysunków i 7 tabel.
Problem: greka nieobecna w modelach NVIDIA
Autorzy wskazują wprost, że nowoczesna greka jest nieobecna zarówno w modelach wyszukiwania Nemotron, jak i w głównych wielojęzycznych benchmarkach do oceny takich modeli. Jednocześnie język ten jest - według autorów - istotny dla systemów RAG (retrieval-augmented generation) w obszarach prawnym, energetycznym, finansowym i medycznym. To właśnie ta luka była punktem wyjścia całej pracy.

Co zrobili
Praca opisuje kompleksowe podejście: eksplorację korpusu, syntetyczny nadzór, trenowanie modelu wyszukiwania, dostosowanie rerankera, dostrajanie modułu czytającego oraz stworzenie nowego benchmarku. Autorzy wytrenowali model na 65 773 greckich parach do wyszukiwania. Użyli modelu Nemotron 1B jako embeddera oraz dostosowali cross-encoder jako reranker. Do generowania odpowiedzi użyli metody LoRA do dostrojenia modelu Nemotron 30B-A3B, który jest architekturą mixture-of-experts.
Liczby, które warto zapamiętać
Wyniki są konkretne. Przed dostrojeniem model Nemotron 1B uzyskiwał nDCG@10 na poziomie 0,362. Po dostrojeniu na greckich danych wynik wzrósł do 0,835. Dla modułu generującego odpowiedzi: poprawność ocenianych odpowiedzi wzrosła z 29,4% do 66,9%, przy jednoczesnej poprawie wierności wobec źródła i jakości cytowań. Autorzy podają też interesującą obserwację - klasyczny, bezparametrowy BM25 okazał się lepszy niż kilka gotowych wielojęzycznych modeli gęstego wyszukiwania na specjalistycznych greckich korpusach. Przewaga wytrenowanego modelu nad BM25 pozostaje zależna od dziedziny.
HERA - nowy benchmark
Jednym z konkretnych produktów tej pracy jest HERA - według autorów pierwszy duży benchmark dla RAG w języku greckim. Autorzy zapowiadają udostępnienie zarówno benchmarku, jak i dostosowanych modeli (pod nazwą Sophea Nemo RAG) w celu wsparcia przyszłych badań nad greckojęzycznymi systemami RAG. Praca jest skategoryzowana w arXiv pod przetwarzaniem mowy i audio, sztuczną inteligencją oraz obliczeniami i językiem.
Czego w dokumencie nie ma
Dostępny tekst to wyłącznie abstrakt i metadane ze strony arXiv - nie mam dostępu do pełnej treści artykułu. Oznacza to, że szczegóły dotyczące źródeł korpusu, metodologii tworzenia syntetycznych danych treningowych, pełnych wyników tabelarycznych czy opisu struktury benchmarku HERA nie są mi znane z tego dokumentu.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co z tego wynika
Moim zdaniem ta praca jest wartościowa z powodów praktycznych, nie prestiżowych. Pokazuje wzorzec działania, który można powtórzyć dla innych języków o małych zasobach - greka jest tu przykładem, nie celem samym w sobie. Szczególnie uderza mnie obserwacja o BM25: jeśli stary algorytm bez parametrów bije nowoczesne wielojęzyczne modele na danych specjalistycznych, to gotowe rozwiązania multilingual są po prostu niewystarczające dla wąskich dziedzin. Wynik skok z 29,4% do 66,9% poprawności w generowaniu jest duży, choć bez pełnego tekstu nie wiem, jak dokładnie mierzono tę poprawność. Udostępnienie modeli i benchmarku to dobry krok - bez tego cała praca byłaby trudna do zweryfikowania i rozwijania przez innych.
Źródło: arXiv cs.AI: Teaching Nemotron Greek: Mining a Corpus, Adapting Retrieval, and Grounding Generation for Modern Greek across Specialist Domains (dokument z 2026-08-06). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


