🔥 Gemini Pro 18 miesięcy (voucher) 170 zł -43% do piątku Kup teraz →
Przejdź do treści
Newsy

Modele Nemotron nauczyły się greckiego - RAG dla prawa, energetyki i medycyny

Autorzy z NVIDIA dostosowali modele Nemotron do nowoczesnego języka greckiego, obejmując wyszukiwanie, reranking i generowanie odpowiedzi. Przy okazji stworzyli pierwszy duży benchmark RAG dla greki - HERA.

3 min czytania
Person seated at a desk reading a document under a warm desk lamp in a dark room

👁 115 przeczytań

Ayoub Kirouane i Christos Petrocheilos opublikowali 5 sierpnia 2026 roku pracę opisującą kompleksowe dostosowanie stosu Nemotron firmy NVIDIA do nowoczesnego języka greckiego. Dokument liczy 15 stron, 10 rysunków i 7 tabel.

Problem: greka nieobecna w modelach NVIDIA

Autorzy wskazują wprost, że nowoczesna greka jest nieobecna zarówno w modelach wyszukiwania Nemotron, jak i w głównych wielojęzycznych benchmarkach do oceny takich modeli. Jednocześnie język ten jest - według autorów - istotny dla systemów RAG (retrieval-augmented generation) w obszarach prawnym, energetycznym, finansowym i medycznym. To właśnie ta luka była punktem wyjścia całej pracy.

Google Headquarters on six displays - Flickr - twid.jpg
fot. Todd Dailey from Santa Clara, CA, United States / Wikimedia Commons, CC BY-SA 2.0

Co zrobili

Praca opisuje kompleksowe podejście: eksplorację korpusu, syntetyczny nadzór, trenowanie modelu wyszukiwania, dostosowanie rerankera, dostrajanie modułu czytającego oraz stworzenie nowego benchmarku. Autorzy wytrenowali model na 65 773 greckich parach do wyszukiwania. Użyli modelu Nemotron 1B jako embeddera oraz dostosowali cross-encoder jako reranker. Do generowania odpowiedzi użyli metody LoRA do dostrojenia modelu Nemotron 30B-A3B, który jest architekturą mixture-of-experts.

Liczby, które warto zapamiętać

Wyniki są konkretne. Przed dostrojeniem model Nemotron 1B uzyskiwał nDCG@10 na poziomie 0,362. Po dostrojeniu na greckich danych wynik wzrósł do 0,835. Dla modułu generującego odpowiedzi: poprawność ocenianych odpowiedzi wzrosła z 29,4% do 66,9%, przy jednoczesnej poprawie wierności wobec źródła i jakości cytowań. Autorzy podają też interesującą obserwację - klasyczny, bezparametrowy BM25 okazał się lepszy niż kilka gotowych wielojęzycznych modeli gęstego wyszukiwania na specjalistycznych greckich korpusach. Przewaga wytrenowanego modelu nad BM25 pozostaje zależna od dziedziny.

HERA - nowy benchmark

Jednym z konkretnych produktów tej pracy jest HERA - według autorów pierwszy duży benchmark dla RAG w języku greckim. Autorzy zapowiadają udostępnienie zarówno benchmarku, jak i dostosowanych modeli (pod nazwą Sophea Nemo RAG) w celu wsparcia przyszłych badań nad greckojęzycznymi systemami RAG. Praca jest skategoryzowana w arXiv pod przetwarzaniem mowy i audio, sztuczną inteligencją oraz obliczeniami i językiem.

Czego w dokumencie nie ma

Dostępny tekst to wyłącznie abstrakt i metadane ze strony arXiv - nie mam dostępu do pełnej treści artykułu. Oznacza to, że szczegóły dotyczące źródeł korpusu, metodologii tworzenia syntetycznych danych treningowych, pełnych wyników tabelarycznych czy opisu struktury benchmarku HERA nie są mi znane z tego dokumentu.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Co z tego wynika

Moim zdaniem ta praca jest wartościowa z powodów praktycznych, nie prestiżowych. Pokazuje wzorzec działania, który można powtórzyć dla innych języków o małych zasobach - greka jest tu przykładem, nie celem samym w sobie. Szczególnie uderza mnie obserwacja o BM25: jeśli stary algorytm bez parametrów bije nowoczesne wielojęzyczne modele na danych specjalistycznych, to gotowe rozwiązania multilingual są po prostu niewystarczające dla wąskich dziedzin. Wynik skok z 29,4% do 66,9% poprawności w generowaniu jest duży, choć bez pełnego tekstu nie wiem, jak dokładnie mierzono tę poprawność. Udostępnienie modeli i benchmarku to dobry krok - bez tego cała praca byłaby trudna do zweryfikowania i rozwijania przez innych.

Źródło: arXiv cs.AI: Teaching Nemotron Greek: Mining a Corpus, Adapting Retrieval, and Grounding Generation for Modern Greek across Specialist Domains (dokument z 2026-08-06). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 600 zł/rok Cursor Pro 320 zł/rok Zobacz wszystko →
× powiększenie