Małe modele językowe uczą się od dużych przez gotowe instrukcje pobierane w locie
Badacze opracowali metodę, która pozwala małym modelom językowym korzystać z wiedzy eksperckiej bez doustrajania - wystarczy odpowiednio przygotowany zbiór instrukcji. Na benchmarku MedQA dokładność wzrosła o 10,6 punktu procentowego.

👁 117 przeczytań
Praca pochodzi od Kenana Alkieka, Davida Jurgensa i Vinoda Vydiswarana i została opublikowana na arXiv w październiku 2025 roku (ostatnia wersja z września 2026). Autorzy zajmują się problemem, który każdy, kto używał małych modeli językowych na urządzeniach końcowych, zna z praktyki: mały model po prostu nie mieści w parametrach wystarczająco dużo wiedzy, żeby radzić sobie z trudnymi, specjalistycznymi pytaniami.
Na czym polega problem
Autorzy opisują trzy typowe podejścia do tego problemu i wskazują ich ograniczenia. Doustrajanie (fine-tuning) zapisuje wiedzę w parametrach modelu, ale trzeba je powtarzać dla każdego modelu i każdej dziedziny z osobna. Podawanie w prompcie wyszukanych fragmentów tekstu (retrieved passages) pozostawia modelowi zadanie samodzielnego znalezienia właściwego faktu i jego zastosowania. Few-shot prompting, jak pokazują wyniki w artykule, w pewnych warunkach wręcz pogarsza wyniki - na benchmarku MedQA przykłady few-shot podawane przez model nauczyciela obniżały dokładność małego modelu.
Czym jest instruction retrieval
Proponowane rozwiązanie nazywa się instruction retrieval. Duży model-nauczyciel analizuje problemy z danej dziedziny, grupuje je w klastry i dla każdego klastra tworzy jedną instrukcję. Taka instrukcja zawiera trzy elementy: wiedzę dziedzinową potrzebną do rozwiązania problemów z tego klastra, procedurę postępowania przy tym typie problemu oraz listę typowych błędów popełnianych przy jego rozwiązywaniu. Zbiór takich instrukcji buduje się raz dla danej dziedziny. Potem, w czasie działania systemu, mały model - bez żadnego doustrajania, w wersji zamrożonej - pobiera instrukcje najbliższe treściowo zadanemu pytaniu i stosuje je.
Ważna właściwość tego podejścia: po zbudowaniu korpusu instrukcji nie jest potrzebny żaden dalszy dostęp do modelu-nauczyciela. Korpus można wykorzystywać wielokrotnie.
Wyniki na benchmarkach
Autorzy testowali metodę na benchmarkach z medycyny, prawa i matematyki. Korpus instrukcji poprawił wyniki względem zero-shot na każdym z tych zadań. W porównaniu z few-shot promptingiem, self-consistency oraz innymi metodami opartymi na wyszukiwaniu tekstu - przewaga korpusu instrukcji pojawia się w medycynie i prawie (dla matematyki autorzy nie sformułowali takiego samego ogólnego twierdzenia w abstrakcie).
Najbardziej konkretna liczba: na benchmarku MedQA metoda podnosi średnią dokładność o 10,6 punktu procentowego. Dla porównania, wyszukane fragmenty podręczników podnoszą ją o 3,9 punktu, a few-shot z tego samego modelu-nauczyciela - obniża.
Co naprawia którą kategorię błędów
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Autorzy przeprowadzili analizę błędów, która wskazuje, że różne składowe instrukcji pomagają w różnych sytuacjach. Sama wiedza dziedzinowa (background knowledge) jest tym elementem, który poprawia pytania, na które mały model zawsze odpowiada błędnie - czyli te, gdzie brakowało mu fundamentalnej wiedzy. Procedura i lista typowych błędów pomagają natomiast przy pytaniach, gdzie model waha się między opcjami - czyli tam, gdzie wiedza jest częściowa, ale model nie umie jej właściwie zastosować.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co z tego wynika
Moim zdaniem najciekawszy aspekt tej pracy to nie sam wynik liczbowy, lecz separacja funkcji: jeden składnik instrukcji naprawia brak wiedzy, inny naprawia błędy w rozumowaniu. To rzadko spotykany poziom szczegółowości w analizie. Praktycznie rzecz biorąc, metoda jest atrakcyjna dla scenariuszy, gdzie mały model musi działać lokalnie - na telefonie, urządzeniu medycznym czy w środowisku bez łączności - a dostrajanie jest zbyt kosztowne. Koszt jednorazowego zbudowania korpusu przez duży model istnieje, ale autorzy traktują go jako akceptowalny. Ograniczeniem, o którym artykuł wprost nie mówi, jest to, jak dobrze metoda skaluje się na nowe dziedziny i czy jakość instrukcji generowanych przez nauczyciela jest zawsze wystarczająca - tego w dostępnym abstrakcie nie opisano.
Źródło: arXiv cs.AI: Instruction Retrieval at Inference Time for Small Language Models (dokument z 2026-10-01). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
