RAG: jak działa generowanie wspomagane wyszukiwaniem i gdzie się psuje

👁 111 przeczytań
RAG to skrót od retrieval-augmented generation, czyli generowanie wspomagane wyszukiwaniem. Zamiast liczyć na to, że model pamięta odpowiedź z treningu, system najpierw szuka w Twoich dokumentach fragmentów pasujących do pytania, a dopiero potem każe modelowi napisać odpowiedź na ich podstawie. To dziś podstawowy sposób budowania asystentów, które odpowiadają na pytania o firmowe dokumenty, regulaminy czy dokumentację.
Jak to działa krok po kroku
- Dokumenty są cięte na kawałki po kilkaset słów.
- Każdy kawałek zamieniany jest na wektor liczb oddający jego znaczenie i trafia do bazy wektorowej.
- Pytanie użytkownika też zamieniane jest na wektor.
- System znajduje kilka kawałków najbliższych pytaniu.
- Model dostaje pytanie razem z tymi kawałkami i ma odpowiedzieć tylko na ich podstawie, podając źródła.
Po co to, skoro można wkleić dokument do czatu
Przy jednym pliku faktycznie nie ma po co. RAG zaczyna mieć sens przy tysiącu plików, których nie zmieścisz w oknie kontekstowym, przy dokumentach zmieniających się co tydzień i wtedy, gdy odpowiedź musi wskazywać źródło. Drugi powód to koszt: model dostaje tylko kilka trafnych akapitów zamiast całej biblioteki, więc rachunek za tokeny jest kilkadziesiąt razy niższy.
Gdzie RAG się psuje
Złe cięcie dokumentów. Jeśli tabela albo definicja zostanie przecięta na pół, model dostanie połowę sensu. Wyszukiwanie po podobieństwie, nie po znaczeniu. Pytanie o „umowę na czas określony” potrafi wyciągnąć fragment o czasie nieokreślonym, bo wektory są blisko siebie. Brak informacji, że czegoś nie ma. Model dostaje pięć niepasujących fragmentów i grzecznie coś z nich składa, zamiast powiedzieć, że nie wie. Dlatego dobry system RAG zawsze pokazuje źródła i pozwala je otworzyć.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Najczęstsze pytania
Mam to spisane w całości
Zebrałem te rzeczy w ebookach, które możesz pobrać za darmo - bez zapisu na listę, bez haczyka.
Czy RAG eliminuje zmyślenia?
Zmniejsza je, bo model odpowiada z dostarczonego materiału, ale nie eliminuje. Jeśli materiał jest nietrafiony, odpowiedź będzie zmyślona z ładnym przypisem.
RAG czy dotrenowanie modelu?
Do wiedzy, która się zmienia, RAG. Do zmiany stylu i formatu odpowiedzi fine tuning. Te dwie rzeczy rozwiązują różne problemy i często stosuje się je razem.
Czy da się zbudować RAG bez programowania?
Tak, gotowe funkcje bazy wiedzy mają dziś czaty firmowe i narzędzia automatyzacji, na przykład n8n.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
