LLM: co to jest duży model językowy, jak działa i skąd biorą się zmyślenia

👁 112 przeczytań
LLM to skrót od large language model, czyli duży model językowy. Tak nazywa się program, który nauczył się z ogromnej ilości tekstu jednej umiejętności: przewidywać, jakie słowo powinno pójść po dotychczasowych. Na tej jednej sztuczce stoją ChatGPT, Claude, Gemini i wszystkie pozostałe czaty. Poniżej: jak to działa naprawdę, skąd biorą się zmyślenia, co znaczą liczby w nazwach modeli i dlaczego LLM nie jest bazą wiedzy.
Jak działa w jednym akapicie
Model dostaje tekst zamieniony na liczby, a jego jedynym zadaniem jest podać rozkład prawdopodobieństwa kolejnego fragmentu. Potem ten fragment dokleja do wejścia i liczy jeszcze raz, słowo po słowie, aż uzna, że wypowiedź się skończyła. Nie ma w środku bazy faktów ani wyszukiwarki; jest ogromna liczba wag ustawionych tak, żeby przewidywanie było trafne. Z tego jednego mechanizmu wynikają wszystkie mocne i słabe strony czatów.
Skąd zmyślenia
Skoro model zawsze podaje najbardziej prawdopodobny ciąg dalszy, to przy pytaniu o rzecz, której nie zna, poda ciąg wyglądający na prawidłowy: nieistniejący wyrok z prawdziwie brzmiącą sygnaturą, książkę, której nikt nie napisał, przepis, którego nie ma w ustawie. To nie awaria, tylko bezpośrednia konsekwencja zasady działania. Dlatego wszystko, co ma konsekwencje, trzeba sprawdzać u źródła, a do pytań o fakty lepiej używać narzędzi, które najpierw szukają, a potem odpowiadają, jak opisany osobno RAG.
Co znaczą liczby przy modelach
| Pojęcie | Co oznacza | Dlaczego ma znaczenie |
|---|---|---|
| Liczba parametrów (np. 8B, 70B) | ile wag ma sieć, w miliardach | większy model zwykle lepiej rozumuje, ale wymaga więcej pamięci i prądu |
| Okno kontekstowe | ile tekstu model widzi naraz, liczone w tokenach | decyduje, czy wgrasz całą umowę, czy tylko fragment |
| Data odcięcia wiedzy | do kiedy sięgają dane treningowe | bez wyszukiwania model nie wie nic o późniejszych wydarzeniach |
| Kwantyzacja | kompresja wag do mniejszej precyzji | pozwala uruchomić model na laptopie, kosztem drobnej utraty jakości |
LLM a czat, model a produkt
Mam to spisane w całości
Zebrałem te rzeczy w ebookach, które możesz pobrać za darmo - bez zapisu na listę, bez haczyka.
ChatGPT nie jest modelem, tylko produktem zbudowanym wokół modelu: ma pamięć rozmów, wyszukiwarkę, narzędzia, limity i interfejs. Ten sam model pod spodem może zachowywać się inaczej w dwóch produktach, bo różnią się instrukcją systemową i dostępnymi narzędziami. Dlatego porównywanie „ChatGPT kontra Claude” to porównanie produktów, a nie samych modeli; bieżące pozycje trzymam w rankingu.
Gdzie LLM naprawdę pomaga
W przekształcaniu tekstu, który już masz: streszczaniu, przepisywaniu, tłumaczeniu, wyciąganiu danych z dokumentów, pisaniu pierwszej wersji. W zadaniach, gdzie liczy się szybkość szkicu, a weryfikacja jest tania. Gorzej radzi sobie tam, gdzie trzeba pamiętać dokładnie i liczyć: do arytmetyki, dat i terminów używaj narzędzi, a modelu do ich obsługi.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Najczęstsze pytania
Czy LLM myśli?
Nie w sensie, w jakim myśli człowiek. Przewiduje kolejne fragmenty tekstu, a wrażenie rozumowania bierze się z tego, że rozumowanie zostawia w tekście regularne ślady, których model się nauczył. To ocena praktyczna, nie rozstrzygnięcie filozoficzne.
Czy da się uruchomić LLM u siebie?
Tak, mniejsze modele działają na zwykłym komputerze; opisuję to w tekstach o LM Studio i Ollamie.
Czy istnieje polski LLM?
Tak, na przykład Bielik i PLLuM, oba uczone na polskich danych.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
