› llama.cpp to darmowy silnik, na którym działa większość lokalnych modeli językowych, także w LM Studio i Ollamie.
› Na Windowsie instaluje się go jedną komendą, a razem z nim dostajesz serwer z czatem w przeglądarce i API zgodne z OpenAI.
› 26 września 2026 roku uruchomiłem go na karcie RTX 4090 z trzema modelami i trafiłem na pułapkę, o której instrukcje milczą: wersja z menedżera winget generowała tekst od 1,9 do 2,6 raza wolniej niż oficjalna wersja na CUDA.
› W skrócie Na karcie Nvidii pobierz z GitHuba paczkę „win-cuda”, a nie wersję z winget.