Słownik AI / Latency (opóźnienie)
⚙️ Technika
Latency (opóźnienie)
Czas od wysłania zapytania do pierwszego słowa odpowiedzi.
Latency to opóźnienie między wysłaniem zapytania a reakcją modelu - w praktyce najczęściej mierzy się czas do pierwszego tokenu odpowiedzi. Dla płynnej rozmowy głosowej czy autouzupełniania kodu liczą się ułamki sekundy; przy generowaniu raportu opóźnienie ma mniejsze znaczenie.
Na latency składa się wielkość modelu, obciążenie serwerów, długość promptu i tryb pracy (modele rozumujące „myślą” zauważalnie dłużej). Twórcy aplikacji często żonglują modelami: szybki do natychmiastowych reakcji, mocny do zadań, gdzie użytkownik zaczeka.
Pojęcia powiązane