› Kiedy model językowy obsługuje wiele zapytań naraz (tzw.
› batching), GPU pobiera pewną łączną ilość energii.
› Problem polega na tym, że telemetria karty graficznej zwraca tylko wartość zagregowaną - jeden pomiar dla całej partii, bez rozbicia na poszczególne zapytania.
› Tymczasem raportowanie zrównoważonego rozwoju, obciążanie kosztami konkretnych klientów czy analiza obciążeń wymagają, żeby wiedzieć, ile energii zużyło każde zapytanie z osobna.