PROMPTOWY_
Newsy

Jak uczciwie rozliczać energię GPU, gdy wiele zapytań do LLM idzie jednocześnie?

promptowy@ai:~$ cat news_1

Kiedy model językowy obsługuje wiele zapytań naraz (tzw.

promptowy@ai:~$ cat news_2

batching), GPU pobiera pewną łączną ilość energii.

promptowy@ai:~$ cat news_3

Problem polega na tym, że telemetria karty graficznej zwraca tylko wartość zagregowaną - jeden pomiar dla całej partii, bez rozbicia na poszczególne zapytania.

promptowy@ai:~$ cat news_4

Tymczasem raportowanie zrównoważonego rozwoju, obciążanie kosztami konkretnych klientów czy analiza obciążeń wymagają, żeby wiedzieć, ile energii zużyło każde zapytanie z osobna.

promptowy@ai:~$ open --full
Czytaj całość

Jak uczciwie rozliczać energię GPU, gdy wiele zapytań do LLM idzie jednocześnie?

Otwórz artykuł na promptowy.com