Hugging Face: serwer vLLM z API zgodnym z OpenAI jednym poleceniem
Hugging Face pozwala uruchomić prywatny endpoint LLM zgodny z API OpenAI jednym poleceniem, rozliczanym za faktyczny czas pracy sprzętu.
👁 135 przeczytań
Hugging Face udostępnił sposób na uruchomienie prywatnego, zgodnego z API OpenAI endpointu LLM jednym poleceniem w usłudze HF Jobs, bez stawiania własnych serwerów ani Kubernetesa i z rozliczeniem za faktyczny czas pracy sprzętu. Autor wpisu Quentin Gallouédec pokazuje całą ścieżkę od startu do zapytania z laptopa, notebooka czy dowolnego innego miejsca.
Sercem rozwiązania jest komenda hf jobs run, którą opisano jako odpowiednik docker run dla infrastruktury Hugging Face. Wykorzystuje oficjalny obraz vllm/vllm-openai, prosi o GPU przez parametr --flavor (w przykładzie a10g-large) i wystawia port vLLM dzięki --expose 8000, który kieruje ruch przez publiczny serwer proxy HF Jobs. Po wykonaniu polecenia narzędzie zwraca adres serwera w formacie https://<job_id>--8000.hf.jobs oraz identyfikator zadania. Wagi modelu pobierają się i uruchamiają przez kilka minut - gdy w logach pojawi się „Application startup complete”, serwer jest gotowy.
Odpytasz go jak OpenAI
Ponieważ vLLM mówi w protokole API OpenAI, każde zapytanie wymaga jedynie tokena HF jako bearer. Endpoint da się wywołać przez curl na /v1/chat/completions albo z Pythona, kierując klienta OpenAI na wystawiony adres URL i podając token jako klucz API. W przykładzie model Qwen/Qwen3-4B odpowiada „Hello! How can I assist you today? 😊”. Przed startem warto sprawdzić listę modeli zapytaniem na /v1/models.
Wymagania są skromne: metoda płatności lub dodatni stan kredytów (Jobs są rozliczane za minutę użycia sprzętu), pakiet huggingface_hub w wersji co najmniej 1.20.0 oraz zalogowanie poleceniem hf auth login.
Kluczowe zastrzeżenie dotyczy dostępu. Endpoint jest bramkowany, a nie publiczny - każde żądanie musi nieść token HF z prawem odczytu w przestrzeni zadania, a zwykła wizyta w przeglądarce zostanie odrzucona. W praktyce serwer proxy Jobs pełni rolę bramy API: dostęp jest ograniczony do użytkownika i jego organizacji.
Hugging Face pozycjonuje to jako najszybszą drogę do postawienia modelu pod testy, ewaluacje albo generowanie wsadowe, a nie pod produkcję - do zarządzanej, gotowej usługi służą Inference Endpoints. Pełny opis i przykłady kodu znajdują się w oficjalnym wpisie na blogu Hugging Face.
To prosty skrót dla każdego, kto chce mieć model dostępny przez API na kilka godzin bez budowania infrastruktury.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


