🔥 Gemini Pro 170 zł -43% CapCut Pro 450 zł -25% do niedzieli Zobacz →
Przejdź do treści
Newsy

Hugging Face: serwer vLLM z API zgodnym z OpenAI jednym poleceniem

Hugging Face pozwala uruchomić prywatny endpoint LLM zgodny z API OpenAI jednym poleceniem, rozliczanym za faktyczny czas pracy sprzętu.

2 min czytania
Hugging Face: serwer vLLM z API zgodnym z OpenAI jednym poleceniem

👁 135 przeczytań

Hugging Face udostępnił sposób na uruchomienie prywatnego, zgodnego z API OpenAI endpointu LLM jednym poleceniem w usłudze HF Jobs, bez stawiania własnych serwerów ani Kubernetesa i z rozliczeniem za faktyczny czas pracy sprzętu. Autor wpisu Quentin Gallouédec pokazuje całą ścieżkę od startu do zapytania z laptopa, notebooka czy dowolnego innego miejsca.

Sercem rozwiązania jest komenda hf jobs run, którą opisano jako odpowiednik docker run dla infrastruktury Hugging Face. Wykorzystuje oficjalny obraz vllm/vllm-openai, prosi o GPU przez parametr --flavor (w przykładzie a10g-large) i wystawia port vLLM dzięki --expose 8000, który kieruje ruch przez publiczny serwer proxy HF Jobs. Po wykonaniu polecenia narzędzie zwraca adres serwera w formacie https://<job_id>--8000.hf.jobs oraz identyfikator zadania. Wagi modelu pobierają się i uruchamiają przez kilka minut - gdy w logach pojawi się „Application startup complete”, serwer jest gotowy.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Odpytasz go jak OpenAI

Ponieważ vLLM mówi w protokole API OpenAI, każde zapytanie wymaga jedynie tokena HF jako bearer. Endpoint da się wywołać przez curl na /v1/chat/completions albo z Pythona, kierując klienta OpenAI na wystawiony adres URL i podając token jako klucz API. W przykładzie model Qwen/Qwen3-4B odpowiada „Hello! How can I assist you today? 😊”. Przed startem warto sprawdzić listę modeli zapytaniem na /v1/models.

Wymagania są skromne: metoda płatności lub dodatni stan kredytów (Jobs są rozliczane za minutę użycia sprzętu), pakiet huggingface_hub w wersji co najmniej 1.20.0 oraz zalogowanie poleceniem hf auth login.

Kluczowe zastrzeżenie dotyczy dostępu. Endpoint jest bramkowany, a nie publiczny - każde żądanie musi nieść token HF z prawem odczytu w przestrzeni zadania, a zwykła wizyta w przeglądarce zostanie odrzucona. W praktyce serwer proxy Jobs pełni rolę bramy API: dostęp jest ograniczony do użytkownika i jego organizacji.

Hugging Face pozycjonuje to jako najszybszą drogę do postawienia modelu pod testy, ewaluacje albo generowanie wsadowe, a nie pod produkcję - do zarządzanej, gotowej usługi służą Inference Endpoints. Pełny opis i przykłady kodu znajdują się w oficjalnym wpisie na blogu Hugging Face.

To prosty skrót dla każdego, kto chce mieć model dostępny przez API na kilka godzin bez budowania infrastruktury.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 450 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
× powiększenie