Przejdź do treści
Artykuły

Opus 5.5 w Claude Code: 3 godziny pracy agenta nad testem AI

Jedno polecenie, 127 GB modeli, 10 testów i 7 tekstów w 3 h 10 min. Przebieg, koszt 22,77 USD według API i miejsca, w których agent sam się poprawił.

6 min czytania
Opus 5.5 w Claude Code: 3 godziny pracy agenta nad testem AI

👁 116 przeczytań

// w skrócie
  • Opus 5.5 w Claude Code wykonał w 3 godziny i 10 minut zadanie obejmujące pobranie 127 GB modeli, testy 10 modeli AI i napisanie 6 tekstów plus przewodnik.
  • Sesja kosztowałaby 22,77 USD według cennika API, z czego ponad połowę - 12,5 USD - pochłonął odczyt 62,7 mln tokenów z pamięci podręcznej.
  • Agent samodzielnie wykrył m.in. że llama.cpp z instalatora winget działa na Vulkan zamiast CUDA, co dawało prędkość 54 zamiast 104 tokenów na sekundę.

Opus 5.5 w Claude Code sprawdziłem na zadaniu, które normalnie zajęłoby mi kilka dni. 26 września 2026 roku o 9:57 poprosiłem o serię tekstów o lokalnych modelach AI: porównania, instalacja i przykładowe wyniki. Po nieco ponad 3 godzinach agent miał pobrane 127 GB modeli, przetestowane 7 modeli tekstowych, 2 generatory obrazów i model wideo, ocenionych przez ślepych sędziów, oraz 6 tekstów i przewodnik. Poniżej jest przebieg, koszt i miejsca, w których agent sam złapał błędy.

W skrócie

Agent zrobił w 3 godziny i 10 minut pracę testera, administratora i autora naraz. Było to 211 odpowiedzi modelu i 228 uruchomień narzędzi. Według cennika API ta sesja kosztowałaby 22,77 USD, ale ponad połowę tej kwoty zjadło ponowne czytanie długiego kontekstu (62,7 mln tokenów z pamięci podręcznej). Opus 5.5 sam wykrył, że wersja llama.cpp z instalatora jest 2-2,6 raza wolniejsza, że Gemma zapętla się w trybie myślenia i że sędziowie w drugiej rundzie są łagodniejsi. Człowiek był potrzebny przede wszystkim do wyznaczenia celu.

3 h 10 minod polecenia do wyników i tekstów
228uruchomień narzędzi przez agenta
127 GBpobranych modeli
22,77 USDwedług cennika API, sesja agenta

Polecenie

Całe polecenie brzmiało (pisownia oryginalna, fragment o okładkach pominięty):

BRAKUJE MI ARTYKULOW NA TEMAT LOKALNYCH MODELI - TEKSTOWE, WIDEO, GRAFICZNE,
KILKA ARTYKULOW, POROWNANIA, PRZYKLADY, JAK ZAINSTALOWAC, JAK WYGLADAJA
PRZYKLADOWO WYGENEROWANE RZECZY.

Nie było w nim listy modeli, sprzętu, metody oceny ani terminu. Agent miał dostęp do komputera z kartą RTX 4090, do pamięci z wcześniejszych sesji (m.in. zestawu zadań z Laboratorium Promptowego) i do terminala. Resztę zaplanował sam.

Przebieg, godzina po godzinie

  1. 9:57-10:15. Plan i zakupy. Agent sprawdził, co już jest na blogu (10 tekstów o lokalnym AI, żeby nie dublować), co jest na dysku (ComfyUI z Qwen-Image 2.1) i co warto dociągnąć. Wybrał 7 modeli tekstowych z licencją Apache 2.0, Z-Image Turbo i Wan 2.2. Pobieranie 127 GB puścił w tle.
  2. 10:15-10:45. Pierwsze pomiary obrazów. Jeszcze w trakcie pobierania uruchomił ComfyUI i zrobił serię 8 obrazów w Qwen-Image 2.1. Mierzył czas, pamięć karty i pobór mocy co pół sekundy.
  3. 10:30. Pierwsze znalezisko. llama.cpp zainstalowany przez winget działał na interfejsie Vulkan zamiast CUDA. Agent pobrał oficjalną paczkę CUDA z GitHuba i zmierzył różnicę: 104 wobec 54 tokenów na sekundę w Gemmie 4 12B. Z tego powstał osobny poradnik llama.cpp na Windowsie.
  4. 10:40. Drugie znalezisko. Gemma 4 z domyślnym myśleniem wygenerowała 54 tys. tokenów zamiast 4,7 tys. i w trzech zadaniach nie oddała odpowiedzi. Agent odłożył te wyniki na bok jako materiał do tekstu, wyłączył myślenie i powtórzył test.
  5. 11:00-12:40. Seria testów. Kolejne modele szły, gdy tylko skończyło się ich pobieranie. Gdy pobieranie przez aria2 spadło do 1,3 MB/s, agent przerwał je i przełączył na oficjalne narzędzie Hugging Face, które dało ok. 25 MB/s. W tle karta generowała klipy wideo.
  6. 12:55. Ocena. Trzej ślepi sędziowie (Opus 5.5, GPT-6 Sol, Gemini 3.1 Pro) ocenili 90 odpowiedzi. Agent dołożył do puli trzy modele z chmury jako kotwice i dzięki temu zauważył, że w tej rundzie sędziowie dali wszystkim o 3,5 pkt więcej niż w pierwszej. Poprawkę opisał w tekście z wynikami.
  7. Równolegle: teksty. Przez cały czas pisał artykuły z gotowych danych i sprawdzał każdą liczbę w źródle. Kilka zdań poprawił po własnej kontroli, m.in. gdy przypisał ocenę sędziemu, który z założenia nie oceniał modeli własnej firmy.

Gdzie agent sam się poprawił

To najciekawsza część, bo tego nie widać w viralowych filmikach. Wszystkie przypadki są z tej jednej sesji:

  • Szyld „ŻÓŁĆ”. Na miniaturce oba generatory obrazów wyglądały poprawnie. Agent powiększył kadry i znalazł „ŽÓŁČ” w Z-Image oraz „ŹÓLĆ” w Qwen-Image.
  • Podpis pod kubkiem. Pierwsza wersja podpisu mówiła o „braku faktury”. Po powiększeniu okazało się, że problemem jest błyszcząca glazura zamiast matowej, więc podpis poprawił.
  • Porównanie z chmurą. Zdanie „Gemma ma tyle co GLM-5.3” nie zgadzało się z tabelą (69 wobec 64,4 pkt). Agent sprawdził pełny ranking i przepisał zdanie.
  • Stracone pobieranie. Zamiast czekać 10 godzin na zablokowane pobieranie, usunął niedokończone pliki i pobrał je od nowa innym narzędziem w 30 minut.

To moja opinia: wartość agenta nie polega na tym, że się nie myli. Myli się tak jak człowiek, ale sam sprawdza wyniki, jeśli ma do tego narzędzia i jeśli w poleceniach jest zasada, że każdą liczbę trzeba potwierdzić.

Koszt i zużycie

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

PozycjaWartość
Czas sesji3 h 10 min (9:57-13:07)
Odpowiedzi modelu / uruchomienia narzędzi211 / 228
Tokeny wyjścia177 tys.
Tokeny odczytane z pamięci podręcznej62,7 mln
Koszt sesji według cennika API Opus 5.522,77 USD (ok. 88 zł)
Sędziowie przez OpenRouter (27 ocen)2,09 USD
Prąd karty graficznej za testyponiżej 50 groszy

Najważniejszy wiersz to odczyt z pamięci podręcznej. Każda odpowiedź agenta czyta całą dotychczasową rozmowę, a ta sesja trwała od rana, więc kontekst był długi. Odczyt kosztuje tylko 0,20 USD za milion tokenów, ale przy 62,7 mln daje 12,5 USD, czyli ponad połowę rachunku. W abonamencie Claude nie płacisz za to osobno, ale długie sesje szybciej zużywają limit. Praktyczna rada: nowe duże zadanie zaczynaj w nowej sesji. Szczegóły cennika są w tekście ile kosztuje Claude Opus 5.5.

Równoległa praca: trzech agentów naraz

W tym samym czasie ta sama sesja uruchomiła trzech pomocniczych agentów z osobnymi zadaniami. Jeden zrobił gry w przeglądarce i stronę z jednego polecenia, drugi analizę danych i grafiki SVG, trzeci poradnik wideo w Remotion i zestaw promptów. Każdy dostał ten sam brief z zasadami redakcyjnymi, osobny budżet na API (maks. 1,50 USD) i zakaz publikowania. Wydali razem 3,45 USD. Ich teksty ukazują się w tej samej serii o Opusie 5.5.

Czego agent nie zrobił

  • Pomocnicze agenty nie publikowały. Oddawały pliki, a na stronę trafiały dopiero po kontroli liczb i linków w głównej sesji.
  • Nie zmieniał ustawień bezpieczeństwa. Gdy serwer blokował zbyt częste połączenia, agent ograniczył liczbę zapytań i przeszedł na inny kanał sprawdzania. Nie próbował obchodzić zapory.
  • Nie zgadywał tam, gdzie nie mierzył. Nie podał czasu generowania na słabszych kartach ani wyników na Macu, bo ich nie mierzył, i pisze to wprost w tekstach.

Najczęstsze pytania

Czy Claude Code z Opus 5.5 może sam przeprowadzić test i napisać artykuł?

W tym przypadku tak: z jednego polecenia agent zaplanował test, pobrał 127 GB modeli, zmierzył 10 modeli i napisał 6 tekstów w 3 godziny i 10 minut. Człowiek określił cel i kierunek, a agent sprawdzał każdą liczbę przed publikacją.

Ile kosztuje długa sesja Claude Code?

Ta sesja kosztowałaby 22,77 USD według cennika API, z czego 12,5 USD to odczyt 62,7 mln tokenów kontekstu z pamięci podręcznej. W abonamencie nie płacisz osobno, ale zużywasz limit.

Czy agent się myli?

Tak, ale w tej sesji sam wychwycił błędne zdania i podpisy, bo porównywał tekst z danymi i powiększał obrazy przed opisem. Warto wpisać taką zasadę do instrukcji projektu.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Źródła i data sprawdzenia

Case własny: zapis sesji Claude Code (model claude-opus-5-5) z 26.09.2026, zużycie tokenów z historii rozmowy, pomiary w projekcie testowym. Cennik Opus 5.5: mój przewodnik. Narzędzie: Claude Code. Sprawdzone 26 września 2026.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Ile tokenów zużywa długa sesja Claude Code i ile to kosztuje?

Ta sesja zużyła 62,7 mln tokenów odczytanych z pamięci podręcznej oraz 177 tys. tokenów wyjścia, co według cennika API dało łącznie 22,77 USD. Odczyt z cache kosztuje 0,20 USD za milion tokenów, ale przy tak długim kontekście dało to 12,5 USD, czyli ponad połowę rachunku.

Czy Claude Code z Opus 5.5 może samodzielnie przeprowadzić test modeli AI i napisać artykuły?

Tak - z jednego ogólnego polecenia agent zaplanował testy, pobrał modele, zmierzył wyniki i napisał teksty bez dodatkowych instrukcji od człowieka. Człowiek określił jedynie cel, natomiast wybór modeli, metody oceny i harmonogram agent zaplanował sam.

Jak agent poradził sobie z błędem pobierania 127 GB danych?

Gdy prędkość pobierania przez aria2 spadła do 1,3 MB/s, agent przerwał pobieranie, usunął niedokończone pliki i przełączył się na oficjalne narzędzie Hugging Face, które dało ok. 25 MB/s. Dzięki temu zamiast czekać 10 godzin, pobrał pliki w 30 minut.

Czy Gemma 4 działa poprawnie w trybie myślenia podczas testów lokalnych modeli?

Nie - Gemma 4 z domyślnym trybem myślenia wygenerowała 54 tys. tokenów zamiast 4,7 tys. i w trzech zadaniach nie oddała odpowiedzi. Agent wyłączył myślenie i powtórzył test, a problematyczne wyniki opisał osobno jako materiał do artykułu.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›