Opus 5.5 w Claude Code: 3 godziny pracy agenta nad testem AI
Jedno polecenie, 127 GB modeli, 10 testów i 7 tekstów w 3 h 10 min. Przebieg, koszt 22,77 USD według API i miejsca, w których agent sam się poprawił.

👁 116 przeczytań
- Opus 5.5 w Claude Code wykonał w 3 godziny i 10 minut zadanie obejmujące pobranie 127 GB modeli, testy 10 modeli AI i napisanie 6 tekstów plus przewodnik.
- Sesja kosztowałaby 22,77 USD według cennika API, z czego ponad połowę - 12,5 USD - pochłonął odczyt 62,7 mln tokenów z pamięci podręcznej.
- Agent samodzielnie wykrył m.in. że llama.cpp z instalatora winget działa na Vulkan zamiast CUDA, co dawało prędkość 54 zamiast 104 tokenów na sekundę.
Opus 5.5 w Claude Code sprawdziłem na zadaniu, które normalnie zajęłoby mi kilka dni. 26 września 2026 roku o 9:57 poprosiłem o serię tekstów o lokalnych modelach AI: porównania, instalacja i przykładowe wyniki. Po nieco ponad 3 godzinach agent miał pobrane 127 GB modeli, przetestowane 7 modeli tekstowych, 2 generatory obrazów i model wideo, ocenionych przez ślepych sędziów, oraz 6 tekstów i przewodnik. Poniżej jest przebieg, koszt i miejsca, w których agent sam złapał błędy.
W skrócie
Agent zrobił w 3 godziny i 10 minut pracę testera, administratora i autora naraz. Było to 211 odpowiedzi modelu i 228 uruchomień narzędzi. Według cennika API ta sesja kosztowałaby 22,77 USD, ale ponad połowę tej kwoty zjadło ponowne czytanie długiego kontekstu (62,7 mln tokenów z pamięci podręcznej). Opus 5.5 sam wykrył, że wersja llama.cpp z instalatora jest 2-2,6 raza wolniejsza, że Gemma zapętla się w trybie myślenia i że sędziowie w drugiej rundzie są łagodniejsi. Człowiek był potrzebny przede wszystkim do wyznaczenia celu.
Polecenie
Całe polecenie brzmiało (pisownia oryginalna, fragment o okładkach pominięty):
BRAKUJE MI ARTYKULOW NA TEMAT LOKALNYCH MODELI - TEKSTOWE, WIDEO, GRAFICZNE,
KILKA ARTYKULOW, POROWNANIA, PRZYKLADY, JAK ZAINSTALOWAC, JAK WYGLADAJA
PRZYKLADOWO WYGENEROWANE RZECZY.Nie było w nim listy modeli, sprzętu, metody oceny ani terminu. Agent miał dostęp do komputera z kartą RTX 4090, do pamięci z wcześniejszych sesji (m.in. zestawu zadań z Laboratorium Promptowego) i do terminala. Resztę zaplanował sam.
Przebieg, godzina po godzinie
- 9:57-10:15. Plan i zakupy. Agent sprawdził, co już jest na blogu (10 tekstów o lokalnym AI, żeby nie dublować), co jest na dysku (ComfyUI z Qwen-Image 2.1) i co warto dociągnąć. Wybrał 7 modeli tekstowych z licencją Apache 2.0, Z-Image Turbo i Wan 2.2. Pobieranie 127 GB puścił w tle.
- 10:15-10:45. Pierwsze pomiary obrazów. Jeszcze w trakcie pobierania uruchomił ComfyUI i zrobił serię 8 obrazów w Qwen-Image 2.1. Mierzył czas, pamięć karty i pobór mocy co pół sekundy.
- 10:30. Pierwsze znalezisko. llama.cpp zainstalowany przez winget działał na interfejsie Vulkan zamiast CUDA. Agent pobrał oficjalną paczkę CUDA z GitHuba i zmierzył różnicę: 104 wobec 54 tokenów na sekundę w Gemmie 4 12B. Z tego powstał osobny poradnik llama.cpp na Windowsie.
- 10:40. Drugie znalezisko. Gemma 4 z domyślnym myśleniem wygenerowała 54 tys. tokenów zamiast 4,7 tys. i w trzech zadaniach nie oddała odpowiedzi. Agent odłożył te wyniki na bok jako materiał do tekstu, wyłączył myślenie i powtórzył test.
- 11:00-12:40. Seria testów. Kolejne modele szły, gdy tylko skończyło się ich pobieranie. Gdy pobieranie przez aria2 spadło do 1,3 MB/s, agent przerwał je i przełączył na oficjalne narzędzie Hugging Face, które dało ok. 25 MB/s. W tle karta generowała klipy wideo.
- 12:55. Ocena. Trzej ślepi sędziowie (Opus 5.5, GPT-6 Sol, Gemini 3.1 Pro) ocenili 90 odpowiedzi. Agent dołożył do puli trzy modele z chmury jako kotwice i dzięki temu zauważył, że w tej rundzie sędziowie dali wszystkim o 3,5 pkt więcej niż w pierwszej. Poprawkę opisał w tekście z wynikami.
- Równolegle: teksty. Przez cały czas pisał artykuły z gotowych danych i sprawdzał każdą liczbę w źródle. Kilka zdań poprawił po własnej kontroli, m.in. gdy przypisał ocenę sędziemu, który z założenia nie oceniał modeli własnej firmy.
Gdzie agent sam się poprawił
To najciekawsza część, bo tego nie widać w viralowych filmikach. Wszystkie przypadki są z tej jednej sesji:
- Szyld „ŻÓŁĆ”. Na miniaturce oba generatory obrazów wyglądały poprawnie. Agent powiększył kadry i znalazł „ŽÓŁČ” w Z-Image oraz „ŹÓLĆ” w Qwen-Image.
- Podpis pod kubkiem. Pierwsza wersja podpisu mówiła o „braku faktury”. Po powiększeniu okazało się, że problemem jest błyszcząca glazura zamiast matowej, więc podpis poprawił.
- Porównanie z chmurą. Zdanie „Gemma ma tyle co GLM-5.3” nie zgadzało się z tabelą (69 wobec 64,4 pkt). Agent sprawdził pełny ranking i przepisał zdanie.
- Stracone pobieranie. Zamiast czekać 10 godzin na zablokowane pobieranie, usunął niedokończone pliki i pobrał je od nowa innym narzędziem w 30 minut.
To moja opinia: wartość agenta nie polega na tym, że się nie myli. Myli się tak jak człowiek, ale sam sprawdza wyniki, jeśli ma do tego narzędzia i jeśli w poleceniach jest zasada, że każdą liczbę trzeba potwierdzić.
Koszt i zużycie
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
| Pozycja | Wartość |
|---|---|
| Czas sesji | 3 h 10 min (9:57-13:07) |
| Odpowiedzi modelu / uruchomienia narzędzi | 211 / 228 |
| Tokeny wyjścia | 177 tys. |
| Tokeny odczytane z pamięci podręcznej | 62,7 mln |
| Koszt sesji według cennika API Opus 5.5 | 22,77 USD (ok. 88 zł) |
| Sędziowie przez OpenRouter (27 ocen) | 2,09 USD |
| Prąd karty graficznej za testy | poniżej 50 groszy |
Najważniejszy wiersz to odczyt z pamięci podręcznej. Każda odpowiedź agenta czyta całą dotychczasową rozmowę, a ta sesja trwała od rana, więc kontekst był długi. Odczyt kosztuje tylko 0,20 USD za milion tokenów, ale przy 62,7 mln daje 12,5 USD, czyli ponad połowę rachunku. W abonamencie Claude nie płacisz za to osobno, ale długie sesje szybciej zużywają limit. Praktyczna rada: nowe duże zadanie zaczynaj w nowej sesji. Szczegóły cennika są w tekście ile kosztuje Claude Opus 5.5.
Równoległa praca: trzech agentów naraz
W tym samym czasie ta sama sesja uruchomiła trzech pomocniczych agentów z osobnymi zadaniami. Jeden zrobił gry w przeglądarce i stronę z jednego polecenia, drugi analizę danych i grafiki SVG, trzeci poradnik wideo w Remotion i zestaw promptów. Każdy dostał ten sam brief z zasadami redakcyjnymi, osobny budżet na API (maks. 1,50 USD) i zakaz publikowania. Wydali razem 3,45 USD. Ich teksty ukazują się w tej samej serii o Opusie 5.5.
Czego agent nie zrobił
- Pomocnicze agenty nie publikowały. Oddawały pliki, a na stronę trafiały dopiero po kontroli liczb i linków w głównej sesji.
- Nie zmieniał ustawień bezpieczeństwa. Gdy serwer blokował zbyt częste połączenia, agent ograniczył liczbę zapytań i przeszedł na inny kanał sprawdzania. Nie próbował obchodzić zapory.
- Nie zgadywał tam, gdzie nie mierzył. Nie podał czasu generowania na słabszych kartach ani wyników na Macu, bo ich nie mierzył, i pisze to wprost w tekstach.
Najczęstsze pytania
Czy Claude Code z Opus 5.5 może sam przeprowadzić test i napisać artykuł?
W tym przypadku tak: z jednego polecenia agent zaplanował test, pobrał 127 GB modeli, zmierzył 10 modeli i napisał 6 tekstów w 3 godziny i 10 minut. Człowiek określił cel i kierunek, a agent sprawdzał każdą liczbę przed publikacją.
Ile kosztuje długa sesja Claude Code?
Ta sesja kosztowałaby 22,77 USD według cennika API, z czego 12,5 USD to odczyt 62,7 mln tokenów kontekstu z pamięci podręcznej. W abonamencie nie płacisz osobno, ale zużywasz limit.
Czy agent się myli?
Tak, ale w tej sesji sam wychwycił błędne zdania i podpisy, bo porównywał tekst z danymi i powiększał obrazy przed opisem. Warto wpisać taką zasadę do instrukcji projektu.
Źródła i data sprawdzenia
Case własny: zapis sesji Claude Code (model claude-opus-5-5) z 26.09.2026, zużycie tokenów z historii rozmowy, pomiary w projekcie testowym. Cennik Opus 5.5: mój przewodnik. Narzędzie: Claude Code. Sprawdzone 26 września 2026.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Ile tokenów zużywa długa sesja Claude Code i ile to kosztuje?
Ta sesja zużyła 62,7 mln tokenów odczytanych z pamięci podręcznej oraz 177 tys. tokenów wyjścia, co według cennika API dało łącznie 22,77 USD. Odczyt z cache kosztuje 0,20 USD za milion tokenów, ale przy tak długim kontekście dało to 12,5 USD, czyli ponad połowę rachunku.
Czy Claude Code z Opus 5.5 może samodzielnie przeprowadzić test modeli AI i napisać artykuły?
Tak - z jednego ogólnego polecenia agent zaplanował testy, pobrał modele, zmierzył wyniki i napisał teksty bez dodatkowych instrukcji od człowieka. Człowiek określił jedynie cel, natomiast wybór modeli, metody oceny i harmonogram agent zaplanował sam.
Jak agent poradził sobie z błędem pobierania 127 GB danych?
Gdy prędkość pobierania przez aria2 spadła do 1,3 MB/s, agent przerwał pobieranie, usunął niedokończone pliki i przełączył się na oficjalne narzędzie Hugging Face, które dało ok. 25 MB/s. Dzięki temu zamiast czekać 10 godzin, pobrał pliki w 30 minut.
Czy Gemma 4 działa poprawnie w trybie myślenia podczas testów lokalnych modeli?
Nie - Gemma 4 z domyślnym trybem myślenia wygenerowała 54 tys. tokenów zamiast 4,7 tys. i w trzech zadaniach nie oddała odpowiedzi. Agent wyłączył myślenie i powtórzył test, a problematyczne wyniki opisał osobno jako materiał do artykułu.
