Przejdź do treści
Artykuły

Analiza danych z Opus 5.5: sprawdziłem 44 twierdzenia modelu

Dałem Opusowi 5.5 wyniki 16 modeli w CSV. Policzył korelacje bez kodu, znalazł błąd w metodologii testu i pomylił się raz na 44 twierdzenia.

8 min czytania
Analiza danych z Opus 5.5: sprawdziłem 44 twierdzenia modelu

👁 114 przeczytań

// w skrócie
  • Opus 5.5 poprawnie zweryfikował 43 z 44 sprawdzonych twierdzeń, a jedyna pomyłka dotyczyła licznika 14 zamiast 15 przebiegów z pauzami.
  • Jedno zapytanie trwało 4 minuty 36 sekund i kosztowało 0,645 USD (2,49 zł), z czego 68% tokenów wyjścia poszło na myślenie.
  • Model bez uruchamiania kodu obliczył korelację Pearsona jako 0,18 i Spearmana jako 0,20, co zgadza się z wynikami pandas do trzeciego miejsca po przecinku.

Analiza danych z Opus 5.5 to test, który zrobiłem na prawdziwym zbiorze: wynikach naszego Laboratorium, w którym 16 modeli pisało po polsku. Dałem modelowi dwa pliki CSV i zadanie jak dla analityka w firmie: wnioski, anomalie, korelacja kosztu z jakością, rekomendacja i kod do wykresów. Potem porównałem z danymi 44 twierdzenia z jego odpowiedzi. Zgodne było 43, a jedna z „hipotez” trafiła w błąd, który sam popełniłem w metodologii testu.

W skrócie

Jedno zapytanie trwało 4 min 36 s i kosztowało 0,645 USD (2,49 zł), z czego 68% tokenów wyjścia poszło na myślenie. Korelacje Pearsona (0,18) i Spearmana (0,20) policzył bez uruchamiania kodu i zgadzają się z pandas do trzeciego miejsca po przecinku. Skrypt do wykresów zadziałał bez poprawek. Jedyna pomyłka: 14 zamiast 15 przebiegów w jednym z liczników. To dobry analityk do pierwszego przejścia przez dane, ale nie tani: ta jedna analiza kosztowała 2,6 raza więcej niż wszystkie 9 zadań pisania Opusa w Laboratorium.

43/44twierdzeń zgodnych z danymi
0,645 USDkoszt jednej analizy
276 sczas odpowiedzi
0poprawek w kodzie wykresów

Dane i zadanie

Źródłem są wyniki Laboratorium Promptowego z 26 września 2026, opisane szerzej w tekście o tym, który AI najlepiej pisze po polsku. Z pliku rankingu zrobiłem modele.csv (16 wierszy, 19 kolumn: wynik, oceny sędziów, reguły, koszt, czas), a z pomiarów automatycznych zadania.csv (234 wiersze: 18 modeli razy 13 zadań, z tokenami, czasem i powodem zakończenia). Komentarzy sędziów nie dałem, żeby model pracował wyłącznie na liczbach.

Opusa wywołałem przez OpenRouter, poziom wysiłku medium, limit 32 000 tokenów wyjścia. Poniżej pełne polecenie, pod nim w zapytaniu była treść obu plików CSV (łącznie 15,6 KB).

Jesteś analitykiem danych. Poniżej dwa pliki CSV z testu 16 modeli językowych na zadaniach pisania po polsku (wrzesień 2026).

Słownik kolumn:
- modele.csv: jeden wiersz = jeden model. wynik_pisanie (0-100) = 70% średnia ocen sędziów (skala 1-10) + 20% reguly_proc + 10% higiena (kara za pauzy i „watę”). sedziowie_srednia, poprawnosc, naturalnosc, wykonanie = oceny sędziów 1-10. reguly_proc = % spełnionych twardych reguł z poleceń. pauzy_na_1000_slow = długie myślniki na 1000 słów. wata = liczba pustych fraz. korekta_* i quiz_* = liczba poprawnych odpowiedzi (maksimum w nazwie kolumny). puste_pierwsza_proba = ile odpowiedzi przyszło puste przy pierwszej próbie. koszt_pisanie_usd i czas_pisanie_s = suma dla 9 zadań pisania (T1-T9).
- zadania.csv: jeden wiersz = model × zadanie (13 zadań, w tym 2 modele lokalne z prefiksem lok_, które nie mają ocen sędziów). koniec = powód zakończenia generowania, tokeny_myslenia puste = model nie raportuje.

Zadanie:
1. Podaj 5 najważniejszych wniosków, każdy z konkretnymi liczbami z danych.
2. Wskaż anomalie i podejrzane wartości w danych (co mogło zafałszować wynik).
3. Oceń związek koszt-jakość: policz korelację (Pearson i Spearman) między koszt_pisanie_usd a wynik_pisanie dla 16 modeli i zinterpretuj ją. Wskaż modele najlepsze w stosunku jakości do ceny.
4. Rekomendacja dla polskiej firmy, która co miesiąc generuje ok. 2000 tekstów marketingowych i mail: który model jako główny, który jako tani zapasowy, i ile to kosztuje miesięcznie przy obecnych kosztach (przyjmij, że 1 tekst ≈ 1/9 kosztu koszt_pisanie_usd).
5. Napisz jeden skrypt w Pythonie (pandas + matplotlib), który wczytuje modele.csv i zadania.csv z bieżącego katalogu i zapisuje DWA wykresy PNG: (a) wykres punktowy koszt vs wynik_pisanie z podpisanymi modelami (oś kosztu logarytmiczna), (b) wykres wybranej przez Ciebie zależności z zadania.csv, która najlepiej pokazuje jedną z anomalii. Polskie podpisy osi. Skrypt ma działać bez zmian.

Odpowiadaj po polsku. Liczby podawaj tylko takie, które wynikają z danych albo z Twoich obliczeń; jeśli coś szacujesz, napisz to wprost.

Ile to kosztowało i trwało

PomiarWartość
Czas odpowiedzi276,4 s
Tokeny wejścia12 457
Tokeny wyjścia29 742, w tym 20 274 myślenia (68%)
Koszt z rozliczenia OpenRoutera0,6447 USD (2,49 zł)
Długość odpowiedzi17,7 tys. znaków: 5 wniosków, 13 anomalii, rekomendacja, skrypt na 107 linii

Samo myślenie kosztowało około 0,41 USD (20 274 tokeny po 20 USD za milion). Model przed odpowiedzią sam sprawdził spójność plików: zsumował koszty zadań i porównał z kolumną zbiorczą, a ze składników wyniku odtworzył wzór na „higienę”. Wyszło mu 100 minus 4 punkty za każdą pauzę na 1000 słów minus 5 za każdą frazę waty i to jest dokładnie wzór z naszego skryptu rankingu, którego nie widział. Oznaczył go uczciwie jako szacunek.

Sprawdziłem 44 twierdzenia z odpowiedzi

Każdą liczbę, którą dało się policzyć z plików, przeliczyłem osobnym skryptem w pandas. Wybór z 44 pozycji:

Twierdzenie modeluModel podałDane
Korelacja Pearsona koszt-wynik0,180,183
Korelacja Spearmana (z sumą kwadratów różnic rang 542)0,200,203, suma 542
Pearson bez Mistrala0,470,468
Front Pareto (nikt tańszy i lepszy)Luna, Sol, OpusLuna, Sol, Opus
Qwen, zadanie T2: tokeny myślenia i udział w koszcie14 460, 51%14 460, 51,3%
Ucięta odpowiedź DeepSeek V4.1 Flash w T26000 tokenów, 70 słów6000, 70
Koszt 2000 tekstów miesięcznie na Opusie55,09 USD55,09 USD
Modele lokalne, spełnione regułyBielik 19/26, Gemma 25/2619/26, 25/26
Przebiegi T9 z co najmniej 2 pauzami14 z 1815 z 18

Jedyna rozbieżność dotyczy licznika w anomalii o myślnikach w tłumaczeniu i nie zmienia wniosku. Wszystkie korelacje policzył w tekście, bez narzędzia do wykonywania kodu, i trzymały się wyniku z pandas. Pełna lista z danymi źródłowymi leży w katalogu testu. O tym, jak Opus zachowuje się, gdy liczby w danych brakuje, pisałem osobno w teście czy Claude Opus 5.5 zmyśla liczby.

Najlepsze znalezisko: błąd w moim własnym teście

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Z 13 anomalii najciekawsza była trzecia. Model zauważył, że dwie odpowiedzi ucięto dokładnie na 6000 tokenach, a jednocześnie Qwen w tym samym zadaniu skończył normalnie przy 14 852 tokenach, a Mistral w mailu przy 11 172. Postawił hipotezę: ponowienia po pustej odpowiedzi szły z innym limitem, i powiązał to z kolumną pustych pierwszych prób. Zaznaczył, że dane tego nie rozstrzygają.

Sprawdziłem w kodzie Laboratorium. Domyślny limit dla tych zadań to 6000 tokenów, a powtórki szły z podniesionym limitem. Cztery odpowiedzi powyżej 6000 tokenów to dokładnie te cztery, które przy pierwszej próbie przyszły puste. Wniosek dla rankingu: DeepSeek V4.1 Flash i Mistral w dwóch zadaniach pracowali przy niższym limicie niż modele z powtórką. To opinia redakcji: różnica rzędu 1-2 punktów nie zmienia kolejności w czołówce, ale przy kolejnej edycji limit powinien być jeden dla wszystkich.

Były też spostrzeżenia na wyrost. Model napisał, że „nie znamy tożsamości sędziów”, więc możliwe jest faworyzowanie własnej firmy. W Laboratorium sędzia nie ocenia modeli swojego producenta, ale tej informacji nie było w danych, więc zastrzeżenie było zasadne.

Kod do wykresów: zadziałał bez zmian

Skrypt uruchomiłem lokalnie w Pythonie 3.13 z matplotlib 3.11. Pierwsze uruchomienie przerwał brak biblioteki pandas na moim komputerze, co nie jest winą modelu, bo wymienił ją w nagłówku. Po instalacji skrypt przeszedł za pierwszym razem w 2,6 s, zapisał oba pliki PNG i wypisał te same korelacje, które model podał w tekście, plus trzecią (0,15 dla logarytmu kosztu).

Wykres punktowy kosztu i wyniku pisania 16 modeli z zaznaczonym frontem Pareto
Wykres 1 z kodu Opusa 5.5, bez żadnej poprawki. Zielone punkty to front Pareto: Luna, Sol i Opus.

Drugi wykres model wybrał sam: tokeny wyjścia kontra liczba słów w gotowym tekście. Dobrze pokazuje dwie rzeczy naraz, czyli ucięte odpowiedzi na linii 6000 tokenów i zadania, w których model spalił ponad 7000 tokenów na tekst długości 43-182 słów.

Wykres tokenów wyjścia i liczby słów w zadaniach pisania z zaznaczonymi uciętymi odpowiedziami
Wykres 2: czerwone punkty to odpowiedzi ucięte limitem. Dwa podpisy w prawym dolnym rogu nachodzą na siebie.

Wady są kosmetyczne: nachodzące podpisy (Grok 4.7 i Kimi K3 na pierwszym wykresie, dwa punkty na drugim) i półpauzy w tytułach wykresów. Poprawka to kilka minut ręcznej pracy.

Rekomendacja dla firmy

Na 2000 tekstów miesięcznie model zaproponował Opusa 5.5 jako model główny (około 55 USD miesięcznie) i GPT-6 Sol jako zapasowy od innego dostawcy (7,96 USD przy przejęciu całego ruchu). Uzasadnienie: w tekstach marketingowych liczy się naturalność, a tu Opus ma 8,50 wobec 7,56 u Sola. Wariant budżetowy to Sol z Luną za około 8 USD miesięcznie. Sam dopisał wrażliwość założenia: gdyby wszystkie teksty były mailami, Opus kosztowałby 17,74 USD. Aktualny cennik modelu jest w tekście o tym, ile kosztuje Claude Opus 5.5.

To opinia redakcji: rekomendacja jest rozsądna i ma dobrze opisane założenia, ale jej jakość zależy od jednej przyjętej przeze mnie proporcji 1/9 kosztu na tekst. Model tę proporcję zakwestionował sam, bez proszenia.

Kiedy to się opłaca

  • Pierwsze przejście przez nowy zbiór danych: 13 anomalii w 4,6 minuty, z czego co najmniej jedna prawdziwa i nieoczywista.
  • Szkic wykresów, gdy nie chcesz pisać matplotlib od zera: 107 linii działającego kodu.
  • Kontrola spójności danych, której nikt nie zamawiał: sumy, wzory, zakresy.

Nie opłaca się przy powtarzalnych raportach na tych samych danych. 0,645 USD za jedną odpowiedź to więcej niż koszt całej sesji pisania w Laboratorium, a przy medium model i tak sam decyduje, ile myśleć (więcej w tekście o poziomach wysiłku). Do stałego raportu lepiej raz wygenerować skrypt i uruchamiać go bez modelu.

Najczęstsze pytania

Czy Claude Opus 5.5 liczy korelację bez uruchamiania kodu?

W moim teście tak. Pearson 0,18 i Spearman 0,20 dla 16 modeli zgadzały się z pandas do trzeciego miejsca po przecinku, a model pokazał też sumę kwadratów różnic rang (542), którą dało się sprawdzić.

Ile kosztuje analiza danych z Opus 5.5?

Jedno zapytanie z 15,6 KB danych CSV kosztowało 0,645 USD, czyli 2,49 zł. 68% tokenów wyjścia to myślenie, więc koszt zależy bardziej od trudności zadania niż od rozmiaru danych.

Czy kod wygenerowany przez Opusa 5.5 działa od razu?

Skrypt do dwóch wykresów w matplotlib zadziałał bez poprawek po doinstalowaniu pandas. Wady były tylko kosmetyczne: nachodzące podpisy punktów.

Czy Opus 5.5 zmyśla liczby w analizie?

Na 44 sprawdzone twierdzenia 43 zgadzały się z danymi, a jedno było pomyłką o 1 w liczniku. Szacunki i hipotezy model oznaczał wprost jako szacunki.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Źródła i data sprawdzenia

Dane: wyniki Laboratorium Promptowego z 26 września 2026 (ranking 16 modeli i pomiary automatyczne 13 zadań). Model: Claude Opus 5.5 na OpenRouterze, cennik z ogłoszenia Anthropic. Wykresy: matplotlib i pandas. Koszt z pola rozliczeniowego odpowiedzi OpenRoutera, kurs 3,857 zł za 1 USD (NBP, 24.09.2026). Test wykonałem na własnym komputerze, sprawdzone 26 września 2026.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Ile kosztowała analiza danych wykonana przez Opus 5.5 w tym teście?

Jedna analiza kosztowała 0,645 USD (2,49 zł) według rozliczenia OpenRoutera. To 2,6 raza więcej niż wszystkie 9 zadań pisania Opusa w Laboratorium.

Czy skrypt w Pythonie wygenerowany przez Opus 5.5 zadziałał od razu?

Skrypt zadziałał bez żadnych poprawek po instalacji biblioteki pandas, której brakowało na komputerze autora. Uruchomienie trwało 2,6 sekundy i zapisało oba pliki PNG.

Jaką anomalię w danych wykrył Opus 5.5, której autor wcześniej nie zauważył?

Model postawił hipotezę, że ponowienia po pustej odpowiedzi szły z innym, wyższym limitem tokenów niż domyślne 6000. Sprawdzenie kodu Laboratorium potwierdziło to: cztery odpowiedzi powyżej 6000 tokenów to dokładnie te, które przy pierwszej próbie przyszły puste.

Który model AI Opus 5.5 zarekomendował polskiej firmie generującej 2000 tekstów miesięcznie?

Model zaproponował Opusa 5.5 jako główny za około 55 USD miesięcznie i GPT-6 Sol jako zapasowy od innego dostawcy za 7,96 USD. Uzasadnieniem był wynik naturalności: Opus uzyskał 8,50 wobec 7,56 u Sola.

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›