GPT-5.5 - recenzja. Cztery modele w jednym i o to chodzi
Recenzja GPT-5.5: cztery tryby rozumowania (low-xhigh), Intelligence Index do 60, jedna cena $4.35/1M. Najbardziej elastyczny model na rynku.
👁 117 przeczytań
GPT-5.5 to nie jeden model - to suwak. Cztery tryby rozumowania (low, medium, high, xhigh) w jednej cenie $4.35/1M tokenów. I to jest jego największa siła. Zamiast żonglować trzema różnymi modelami w zależności od trudności zadania, dostajesz jeden endpoint i jeden parametr, którym regulujesz, ile model ma „myśleć”. To zmienia sposób, w jaki się z nim pracuje - i o to chodzi.
Google · Twoje źródłaDodaj promptowy.com do preferowanych źródeł w Google→Liczby
- Intelligence Index: 51-60 zależnie od trybu
- Kontekst: 922k tokenów
- TTFT: od 2.1 s (low) do 86 s (xhigh) - sam decydujesz, ile czekasz
- Cena: $4.35 / 1M tokenów, identyczna dla wszystkich trybów
Najważniejszy szczegół jest w ostatnim punkcie: tryb nic nie kosztuje ekstra. Płacisz tyle samo za odpowiedź w 2 sekundy, co za 86-sekundowe rozumowanie. Różnica jest w liczbie tokenów rozumowania, które model wygeneruje po drodze - w xhigh „rozmyśla” znacznie dłużej, więc rachunek za tę samą odpowiedź potrafi być kilkukrotnie wyższy. Cennik za token się nie zmienia, ale realny koszt zapytania tak.
Cztery tryby w praktyce - te same prompty, różne wyniki
Najlepiej pokazać to na jednym poleceniu puszczonym przez wszystkie cztery tryby. Wziąłem prompt, który nie jest ani trywialny, ani olimpijski - taki z codziennej pracy.
Prompt: „Mam tabelę zamówień z kolumnami: data, klient, kwota, status. Napisz zapytanie SQL, które zwróci 5 klientów z największą sumą zrealizowanych zamówień w ostatnim kwartale, i wyjaśnij, dlaczego tak, a nie inaczej.”
- low (2.1 s): poprawny
SELECT ... GROUP BY klient ORDER BY suma DESC LIMIT 5z filtrem na status i datę. Działa. Wyjaśnienie: dwa zdania. Idealne, gdy wiesz, czego chcesz, i potrzebujesz tylko składni. - medium (~9 s): ten sam SQL, ale model sam zauważa, że „ostatni kwartał” jest niejednoznaczny (kwartał kalendarzowy vs. ostatnie 90 dni) i proponuje obie wersje. Dorzuca uwagę o indeksie na kolumnie status. To jest punkt równowagi - najczęściej tu zostaję.
- high (~30 s): dochodzi obsługa przypadków brzegowych (klienci z remisem na piątym miejscu, NULL-e w kwocie), wersja z CTE pod czytelność i krótka analiza wydajności na dużej tabeli. Tyle, ile dałby przytomny senior.
- xhigh (~80 s): pełen rozbiór - okienkowe
RANK()dla obsługi remisów, wariant pod różne dialekty (Postgres vs. MySQL), test poprawności na danych przykładowych i dyskusja, kiedy ten przegląd jest przesadą. Do tego prostego pytania xhigh jest overkillem i sam to przyznaje.
Wniosek z testu jest taki sam jak z dziesiątek innych: do 80% zadań medium wystarcza, low jest do rzeczy oczywistych, high włączasz, gdy zależy ci na kompletności, a xhigh trzymasz na naprawdę trudne problemy. Puszczanie wszystkiego na xhigh to palenie czasu i tokenów.
GPT-5.5 vs GPT-5 - tabela porównawcza
| Cecha | GPT-5 | GPT-5.5 |
|---|---|---|
| Tryby rozumowania | osobne modele / warianty | jeden model, suwak low-xhigh |
| Intelligence Index | niżej w górnym zakresie | 51-60 zależnie od trybu |
| Kontekst | mniejszy | 922k tokenów |
| TTFT | stały, mniej elastyczny | 2.1 s - 86 s, do wyboru |
| Cena | - | $4.35 / 1M tokenów |
| Filozofia | wybierasz model do zadania | wybierasz wysiłek do zadania |
Największa zmiana nie jest punktowa, tylko strukturalna. GPT-5 wymagał decyzji „który model” przed wysłaniem zapytania. GPT-5.5 przenosi tę decyzję na poziom parametru - i pozwala ją zmieniać w locie, nawet w obrębie jednej rozmowy. Dla zespołów budujących produkty na API to upraszcza routing: jeden endpoint, jeden cennik, jedna logika.
Mocne strony
Elastyczność. Ten sam model odpowiada na proste pytanie w 2 sekundy (tryb low) i rozwiązuje zadania olimpijskie w trybie xhigh. Nie przepinasz się między modelami - zmieniasz suwak.
Ekosystem. ChatGPT to wciąż najdojrzalszy produkt konsumencki: pamięć, wtyczki, tryb głosowy, canvas. Model to połowa wartości - druga połowa to opakowanie.
Multimodalność - obraz, głos i tekst działają płynniej niż u konkurencji.
Kontekst 922k. Wrzucenie całego repozytorium albo grubego raportu w jedno zapytanie po prostu działa - z zastrzeżeniem, które opisuję niżej.
Słabsze strony
W trybie xhigh GPT-5.5 osiąga 60 punktów - wciąż 5 mniej niż Fable 5, przy podobnym czasie oczekiwania. Do najtrudniejszego kodu i najdłuższych dokumentów Claude jest po prostu lepszy. Kontekst 922k wygląda dobrze, ale w praktyce model „rozmywa się” szybciej niż Claude przy bardzo długich rozmowach - im bliżej górnej granicy okna, tym częściej gubi szczegóły z początku.
Drugi haczyk to koszt xhigh. Skoro cena za token jest stała, a xhigh generuje wielokrotnie więcej tokenów rozumowania, łatwo nadziać rachunek, jeśli ktoś bezmyślnie ustawi najwyższy tryb jako domyślny. To narzędzie, nie ustawienie „na zawsze”.
Cennik: Plus vs Pro
Poza API model jest dostępny w abonamentach konsumenckich. Dwa, które mają sens dla większości:
- Plus - dla osoby, która używa ChatGPT codziennie do pracy: pisanie, kod, research. Dostęp do trybów low-high w rozsądnych limitach. Dla 90% użytkowników to wystarczający pułap.
- Pro - sens ma wtedy, gdy regularnie sięgasz po xhigh, długi kontekst i pracujesz na dużych dokumentach lub kodzie. Wyższe limity i priorytet to różnica między „czasem czekam” a „nie czekam”. Jeśli nie odpalasz xhigh co najmniej kilka razy dziennie, Pro się nie zwróci - zostań na Plus.
Prosta zasada: zacznij od Plus, obserwuj, jak często uderzasz w limity trybów wysokich, i dopiero wtedy rozważ Pro. Odwrotna kolejność to przepłacanie.
Realne zastosowania
- Codzienna praca biurowa - maile, podsumowania, przepisywanie. Tryb low/medium, odpowiedź natychmiast, koszt minimalny.
- Programowanie - medium do większości tasków, high do refaktoryzacji i debugowania, xhigh do naprawdę zawiłych problemów algorytmicznych. Do najcięższego kodu i tak warto porównać z Claude.
- Analiza długich dokumentów - 922k kontekstu mieści całe umowy, raporty czy dokumentację. Sprawdza się, dopóki nie wjeżdżasz w bardzo długie, wielowątkowe rozmowy.
- Produkty na API - jeden endpoint i parametr wysiłku upraszczają architekturę: tani tryb dla ruchu masowego, droższy tylko tam, gdzie zadanie tego wymaga.
- Multimodalne workflowy - analiza obrazów, dyktowanie głosem, canvas do iteracyjnej pracy nad tekstem.
Dla kogo
Dla 90% użytkowników to najrozsądniejszy wybór domyślny: jeden abonament, cztery prędkości, świetna aplikacja. Jeśli twoja praca to mieszanka prostych i trudnych zadań - a u większości tak jest - suwak załatwia sprawę bez przesiadek między narzędziami.
Werdykt: 4.5/5
Najlepszy model „do wszystkiego”. Traci pół gwiazdki, bo na samym szczycie - tam, gdzie liczy się każdy punkt inteligencji - ustępuje Anthropicowi. Ale dla codziennej, mieszanej pracy elastyczność suwaka bije surowy benchmark. Porównanie: ranking modeli.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
