Opus 5 kontra reszta stawki. Kiedy naprawdę nie potrzebujecie najlepszego modelu
Najmądrzejszy model świata kosztuje 10 dolarów za milion tokenów w miksie. Kimi K3 daje 57 punktów za 6 dolarów, a GLM-5.2 pięćdziesiąt jeden za 90 centów. Rachunek, który warto zrobić przed przepięciem produkcji.
👁 263 przeczytań
Opus 5 jest teraz najwyżej ocenianym modelem w niezależnym Intelligence Index. Pytanie, które zadaję sobie przy każdej takiej premierze, brzmi inaczej niż w nagłówkach: nie „czy jest najlepszy”, tylko „do czego naprawdę potrzebuję najlepszego”.
Ile kosztuje inteligencja
Poniżej zestawienie z danych Artificial Analysis. Cena to koszt miksu 3:1 wejścia do wyjścia, czyli to, co realnie płacicie przy typowym użyciu:
| Model | Inteligencja | Cena / 1M |
|---|---|---|
| Claude Opus 5 (max) | 61 | 10 USD |
| Claude Fable 5 | 60 | 20 USD |
| GPT-5.6 Sol | 59 | 11,25 USD |
| Kimi K3 | 57 | 6 USD |
| Claude Opus 4.8 | 56 | 10 USD |
| GLM-5.2 (max) | 51 | 0,90 USD |
Trzy wnioski z tej tabeli. Po pierwsze, Opus 5 zbił cenę szczytu o połowę: to samo miejsce w rankingu co Fable 5, dwa razy taniej. Po drugie, chiński Kimi K3 daje 93 procent inteligencji lidera za 60 procent ceny. Po trzecie, GLM-5.2 z otwartymi wagami kosztuje jedenaście razy mniej niż Opus 5, a wciąż ma 51 punktów.
Gdzie te punkty znikają
Różnica między 61 a 51 punktem nie rozkłada się równo na wszystkie zadania. W streszczaniu maila, przepisaniu tekstu czy wyciągnięciu danych z faktury nie zobaczycie jej wcale. Zobaczycie ją w zadaniach wieloetapowych, w kodzie, którego nie znacie, i wszędzie tam, gdzie model musi zauważyć, że sam się pomylił.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Jak to policzyć u siebie
Weźcie sto swoich prawdziwych zapytań z ostatniego tygodnia, puśćcie je przez dwa modele i policzcie, ile odpowiedzi wymagało poprawki. Jeśli tańszy model wymaga poprawki w pięciu procentach przypadków, a jest cztery razy tańszy, wybór jest oczywisty. Jeśli w trzydziestu, płacicie za drogi model swoim czasem, tylko w innej walucie.
Nowy suwak wysiłku w Opus 5 dokłada tu jeszcze jedną możliwość: zamiast przesiadać się na inny model, można zejść z wysiłkiem na tym samym. To pierwszy raz, gdy ta decyzja jest w waszych rękach na poziomie pojedynczego zapytania.
Ta sama arytmetyka działa przy nowszych modelach: Fable 5.1 kosztuje dwa razy tyle co Opus 5, a w zadaniach językowych po polsku przewagi nie widać. Pełne dane obu wersji zebrałem w przewodniku o Fable 5.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
Ile pamięci naprawdę potrzebuje agent AI? To zależy od modelu, nie od intuicjiNewsy
Kiedy dostaniesz GPT-6 Astra? Etapy udostępniania, plany i co zrobić, gdy modelu nie widaćMagazyn
Który model AI pisze najlepiej po polsku? Benchmark: 5 generatorów kontra „Zażółć gęślą jaźń”AI dla twórców
