Claude Opus 5.5 po polsku: test na tym samym poleceniu co Opus 5
Oba modele zdały twarde reguły. Różnica wyszła gdzie indziej: w czasie, koszcie i tym, jak często model przyznaje się do niewiedzy.

👁 124 przeczytań
- Claude Opus 5.5 pisze po polsku bez błędów w twardych regułach - zero długich pauz, zero zakazanych fraz, ogonki równe od początku do końca 900-słowowego tekstu.
- Opus 5.5 na ustawieniu domyślnym kosztował 0,092 USD wobec 0,146 USD za Opus 5, a czas generowania skrócił się z 98,6 s do 50,2 s.
- Opus 5.5 użył średnio 15,8 słowa w zdaniu wobec 17,9 u Opus 5 i częściej oznaczał opinie oraz zdania z liczbą - 23 zdania z liczbą wobec 14 u poprzednika.
Anthropic obiecuje, że Claude Opus 5.5 pisze wyraźniej od poprzednika - ważne rzeczy na początku, mniej żargonu, lepsze trzymanie się zasad. Żaden producent nie mierzy tego po polsku, więc zrobiłem to sam: to samo polecenie na Opus 5 i dwóch ustawieniach Opus 5.5, z regułami, na których modele zwykle się wykładają.
Werdykt w jednym akapicie
W twardych regułach remis - wszystkie trzy teksty bez jednego błędu. Zero długich pauz, zero zakazanych fraz, ogonki równe od pierwszego do ostatniego akapitu. Różnica wyszła gdzie indziej: Opus 5.5 pisał krótszymi zdaniami, częściej oznaczał, co jest opinią, a czego nie wie, i zrobił to dwa razy szybciej za 37% mniejszy rachunek. Obietnica „wyraźniejszego pisania” w polszczyźnie się broni - nie jako skok jakości, tylko jako lepszy stosunek jakości do kosztu.
Polecenie, którego użyłem
Napisz tekst po polsku na 900 słów o tym, jak zmienia się polski rynek pracy w IT. Zasady bezwzględne: polskie znaki diakrytyczne obowiązkowo, ani jednego słowa bez ogonków. Tylko dywiz "-", nigdy długa pauza. Zero waty typu "w dzisiejszych czasach", "warto pamiętać", "podsumowując", "kluczowe jest". Każdą tezę popierasz liczbą albo piszesz wprost, że to opinia. Jeśli czegoś nie wiesz, piszesz "nie wiem" - nie zmyślasz danych ani nazw firm. Zwróć sam tekst, bez komentarza.
To jest ten sam test, który publikowałem przy innych premierach - możesz go wkleić do dowolnego modelu i porównać. Każda reguła celuje w typową słabość: ogonki giną pod koniec długich tekstów, długa pauza to najczęstsza sygnatura tekstu z modelu, a wata wraca, jeśli jej wprost nie zakażesz.
Twarde reguły: wyniki
| Reguła | Opus 5 | Opus 5.5 | Opus 5.5, low |
|---|---|---|---|
| Długie pauzy | 0 | 0 | 0 |
| Zakazane frazy | 0 | 0 | 0 |
| Ogonki, pierwsza połowa* | 46,3 | 50,5 | 49,7 |
| Ogonki, druga połowa* | 47,2 | 55,0 | 48,2 |
| Długość | 884 słowa | 976 słów | 907 słów |
* Liczba polskich znaków diakrytycznych na tysiąc znaków tekstu. Jeśli model gubi ogonki pod koniec, liczba w drugiej połowie wyraźnie spada. W żadnym z trzech tekstów nie spadła - czyli ten klasyczny problem przestał dotyczyć obu generacji.
Długość: prosiłem o 900 słów. Opus 5 dał 2% mniej, Opus 5.5 na domyślnym ustawieniu 8% więcej, a na low najbliżej celu - 1% więcej.
Gdzie wyszła różnica
1. Krótsze zdania
| Miara | Opus 5 | Opus 5.5 | Opus 5.5, low |
|---|---|---|---|
| Liczba zdań | 46 | 59 | 53 |
| Średnio słów w zdaniu | 17,9 | 15,8 | 16,4 |
| Śródtytuły | 11 | 9 | 7 |
Dwa słowa mniej w zdaniu to w polszczyźnie odczuwalna różnica - krótsze zdanie łatwiej przeczytać bez wracania. To jest opinia: ta zmiana zgadza się z tym, co obiecuje producent, i jest ważniejsza dla czytelnika niż cokolwiek w tabeli benchmarków.
2. Częściej mówi, czego nie wie
| Miara | Opus 5 | Opus 5.5 | Opus 5.5, low |
|---|---|---|---|
| Zwrot „nie wiem” | 4 | 7 | 6 |
| Oznaczenie „to opinia” | 2 | 4 | 5 |
| Zdania z liczbą | 14 | 23 | 15 |
Opus 5.5 zaczął od zdania, którego Opus 5 nie napisał: „Tam, gdzie mam dane, podaję liczby. Tam, gdzie ich nie mam, piszę, że to moja opinia albo że nie wiem.” - czyli powtórzył czytelnikowi zasadę z polecenia. Zakończył podobnie: interpretacją wyraźnie oznaczoną jako interpretacja i przyznaniem, że czegoś nie potrafi udowodnić.
Opus 5 też trzymał się reguły - zakończył tekst listą „czego nie wiem” - ale rzadziej oznaczał opinie w środku tekstu.
3. Czas i koszt
| Miara | Opus 5 | Opus 5.5 | Opus 5.5, low |
|---|---|---|---|
| Czas | 98,6 s | 50,2 s | 42,5 s |
| Koszt | 0,146 USD | 0,092 USD | 0,076 USD |
Ten sam poziom jakości w twardych regułach, połowa czasu i o jedną trzecią mniejszy rachunek. Przy produkcji wielu tekstów to właśnie ta tabela decyduje. Pełny rachunek rozpisałem osobno.
Czego ten test nie sprawdza
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Uczciwie: nie weryfikowałem każdej liczby w tych tekstach. Oba modele przywoływały dane z Eurostatu, GUS i raportów branżowych. Opus 5.5 podał więcej liczb (23 zdania z liczbą wobec 14), a więcej liczb to więcej miejsc na pomyłkę. Dwie wyrywkowo sprawdzone - stopa NBP 6,75% we wrześniu 2022 i przedział stóp amerykańskiej Rezerwy Federalnej 5,25-5,5% w 2023 - się zgadzają, ale dwie to nie próba.
Zachowanie modeli przy braku danych sprawdziłem osobnym testem z pułapką - opisałem go tutaj.
Pięć zasad pisania po polsku z Opus 5.5
- Pisz polecenie z pełnymi ogonkami. Model kopiuje styl instrukcji - polecenie bez ogonków daje tekst bez ogonków, niezależnie od generacji.
- Zakaż długiej pauzy wprost. W tym teście żaden model jej nie użył, ale tylko dlatego, że zakaz był w poleceniu.
- Wymień zakazane frazy. Lista czterech wyrażeń wystarczyła, żeby żadne się nie pojawiło.
- Spróbuj ustawienia low. W tym zadaniu dało tekst najbliższy zamówionej długości, za 52% ceny Opus 5.
- Sprawdzaj liczby, nie styl. Styl przestał być problemem. Fakty wciąż wymagają weryfikacji.
Najczęstsze pytania
Czy Claude Opus 5.5 dobrze pisze po polsku?
W moim teście tak: zero błędów w zakazach, ogonki równe do końca tekstu, krótsze zdania niż u poprzednika.
Czy jest lepszy po polsku od Opus 5?
W twardych regułach remis. Pisze krótszymi zdaniami, częściej oznacza opinie i robi to dwa razy szybciej i o jedną trzecią taniej.
Czy gubi polskie znaki pod koniec długich tekstów?
Nie. Gęstość znaków diakrytycznych w drugiej połowie tekstu była taka sama albo wyższa niż w pierwszej.
Czy używa długich pauz?
Nie, jeśli zakażesz ich w poleceniu. W teście z zakazem - zero.
Które ustawienie wybrać do tekstów?
W tym teście low dał najbliższą zamówionej długość i najniższy koszt przy tych samych wynikach w regułach.
Źródła i data sprawdzenia
Test przeprowadziłem sam 24 września 2026 przez OpenRouter: po jednym zapytaniu na Claude Opus 5 i Claude Opus 5.5 na ustawieniach domyślnych oraz na Opus 5.5 z ustawieniem low. Liczby w tabelach policzyłem skryptem z pełnych odpowiedzi, koszt i tokeny z pola rozliczeniowego OpenRoutera. Jedno zapytanie na wariant to wynik konkretnego przebiegu, a nie średnia - inne losowanie może dać inne liczby. Obietnicę producenta dotyczącą pisania cytuję z ogłoszenia premiery.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Czy Claude Opus 5.5 dobrze pisze po polsku?
W przeprowadzonym teście tak - zero błędów w zakazanych frazach, brak długich pauz i ogonki równe do końca tekstu. Różnica względem Opus 5 widoczna jest w krótszych zdaniach i częstszym oznaczaniu opinii, a nie w twardych regułach, gdzie oba modele wypadły remisem.
Czy Claude Opus 5.5 gubi polskie znaki diakrytyczne pod koniec długich tekstów?
Nie - gęstość znaków diakrytycznych w drugiej połowie tekstu nie spadła w żadnym z trzech testowanych wariantów. Dla Opus 5.5 na ustawieniu domyślnym wyniosła 55,0 znaków na tysiąc w drugiej połowie wobec 50,5 w pierwszej.
Które ustawienie Claude Opus 5.5 wybrać do generowania tekstów po polsku?
W tym teście ustawienie low dało tekst najbliższy zamówionej długości - 907 słów wobec zamówionych 900 - przy koszcie 0,076 USD, czyli 52% ceny Opus 5. Wyniki w twardych regułach były identyczne jak na ustawieniu domyślnym.
Czy Claude Opus 5.5 zmyśla dane i liczby w tekstach po polsku?
Test nie weryfikował każdej liczby - autor sprawdził wyrywkowo dwie: stopę NBP 6,75% z września 2022 i przedział stóp Fed 5,25-5,5% z 2023, i obie się zgadzały. Opus 5.5 podał więcej zdań z liczbami niż Opus 5 - 23 wobec 14 - co oznacza więcej miejsc na ewentualną pomyłkę.
