Claude Opus 4.7 - model, który sam sobie sprawdza zadanie domowe
Anthropic wypuścił Claude Opus 4.7, nowy model językowy, który potrafi samodzielnie sprawdzać zadania. Model ten zaczyna zachowywać się jak współpracownik, a nie tylko narzędzie dla programisty.
Anthropic wypuścił właśnie swój najnowszy flagowy model. Nie jest najpotężniejszy w całym katalogu - ten tytuł wciąż należy do zamkniętego Mythos Preview - ale robi coś, co w praktyce liczy się bardziej niż kolejny punkt na wykresie. Zaczyna zachowywać się jak ktoś, komu można wreszcie powierzyć pracę i wrócić po godzinie, zamiast siedzieć mu nad głową.
- Claude Opus 4.7 kosztuje tyle samo co 4.6 - 5 USD za milion tokenów wejściowych i 25 USD za milion wyjściowych - ale oferuje m.in. trzykrotnie wyższą rozdzielczość obrazów (do 2576 px).
- GitHub raportuje 13-procentowy wzrost rozwiązywalności zadań, XBOW odnotował skok z 54,5 do 98,5 proc., a Harvey osiągnął 90,9 proc. na BigLaw Bench.
- Model zastąpił Extended Thinking z budżetem tokenów nowym trybem adaptive thinking, w którym sam decyduje, ile czasu poświęcić na rozwiązanie problemu.
Jest pewien moment w życiu modelu językowego, w którym przestaje on być narzędziem dla programisty, a zaczyna być współpracownikiem. Nie chodzi o benchmarki. Chodzi o to, czy po powierzeniu mu zadania trzeba wracać co trzy minuty, czy też można wyjść po kawę. Opus 4.7 - według deklaracji Anthropic i pierwszych testerów - przekroczył właśnie ten próg. Przynajmniej w kategorii długich, wieloetapowych zadań inżynierskich.
Nowy model zastępuje wersję 4.6, która sama w sobie była już bardzo solidna. Kosztuje dokładnie tyle samo - 5 dolarów za milion tokenów wejściowych i 25 dolarów za milion wyjściowych - ale w środku dzieje się kilka rzeczy, które warto zrozumieć, zanim podmieni się jedną linijkę w kodzie i oczekuje, że wszystko nagle zacznie działać lepiej. Czasem zadziała inaczej.
Co faktycznie się zmieniło
Anthropic pozycjonuje Opusa 4.7 jako największy skok w trudnych zadaniach programistycznych od czasu przejścia z serii 3.7 na 4. Kluczowa obserwacja: model stał się znacznie bardziej precyzyjny w wykonywaniu instrukcji. Brzmi niewinnie, ale ma konkretną konsekwencję. Prompty, które działały na starym Opusie i które z czasem ktoś łatał dopiskami w rodzaju „nie rób X, nie zapomnij o Y”, mogą teraz produkować dziwne wyniki. Nowy model traktuje każde słowo literalnie. Dawniej omijał niektóre instrukcje, dziś wykonuje wszystkie. Jeśli masz stare rusztowania promptowe, zrewiduj je.

Opus 4.7 konsekwentnie poprawia wyniki 4.6 we wszystkich kluczowych kategoriach. Nie dogania Mythos Preview, ale też nie taka jest jego rola - Mythos pozostaje zamknięty.
Liczby, które stoją za tym skokiem, są konkretne. GitHub raportuje trzynastoprocentowy wzrost rozwiązywalności zadań na wewnętrznym benchmarku, w tym cztery zadania, których żaden wcześniejszy model Claude nie domknął. Rakuten mówi o trzykrotnie większej liczbie rozwiązanych zadań produkcyjnych na własnym benchu SWE. XBOW - firma od automatycznych testów penetracyjnych - pokazuje skok z 54,5 do 98,5 procent w teście ostrości wzrokowej. A Harvey, produkt prawniczy, raportuje wynik 90,9 procent na BigLaw Bench, z poprawnym rozróżnianiem klauzul kontraktowych, które do tej pory myliły modele frontier.

Sześć wyników od sześciu różnych partnerów. Wszystkie pokazują ten sam wzorzec: dwucyfrowe wzrosty w punktach procentowych, najmocniejsze tam, gdzie liczy się percepcja wzrokowa i wieloetapowe wnioskowanie.
Wzrok trzy razy lepszy
Jedna z cichszych, ale najbardziej praktycznych zmian dotyczy multimodalności. Opus 4.7 akceptuje obrazy do 2576 pikseli na dłuższej krawędzi - ponad trzy razy więcej niż poprzednicy. Dla agentów obsługujących interfejsy graficzne, dla ekstrakcji danych z diagramów, dla pracy z dokumentami, w których liczy się każdy piksel - to jest realna różnica, a nie kosmetyka.
Z perspektywy użytkownika: zrzuty ekranu z aplikacji, skomplikowane diagramy techniczne, struktury chemiczne, tabele zagnieżdżone w tabelach - Opus 4.7 zaczyna widzieć je tak, jak widzi człowiek. Dla osób, które używają Claude’a do analizy UI, projektów graficznych albo produktów typu computer use, to jedno z tych usprawnień, które w logach nie zapisze się jako „lepsza wizja”, tylko jako „nagle działa”.
Claude Opus 4.7 to najlepszy model na świecie do budowania dashboardów i interfejsów opartych na danych. Gust projektowy jest naprawdę zaskakujący - podejmuje wybory, które sam bym wdrożył do produkcji.Aj Orbach, współzałożyciel i CEO v0
Nowy poziom wysiłku, nowy tryb myślenia
Anthropic wprowadził przy okazji nowy suwak wysiłku: xhigh. Siedzi między high a max i staje się ustawieniem domyślnym w Claude Code dla wszystkich planów. Powód jest prosty. Max ma tendencję do nadmiernego myślenia i palenia tokenów, high bywa zbyt ekonomiczne na trudniejszych zadaniach. Z kolei xhigh celuje w ten punkt, w którym jakość rośnie, a rachunek nie wystrzeliwuje w kosmos.
Druga zmiana jest bardziej fundamentalna. Opus 4.7 nie obsługuje już Extended Thinking ze sztywnym budżetem tokenów. Zamiast tego dostajemy adaptive thinking - model sam decyduje, kiedy pomyśleć dłużej, a kiedy odpowiedzieć od razu. Proste zapytanie dostaje szybką odpowiedź, trudny problem dostaje realne rozważania. To ma sens - tak właśnie pracują ludzie. Ale oznacza też, że jeśli budowałeś harnessy oparte na sztywnym budżecie myślenia, trzeba je zaprojektować na nowo.
Drobny problem z tokenami, o którym warto wiedzieć
Migracja z 4.6 na 4.7 nie jest operacją typu drop-in w sensie rachunku za API. Dwie rzeczy. Po pierwsze, nowy tokenizer - ten sam tekst potrafi zamienić się na 1,0 do 1,35 raza więcej tokenów, w zależności od treści. Po drugie, Opus 4.7 myśli więcej, szczególnie w długich sesjach agentowych. Anthropic mówi wprost: efekt netto jest korzystny, bo zadania są domykane w mniejszej liczbie iteracji, ale trzeba to zmierzyć na własnym ruchu, a nie zakładać.
Dla osób, które skalują Claude’a w produkcji, to nie jest detal. Jeśli masz budżet miesięczny podzielony na tokeny wejściowe i wyjściowe, warto dodać bufor i obserwować rzeczywiste zużycie przez pierwsze dni, zamiast reagować paniką na pierwszym billingu.
| Parametr | Wartość |
|---|---|
| Identyfikator API | claude-opus-4-7 |
| Cena input | 5 USD za milion tokenów |
| Cena output | 25 USD za milion tokenów |
| Maksymalna rozdzielczość obrazu | 2576 px (dłuższa krawędź), ~3,75 MP |
| Domyślny poziom wysiłku | xhigh (w Claude Code) |
| Dostępność | Claude.ai, API, Bedrock, Vertex AI, Microsoft Foundry |
| Extended Thinking | zastąpione przez adaptive thinking |
Bezpieczeństwo i cyber - osobna rozmowa
Tydzień przed premierą Opusa 4.7 Anthropic ogłosił Project Glasswing - inicjatywę dotyczącą ryzyk i korzyści modeli w kontekście cyberbezpieczeństwa. Mythos Preview, najsilniejszy model w katalogu firmy, pozostaje w ograniczonym releasie. Opus 4.7 jest pierwszym modelem, na którym testowane są zabezpieczenia w warunkach realnego użycia. W praktyce oznacza to automatyczne blokady dla zapytań, które wyglądają na próby wykorzystania modelu do ataków. Dla specjalistów od bezpieczeństwa Anthropic uruchomił Cyber Verification Program - weryfikujesz się i dostajesz dostęp bez sztywnych blokad. Eleganckie rozwiązanie, pod warunkiem że sama weryfikacja zadziała sprawnie.
W kwestii alignmentu Opus 4.7 jest lekkim ulepszeniem wobec 4.6 - niższa podatność na prompt injection, lepsza uczciwość, niższa sykofancja. Nie jest tak dobrze wyrównany jak Mythos Preview, ale Anthropic określa go jako „w dużej mierze dobrze wyrównany i godny zaufania, choć nie w pełni idealny”. To nie jest pusta formułka - sformułowanie pojawia się wprost w oficjalnym wpisie. Warto docenić, że firma publikuje to tak otwarcie.
Co z tego wynika dla osób, które używają Claude’a na co dzień
Jeśli korzystasz z Claude’a na claude.ai albo w aplikacji desktop, upgrade dzieje się automatycznie. Jeśli budujesz na API, lista kontrolna jest krótka. Zmień identyfikator modelu. Przejrzyj prompty - pamiętaj o literalności. Rozważ xhigh jako punkt startowy. Zmierz tokeny na swoim ruchu przez kilka dni. Jeśli używasz Extended Thinking, zaplanuj migrację na adaptive.
Jeśli pracujesz w Claude Code, pojawiły się dwa nowe smaczki warte sprawdzenia. /ultrareview to dedykowana sesja code review - model czyta zmiany w kodzie i wskazuje błędy oraz problemy projektowe, które wyłapałby doświadczony reviewer. Użytkownicy Pro i Max dostają trzy darmowe ultrareview na start. Drugi smaczek to auto mode, rozszerzony na plany Max. Claude podejmuje decyzje w twoim imieniu, co oznacza mniej przerywań i dłuższe zadania bez nadzoru. Trochę ryzykowniej niż tryb zwykły, ale znacznie bezpieczniej niż „skip all permissions”.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Najbardziej uderzającą rzeczą w tej premierze nie są benchmarki. Są komentarze testerów - Replit, Cursor, Warp, Devin - którzy powtarzają to samo zdanie innymi słowami: model się z tobą sprzecza. Cofa. Mówi, że twoje założenie jest błędne. To pierwszy raz od dawna, kiedy „asystent” zaczyna faktycznie asystować, a nie potakiwać.
Jedna rzecz, o której się głośno nie mówi
W trakcie treningu Opusa 4.7 Anthropic testowo redukował pewne kompetencje cyber, żeby model mógł być szerzej dostępny bez takich obostrzeń, jakie dotyczą Mythosa. To jest ciekawe z perspektywy strategii wydawniczej. Zamiast wypuścić najmocniejszy model od razu, firma wypuszcza model z celowo ograniczonymi pewnymi umiejętnościami, obserwuje, jak działa w realu, testuje zabezpieczenia - a dopiero potem zwolni pełniejsze wersje. Mało kto robi to tak jawnie.
Na polskim rynku, gdzie sporo osób dopiero odkrywa Claude’a po latach trzymania się jednego dostawcy modeli, ta premiera może być dobrym momentem na test. Model jest tańszy, niż wydajność by sugerowała, a domyślne xhigh w Claude Code oznacza, że nie trzeba głęboko nurkować w konfigurację, żeby dostać dobry wynik. Jeśli odbijałeś się od Opusa 4.6 przy zadaniach wieloplikowych, gdzie gubił kontekst - spróbuj jeszcze raz. Szczególnie przy długich sesjach, w których model odwołuje się do wcześniejszych notatek w systemie plików.
Dzień premiery to zawsze moment największego szumu. Prawdziwa wartość Opusa 4.7 zweryfikuje się w ciągu najbliższych dwóch, trzech tygodni - kiedy produkcja zacznie gadać głośniej niż marketing. Na razie sygnały są zbieżne: to mocny release, z kilkoma realnymi zmianami pod maską, za te same pieniądze co wcześniej.
Źródła: ogłoszenie Anthropic „Introducing Claude Opus 4.7” (anthropic.com/news/claude-opus-4-7), strona Project Glasswing (anthropic.com/glasswing).
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Ile kosztuje Claude Opus 4.7 w API?
Claude Opus 4.7 kosztuje 5 USD za milion tokenów wejściowych i 25 USD za milion tokenów wyjściowych. Cena jest identyczna jak w poprzedniej wersji 4.6.
Czym różni się adaptive thinking od Extended Thinking w Claude Opus 4.7?
Adaptive thinking zastępuje Extended Thinking ze sztywnym budżetem tokenów - model sam decyduje, kiedy myśleć dłużej, a kiedy odpowiedzieć od razu. Oznacza to, że harnessy oparte na sztywnym budżecie myślenia trzeba zaprojektować od nowa.
Czy migracja z Claude Opus 4.6 na 4.7 zmieni moje koszty API?
Tak, możliwe jest wyższe zużycie tokenów, bo nowy tokenizer zamienia ten sam tekst na 1,0 do 1,35 raza więcej tokenów. Anthropic zaleca zmierzenie rzeczywistego zużycia przez pierwsze dni i dodanie bufora do budżetu.
Co to jest Cyber Verification Program w Anthropic?
To program, w którym specjaliści od bezpieczeństwa mogą się zweryfikować i uzyskać dostęp do modelu bez sztywnych automatycznych blokad dla zapytań cybersecurity. Opus 4.7 jest pierwszym modelem, na którym te zabezpieczenia są testowane w warunkach realnego użycia.



