🔥 Gemini Pro 170 zł -43% CapCut Pro 450 zł -25% do niedzieli Zobacz →
Przejdź do treści
Claude

Claude Opus 4.7 - model, który sam sobie sprawdza zadanie domowe

Anthropic wypuścił Claude Opus 4.7, nowy model językowy, który potrafi samodzielnie sprawdzać zadania. Model ten zaczyna zachowywać się jak współpracownik, a nie tylko narzędzie dla programisty.

8 min czytania
Ostatnia aktualizacja:
Abstract split-panel artwork: left side orange with a white molecular-like shape and a black curved line; right side pale teal with a grid paper doodle on a dotted-gray background.
👁 135 przeczytań

Anthropic wypuścił właśnie swój najnowszy flagowy model. Nie jest najpotężniejszy w całym katalogu - ten tytuł wciąż należy do zamkniętego Mythos Preview - ale robi coś, co w praktyce liczy się bardziej niż kolejny punkt na wykresie. Zaczyna zachowywać się jak ktoś, komu można wreszcie powierzyć pracę i wrócić po godzinie, zamiast siedzieć mu nad głową.

// w skrócie
  • Claude Opus 4.7 kosztuje tyle samo co 4.6 - 5 USD za milion tokenów wejściowych i 25 USD za milion wyjściowych - ale oferuje m.in. trzykrotnie wyższą rozdzielczość obrazów (do 2576 px).
  • GitHub raportuje 13-procentowy wzrost rozwiązywalności zadań, XBOW odnotował skok z 54,5 do 98,5 proc., a Harvey osiągnął 90,9 proc. na BigLaw Bench.
  • Model zastąpił Extended Thinking z budżetem tokenów nowym trybem adaptive thinking, w którym sam decyduje, ile czasu poświęcić na rozwiązanie problemu.

Jest pewien moment w życiu modelu językowego, w którym przestaje on być narzędziem dla programisty, a zaczyna być współpracownikiem. Nie chodzi o benchmarki. Chodzi o to, czy po powierzeniu mu zadania trzeba wracać co trzy minuty, czy też można wyjść po kawę. Opus 4.7 - według deklaracji Anthropic i pierwszych testerów - przekroczył właśnie ten próg. Przynajmniej w kategorii długich, wieloetapowych zadań inżynierskich.

Nowy model zastępuje wersję 4.6, która sama w sobie była już bardzo solidna. Kosztuje dokładnie tyle samo - 5 dolarów za milion tokenów wejściowych i 25 dolarów za milion wyjściowych - ale w środku dzieje się kilka rzeczy, które warto zrozumieć, zanim podmieni się jedną linijkę w kodzie i oczekuje, że wszystko nagle zacznie działać lepiej. Czasem zadziała inaczej.

Co faktycznie się zmieniło

Anthropic pozycjonuje Opusa 4.7 jako największy skok w trudnych zadaniach programistycznych od czasu przejścia z serii 3.7 na 4. Kluczowa obserwacja: model stał się znacznie bardziej precyzyjny w wykonywaniu instrukcji. Brzmi niewinnie, ale ma konkretną konsekwencję. Prompty, które działały na starym Opusie i które z czasem ktoś łatał dopiskami w rodzaju „nie rób X, nie zapomnij o Y”, mogą teraz produkować dziwne wyniki. Nowy model traktuje każde słowo literalnie. Dawniej omijał niektóre instrukcje, dziś wykonuje wszystkie. Jeśli masz stare rusztowania promptowe, zrewiduj je.

Claude Opus 4.7 - model, który sam sobie sprawdza zadanie domowe - ilustracja 1

Opus 4.7 konsekwentnie poprawia wyniki 4.6 we wszystkich kluczowych kategoriach. Nie dogania Mythos Preview, ale też nie taka jest jego rola - Mythos pozostaje zamknięty.

Liczby, które stoją za tym skokiem, są konkretne. GitHub raportuje trzynastoprocentowy wzrost rozwiązywalności zadań na wewnętrznym benchmarku, w tym cztery zadania, których żaden wcześniejszy model Claude nie domknął. Rakuten mówi o trzykrotnie większej liczbie rozwiązanych zadań produkcyjnych na własnym benchu SWE. XBOW - firma od automatycznych testów penetracyjnych - pokazuje skok z 54,5 do 98,5 procent w teście ostrości wzrokowej. A Harvey, produkt prawniczy, raportuje wynik 90,9 procent na BigLaw Bench, z poprawnym rozróżnianiem klauzul kontraktowych, które do tej pory myliły modele frontier.

Claude Opus 4.7 - model, który sam sobie sprawdza zadanie domowe - ilustracja 2
wykres 2 partnerzy 1

Sześć wyników od sześciu różnych partnerów. Wszystkie pokazują ten sam wzorzec: dwucyfrowe wzrosty w punktach procentowych, najmocniejsze tam, gdzie liczy się percepcja wzrokowa i wieloetapowe wnioskowanie.

Wzrok trzy razy lepszy

Jedna z cichszych, ale najbardziej praktycznych zmian dotyczy multimodalności. Opus 4.7 akceptuje obrazy do 2576 pikseli na dłuższej krawędzi - ponad trzy razy więcej niż poprzednicy. Dla agentów obsługujących interfejsy graficzne, dla ekstrakcji danych z diagramów, dla pracy z dokumentami, w których liczy się każdy piksel - to jest realna różnica, a nie kosmetyka.

Z perspektywy użytkownika: zrzuty ekranu z aplikacji, skomplikowane diagramy techniczne, struktury chemiczne, tabele zagnieżdżone w tabelach - Opus 4.7 zaczyna widzieć je tak, jak widzi człowiek. Dla osób, które używają Claude’a do analizy UI, projektów graficznych albo produktów typu computer use, to jedno z tych usprawnień, które w logach nie zapisze się jako „lepsza wizja”, tylko jako „nagle działa”.

Claude Opus 4.7 to najlepszy model na świecie do budowania dashboardów i interfejsów opartych na danych. Gust projektowy jest naprawdę zaskakujący - podejmuje wybory, które sam bym wdrożył do produkcji.Aj Orbach, współzałożyciel i CEO v0

Nowy poziom wysiłku, nowy tryb myślenia

Anthropic wprowadził przy okazji nowy suwak wysiłku: xhigh. Siedzi między high a max i staje się ustawieniem domyślnym w Claude Code dla wszystkich planów. Powód jest prosty. Max ma tendencję do nadmiernego myślenia i palenia tokenów, high bywa zbyt ekonomiczne na trudniejszych zadaniach. Z kolei xhigh celuje w ten punkt, w którym jakość rośnie, a rachunek nie wystrzeliwuje w kosmos.

Druga zmiana jest bardziej fundamentalna. Opus 4.7 nie obsługuje już Extended Thinking ze sztywnym budżetem tokenów. Zamiast tego dostajemy adaptive thinking - model sam decyduje, kiedy pomyśleć dłużej, a kiedy odpowiedzieć od razu. Proste zapytanie dostaje szybką odpowiedź, trudny problem dostaje realne rozważania. To ma sens - tak właśnie pracują ludzie. Ale oznacza też, że jeśli budowałeś harnessy oparte na sztywnym budżecie myślenia, trzeba je zaprojektować na nowo.

Drobny problem z tokenami, o którym warto wiedzieć

Migracja z 4.6 na 4.7 nie jest operacją typu drop-in w sensie rachunku za API. Dwie rzeczy. Po pierwsze, nowy tokenizer - ten sam tekst potrafi zamienić się na 1,0 do 1,35 raza więcej tokenów, w zależności od treści. Po drugie, Opus 4.7 myśli więcej, szczególnie w długich sesjach agentowych. Anthropic mówi wprost: efekt netto jest korzystny, bo zadania są domykane w mniejszej liczbie iteracji, ale trzeba to zmierzyć na własnym ruchu, a nie zakładać.

Dla osób, które skalują Claude’a w produkcji, to nie jest detal. Jeśli masz budżet miesięczny podzielony na tokeny wejściowe i wyjściowe, warto dodać bufor i obserwować rzeczywiste zużycie przez pierwsze dni, zamiast reagować paniką na pierwszym billingu.

ParametrWartość
Identyfikator APIclaude-opus-4-7
Cena input5 USD za milion tokenów
Cena output25 USD za milion tokenów
Maksymalna rozdzielczość obrazu2576 px (dłuższa krawędź), ~3,75 MP
Domyślny poziom wysiłkuxhigh (w Claude Code)
DostępnośćClaude.ai, API, Bedrock, Vertex AI, Microsoft Foundry
Extended Thinkingzastąpione przez adaptive thinking

Bezpieczeństwo i cyber - osobna rozmowa

Tydzień przed premierą Opusa 4.7 Anthropic ogłosił Project Glasswing - inicjatywę dotyczącą ryzyk i korzyści modeli w kontekście cyberbezpieczeństwa. Mythos Preview, najsilniejszy model w katalogu firmy, pozostaje w ograniczonym releasie. Opus 4.7 jest pierwszym modelem, na którym testowane są zabezpieczenia w warunkach realnego użycia. W praktyce oznacza to automatyczne blokady dla zapytań, które wyglądają na próby wykorzystania modelu do ataków. Dla specjalistów od bezpieczeństwa Anthropic uruchomił Cyber Verification Program - weryfikujesz się i dostajesz dostęp bez sztywnych blokad. Eleganckie rozwiązanie, pod warunkiem że sama weryfikacja zadziała sprawnie.

W kwestii alignmentu Opus 4.7 jest lekkim ulepszeniem wobec 4.6 - niższa podatność na prompt injection, lepsza uczciwość, niższa sykofancja. Nie jest tak dobrze wyrównany jak Mythos Preview, ale Anthropic określa go jako „w dużej mierze dobrze wyrównany i godny zaufania, choć nie w pełni idealny”. To nie jest pusta formułka - sformułowanie pojawia się wprost w oficjalnym wpisie. Warto docenić, że firma publikuje to tak otwarcie.

Co z tego wynika dla osób, które używają Claude’a na co dzień

Jeśli korzystasz z Claude’a na claude.ai albo w aplikacji desktop, upgrade dzieje się automatycznie. Jeśli budujesz na API, lista kontrolna jest krótka. Zmień identyfikator modelu. Przejrzyj prompty - pamiętaj o literalności. Rozważ xhigh jako punkt startowy. Zmierz tokeny na swoim ruchu przez kilka dni. Jeśli używasz Extended Thinking, zaplanuj migrację na adaptive.

Jeśli pracujesz w Claude Code, pojawiły się dwa nowe smaczki warte sprawdzenia. /ultrareview to dedykowana sesja code review - model czyta zmiany w kodzie i wskazuje błędy oraz problemy projektowe, które wyłapałby doświadczony reviewer. Użytkownicy Pro i Max dostają trzy darmowe ultrareview na start. Drugi smaczek to auto mode, rozszerzony na plany Max. Claude podejmuje decyzje w twoim imieniu, co oznacza mniej przerywań i dłuższe zadania bez nadzoru. Trochę ryzykowniej niż tryb zwykły, ale znacznie bezpieczniej niż „skip all permissions”.

Najbardziej uderzającą rzeczą w tej premierze nie są benchmarki. Są komentarze testerów - Replit, Cursor, Warp, Devin - którzy powtarzają to samo zdanie innymi słowami: model się z tobą sprzecza. Cofa. Mówi, że twoje założenie jest błędne. To pierwszy raz od dawna, kiedy „asystent” zaczyna faktycznie asystować, a nie potakiwać.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Jedna rzecz, o której się głośno nie mówi

W trakcie treningu Opusa 4.7 Anthropic testowo redukował pewne kompetencje cyber, żeby model mógł być szerzej dostępny bez takich obostrzeń, jakie dotyczą Mythosa. To jest ciekawe z perspektywy strategii wydawniczej. Zamiast wypuścić najmocniejszy model od razu, firma wypuszcza model z celowo ograniczonymi pewnymi umiejętnościami, obserwuje, jak działa w realu, testuje zabezpieczenia - a dopiero potem zwolni pełniejsze wersje. Mało kto robi to tak jawnie.

Na polskim rynku, gdzie sporo osób dopiero odkrywa Claude’a po latach trzymania się jednego dostawcy modeli, ta premiera może być dobrym momentem na test. Model jest tańszy, niż wydajność by sugerowała, a domyślne xhigh w Claude Code oznacza, że nie trzeba głęboko nurkować w konfigurację, żeby dostać dobry wynik. Jeśli odbijałeś się od Opusa 4.6 przy zadaniach wieloplikowych, gdzie gubił kontekst - spróbuj jeszcze raz. Szczególnie przy długich sesjach, w których model odwołuje się do wcześniejszych notatek w systemie plików.

Dzień premiery to zawsze moment największego szumu. Prawdziwa wartość Opusa 4.7 zweryfikuje się w ciągu najbliższych dwóch, trzech tygodni - kiedy produkcja zacznie gadać głośniej niż marketing. Na razie sygnały są zbieżne: to mocny release, z kilkoma realnymi zmianami pod maską, za te same pieniądze co wcześniej.


Źródła: ogłoszenie Anthropic „Introducing Claude Opus 4.7” (anthropic.com/news/claude-opus-4-7), strona Project Glasswing (anthropic.com/glasswing).

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Ile kosztuje Claude Opus 4.7 w API?

Claude Opus 4.7 kosztuje 5 USD za milion tokenów wejściowych i 25 USD za milion tokenów wyjściowych. Cena jest identyczna jak w poprzedniej wersji 4.6.

Czym różni się adaptive thinking od Extended Thinking w Claude Opus 4.7?

Adaptive thinking zastępuje Extended Thinking ze sztywnym budżetem tokenów - model sam decyduje, kiedy myśleć dłużej, a kiedy odpowiedzieć od razu. Oznacza to, że harnessy oparte na sztywnym budżecie myślenia trzeba zaprojektować od nowa.

Czy migracja z Claude Opus 4.6 na 4.7 zmieni moje koszty API?

Tak, możliwe jest wyższe zużycie tokenów, bo nowy tokenizer zamienia ten sam tekst na 1,0 do 1,35 raza więcej tokenów. Anthropic zaleca zmierzenie rzeczywistego zużycia przez pierwsze dni i dodanie bufora do budżetu.

Co to jest Cyber Verification Program w Anthropic?

To program, w którym specjaliści od bezpieczeństwa mogą się zweryfikować i uzyskać dostęp do modelu bez sztywnych automatycznych blokad dla zapytań cybersecurity. Opus 4.7 jest pierwszym modelem, na którym te zabezpieczenia są testowane w warunkach realnego użycia.

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 450 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
× powiększenie