SPAWNSY

Claude Sonnet 5.5 kosztuje tyle co Sonnet 5, ale zadanie w trybie max wychodzi drożej niż z Opusem

Anthropic wypuściło Sonneta 5.5 w tej samej cenie za token. Artificial Analysis daje mu drugie miejsce w indeksie, ale w trybie maksymalnym jedno zadanie kosztuje 7,60 dolara wobec 5,98 dla Opusa 5.5.

AutorTwenZyRedakcja SPAWNSY
Publikacja29 września 2026
Czytanie6 min
SekcjaTech
Wyświetlenia280
Udostępnij
Claude Sonnet 5.5 kosztuje tyle co Sonnet 5, ale zadanie w trybie max wychodzi drożej niż z Opusem

Anthropic wypuściło 28 września Claude Sonnet 5.5 i zostawiło cennik Sonneta 5 bez zmian: 2 dolary za milion tokenów wejściowych, 10 za wyjściowe. Niezależny indeks Artificial Analysis stawia nowy model na drugim miejscu na świecie, dwa punkty za Opusem 5.5 i trzy przed GPT-6 Astra. Ten sam indeks pokazuje jednak rzecz, której nie ma w komunikacie prasowym: w trybie maksymalnym jedno zadanie kosztuje z Sonnetem 5.5 około 7,60 dolara, czyli więcej niż z Opusem 5.5. Cena tokena pozostała ta sama, rachunek nie.

Co dostajemy

Model działa pod identyfikatorem claude-sonnet-5-5, ma okno kontekstu 1 mln tokenów, do 128 tys. tokenów odpowiedzi i datę odcięcia wiedzy w czerwcu 2026. Rozumowanie adaptacyjne jest domyślnie włączone, a poziomów wysiłku jest pięć, od niskiego po maksymalny. Wagi pozostają zamknięte. Sonnet 5.5 działa w aplikacjach Claude, na platformie Claude oraz w AWS, Google Cloud i Microsoft Azure. Cache kosztuje 0,20 dolara za odczyt i 2,50 za zapis na milion tokenów.

Anthropic deklaruje, że model generuje odpowiedzi ponad 30% szybciej niż Sonnet 5 i kosztuje do 30% mniej na zadanie, mimo identycznej stawki za token. Oszczędność ma wynikać z mniejszej liczby tokenów potrzebnych do rozwiązania tego samego problemu. Firma podaje przykłady klientów: fundusz Balyasny Asset Management zmierzył około 121 tys. tokenów na odpowiedź wobec 497 tys. u Sonneta 5, Box zanotował 2,4 raza szybsze wyniki przy 12% mniejszym zużyciu tokenów, Slack zeszedł o około 14% w tokenach wyjściowych, a Atlassian mówi o agentach Rovo działających do 30% szybciej.

Wyniki: Anthropic kontra pomiar zewnętrzny

Na własnych testach Anthropic skok jest ogromny. Terminal-Bench 4.0, test agentowego kodowania w terminalu, daje 70,6% dla Sonneta 5.5 wobec 10,3% dla Sonneta 5 i 66,4% dla Opusa 5.5. CursorBench 4.0 pokazuje 55,5% wobec 34,1%, FrontierCode 1.1 przy maksymalnym wysiłku 46,2% wobec 42,4%, a OSWorld 2.1 w obsłudze komputera 80,1%. Sonnet 5.5 jest według Anthropica pierwszym modelem tej linii, który przeszedł Pokémon Red wyłącznie na podstawie zrzutów ekranu.

Artificial Analysis mierzy to samo inaczej i wychodzą mu mniejsze liczby, ale ten sam układ sił. Terminal-Bench 4.0 przy maksymalnym wysiłku: 64% dla Sonneta 5.5 wobec 60% dla Opusa 5.5 i 60% dla GPT-6 Astra. Przewaga nad flagowym modelem własnej firmy jest tu prawdziwa, ale mniejsza niż w komunikacie. Wynik indeksu ogólnego to 56 punktów, o 18 więcej niż 38 u Sonneta 5.

Tabela pokazuje, gdzie kończy się klasa „mniejszy model". Sonnet 5.5 wygrywa tam, gdzie liczy się autonomiczna praca w narzędziach, a przegrywa z Opusem w wiedzy faktograficznej: 54% trafności wobec 66%. Halucynuje przy tym rzadziej, bo częściej odmawia niż zgaduje, co dla użytkowników agentów bywa cenniejsze niż wynik surowy. Artificial Analysis zastrzega, że ocenił wersję przedpremierową z błędem w ustrukturyzowanych odpowiedziach, naprawionym w publicznym wydaniu, i zapowiada ponowne testy.

Rachunek za zadanie

Najciekawsza liczba z niezależnego pomiaru nie dotyczy jakości. Na maksymalnym wysiłku Sonnet 5.5 zużył średnio około 193 tys. tokenów wyjściowych na zadanie indeksu, najwięcej ze wszystkich modeli, jakie Artificial Analysis dotąd zmierzył. To około 60% więcej niż Opus 5.5 i około siedem razy tyle co GPT-6 Astra w trybie maksymalnym. Przy tej samej stawce za token zadanie kosztuje więc około 7,60 dolara, o mniej więcej połowę więcej niż z Sonnetem 5.

Nie ma tu sprzeczności z deklaracją Anthropica o 30% niższym koszcie na zadanie. Firma porównuje z Sonnetem 5 na własnych obciążeniach klientów i przy niższych poziomach wysiłku, gdzie model rzeczywiście oszczędza tokeny. Test z ComputingForGeeks pokazuje, jak duża jest rozpiętość: maksymalny wysiłek generuje na tym samym wdrożeniu około 22 razy więcej tokenów niż średni, a średni przeszedł wszystkie testy w 36 sekund. W tym samym teście zadanie debugowania w Claude Code zajęło Sonnetowi 5.5 trzy wywołania narzędzi wobec 12 do 13 u poprzednika.

W naszej ocenie to jest główna wiadomość: w rodzinie modeli z „myślącym" trybem cena za token przestała być ceną produktu. Prawdziwym pokrętłem kosztu jest poziom wysiłku, a jego domyślna wartość decyduje o rachunku bardziej niż cennik. Kto włączy Sonneta 5.5 w maksymalnym trybie z przyzwyczajenia po poprzedniku, zapłaci więcej za Sonneta niż za Opusa.

Filtry, odmowy i fallback na Sonneta 5

Sonnet 5.5 jest pierwszym Sonnetem z zabezpieczeniami cybernetycznymi na poziomie Opusa 5. Karta systemowa podaje 99,43% pokrycia szkodliwych zapytań i skuteczność ataków typu „rewind" spadającą z 57,2% u Sonneta 5 do 21,0%. Cena tego jest zapisana wprost w dokumentacji: użytkownicy powinni oczekiwać większej liczby odmów niż w Sonnecie 5, także przy zapytaniach o legalną pracę z bezpieczeństwem.

Zapytania oflagowane jako cyber, budowa modeli granicznych (na przykład kernele dla akceleratorów ML) albo próba wydobycia rozumowania są automatycznie przekierowywane na Sonneta 5, a użytkownik dostaje komunikat o zmianie modelu. Zapytania biologiczne są blokowane bez fallbacku. W aplikacjach przełączanie działa domyślnie i można je wyłączyć w Ustawieniach, żeby czat po prostu się zatrzymywał. W API automatyczny fallback nie jest domyślnie aktywny i trzeba go włączyć w konfiguracji. Programu Cyber Verification Program, który daje obrońcom dostęp do pełniejszych możliwości, nie ma dla Sonneta 5.5 na starcie. Anthropic obiecuje jego rozszerzenie wkrótce.

Ten schemat znamy z Fable 5.1 i Mythos 5.1, gdzie dwuklasowy dostęp stał się stałym systemem. Sonnet 5.5 przenosi go do średniej półki, która dotąd była wolna od takich filtrów. Dla pentesterów i badaczy bezpieczeństwa oznacza to, że najtańszy model z serii przestaje być dobrym narzędziem do ich pracy, dopóki program weryfikacji się nie rozszerzy.

Migracja w API

Według testu ComputingForGeeks nowe wydanie wprowadza zmiany łamiące zgodność: wymuszone użycie narzędzia zostaje usunięte, ręczne budżety rozumowania są odrzucane, a parametr temperature jest wycofywany. Myślenia nie da się wyłączyć, można je tylko ograniczyć do rozumowania między wywołaniami narzędzi. Kto ma produkcyjną integrację opartą na Sonnecie 5, powinien przetestować ją przed przełączeniem aliasu. Przejście na Sonneta 5.5 wymaga zmian po stronie klienta.

Porównanie z pozostałymi modelami z górnej półki znajdziecie w naszym tekście o premierze Opusa 5, w którym Anthropic pierwszy raz sprzedawało inteligencję bliską najmocniejszym modelom za ułamek ich ceny.

Sonnet 5.5 to jeden z najmocniejszych modeli do agentowej pracy w terminalu i w narzędziach, a przy tym pierwszy Sonnet, który realnie konkuruje z flagowcem własnej firmy. To osiągnięcie, a wyniki niezależnego pomiaru potwierdzają je lepiej niż komunikat prasowy, bo pokazują przewagę nad Opusem 5.5 w Terminal-Bench, choć mniejszą niż deklarowana.

Ostrzegamy jednak przed czytaniem cennika jak w poprzednich generacjach. Jeśli zostawisz maksymalny wysiłek, dostaniesz najdroższy rachunek w tej klasie. Zaczynaj od poziomu średniego, sprawdź na własnych zadaniach, ile tokenów model faktycznie zużywa, i podnoś wysiłek tylko tam, gdzie test coś zmienia. Domyślna konfiguracja jest największą pozycją na rachunku.

Największym kosztem ukrytym są odmowy. Dla zwykłego programisty fallback na Sonneta 5 będzie rzadko widoczny, ale dla każdego, kto pracuje na pograniczu bezpieczeństwa, Sonnet 5.5 bez Cyber Verification Program bywa gorszym wyborem niż jego poprzednik. Jeśli Anthropic szybko rozszerzy program, ten minus zniknie. Do tego czasu polecamy Sonneta 5.5 do kodu, automatyzacji i pracy agentowej, a odradzamy do ofensywnego i badawczego cyber.

Komentarze

Dyskusja

Dołącz do rozmowy pod publikacją.

0 wpisy

Dołącz do dyskusji

Zaloguj się, aby komentować i odpowiadać innym użytkownikom.

Zaloguj się

Brak komentarzy

Rozpocznij dyskusję jako pierwszy.

Czytaj dalej

Wszystkie wpisy