Anthropic udgav i går Claude Sonnet 5.5, den anden model i Claude 5.5-familien, knap en uge efter Opus 5.5. Prisen er den samme som for Sonnet 5, men ifølge Anthropic er modellen over 30 procent hurtigere og op til 30 procent billigere per opgave, fordi den bruger færre tokens og færre værktøjskald. På flere af Anthropics egne test ligger den kun få point fra Opus 5.5, der koster det dobbelte.
Det gør Sonnet 5.5 interessant for alle, der i dag betaler Opus-pris for opgaver, som ikke kræver Opus. Der er dog to forbehold. Uafhængige målinger viser, at modellen på den højeste effort-indstilling bruger så mange tokens, at den bliver dyrere per opgave end Opus 5.5. Og ligesom storebroren kommer den med ændringer i API'et, der kan få eksisterende kode til at fejle.
Claude 5.5 til Sonnet-pris
Sonnet 5.5 koster 2 dollar per million input-tokens og 10 dollar per million output-tokens, præcis som Sonnet 5. Cache og batch koster også det samme. Besparelsen kommer altså ikke fra prisskiltet, men fra at modellen løser den samme opgave med færre tokens. Ifølge Anthropic slår Sonnet 5.5 på lav eller medium effort Sonnet 5's bedste resultat på flere test, for omkring en tiendedel af prisen per opgave.
| Sonnet 5 | Sonnet 5.5 | Opus 5.5 | |
|---|---|---|---|
| Pris per mio. tokens, input / output | 2 / 10 dollar | 2 / 10 dollar | 4 / 20 dollar |
| Cache-læsning per mio. tokens | 0,20 dollar | 0,20 dollar | 0,20 dollar |
| Kontekstvindue / maks. output | 1 mio. / 128.000 | 1 mio. / 128.000 | 1 mio. / 128.000 |
| Tænkning | Kan slås fra | Kan begrænses til mellem værktøjskald | Altid slået til |
| Standard-effort i API'et | high | high | medium |
| Videnskæringsdato | Januar 2026 | Juni 2026 | Juni 2026 |
Læg mærke til cache-linjen. Tekst, som modellen allerede har set, koster 0,20 dollar per million tokens på både Sonnet 5.5 og Opus 5.5. For agenter, hvor det meste af input er den samme lange instruktion igen og igen, er prisforskellen mellem de to modeller derfor mindre, end listeprisen antyder. Output koster stadig det halve.
Kundernes tal peger samme vej som Anthropics. Balyasny Asset Management kørte 2.441 finansopgaver, hvor Sonnet 5.5 brugte omkring 121.000 tokens per svar mod 497.000 for Sonnet 5. Base44 byggede 118 rigtige apps og fik resultater på niveau med Opus 5 på 3,6 iterationer mod 7,7 for Opus 5. Box fik resultater 2,4 gange hurtigere med 12 procent færre tokens, og Lovable så en tredjedel færre værktøjskald. Zendesk behandlede supportsager 20 procent hurtigere, og Atlassian regner med, at kunderne kan køre deres Rovo-agenter op til 30 procent hurtigere end med Sonnet 5. Netop dér, hvor AI-automatisering kører de samme trin tusindvis af gange om dagen, er det hastigheden og tokenforbruget per trin, der afgør regningen.
Som kuriosum er Sonnet 5.5 også den første Sonnet-model, der har gennemført Pokémon Red udelukkende ud fra skærmbilleder.
Sonnet 5.5 mod Opus 5.5 og GPT-6 Sol
For en uge siden gav Opus 5.5 Fable-niveau til under halv pris. Sonnet 5.5 gentager tricket et trin længere nede. Anthropic sammenligner den med forgængeren, med Opus 5.5 og med OpenAI's GPT-6 Sol, der ifølge VentureBeat ligger i samme prisklasse som Sonnet.
| Benchmark | Sonnet 5 | Sonnet 5.5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 (kodning i terminalen) | 10,3 % | 70,6 % | 66,4 % (xhigh) | Ikke oplyst |
| FrontierCode 1.1 (svære kodeopgaver) | 42,4 % | 46,2 % (max) | 54,4 % | 49,3 % (52,1 % på xhigh) |
| CursorBench 4.0 (kodning i Cursor) | 34,1 % | 55,5 % | 57,8 % | Ikke oplyst |
| GDPval-AA v2.1 (videnarbejde, Elo) | 1449 | 1844 | 1846 | 1487 |
| AA-Briefcase v1.1 (videnarbejde, Elo) | 1359 | 1811 | 1822 | 1483 |
| Humanity's Last Exam med værktøjer | 54,9 % | 64,5 % | 67,7 % | Ikke oplyst |
| OSWorld 2.1 (betjening af en computer) | 57,0 % | 80,1 % | 81,8 % | Ikke oplyst |
| Chartography (aflæsning af diagrammer) | 15,6 % | 61,6 % | 64,4 % | 53,6 % |
Det mest opsigtsvækkende tal er Terminal-Bench, hvor Sonnet 5.5 slår Opus 5.5, selv om Opus-tallet er målt på den næsthøjeste effort-indstilling. Ellers ligger Opus 5.5 foran med mellem knap 2 og godt 8 procentpoint. Den største afstand er på FrontierCode, hvor Anthropic selv bemærker, at Sonnet 5.5 scorer lavere på max end på xhigh, fordi testen trækker fra for ændringer uden for opgaven. På videnarbejde er forskellen to Elo-point på GDPval, og det er i praksis det samme.
Over for GPT-6 Sol står Sonnet 5.5 stærkest på videnarbejde og diagrammer, mens OpenAI's model vinder på FrontierCode. Som altid er det producentens egne tal, og for GPT-6 Sol noterer Anthropic, at OpenAI har rettet en fejl i billedforståelsen, som tallene måske ikke afspejler.
Hurtig, men ikke billig på max
Det uafhængige analysefirma Artificial Analysis placerer Sonnet 5.5 som nummer tre ud af 216 modeller på sit Intelligence Index med 56 point. Opus 5.5 ligger øverst med 58. Sonnet 5.5 er også hurtig med 139 tokens i sekundet mod 94 for Opus 5.5.
Men målingen er foretaget på max, og her vender regnestykket. Sonnet 5.5 genererede 410 millioner output-tokens for at komme igennem indekset, mod 260 millioner for Opus 5.5 og en median på 88 millioner for sammenlignelige modeller. Det gav en pris på 7,60 dollar per opgave mod 5,98 dollar for Opus 5.5. Halv pris per token endte altså med at blive 27 procent dyrere per opgave.
Det betyder noget, fordi Sonnet 5.5 som standard kører på high i API'et, mens Opus 5.5 kører på medium. Kode, der ikke angiver effort, kører altså Sonnet på et højere niveau, end Opus 5.5 ville være kørt på. Anthropic skriver samtidig, at effort-niveauerne er kalibreret om, så high på Sonnet 5.5 ikke svarer til high på Sonnet 5. Virksomheden anbefaler medium som udgangspunkt til agentisk kodning og veldefinerede opgaver, og medium eller low til chat. Ellers er det præcis her, token-forbruget løber løbsk, uden at nogen opdager det, før fakturaen kommer.
Cyberforespørgsler falder synligt tilbage til Sonnet 5
Sonnet 5.5 er den første Sonnet-model med de samme typer cyberfiltre som Anthropics største modeller. Du kan stadig bruge den til at finde og rette fejl i din egen kode, men cyberopgaver med højere risiko falder ifølge Anthropic synligt tilbage til Sonnet 5. Hos Opus 5.5 havner den slags forespørgsler hos den ældre Opus 4.8. For Sonnet er faldet mindre, fordi Sonnet 5 er den direkte forgænger til samme pris.
I dokumentationen ser det ud som hos Opus 5.5. En afvist forespørgsel returnerer HTTP 200 med stop_reason: "refusal" og et stop_details-felt, der angiver en af fem kategorier: cyber, biologi, udvikling af konkurrerende AI-modeller, forsøg på at trække modellens ræsonnement ud og øvrige skadelige formål. Slår du server-side fallback til, prøver API'et kun igen på Sonnet 5, når kategorien er cyber eller modeludvikling. De tre andre kategorier bliver ikke prøvet igen. Biologifiltrene er de samme som på Sonnet 5.
Den nye kategori om ræsonnement hænger sammen med, at Sonnet 5.5 er den første Sonnet med filtre, der blokerer forsøg på at få modellen til at gengive sin interne tænkning. Tænkeblokkene virker også kun i den konto, der har skabt dem. The Next Web kobler det til, at forskere i august afkodede 315.320 tænkeblokke fra 6.708 offentlige agentforløb på tværs af OpenAI, Anthropic og Google og fandt 62 API-nøgler, 33 adgangskoder og syv private nøgler. Mediet peger også på en selvmodsigelse: Anthropic skriver, at modellen ikke flytter grænsen for, hvad virksomhedens modeller kan, og har derfor begrænset sin sikkerhedsvurdering til udvalgte risici. Samtidig kalder virksomheden cyberevnerne en så stor forbedring, at de kræver samme filtre som frontiermodellerne.
Cyberforsvarere kan snart søge om udvidet adgang gennem Anthropics Cyber Verification Program, der kommer til at omfatte Sonnet 5.5, Opus 5.5 og Mythos-modellerne.
Fem ændringer kan få din kode til at fejle
Migreringen fra Sonnet 5 er i udgangspunktet et skift af model-id fra claude-sonnet-5 til claude-sonnet-5-5. Til gengæld er der fem ændringer, der kan give fejl 400, hvis du ikke retter dem først. Det er én mere end ved Opus 5.5.
| Ændring | Hvad sker der | Løsning |
|---|---|---|
Tænkning slås ikke længere fra med disabled | Kald med disabled eller et fast tænkebudget giver fejl | Send between_tools, som virker op til effort high |
| Tvunget værktøjsbrug er fjernet | tool_choice med any eller tool giver fejl | Brug auto med strict tool use eller structured outputs |
| Tænkeblokke er bundet til samtalen | Ændres systemprompt, værktøjer eller en tidligere besked, kan genafspilning give fejl | Tilføj nye instruktioner som systembeskeder midt i samtalen i stedet for at redigere |
| Det gamle computer use-værktøj afvises | computer_20251124 virker ikke på Claude API og Google Cloud | Skift til computer_toolset_20260801. Amazon Bedrock er ikke berørt |
| Advisor-værktøjet afviser ældre modeller | Opus 4.8, Opus 4.7 og Sonnet 5 kan ikke længere bruges som advisor | Brug Opus 5 eller nyere, Fable, Mythos eller Sonnet 5.5 selv |
Bindingen af tænkeblokke gælder som standard for konti oprettet 31. august 2026 eller senere. Den har også en konsekvens, der ikke giver fejl: Ingen anden model kan læse Sonnet 5.5's tænkeblokke. Skifter en agent fra Sonnet 5.5 til Opus 5.5 midt i en opgave, fortsætter den uden det ræsonnement, der er bygget op indtil da. Den anden vej virker det, for Sonnet 5.5 kan læse blokke fra Sonnet 5.
Endelig er der den stille ændring, som også kom med Opus 5.5. De korte statusbeskeder, modellen skriver mellem værktøjskald, kommer nu som tænkeblokke, der som standard er tomme. En brugerflade, der viser dem, bliver tavs uden fejl, indtil du ændrer indstillingen display eller bruger between_tools.
Sonnet 5.5 flytter grænsen for, hvornår Opus er pengene værd. Til kodning i terminalen og til det meste videnarbejde er afstanden nu så lille, at Sonnet bør være udgangspunktet, og Opus det, du skifter til, når kvaliteten halter. Det er endnu et tegn på, at ingen bruger én model længere. Den tommelfingerregel holder dog kun, så længe effort står på medium eller lavere. På max tænker Sonnet 5.5 sig forbi prisfordelen.
Kilder: Anthropic · Claude Platform Docs · Artificial Analysis · VentureBeat · The Next Web


