Sonnet 5.5 kommer tæt på Opus til halv pris

Claude Sonnet 5.5 koster det samme som Sonnet 5 og ligger tæt på Opus 5.5 på de fleste test. På max-effort bliver den dog dyrere per opgave end Opus.

Sonnet 5.5 kommer tæt på Opus til halv pris

Anthropic udgav i går Claude Sonnet 5.5, den anden model i Claude 5.5-familien, knap en uge efter Opus 5.5. Prisen er den samme som for Sonnet 5, men ifølge Anthropic er modellen over 30 procent hurtigere og op til 30 procent billigere per opgave, fordi den bruger færre tokens og færre værktøjskald. På flere af Anthropics egne test ligger den kun få point fra Opus 5.5, der koster det dobbelte.

Det gør Sonnet 5.5 interessant for alle, der i dag betaler Opus-pris for opgaver, som ikke kræver Opus. Der er dog to forbehold. Uafhængige målinger viser, at modellen på den højeste effort-indstilling bruger så mange tokens, at den bliver dyrere per opgave end Opus 5.5. Og ligesom storebroren kommer den med ændringer i API'et, der kan få eksisterende kode til at fejle.

Claude 5.5 til Sonnet-pris

Sonnet 5.5 koster 2 dollar per million input-tokens og 10 dollar per million output-tokens, præcis som Sonnet 5. Cache og batch koster også det samme. Besparelsen kommer altså ikke fra prisskiltet, men fra at modellen løser den samme opgave med færre tokens. Ifølge Anthropic slår Sonnet 5.5 på lav eller medium effort Sonnet 5's bedste resultat på flere test, for omkring en tiendedel af prisen per opgave.

Sonnet 5 Sonnet 5.5 Opus 5.5
Pris per mio. tokens, input / output2 / 10 dollar2 / 10 dollar4 / 20 dollar
Cache-læsning per mio. tokens0,20 dollar0,20 dollar0,20 dollar
Kontekstvindue / maks. output1 mio. / 128.0001 mio. / 128.0001 mio. / 128.000
TænkningKan slås fraKan begrænses til mellem værktøjskaldAltid slået til
Standard-effort i API'ethighhighmedium
VidenskæringsdatoJanuar 2026Juni 2026Juni 2026

Læg mærke til cache-linjen. Tekst, som modellen allerede har set, koster 0,20 dollar per million tokens på både Sonnet 5.5 og Opus 5.5. For agenter, hvor det meste af input er den samme lange instruktion igen og igen, er prisforskellen mellem de to modeller derfor mindre, end listeprisen antyder. Output koster stadig det halve.

Kundernes tal peger samme vej som Anthropics. Balyasny Asset Management kørte 2.441 finansopgaver, hvor Sonnet 5.5 brugte omkring 121.000 tokens per svar mod 497.000 for Sonnet 5. Base44 byggede 118 rigtige apps og fik resultater på niveau med Opus 5 på 3,6 iterationer mod 7,7 for Opus 5. Box fik resultater 2,4 gange hurtigere med 12 procent færre tokens, og Lovable så en tredjedel færre værktøjskald. Zendesk behandlede supportsager 20 procent hurtigere, og Atlassian regner med, at kunderne kan køre deres Rovo-agenter op til 30 procent hurtigere end med Sonnet 5. Netop dér, hvor AI-automatisering kører de samme trin tusindvis af gange om dagen, er det hastigheden og tokenforbruget per trin, der afgør regningen.

Som kuriosum er Sonnet 5.5 også den første Sonnet-model, der har gennemført Pokémon Red udelukkende ud fra skærmbilleder.

Sonnet 5.5 mod Opus 5.5 og GPT-6 Sol

For en uge siden gav Opus 5.5 Fable-niveau til under halv pris. Sonnet 5.5 gentager tricket et trin længere nede. Anthropic sammenligner den med forgængeren, med Opus 5.5 og med OpenAI's GPT-6 Sol, der ifølge VentureBeat ligger i samme prisklasse som Sonnet.

Benchmark Sonnet 5 Sonnet 5.5 Opus 5.5 GPT-6 Sol
Terminal-Bench 4.0 (kodning i terminalen)10,3 %70,6 %66,4 % (xhigh)Ikke oplyst
FrontierCode 1.1 (svære kodeopgaver)42,4 %46,2 % (max)54,4 %49,3 % (52,1 % på xhigh)
CursorBench 4.0 (kodning i Cursor)34,1 %55,5 %57,8 %Ikke oplyst
GDPval-AA v2.1 (videnarbejde, Elo)1449184418461487
AA-Briefcase v1.1 (videnarbejde, Elo)1359181118221483
Humanity's Last Exam med værktøjer54,9 %64,5 %67,7 %Ikke oplyst
OSWorld 2.1 (betjening af en computer)57,0 %80,1 %81,8 %Ikke oplyst
Chartography (aflæsning af diagrammer)15,6 %61,6 %64,4 %53,6 %

Det mest opsigtsvækkende tal er Terminal-Bench, hvor Sonnet 5.5 slår Opus 5.5, selv om Opus-tallet er målt på den næsthøjeste effort-indstilling. Ellers ligger Opus 5.5 foran med mellem knap 2 og godt 8 procentpoint. Den største afstand er på FrontierCode, hvor Anthropic selv bemærker, at Sonnet 5.5 scorer lavere på max end på xhigh, fordi testen trækker fra for ændringer uden for opgaven. På videnarbejde er forskellen to Elo-point på GDPval, og det er i praksis det samme.

Over for GPT-6 Sol står Sonnet 5.5 stærkest på videnarbejde og diagrammer, mens OpenAI's model vinder på FrontierCode. Som altid er det producentens egne tal, og for GPT-6 Sol noterer Anthropic, at OpenAI har rettet en fejl i billedforståelsen, som tallene måske ikke afspejler.

Hurtig, men ikke billig på max

Det uafhængige analysefirma Artificial Analysis placerer Sonnet 5.5 som nummer tre ud af 216 modeller på sit Intelligence Index med 56 point. Opus 5.5 ligger øverst med 58. Sonnet 5.5 er også hurtig med 139 tokens i sekundet mod 94 for Opus 5.5.

Men målingen er foretaget på max, og her vender regnestykket. Sonnet 5.5 genererede 410 millioner output-tokens for at komme igennem indekset, mod 260 millioner for Opus 5.5 og en median på 88 millioner for sammenlignelige modeller. Det gav en pris på 7,60 dollar per opgave mod 5,98 dollar for Opus 5.5. Halv pris per token endte altså med at blive 27 procent dyrere per opgave.

Det betyder noget, fordi Sonnet 5.5 som standard kører på high i API'et, mens Opus 5.5 kører på medium. Kode, der ikke angiver effort, kører altså Sonnet på et højere niveau, end Opus 5.5 ville være kørt på. Anthropic skriver samtidig, at effort-niveauerne er kalibreret om, så high på Sonnet 5.5 ikke svarer til high på Sonnet 5. Virksomheden anbefaler medium som udgangspunkt til agentisk kodning og veldefinerede opgaver, og medium eller low til chat. Ellers er det præcis her, token-forbruget løber løbsk, uden at nogen opdager det, før fakturaen kommer.

Cyberforespørgsler falder synligt tilbage til Sonnet 5

Sonnet 5.5 er den første Sonnet-model med de samme typer cyberfiltre som Anthropics største modeller. Du kan stadig bruge den til at finde og rette fejl i din egen kode, men cyberopgaver med højere risiko falder ifølge Anthropic synligt tilbage til Sonnet 5. Hos Opus 5.5 havner den slags forespørgsler hos den ældre Opus 4.8. For Sonnet er faldet mindre, fordi Sonnet 5 er den direkte forgænger til samme pris.

I dokumentationen ser det ud som hos Opus 5.5. En afvist forespørgsel returnerer HTTP 200 med stop_reason: "refusal" og et stop_details-felt, der angiver en af fem kategorier: cyber, biologi, udvikling af konkurrerende AI-modeller, forsøg på at trække modellens ræsonnement ud og øvrige skadelige formål. Slår du server-side fallback til, prøver API'et kun igen på Sonnet 5, når kategorien er cyber eller modeludvikling. De tre andre kategorier bliver ikke prøvet igen. Biologifiltrene er de samme som på Sonnet 5.

Den nye kategori om ræsonnement hænger sammen med, at Sonnet 5.5 er den første Sonnet med filtre, der blokerer forsøg på at få modellen til at gengive sin interne tænkning. Tænkeblokkene virker også kun i den konto, der har skabt dem. The Next Web kobler det til, at forskere i august afkodede 315.320 tænkeblokke fra 6.708 offentlige agentforløb på tværs af OpenAI, Anthropic og Google og fandt 62 API-nøgler, 33 adgangskoder og syv private nøgler. Mediet peger også på en selvmodsigelse: Anthropic skriver, at modellen ikke flytter grænsen for, hvad virksomhedens modeller kan, og har derfor begrænset sin sikkerhedsvurdering til udvalgte risici. Samtidig kalder virksomheden cyberevnerne en så stor forbedring, at de kræver samme filtre som frontiermodellerne.

Cyberforsvarere kan snart søge om udvidet adgang gennem Anthropics Cyber Verification Program, der kommer til at omfatte Sonnet 5.5, Opus 5.5 og Mythos-modellerne.

Fem ændringer kan få din kode til at fejle

Migreringen fra Sonnet 5 er i udgangspunktet et skift af model-id fra claude-sonnet-5 til claude-sonnet-5-5. Til gengæld er der fem ændringer, der kan give fejl 400, hvis du ikke retter dem først. Det er én mere end ved Opus 5.5.

Ændring Hvad sker der Løsning
Tænkning slås ikke længere fra med disabledKald med disabled eller et fast tænkebudget giver fejlSend between_tools, som virker op til effort high
Tvunget værktøjsbrug er fjernettool_choice med any eller tool giver fejlBrug auto med strict tool use eller structured outputs
Tænkeblokke er bundet til samtalenÆndres systemprompt, værktøjer eller en tidligere besked, kan genafspilning give fejlTilføj nye instruktioner som systembeskeder midt i samtalen i stedet for at redigere
Det gamle computer use-værktøj afvisescomputer_20251124 virker ikke på Claude API og Google CloudSkift til computer_toolset_20260801. Amazon Bedrock er ikke berørt
Advisor-værktøjet afviser ældre modellerOpus 4.8, Opus 4.7 og Sonnet 5 kan ikke længere bruges som advisorBrug Opus 5 eller nyere, Fable, Mythos eller Sonnet 5.5 selv

Bindingen af tænkeblokke gælder som standard for konti oprettet 31. august 2026 eller senere. Den har også en konsekvens, der ikke giver fejl: Ingen anden model kan læse Sonnet 5.5's tænkeblokke. Skifter en agent fra Sonnet 5.5 til Opus 5.5 midt i en opgave, fortsætter den uden det ræsonnement, der er bygget op indtil da. Den anden vej virker det, for Sonnet 5.5 kan læse blokke fra Sonnet 5.

Endelig er der den stille ændring, som også kom med Opus 5.5. De korte statusbeskeder, modellen skriver mellem værktøjskald, kommer nu som tænkeblokke, der som standard er tomme. En brugerflade, der viser dem, bliver tavs uden fejl, indtil du ændrer indstillingen display eller bruger between_tools.

Sonnet 5.5 flytter grænsen for, hvornår Opus er pengene værd. Til kodning i terminalen og til det meste videnarbejde er afstanden nu så lille, at Sonnet bør være udgangspunktet, og Opus det, du skifter til, når kvaliteten halter. Det er endnu et tegn på, at ingen bruger én model længere. Den tommelfingerregel holder dog kun, så længe effort står på medium eller lavere. På max tænker Sonnet 5.5 sig forbi prisfordelen.

Kilder: Anthropic · Claude Platform Docs · Artificial Analysis · VentureBeat · The Next Web

Michael Nielsen

Michael Nielsen

Michael Nielsen er AI-konsulent hos Nordium ApS og skriver om AI fra et praktisk standpunkt - hvad virker, hvad er hype, og hvordan danske virksomheder kan bruge teknologien til at skabe reel værdi. Han følger udviklingen tæt og dækker alt fra konkrete værktøjer og automatisering til de større tendenser, der former fremtidens arbejdsmarked.