Opus 5.5 giver Fable-niveau til under halv pris

Claude Opus 5.5 koster 20 procent mindre end Opus 5 og matcher Fable 5.1 på det meste. Men sikkerhedsfiltrene kan sende dit kald videre til en ældre model.

Opus 5.5 giver Fable-niveau til under halv pris

Anthropic har i dag udgivet Claude Opus 5.5, den første model i Claude 5.5-familien. Listeprisen falder med 20 procent i forhold til Opus 5, og ifølge Anthropic ligger modellen på niveau med storesøsteren Fable 5.1 på det meste arbejde, selv om den kun koster 40 procent af Fable-prisen. Sonnet 5.5 og Haiku 5.5 følger i løbet af de kommende uger.

Den reelle besparelse er ifølge Anthropic større end prisskiltet viser, fordi modellen bruger færre tokens på at løse den samme opgave. Virksomheden regner med omkring 40 procent lavere omkostninger end Opus 5 på typiske opgaver. Med modellen følger dog også fire ændringer i API'et, der kan få eksisterende kode til at fejle, og sikkerhedsfiltre, der uden at sige det højt kan sende et kald videre til en ældre model.

Claude 5.5 koster mindre og bruger færre tokens

Opus 5.5 koster 4 dollar per million input-tokens og 20 dollar per million output-tokens. Den største rabat ligger på cachen, hvor læsning af tekst, modellen allerede har set, falder fra 0,50 til 0,20 dollar. For agenter, der sender den samme lange instruktion med i hvert eneste kald, er det dén linje, der flytter regningen mest.

Opus 5 Opus 5.5 Fable 5.1
Pris per mio. tokens, input / output5 / 25 dollar4 / 20 dollar10 / 50 dollar
Cache-læsning per mio. tokens0,50 dollar0,20 dollar0,25 dollar
Kontekstvindue / maks. output1 mio. / 128.0001 mio. / 128.0001 mio. / 128.000
TænkningKan slås fra op til highAltid slået tilAltid slået til
Standard-efforthighmediumhigh
VidenskæringsdatoMaj 2026Juni 2026Juni 2026

De tidlige kunder bekræfter billedet, i hvert fald på deres egne opgaver. Box målte, at Opus 5.5 brugte omkring en tredjedel så mange tokens som Opus 5, og at svarene var 40 procent kortere uden at miste præcision. GitHub testede modellen i Copilot og fandt, at den løste flere terminalopgaver end Opus 5 med under halvt så mange trin. Deloitte fik den laveste effort-indstilling til at finde 72 procent af kendte fejl i kodegennemgange, mod 56 procent for Opus 5 på high.

Anthropics eget mest konkrete eksempel er en oversættelse af load balanceren HAProxy fra C til Rust. Både Opus 5.5 og Fable 5.1 bestod næsten alle HAProxys regressionstest, men Opus 5.5 var færdig på 9,5 timer mod 12 og kostede 51 procent mindre. Det er kundernes og Anthropics egne målinger, ikke uafhængige test, men de peger samme vej.

Abonnenter på Claude får samtidig 20 procent mere plads i femtimersgrænsen på alle planer, og ifølge Anthropic rækker både femtimers- og ugegrænserne 25 procent længere, fordi modellen er billigere at køre. Fast mode, der svarer op til 2,5 gange hurtigere, koster 8 og 40 dollar per million tokens og findes kun på Anthropics eget API og i Claude Code.

Opus 5.5 mod Fable 5.1 og GPT-6 Astra

Tallene fra Anthropics annoncering viser en model, der slår sin dyrere storesøster på agentisk kodning og ligger tæt på den andre steder. Opus 5 leverede frontier til halv pris for to måneder siden, og Opus 5.5 rykker især på terminalarbejde og videnarbejde.

Benchmark Opus 5 Opus 5.5 Fable 5.1 GPT-6 Astra
Terminal-Bench 4.0 (kodning i terminalen)52,3 %66,4 %55,8 %57,9 %
FrontierCode v1.1 (svære kodeopgaver)48,0 %54,4 %50,3 %53,3 %
CursorBench 4.0 (kodning i Cursor)46,6 %57,8 %51,8 %41,7 % (GPT-5.6 Sol)
GDPval-AA v2.1 (videnarbejde, Elo)1708184617351542
AutomationBench (forretningsgange)26,9 %40,0 %31,4 %41,4 %
Humanity's Last Exam med værktøjer63,6 %67,7 %65,6 %57,2 %
Terminal-Bench-Science 0.1 (forskning)29,0 %58,7 %52,6 %64,6 %

GPT-6 Astra vinder stadig på automatisering af forretningsgange og på videnskabeligt arbejde i terminalen, så Opus 5.5 er ikke bedst til alt. Anthropic advarer også selv mod at læse for meget ind i marginerne. På dette niveau betyder nogle få point på en benchmark ifølge virksomheden ikke en forskel, man kan mærke i praksis. Det mere interessante tal er prisen per opgave: På FrontierCode slår Opus 5.5 GPT-6 Astra til omkring en femtedel af omkostningen per opgave, når Opus 5.5 kører på standard-effort.

Nummer ét hos Artificial Analysis, men ikke billigt på max

Det uafhængige analysefirma Artificial Analysis placerer Opus 5.5 som nummer ét ud af 206 modeller på sit Intelligence Index med 58 point. Medianen for modeller i samme prisklasse er 25.

Men målingen er foretaget på effort-niveauet max, og her ser tokenregnskabet helt anderledes ud. Opus 5.5 genererede 260 millioner output-tokens for at komme igennem de ti test i indekset, mod en median på 92 millioner for sammenlignelige modeller. Hele kørslen kostede 8.708 dollar, knap 6 dollar per opgave.

Det modsiger ikke Anthropics tal om færre tokens. Det viser, at besparelsen hænger på indstillingen. På medium, som er den nye standard, er modellen sparsommelig. På max tænker den så længe, den kan, og regningen følger med. Lav pris per token er ikke det samme som lav pris per opgave, og det er præcis dér, token-forbruget løber løbsk, hvis ingen holder øje.

Dit kald kan ende hos Opus 4.8

Den vigtigste detalje for udviklere står et godt stykke nede i lanceringen, og det er den, The New Stack hæfter sig ved. Opus 5.5 kører med de samme sikkerhedsfiltre som Fable 5.1 inden for cybersikkerhed, biologi og udvikling af nye frontiermodeller. Når et filter slår til, sendes forespørgslen videre til en ældre model. De fleste markerede cyberforespørgsler havner hos Opus 4.8, mens biologi og modeludvikling går til Opus 5.

I dokumentationen ser det sådan ud: En afvist forespørgsel returnerer HTTP 200 med stop_reason: "refusal" og et felt, der angiver politikområdet. Har du slået server-side fallback til, prøver API'et igen på den model, Anthropic anbefaler for netop den kategori. For en chatbot er det en detalje. For en agent, der arbejder over mange trin, betyder det, at enkelte trin kan være løst af en svagere model, uden at det fremgår af resultatet. Tænkeblokkene fra Opus 5.5 kan ifølge dokumentationen kun læses af Fable 5.1 og Mythos 5.1, så et skift til Opus 4.8 undervejs betyder også, at modellens hidtidige ræsonnement ikke følger med.

Anthropic understreger, at man stadig kan bruge Opus 5.5 til at finde og rette fejl i sin egen kode. Virksomheder og institutioner inden for biovidenskab kan søge om at bruge modellen uden biologifilteret gennem et verifikationsprogram, der åbnede 17. september, og et tilsvarende program for cybersikkerhed med tre adgangsniveauer udvides til Opus 5.5 i de kommende uger. Arbejder du med sikkerhed, bør du logge, hvornår et svar er en afvisning eller er kommet via fallback, og tage højde for det i dine evalueringer.

På sikkerhedssiden kalder Anthropic i øvrigt Opus 5.5 den model, der har klaret sig bedst i virksomhedens interne adfærdsaudit til dato. Den forsøgte omkring 85 procent sjældnere end Opus 5 at bryde ud af de rammer, den blev testet i, og METR har evalueret modellen før lanceringen.

Fire ændringer kan få din kode til at fejle

Migreringen fra Opus 5 er i udgangspunktet et skift af model-id fra claude-opus-5 til claude-opus-5-5. Fire ting giver dog en fejl, hvis du ikke retter dem først.

Ændring Hvad sker der Løsning
Tænkning kan ikke slås fraKald med tænkning slået fra eller et fast tænkebudget giver fejl 400Fjern indstillingen og styr dybden med effort
Tvunget værktøjsbrug er fjernettool_choice med any eller tool giver fejl 400Brug auto med strict tool use eller structured outputs
Tænkeblokke er bundet til samtalenÆndres systemprompt eller værktøjer midt i en samtale, kan genafspilning give fejl 400Tilføj nye instruktioner som systembeskeder i stedet for at redigere
Det gamle computer use-værktøj afvisescomputer_20251124 virker ikke på Claude API og Google CloudSkift til computer_toolset_20260801. Amazon Bedrock er ikke berørt

To ændringer giver ingen fejl, men mærkes alligevel. Standard-effort er sænket fra high til medium, så kode, der ikke angiver effort, stille kører på et lavere niveau end før. Og de korte statusbeskeder, modellen skriver mellem værktøjskald, kommer nu som tænkeblokke, der som standard er tomme. En brugerflade, der viser dem, bliver derfor tavs, indtil du ændrer indstillingen display.

Opus 5.5 gør altså topniveauet billigere, men også lidt mindre gennemsigtigt. Prisen afhænger af, hvilken effort du vælger, og svaret kan i særlige tilfælde komme fra en anden model end den, du bad om. Begge dele kan håndteres, men kun hvis du måler på dine egne opgaver i stedet for at stole på prisskiltet.

Kilder: Anthropic · Claude Platform Docs · The New Stack · Artificial Analysis

Michael Nielsen

Michael Nielsen

Michael Nielsen er AI-konsulent hos Nordium ApS og skriver om AI fra et praktisk standpunkt - hvad virker, hvad er hype, og hvordan danske virksomheder kan bruge teknologien til at skabe reel værdi. Han følger udviklingen tæt og dækker alt fra konkrete værktøjer og automatisering til de større tendenser, der former fremtidens arbejdsmarked.