Anthropic har i dag udgivet Claude Opus 5.5, den første model i Claude 5.5-familien. Listeprisen falder med 20 procent i forhold til Opus 5, og ifølge Anthropic ligger modellen på niveau med storesøsteren Fable 5.1 på det meste arbejde, selv om den kun koster 40 procent af Fable-prisen. Sonnet 5.5 og Haiku 5.5 følger i løbet af de kommende uger.
Den reelle besparelse er ifølge Anthropic større end prisskiltet viser, fordi modellen bruger færre tokens på at løse den samme opgave. Virksomheden regner med omkring 40 procent lavere omkostninger end Opus 5 på typiske opgaver. Med modellen følger dog også fire ændringer i API'et, der kan få eksisterende kode til at fejle, og sikkerhedsfiltre, der uden at sige det højt kan sende et kald videre til en ældre model.
Claude 5.5 koster mindre og bruger færre tokens
Opus 5.5 koster 4 dollar per million input-tokens og 20 dollar per million output-tokens. Den største rabat ligger på cachen, hvor læsning af tekst, modellen allerede har set, falder fra 0,50 til 0,20 dollar. For agenter, der sender den samme lange instruktion med i hvert eneste kald, er det dén linje, der flytter regningen mest.
| Opus 5 | Opus 5.5 | Fable 5.1 | |
|---|---|---|---|
| Pris per mio. tokens, input / output | 5 / 25 dollar | 4 / 20 dollar | 10 / 50 dollar |
| Cache-læsning per mio. tokens | 0,50 dollar | 0,20 dollar | 0,25 dollar |
| Kontekstvindue / maks. output | 1 mio. / 128.000 | 1 mio. / 128.000 | 1 mio. / 128.000 |
| Tænkning | Kan slås fra op til high | Altid slået til | Altid slået til |
| Standard-effort | high | medium | high |
| Videnskæringsdato | Maj 2026 | Juni 2026 | Juni 2026 |
De tidlige kunder bekræfter billedet, i hvert fald på deres egne opgaver. Box målte, at Opus 5.5 brugte omkring en tredjedel så mange tokens som Opus 5, og at svarene var 40 procent kortere uden at miste præcision. GitHub testede modellen i Copilot og fandt, at den løste flere terminalopgaver end Opus 5 med under halvt så mange trin. Deloitte fik den laveste effort-indstilling til at finde 72 procent af kendte fejl i kodegennemgange, mod 56 procent for Opus 5 på high.
Anthropics eget mest konkrete eksempel er en oversættelse af load balanceren HAProxy fra C til Rust. Både Opus 5.5 og Fable 5.1 bestod næsten alle HAProxys regressionstest, men Opus 5.5 var færdig på 9,5 timer mod 12 og kostede 51 procent mindre. Det er kundernes og Anthropics egne målinger, ikke uafhængige test, men de peger samme vej.
Abonnenter på Claude får samtidig 20 procent mere plads i femtimersgrænsen på alle planer, og ifølge Anthropic rækker både femtimers- og ugegrænserne 25 procent længere, fordi modellen er billigere at køre. Fast mode, der svarer op til 2,5 gange hurtigere, koster 8 og 40 dollar per million tokens og findes kun på Anthropics eget API og i Claude Code.
Opus 5.5 mod Fable 5.1 og GPT-6 Astra
Tallene fra Anthropics annoncering viser en model, der slår sin dyrere storesøster på agentisk kodning og ligger tæt på den andre steder. Opus 5 leverede frontier til halv pris for to måneder siden, og Opus 5.5 rykker især på terminalarbejde og videnarbejde.
| Benchmark | Opus 5 | Opus 5.5 | Fable 5.1 | GPT-6 Astra |
|---|---|---|---|---|
| Terminal-Bench 4.0 (kodning i terminalen) | 52,3 % | 66,4 % | 55,8 % | 57,9 % |
| FrontierCode v1.1 (svære kodeopgaver) | 48,0 % | 54,4 % | 50,3 % | 53,3 % |
| CursorBench 4.0 (kodning i Cursor) | 46,6 % | 57,8 % | 51,8 % | 41,7 % (GPT-5.6 Sol) |
| GDPval-AA v2.1 (videnarbejde, Elo) | 1708 | 1846 | 1735 | 1542 |
| AutomationBench (forretningsgange) | 26,9 % | 40,0 % | 31,4 % | 41,4 % |
| Humanity's Last Exam med værktøjer | 63,6 % | 67,7 % | 65,6 % | 57,2 % |
| Terminal-Bench-Science 0.1 (forskning) | 29,0 % | 58,7 % | 52,6 % | 64,6 % |
GPT-6 Astra vinder stadig på automatisering af forretningsgange og på videnskabeligt arbejde i terminalen, så Opus 5.5 er ikke bedst til alt. Anthropic advarer også selv mod at læse for meget ind i marginerne. På dette niveau betyder nogle få point på en benchmark ifølge virksomheden ikke en forskel, man kan mærke i praksis. Det mere interessante tal er prisen per opgave: På FrontierCode slår Opus 5.5 GPT-6 Astra til omkring en femtedel af omkostningen per opgave, når Opus 5.5 kører på standard-effort.
Nummer ét hos Artificial Analysis, men ikke billigt på max
Det uafhængige analysefirma Artificial Analysis placerer Opus 5.5 som nummer ét ud af 206 modeller på sit Intelligence Index med 58 point. Medianen for modeller i samme prisklasse er 25.
Men målingen er foretaget på effort-niveauet max, og her ser tokenregnskabet helt anderledes ud. Opus 5.5 genererede 260 millioner output-tokens for at komme igennem de ti test i indekset, mod en median på 92 millioner for sammenlignelige modeller. Hele kørslen kostede 8.708 dollar, knap 6 dollar per opgave.
Det modsiger ikke Anthropics tal om færre tokens. Det viser, at besparelsen hænger på indstillingen. På medium, som er den nye standard, er modellen sparsommelig. På max tænker den så længe, den kan, og regningen følger med. Lav pris per token er ikke det samme som lav pris per opgave, og det er præcis dér, token-forbruget løber løbsk, hvis ingen holder øje.
Dit kald kan ende hos Opus 4.8
Den vigtigste detalje for udviklere står et godt stykke nede i lanceringen, og det er den, The New Stack hæfter sig ved. Opus 5.5 kører med de samme sikkerhedsfiltre som Fable 5.1 inden for cybersikkerhed, biologi og udvikling af nye frontiermodeller. Når et filter slår til, sendes forespørgslen videre til en ældre model. De fleste markerede cyberforespørgsler havner hos Opus 4.8, mens biologi og modeludvikling går til Opus 5.
I dokumentationen ser det sådan ud: En afvist forespørgsel returnerer HTTP 200 med stop_reason: "refusal" og et felt, der angiver politikområdet. Har du slået server-side fallback til, prøver API'et igen på den model, Anthropic anbefaler for netop den kategori. For en chatbot er det en detalje. For en agent, der arbejder over mange trin, betyder det, at enkelte trin kan være løst af en svagere model, uden at det fremgår af resultatet. Tænkeblokkene fra Opus 5.5 kan ifølge dokumentationen kun læses af Fable 5.1 og Mythos 5.1, så et skift til Opus 4.8 undervejs betyder også, at modellens hidtidige ræsonnement ikke følger med.
Anthropic understreger, at man stadig kan bruge Opus 5.5 til at finde og rette fejl i sin egen kode. Virksomheder og institutioner inden for biovidenskab kan søge om at bruge modellen uden biologifilteret gennem et verifikationsprogram, der åbnede 17. september, og et tilsvarende program for cybersikkerhed med tre adgangsniveauer udvides til Opus 5.5 i de kommende uger. Arbejder du med sikkerhed, bør du logge, hvornår et svar er en afvisning eller er kommet via fallback, og tage højde for det i dine evalueringer.
På sikkerhedssiden kalder Anthropic i øvrigt Opus 5.5 den model, der har klaret sig bedst i virksomhedens interne adfærdsaudit til dato. Den forsøgte omkring 85 procent sjældnere end Opus 5 at bryde ud af de rammer, den blev testet i, og METR har evalueret modellen før lanceringen.
Fire ændringer kan få din kode til at fejle
Migreringen fra Opus 5 er i udgangspunktet et skift af model-id fra claude-opus-5 til claude-opus-5-5. Fire ting giver dog en fejl, hvis du ikke retter dem først.
| Ændring | Hvad sker der | Løsning |
|---|---|---|
| Tænkning kan ikke slås fra | Kald med tænkning slået fra eller et fast tænkebudget giver fejl 400 | Fjern indstillingen og styr dybden med effort |
| Tvunget værktøjsbrug er fjernet | tool_choice med any eller tool giver fejl 400 | Brug auto med strict tool use eller structured outputs |
| Tænkeblokke er bundet til samtalen | Ændres systemprompt eller værktøjer midt i en samtale, kan genafspilning give fejl 400 | Tilføj nye instruktioner som systembeskeder i stedet for at redigere |
| Det gamle computer use-værktøj afvises | computer_20251124 virker ikke på Claude API og Google Cloud | Skift til computer_toolset_20260801. Amazon Bedrock er ikke berørt |
To ændringer giver ingen fejl, men mærkes alligevel. Standard-effort er sænket fra high til medium, så kode, der ikke angiver effort, stille kører på et lavere niveau end før. Og de korte statusbeskeder, modellen skriver mellem værktøjskald, kommer nu som tænkeblokke, der som standard er tomme. En brugerflade, der viser dem, bliver derfor tavs, indtil du ændrer indstillingen display.
Opus 5.5 gør altså topniveauet billigere, men også lidt mindre gennemsigtigt. Prisen afhænger af, hvilken effort du vælger, og svaret kan i særlige tilfælde komme fra en anden model end den, du bad om. Begge dele kan håndteres, men kun hvis du måler på dine egne opgaver i stedet for at stole på prisskiltet.
Kilder: Anthropic · Claude Platform Docs · The New Stack · Artificial Analysis


