DeepSeeks billigste model er nu en agent

DeepSeek har sendt den officielle V4-Flash i luften med markant bedre agent-evner. Prisen er stadig omkring to kroner per million output-tokens.

DeepSeeks billigste model er nu en agent

DeepSeek udgav i dag den officielle version af V4-Flash, tre måneder efter at modellen kom som preview. Arkitekturen og størrelsen er uændret - modellen er udelukkende gentrænet i sidste fase - men agent-evnerne er ifølge DeepSeek løftet så meget, at den lille model nu slår virksomhedens egen topmodel på flere agent-opgaver. Prisen er den samme som før, og det er den, der gør nyheden interessant.

Hvad der er nyt

Opdateringen gælder kun API-versionen af V4-Flash. V4-Pro og modellerne bag DeepSeeks app og webchat er uændrede. Man skal ikke ændre noget i sin kode - modelnavnet deepseek-v4-flash peger nu automatisk på den nye version, som foreløbig kører i offentlig beta.

Baggrunden er lanceringen af V4-familien den 24. april, hvor DeepSeek udgav to modeller: den store V4-Pro og den lille, hurtige V4-Flash. Samtidig fik de gamle modelnavne deepseek-chat og deepseek-reasoner en udløbsdato, og den passerede i sidste uge. DeepSeeks sortiment består altså nu af to modeller, hvor den billigste netop har fået sin færdige form.

To ting skiller sig ud i dagens opdatering:

  • Agent-evnerne er det centrale salgsargument. DeepSeek fremhæver ni agent-benchmarks og skriver direkte, at resultaterne ligger langt over V4-Pro-Preview - altså deres egen større og dyrere model.
  • Modellen taler nu OpenAIs nye sprog. Den officielle V4-Flash understøtter Responses API-formatet og er specifikt tilpasset Codex, OpenAIs kodeagent.

Tallene bag agent-påstanden

DeepSeek offentliggør blandt andet disse resultater for den nye version: 82,7 på Terminal-Bench 2.1, 76,7 på Cybergym, 70,3 på Toolathlon, 68,7 på DSBench-FullStack og 54,4 på DeepSWE. Det er DeepSeeks egne målinger, og den sædvanlige forsigtighed gælder.

Terminal-Bench er den mest sigende af dem, fordi den tester det, agenter faktisk laver i drift: at betjene en computer gennem terminalen, kompilere kode, sætte servere op og løse administrationsopgaver fra ende til anden. Her kan tallet holdes op mod det offentlige leaderboard:

Model Terminal-Bench 2.1 Kilde
GPT-5.6 Sol (OpenAI)88,8Leaderboard
Kimi K3 (Moonshot)88,3Leaderboard, bedste åbne model
DeepSeek V4-Flash82,7DeepSeeks egen måling
Gennemsnit, alle 15 modeller76,3Leaderboard

Læsningen er ligetil. V4-Flash er ikke den bedste agentmodel på markedet, og DeepSeek påstår det heller ikke. Men den ligger klart over gennemsnittet af de modeller, der overhovedet måles - og den er i en helt anden priskategori end alt det, der ligger over den.

Prisen er stadig historiens kerne

V4-Flash koster omkring 1 krone per million input-tokens og 2 kroner per million output-tokens. Rammer et kald cachen, fordi systemprompten eller dokumentet er set før, falder input-prisen til omkring 2 øre. Til sammenligning ser feltet sådan ud:

Model Input per mio. tokens Output per mio. tokens
DeepSeek V4-Flashca. 1 krca. 2 kr
DeepSeek V4-Proca. 3 krca. 6 kr
Claude Opus 5 (Anthropic)ca. 35 krca. 175 kr
GPT-5.5 (OpenAI)ca. 35 krca. 210 kr

Forskellen er ikke procenter, men størrelsesordener. På output-siden får man omkring hundrede gange så mange tokens for pengene hos DeepSeek som hos de vestlige frontier-modeller. Det er netop derfor, agent-vinklen betyder noget: agenter er den mest token-hungrende arbejdsform, der findes. En agent, der arbejder i en terminal i tyve minutter, brænder let millioner af tokens af, og det forbrug kan løbe løbsk, hvis hvert token koster frontier-pris.

Regnestykket skal dog laves ærligt. En billig model, der skal bruge tre forsøg på en opgave, en dyr model løser i første hug, er ikke billig. Afstanden på Terminal-Bench - 82,7 mod leaderboardets 88,8 i toppen - er reel og mærkes netop på den slags lange opgaver, hvor små fejl akkumulerer. Prisforskellen er til gengæld så stor, at V4-Flash kan fejle mange gange og stadig vinde regnestykket på opgaver, hvor et fejlet forsøg er billigt at opdage.

Signalet i Codex-tilpasningen

Den mest bemærkelsesværdige linje i opdateringen er næsten en bisætning: V4-Flash understøtter Responses API-formatet og er specifikt tilpasset Codex.

Codex er OpenAIs kodeagent, og Responses API er OpenAIs nye standardformat. DeepSeek bygger med andre ord sin model, så den kan sættes direkte ind i konkurrentens værktøjer og økosystem. Det er samme mønster, som da V4-familien fra start understøttede både OpenAI- og Anthropic-formaterne: DeepSeek forsøger ikke at bygge sin egen have med hegn om, men gør det så friktionsfrit som muligt at skifte motoren ud i de værktøjer, folk allerede bruger.

For alle, der har bygget rutedelte opsætninger, hvor flere modeller deles om arbejdet, er det en gave. Modellen bliver et udskifteligt komponent, man kan pege sin eksisterende agent-infrastruktur mod med én linjes ændring.

Hvad det betyder i praksis

Dagens udgivelse ændrer ikke billedet af, hvem der har den bedste model. Den skærper billedet af, hvor grænsen går for, hvad den billige del af markedet kan. For et halvt år siden var modeller i denne prisklasse noget, man brugte til klassificering og opsummering. Nu leverer de agent-arbejde over leaderboard-gennemsnittet.

Tre ting er værd at handle på:

  • Genovervej hvilke opgaver der kræver frontier-pris. Interne automatiseringer, dataoprydning og terminalopgaver med billig fejl-detektion er oplagte kandidater til en model i denne klasse - især i opsætninger som Opus 5's effort-skala har gjort det normalt at tænke i pris- og kvalitetstrin.
  • Test på egne opgaver, ikke på DeepSeeks tal. Benchmarktallene er leverandørens egne, og modellen er i beta. Tyve reelle opgaver fra egen drift siger mere end ni benchmarks.
  • Husk hvor data lander. DeepSeek er en kinesisk tjeneste, og API-kald forlader EU. For persondata og forretningskritisk materiale er det et selvstændigt spørgsmål, der skal afklares før prisen overhovedet er relevant.

Den billigste ende af modelmarkedet er holdt op med at være discount-hylden. Den er blevet det sted, hvor prispresset på hele feltet kommer fra.

Kilder: DeepSeek API Docs - Change Log · TechNode · Terminal-Bench 2.1 Leaderboard

Michael Nielsen

Michael Nielsen

Michael Nielsen er AI-konsulent hos Nordium ApS og skriver om AI fra et praktisk standpunkt - hvad virker, hvad er hype, og hvordan danske virksomheder kan bruge teknologien til at skabe reel værdi. Han følger udviklingen tæt og dækker alt fra konkrete værktøjer og automatisering til de større tendenser, der former fremtidens arbejdsmarked.