DeepSeeks billige agentmodel kan nu se

DeepSeek har udgivet en eksperimentel vision-udgave af V4-Flash. Den analyserer skærmbilleder og diagrammer til en brøkdel af frontier-prisen - men fin tekst er stadig et problem.

DeepSeeks billige agentmodel kan nu se

For fire uger siden gjorde DeepSeek sin billigste model til en agent. I fredags gav de den øjne. Den 21. august udgav virksomheden DeepSeek-V4-Flash-Vision-Exp, en eksperimentel udgave af V4-Flash, der kan analysere billeder, skærmbilleder og diagrammer - og handle på dem som agent. Det er den første multimodale model i V4-familien, og den koster det samme som den tekstmodel, den bygger på.

Hvad den kan

Vision-Exp er DeepSeeks billige agentmodel V4-Flash med billedforståelse lagt ovenpå. På rene tekstopgaver præsterer den på niveau med - og på flere benchmarks en anelse bedre end - den model, den udspringer af. Det nye er, at den kan tage imod billeder som input: op til 600 billeder i ét kald, inden for det samme kontekstvindue på en million tokens.

I praksis betyder det, at en agent bygget på modellen kan kigge på et skærmbillede af en fejlside, et dashboard eller en brugerflade og arbejde videre ud fra det, den ser. DeepSeeks egen formulering er, at modellen på agent-benchmarks med visuel forståelse tager et markant spring over V4-Flash og lander "tæt på Opus 4.8" - Anthropics næstbedste model og en af de mest udbredte til netop agent-arbejde.

Modellen understøtter værktøjskald, JSON-output og både thinking- og non-thinking-mode, og den tilgås via de OpenAI- og Anthropic-kompatible API-formater, DeepSeek efterhånden har gjort til sit varemærke. Den findes kun i API'et - app og webchat er uændrede.

Tallene mod Opus 4.8

Påstanden om Opus 4.8-niveau kan efterprøves på de tal, DeepSeek selv har lagt frem. På de fire visuelle benchmarks står den 2-2: Vision-Exp vinder på Agents' Last Exam og ZeroBench, Opus 4.8 vinder på ApexBench og Chartography. Marginerne er små i begge retninger.

Søjlediagram der sammenligner DeepSeek V4-Flash-Vision-Exp og Claude Opus 4.8 på fem benchmarks

Uden for de visuelle opgaver er billedet mindre flatterende. På NL2Repo, der tester evnen til at omsætte krav til en hel kodebase, ligger Opus 4.8 tolv point over. "Tæt på Opus 4.8" gælder altså det snævre udsnit af opgaver, hvor synet er flaskehalsen - ikke modellernes generelle niveau.

Og som altid gælder forbeholdet: tallene er DeepSeeks egne målinger, uden uafhængig verificering og uden offentliggjorte konfidensintervaller.

Hvad den ikke kan

Den vigtigste begrænsning står med småt: hvert billede komprimeres til maksimalt 384 tokens, og større billeder skaleres ned til omkring 800x800 pixels. Der findes ingen høj-opløsningstilstand.

Det sætter en hård grænse for, hvad modellen reelt kan læse. Uafhængige test viser, at den håndterer layout og struktur fint - hvilke elementer der er på en side, hvordan et diagram er bygget op, om en brugerflade matcher et design. Men fin tekst går tabt i nedskaleringen:

  • Kvitteringer, serienumre og tætte regneark læses upålideligt - detaljerne er simpelthen ikke til stede efter komprimeringen.
  • Stack traces og logfiler i skærmbilleder rammes af samme problem.
  • Falske præmisser accepteres. I test bekræftede modellen selvsikkert forkerte påstande om billedindhold i stedet for at sige fra. I en valideringstest af billedtekster svarede den rigtigt i 6 ud af 12 tilfælde, hvor en konkurrent ramte 11.

Dertil kommer det eksperimentelle. Modellen har intet versionsstempel og kan ikke fastlåses, så den model, man tester mandag, er ikke garanteret den samme, der svarer fredag. Der er ingen åbne vægte, ingen teknisk rapport og ingen garanti for, at den overhovedet bliver stående i sortimentet.

Prisen er stadig våbnet

Vision-Exp koster det samme som V4-Flash: efter prisjusteringen den 16. august omkring 1,40 kroner per million input-tokens og 4,20 kroner per million output-tokens uden for spidsbelastning, det dobbelte indenfor. Spidsbelastningen følger kinesisk arbejdstid, så det meste af den danske eftermiddag og aften ligger i den billige halvdel.

Fordi et billede maksimalt fylder 384 tokens, koster en skærmbillede-analyse under en tiendedel øre i input. Det er den egentlige nyhed: visuel forståelse har hidtil ligget i den dyre ende af modelmarkedet, og her lander den pludselig i den billigste. Sammenlignet med de vestlige modeller, der kan det samme, er forskellen fortsat en størrelsesorden eller to - og for agenter, hvor token-forbruget hurtigt løber løbsk, er det den forskel, der afgør regnestykket. Medianlatensen på 1,1 sekunder gør den samtidig hurtig nok til interaktiv brug.

Mønstret er det samme, som da DeepSeek V4 Pro gik i almindelig drift tidligere på måneden: DeepSeek konkurrerer ikke på at have den bedste model, men på at gøre næsten-frontier-evner så billige, at regnestykket ændrer sig.

Hvad det betyder for danske virksomheder

Vision-Exp er et værktøj til en bestemt type opgaver, og skillelinjen er skarp.

Den er oplagt til opgaver, hvor struktur betyder mere end detaljer: automatisk sortering af indkomne henvendelser med skærmbilleder, kontrol af at brugerflader ser rigtige ud efter en ændring, klassificering af store billedmængder, agenter der skal navigere efter det, de ser. Den slags workflow-automatisering med AI har hidtil krævet dyre modeller, og her flytter prisgrænsen sig markant.

Den er det forkerte valg til dokumentlæsning. Fakturaer, kvitteringer og kontrakter kræver, at hver linje læses korrekt, og netop det kan modellen ikke love med sin opløsningsgrænse. Og fordi den bekræfter falske præmisser, er den risikabel i kundevendte situationer, hvor den bør sige fra.

To forbehold gælder uanset opgaven. Modellen er eksperimentel og kan ændre sig uden varsel, så byg ikke produktionskritiske systemer på den endnu. Og DeepSeek er en kinesisk tjeneste, hvor API-kald forlader EU - for persondata er det et selvstændigt spørgsmål, der hører hjemme i AI-rådgivning til danske virksomheder, før prisen overhovedet er interessant.

Men retningen er tydelig. Syn var det sidste område, hvor de billige modeller haltede klart bagefter. Det er de holdt op med.

Kilder: DeepSeek API Docs - Change Log · XenoSpectrum · eesel AI · Bloomberg

Michael Nielsen

Michael Nielsen

Michael Nielsen er AI-konsulent hos Nordium ApS og skriver om AI fra et praktisk standpunkt - hvad virker, hvad er hype, og hvordan danske virksomheder kan bruge teknologien til at skabe reel værdi. Han følger udviklingen tæt og dækker alt fra konkrete værktøjer og automatisering til de større tendenser, der former fremtidens arbejdsmarked.