Qwen3.8-Max og DeepSeek V4 Pro lander samme uge

Alibaba åbner vægtene på en 2,4 billioner parametre stor model, og DeepSeek sætter V4 Pro i almindelig drift. Begge rammer benchmarks på niveau med de lukkede topmodeller.

Qwen3.8-Max og DeepSeek V4 Pro lander samme uge

Mens opmærksomheden har ligget på de fire store vestlige chatbots, er de åbne modeller stille og roligt nået frem til samme niveau. I denne uge landede to udgivelser med få dages mellemrum: Alibaba lægger vægtene til Qwen3.8-Max ud på Hugging Face, og DeepSeek sætter V4 Pro i almindelig drift med model-id'et deepseek-v4-pro-0813. Begge modeller ligger inden for få point af de bedste lukkede modeller på de benchmarks, der måler agent-arbejde.

Det er første gang, Alibaba åbner en model i Max-klassen.

DeepSeek V4 Pro går i almindelig drift

V4 Pro har kørt som preview siden april. Den færdige version er en mixture-of-experts-model på 1,6 billioner parametre med et kontekstvindue på 1.048.576 tokens og op til 384.000 tokens i output. Prisen er cirka 2,80 kroner per million input-tokens og 5,60 kroner per million output-tokens.

Springet fra preview til færdig version ligger næsten udelukkende i agent-evnerne, og tallene er usædvanligt store:

  • Terminal-Bench 2.1: fra 72,1 til 87,9
  • CyberGym: fra 52,7 til 83,3
  • DeepSWE: fra 12,8 til 62,7
  • DSBench-Hard: fra 31,1 til 67,2
  • AutomationBench: fra 12,8 til 31,8

På SWE-bench Verified lander modellen på 80,6 procent, hvilket er det højeste for en model med åbne vægte og på niveau med Gemini 3.1 Pro. Samme mønster som da DeepSeek V4-Flash blev en agentmodel i juli: arkitekturen står stille, eftertræningen flytter alt.

Qwen3.8-Max åbner vægtene

Qwen3.8-Max blev udgivet via Alibabas API den 3. august, og vægtene lander på Hugging Face og ModelScope i denne uge sammen med en mindre Qwen3.8-27B. Modellen er på 2,4 billioner parametre i alt med 95 milliarder aktive per token, fordelt på 512 eksperter hvoraf 11 er aktive ad gangen. Kontekstvinduet er 262.144 tokens indbygget og kan strækkes til godt en million.

På benchmarks ligger den tæt på toppen: 86,6 på Terminal-Bench 2.1, 93,0 på PaperBench, 92,6 på GPQA Diamond og 67,7 på SWE-Bench Pro. Til sammenligning ligger Claude Opus 4.8 og Fable 5 på 84,6 på Terminal-Bench, mens GPT-5.6 Sol i sin kraftigste indstilling ligger på 88,8.

Søjlediagram der sammenligner Terminal-Bench 2.1-resultater for GPT-5.6 Sol, DeepSeek V4 Pro, Qwen3.8-Max og Claude Opus 4.8

En detalje er værd at bemærke for dem, der skal køre modellen selv: licensen hedder qwen3.8-max og er ikke en standard open source-licens som MIT eller Apache 2.0. Åbne vægte og fri erhvervsmæssig brug er to forskellige ting, og forskellen står i licensteksten, ikke i pressemeddelelsen.

Resten af feltet står ikke stille

De to udgivelser er ikke enkeltstående. Sommeren 2026 har været den tættest pakkede periode nogensinde for modeller med åbne vægte.

Moonshot udgav Kimi K3 den 16. juli med 2,8 billioner parametre. Kimi K2.6 fra april ligger stadig som nummer fire på tværs af 346 modeller hos Artificial Analysis og som nummer et blandt modeller med åbne vægte. Dertil kommer GLM-5.2 fra Z.ai, MiniMax M3, Tencents Hy3 og Nvidias Nemotron 3 Ultra, der alle er landet inden for de samme to måneder.

Retningen er entydig. Der er ikke længere ét åbent alternativ, man vælger, fordi det er billigt. Der er et halvt dusin, der konkurrerer på resultater, og de udkommer hurtigere end de lukkede.

Forskellen ligger ikke længere i modellen

Når fire modeller ligger inden for 4,2 point af hinanden på den benchmark, der bedst beskriver agent-arbejde, holder benchmarken op med at være et beslutningsgrundlag. Forskellen flytter sig til alt det andet.

Det, der reelt adskiller modellerne i drift, er stabiliteten under lange kørsler, hvor godt de håndterer feedback fra det miljø, de arbejder i, hvor forudsigelig ventetiden er, og hvor godt værktøjskald og struktureret output fungerer. Det er de ting, der afgør, om en agent kan køre en time uden opsyn. De står ikke på nogen scoretavle.

Hertil kommer den forskel, der er lettest at måle: prisen. DeepSeek V4 Pro koster omkring en tiendedel af de lukkede topmodeller per token, og en model med åbne vægte kan hostes, hvor man vil. Det er derfor orkestrering af flere sprogmodeller er ved at blive standardarkitekturen frem for ét fast modelvalg.

Hvad det betyder for danske virksomheder

For danske virksomheder ændrer udgivelserne to konkrete ting.

Den ene er hosting. En model med åbne vægte kan køre på infrastruktur i EU eller i eget datacenter, hvilket fjerner en stor del af diskussionen om overførsel af persondata til tredjelande. Det er den mest håndfaste fordel ved åbne vægte, og den er uafhængig af, hvor godt modellen klarer sig på en benchmark.

Den anden er licensgennemgangen. Qwens Max-licens, DeepSeeks vilkår og Kimis modificerede MIT-licens er ikke ens, og de begrænser forskellige ting. Det er en times arbejde at læse dem, og det arbejde bør ligge før beslutningen, ikke efter.

Selve modelvalget er til gengæld blevet mindre vigtigt, end det har været i to år. Når feltet ligger så tæt, ligger den reelle gevinst i at bygge et opsæt, hvor modellen kan udskiftes, når den næste udgives om tre uger.

Kilder: OpenRouter, Hugging Face, Artificial Analysis

Michael Nielsen

Michael Nielsen

Michael Nielsen er AI-konsulent hos Nordium ApS og skriver om AI fra et praktisk standpunkt - hvad virker, hvad er hype, og hvordan danske virksomheder kan bruge teknologien til at skabe reel værdi. Han følger udviklingen tæt og dækker alt fra konkrete værktøjer og automatisering til de større tendenser, der former fremtidens arbejdsmarked.