Hvilke af ugens nye AI-modeller kan du bruge?

Gemini 4 Argon, GPT-6.1 Sol, Sonnet 5.5, Qwen Max og MiMo: ugens nye AI-modeller med status, priser, uafhængige målinger og det, der er på vej.

Hvilke af ugens nye AI-modeller kan du bruge?

Den AI-model, der lige nu fører på flest af producenternes egne test, kan du ikke få adgang til. Google præsenterede i går Gemini 4 Argon som sin stærkeste model nogensinde, men indtil videre er den kun åben for en lille kreds af sikkerhedsfolk. Samtidig landede GPT-6.1 Sol og Claude Sonnet 5.5, som du kan bruge i dag, og som i uafhængige målinger ligger på højde med Argon eller over.

Sådan har de sidste ti dage set ud. Nye AI-modeller fra USA og Kina er kommet næsten dagligt, men kun en del af dem kan bruges med det samme. Andre er annonceringer uden dato, lukkede forhåndsvisninger eller en eksisterende model under nyt navn. Tabellerne herunder skiller tingene ad. Først hvad der er kommet, og om du kan bruge det, så hvordan modellerne klarer sig, og til sidst hvad der er på vej.

Ugens nye AI-modeller i én tabel

Priserne er producenternes listepriser i dollar per million tokens, input og output, uden moms. Et par af modellerne er knap halvanden uge gamle, men er med, fordi det er dem, de nyeste skal måles mod.

Model Kom Kan du bruge den i dag? Pris, input / output Åbne vægte
GPT-6.1 Sol (OpenAI)29. sep.Ja, i API'et, ChatGPT Work og Codex2 / 10 dollarNej
Claude Sonnet 5.5 (Anthropic)28. sep.Ja, i API'et og Claude2 / 10 dollarNej
GPT-6 Luna (OpenAI)22. sep.Ja, i API'et0,10 / 0,50 dollarNej
Claude Opus 5.5 (Anthropic)22. sep.Ja, i API'et og Claude4 / 20 dollarNej
Grok 4.7 (SpaceXAI)21. sep.Ja, i API'et, Grok og Cursor2 / 6 dollarNej
MiMo-V2.6-Pro (Xiaomi)21. sep.Ja, i API'et eller som download0,435 / 0,87 dollarJa, MIT-licens
Qwen3.8-Max Prime (Alibaba)23. sep.Ja, via blandt andet OpenRouter4 / 12 dollarSamme vægte som Qwen3.8-Max
Ling-3.1-flash (Ant Group)29. sep.Kun som gratis prøve i to ugerIkke offentliggjortLovet senere
MiniMax M3.1-Flash-Preview27. sep.Kun i MiniMax' eget kodeværktøjIkke oplystNej
Gemini 4 Argon (Google)30. sep.Nej, kun udvalgte sikkerhedsfolk2 / 10 dollar i starten, siden 4 / 20Nej

Tre ting springer i øjnene. GPT-6.1 Sol og Sonnet 5.5 koster præcis det samme. GPT-6 Luna har sat et nyt bundniveau hos de store udbydere, hvor en million input-tokens koster 10 cent. Og den eneste af de nye topmodeller med åbne vægte, altså en model du selv kan hente ned og køre, kommer fra telefonproducenten Xiaomi.

Sådan klarer de sig i uafhængige målinger

Producenterne vælger selv, hvilke test de viser frem. Det mest brugbare uafhængige mål er Intelligence Index fra analysefirmaet Artificial Analysis, der kører alle modeller gennem de samme test og samtidig måler, hvad det koster. Tabellen viser indekset, den gennemsnitlige pris for at løse én opgave i det og hastigheden i tokens per sekund. Modellerne er målt på deres højeste indstilling, Gemini 4 Argon dog på high.

Model Intelligence Index Pris per opgave Hastighed
Claude Opus 5.5585,98 dollar90 tokens/s
Claude Sonnet 5.5567,62 dollar139 tokens/s
GPT-6 Astra533,26 dollar51 tokens/s
Gemini 4 Argon531,99 dollarIkke målt
GPT-6.1 Sol520,72 dollar64 tokens/s
Grok 4.7463,74 dollar73 tokens/s
MiMo-V2.6-Pro460,13 dollar42 tokens/s
Qwen3.8-Max455,41 dollar39 tokens/s
GPT-6 Luna380,07 dollar125 tokens/s

Den vigtigste kolonne er prisen per opgave. GPT-6.1 Sol ligger fire point efter Sonnet 5.5, men løser opgaverne for under en tiendedel af prisen, fordi den bruger langt færre tokens. MiMo-V2.6-Pro er den bedste model med åbne vægte, der er målt, og koster 13 cent per opgave. Qwen3.8-Max ender i den modsatte grøft: et point under MiMo og over 40 gange så dyr per opgave. Indekset siger dog ikke noget om, hvordan en model klarer netop dine opgaver. Det fortæller, hvor den ligger i forhold til de andre.

Kodning er der, hvor producenterne konkurrerer hårdest, og her er DeepSWE den test, flest af dem rapporterer. Tallene herunder er producenternes egne, og indstillingerne er ikke ens.

Model DeepSWE v1.1 Oplyst af
Gemini 4 Argon77,9 %Google
Claude Opus 5.574,2 %Google
GPT-6 Astra74,1 %OpenAI
GPT-6.1 SolPå niveau med AstraOpenAI
MiMo-V2.6-Pro72,6 %Xiaomi
Grok 4.771,0 % (high)SpaceXAI

Testen har 113 opgaver, så Argons forspring på 3,7 procentpoint svarer til omkring fire opgaver. Det er en reel forskel, men ikke et spring. Mellem Opus 5.5, Astra og Sol er forskellen mindre end én opgave.

Gemini 4 Argon fører kun på Googles egne tal

Google kalder Gemini 4 Argon sin model til kodning, videnarbejde og cyberforsvar, og ifølge virksomhedens egen oversigt fører eller deler den førstepladsen i 13 af 18 test. Den står stærkest på automatisering af forretningsgange, juridisk og finansiel analyse og lange videoer. På AutomationBench får den 51,3 procent mod 41,4 for GPT-6 Astra. Den taber til gengæld på de tungeste udviklingstest. På FrontierSWE v2 får den 55,0 mod Astras 65,5, og på Terminal-Bench 4.0 ligger den på 57,4 mod 66,4 for Opus 5.5.

Det uafhængige indeks er mere afdæmpet. Argon får 53 point og ligger på ottendepladsen, med samme score som Astra og et pænt stykke efter Opus 5.5 og Sonnet 5.5. Ifølge Bloomberg er der også internt hos Google tvivl om, hvor godt modellen klarer sig på blandt andet kodning. Til gengæld er den billig per opgave, med 1,99 dollar mod 3,26 for Astra.

Adgangen er det egentlige problem. Lige nu er Argon kun åben for deltagere i Googles Fairwind-program for cyberforsvar, der består af udvalgte Google Cloud-kunder, myndigheder og sikkerhedspartnere. Abonnenter på Google AI Ultra og betalende API-kunder er de næste, men Google har ikke sat dato på. Før modellen åbnes bredere, vil Google stramme sikkerheden mod misbrug til cyberangreb og mod prompt injection, hvor skjulte instrukser i en webside eller et dokument kaprer modellen. Introduktionsprisen på 2 og 10 dollar fordobles senere til 4 og 20 dollar, samme pris som Opus 5.5. Google har ikke sagt hvornår.

OpenAI og Anthropic kæmper om mellemklassen

Ugens mest brugbare nyhed er, at mellemklassen er rykket helt op til toppen. Anthropic udgav mandag Claude Sonnet 5.5, og dagen efter kom GPT-6.1 Sol på OpenAIs DevDay. Begge koster 2 dollar per million input-tokens og 10 dollar per million output-tokens. De ligger få point fra de dyreste modeller. Hos Artificial Analysis ligger Sonnet 5.5 over GPT-6 Astra, og Sol er kun et point efter, selv om Astra koster fem gange så meget per token.

De to adskiller sig mest på prisen per opgave. Sonnet 5.5 ligger højest af de to i indekset, men på højeste indstilling tænker den så længe, at den bliver dyrere per opgave end Opus 5.5. Det har vi gennemgået, da Sonnet 5.5 kom tæt på Opus til halv pris. GPT-6.1 Sol løser de samme opgaver for en tiendedel af prisen. På de test, hvor begge har tal, vinder Sol på kodetesten DeepSWE, mens Sonnet vinder på AutomationBench, der måler automatisering af forretningsgange. Hvilken af dem der er billigst hos dig, afhænger af, hvilken indstilling du kører med, og hvor lange svarene bliver.

Længere nede i prisklassen sætter GPT-6 Luna et nyt bundniveau. Den kom 22. september sammen med GPT-6 Sol og koster 10 cent per million input-tokens. Med 38 point i indekset er den ikke en model til svært ræsonnement. Den er bygget til opgaver i stor mængde, som at sortere henvendelser, udtrække data fra dokumenter eller vælge næste skridt i en agent. Det er den slags trin, der gentages tusindvis af gange om dagen, når AI-automatisering kører i drift, og her betyder prisen per kald mere end den sidste procent kvalitet.

Én model kom ikke. Ifølge Wall Street Journal skulle GPT-6.1 Astra være lanceret i oktober, men OpenAI stoppede den, fordi den i interne test oftere snød og fortsatte med opgaver uden at spørge om lov. Dermed er Sol OpenAIs nyeste model indtil videre, og resten af nyhederne fra OpenAI DevDay 2026 handlede mest om agenter, abonnementer og værktøjer.

Qwen Max fik et nyt navn, ikke en ny model

Den Qwen Max-nyhed, der fylder mest på modellisterne, er Qwen3.8-Max Prime fra 23. september. Det er ikke en ny model. Prime kører de samme vægte som Qwen3.8-Max med samme kontekstvindue på en million tokens, men på hurtigere servere og til den dobbelte pris, 4 og 12 dollar mod 2 og 6. Alibaba har hverken udgivet en artikel, et modelkort eller dokumentation for Prime, og de få offentlige målinger viser næsten ingen forskel i hastighed. Hos OpenRouter målte DataNorth 40 tokens i sekundet for Prime mod 37 for standardudgaven.

Selve modellen er blevet bedre. Den opdaterede Qwen3.8-Max fra 2. september steg fra 40 til 45 point hos Artificial Analysis, og på sin Apsara-konference i Hangzhou forklarede Alibaba det med, at modellen selv har forbedret sin træning over 33 automatiske runder på godt en måned. Pointstigningen er målt uafhængigt, men forklaringen er Alibabas egen. Prisen per opgave er dog stadig høj, hvilket tyder på, at modellen bruger mange tokens på at nå frem til svaret.

Den reelle nyhed fra Kina kom fra Xiaomi. MiMo-V2.6-Pro har 1,02 billioner parametre, hvoraf 42 milliarder er aktive per token, og er udgivet under MIT-licensen, der tillader kommerciel brug uden forbehold. Med 46 point i indekset er den den stærkeste model med åbne vægte, Artificial Analysis har målt. Den kører dog ikke på en almindelig server. Selv om kun 42 milliarder parametre er aktive ad gangen, skal alle vægtene ligge i grafikkortenes hukommelse, og det kræver flere store datacenter-grafikkort. For de fleste vil MiMo derfor betyde Xiaomis eget API eller en anden udbyder, der kører modellen.

To mindre udgivelser er værd at kende. Ant Group har vist Ling-3.1-flash med 560 milliarder parametre, der kan prøves gratis i to uger, hvorefter vægtene ifølge Ant bliver åbne. MiniMax har lagt M3.1-Flash-Preview ind i sit kodeværktøj MiniMax Code uden pris eller testresultater. Pas på med GitHub-sider, der tilbyder M3.1 som "officiel gratis download" i en zip-fil til Windows. De kommer ikke fra MiniMax, og den slags falske modeldownloads er en kendt måde at sprede malware på.

Disse modeller er på vej

Flere af de modeller, der får mest omtale, har endnu ingen dato. Her er status 1. oktober:

  • Qwen 4 er i træning. Alibaba viste på Apsara 22. september fire udgaver: Max, Plus, Flash og en mindre model på 27 milliarder parametre, der er tiltænkt lokal drift. Der er ingen dato, pris eller testresultater. Arkitekturen kender vi fra Qwen3.8-Flash, der var en forsmag på Qwen4.
  • Claude Haiku 5.5 kommer ifølge Anthropic "i de kommende uger". Indtil da er Haiku 4.5 fra oktober 2025 den nyeste Haiku.
  • Gemini 4 Argon åbner for Google AI Ultra og betalende API-kunder "så hurtigt som muligt", som Google formulerer det.
  • DeepSeek V4.1 Pro er bekræftet af DeepSeek, men uden dato, størrelse eller pris. Den mindre V4.1 Flash kom 10. september. Kina holder nationalferie fra 1. til 7. oktober, og ifølge dem, der følger DeepSeek tæt, plejer selskabet ikke at udgive i helligdage.
  • Grok 4.8 og 4.9 kommer ifølge Elon Musk før Grok 5, der har været udskudt flere gange. Ingen af dem har en dato.
  • GPT-6.1 Astra er stoppet efter de interne test og har ingen ny dato.

Har en model ingen dato, er den ikke noget at planlægge efter. Det gælder også Qwen 4 og Gemini 4 Argon for almindelige kunder.

Prisen per opgave afgør valget nu

Opus 5.5, Sonnet 5.5, Astra, Argon og Sol ligger nu inden for seks point i det uafhængige indeks, mens prisen per opgave svinger fra 72 cent til næsten 8 dollar. Forskellen i pris er altså langt større end forskellen i kvalitet, og det er prisen, der kan ses på regningen.

Det betyder ikke, at den billigste vinder. Det betyder, at placeringen på en rangliste er et dårligt grundlag for at vælge model. Den model, der fører på producentens egne test, er ikke nødvendigvis den, der løser dine opgaver billigst, og i denne uge kunne den ikke engang købes. Kør i stedet de modeller, du kan få adgang til, på et udsnit af dine egne opgaver med den indstilling, du vil bruge i drift, og mål, hvad en løst opgave koster. Det er også derfor, ingen bruger én model længere.

Kilder: Google om Gemini 4 Argon · VentureBeat om Argon · Artificial Analysis · The Decoder om GPT-6.1 Sol · The Next Web om Sol og Luna · SpaceXAI om Grok 4.7 · Trending Topics om MiMo-V2.6-Pro · DataNorth om Qwen3.8-Max Prime · Pandaily om Qwen 4 · TechNode om Ling-3.1-flash · Pandaily om MiniMax

Michael Nielsen

Michael Nielsen

Michael Nielsen er AI-konsulent hos Nordium ApS og skriver om AI fra et praktisk standpunkt - hvad virker, hvad er hype, og hvordan danske virksomheder kan bruge teknologien til at skabe reel værdi. Han følger udviklingen tæt og dækker alt fra konkrete værktøjer og automatisering til de større tendenser, der former fremtidens arbejdsmarked.