OpenAI lancerer GPT-6 Astra og erklærer AGI-æraen

ChatGPT 6 er her: GPT-6 Astra koster det samme som Fable 5.1, topper matematik og cybersikkerhed og er OpenAIs første model i kritisk risikoklasse. På kodning er føringen mindre, end tallene antyder.

OpenAI lancerer GPT-6 Astra og erklærer AGI-æraen

OpenAI udgav torsdag GPT-6 Astra, modellen bag det, de fleste vil kalde ChatGPT 6. Det er den model, selskabet har talt om siden foråret og satte på pause i august for at få sikkerheden på plads. Præsident Greg Brockman afsluttede pressemødet med ordene "Velkommen til AGI-æraen". Det er en stor overskrift til en model, der på flere af de vigtigste opgaver ligger side om side med konkurrenterne, og som koster præcis det samme som Anthropics Fable 5.1.

Det, der reelt er nyt, ligger tre steder: i matematik og naturvidenskab, i arbejde på tværs af skrivebordsprogrammer og i cybersikkerhed. Det sidste er så markant, at OpenAI for første gang selv klassificerer en model som kritisk under sit eget sikkerhedsrammeværk. Resten er en historie om benchmarks, og den skal læses med briller på.

Hvornår ChatGPT 6 Astra dukker op i din konto

GPT-6 Astra er ifølge OpenAI selskabets største træningsforløb til dato. Det er første gang, der er fortrænet på over 100.000 GPU'er på Stargate-anlægget i Texas, og første gang tidligere modeller har spillet en væsentlig rolle i at overvåge træningen af den næste. Det sidste var præcis den type arbejdsgang, OpenAI selv trak i håndbremsen på i august, efter modeller under test brød ud af et lukket miljø.

Modsat GPT-5.6, der kom i tre udgaver, består GPT-6 indtil videre kun af Astra og Astra Pro. Astra Pro er forbeholdt Pro-, Business- og Enterprise-abonnementer. Udrulningen starter hos erhvervskunder i OpenAIs Daybreak-program. ChatGPT Plus, Pro, Business og Enterprise samt API'en, Codex og AWS følger "i de kommende dage". Ifølge OpenAIs hjælpecenter gælder det også brugere i EØS, Schweiz og Storbritannien, når modellen er tilgængelig for deres abonnement. Gratis ChatGPT-brugere nævnes ikke i udrulningsplanen.

Hvor GPT-6 Astra fører, og hvor den ikke gør

OpenAI beskriver Astra som "verdens mest intelligente og bedst alignede model". Tabellen herunder samler de vigtigste tal fra lanceringen og stiller dem op mod OpenAIs egen GPT-5.6 Sol og Anthropics to topmodeller. Med undtagelse af den nederste række er det leverandørernes egne målinger, og OpenAI oplyser, at modellerne som udgangspunkt kørte på maksimal indsats.

Benchmark GPT-6 Astra GPT-5.6 Sol Fable 5.1 Opus 5
DeepSWE v1.1 (agent-kodning)74,170,867,473,7
Terminal-Bench 4.057,737,355,852,3
ARC-AGI-398,67,8-30,2
FrontierMath Tier 497,683,087,873,2
GPQA Diamond96,094,693,7-
Humanity's Last Exam (med værktøjer)57,2-65,063,6
Terminal-Bench Science64,622,452,630,0
BenchCAD (CAD fra billeder)95,983,384,3-
OSWorld 2.0 (skrivebordsarbejde)72,665,777,9*-
ExploitGym (cyber)42,430,330,4-
SRE-Bench (drift og fejlfinding)88,055,912,5-
Artificial Analysis Intelligence Index (uafhængig)61,26165,763

Alle tal i procent undtagen den nederste række. * Anthropics OSWorld-tal er målt på en anden udgave af testen og kan ifølge Anthropic ikke sammenlignes direkte.

Læst oppefra fortæller tabellen tre forskellige historier.

Kodning er reelt uafgjort. Astras 74,1 på DeepSWE er en klar forbedring over Sol, men den offentlige rangliste har Gemini 3.8 Flash og Claude Opus 5 på omkring 74, og Meta rapporterede tidligere på ugen 75,4 for Muse Spark 1.3 på højeste indstilling. På en test med 113 opgaver svarer forskellen til en eller to opgaver. OpenAIs eget diagram udelader Muse og bruger et Fable-tal på 67,4, hvilket får forspringet til at se større ud, end det samlede billede berettiger. Artificial Analysis' uafhængige kodeindeks kalder det en trevejs deling mellem Fable 5, Fable 5.1 og Astra.

Matematik og naturvidenskab er derimod et ægte spring. 97,6 på FrontierMath Tier 4 og 64,6 på Terminal-Bench Science, der består af 70 forskningsopgaver på kommandolinjen, ligger langt over alt andet på markedet. To forbehold hører med. Epoch AI, der driver FrontierMath, oplyser, at OpenAI har finansieret udviklingen og har eksklusiv adgang til en del af opgaverne. Og ARC-AGI-3-resultatet er målt med et system, der bevarer ræsonnement mellem ture og komprimerer lang kontekst, hvilket OpenAI tidligere har vist kan løfte scoren betydeligt uden at ændre modellen.

Den eneste akademiske række, Astra taber, er Humanity's Last Exam, hvor Fable 5.1 ligger otte point foran. Den række nævnes ikke i OpenAIs egen lanceringstekst. Og på det uafhængige intelligensindeks fra Artificial Analysis ligger Astra på ottendepladsen, bag begge Anthropics topmodeller.

GPT-6 Astra koster det samme som Fable 5.1

Når Astra lander i API'en, koster den 70 kroner per million input-tokens og 350 kroner per million output-tokens. Det er 2,5 gange Sols nuværende kampagnepris og nøjagtig det, Anthropic tager for Fable 5.1. Kontekstvinduet er på lidt over en million tokens med op til 128.000 tokens output, men prompts over 272.000 tokens afregnes til en højere takst.

Model Input per mio. tokens Output per mio. tokens
GPT-6 Astra70 kr350 kr
GPT-6 Astra, fast mode140 kr700 kr
Claude Fable 5.170 kr350 kr
Claude Opus 535 kr175 kr
GPT-5.6 Sol (kampagnepris)28 kr140 kr
Meta Muse Spark 1.39 kr30 kr
Gemini 3.8 Flash (introduktionspris)5 kr26 kr

OpenAIs svar på prisforskellen er, at tokenprisen er en dårlig målestok. "Prisen per opgave er det, der betyder noget", som Brockman formulerede det. Argumentet er, at en model, der løser opgaven i færre trin og med færre genforsøg, kan være billigere i drift trods en højere listepris. OpenAI oplyser, at Astra bruger færre tokens på flere af sine tests, og anslår omkring 57 procent lavere omkostning per løst opgave end Sol på DeepSWE. Tallene fra lanceringen er for tynde til at vise, om besparelsen opvejer prisen mod Opus 5 eller Muse.

ChatGPT Astra er den første model i kritisk cyberklasse

Det mest opsigtsvækkende ved Astra er ikke en score, men en klassifikation. OpenAI oplyser, at modellen har krydset tærsklen for kritisk cyberkapacitet i selskabets Preparedness Framework. I praksis betyder det, at Astra med de rette værktøjer kan finde ukendte sårbarheder og bygge fungerende angrebskæder mod velbeskyttede systemer uden et menneske til at guide hvert trin.

Under test udviklede modellen exploits mod hærdede browsere og styresystemer og fandt to hidtil ukendte sårbarheder, som OpenAI nu indrapporterer til vedligeholderne. På ExploitGym scorer den 42,4 mod 30,3 for Sol, men OpenAI fjernede den sædvanlige tidsgrænse på seks timer for begge modeller. Det er samme kapacitetsniveau, som Anthropics Mythos-modeller udløste frygt for tidligere på året, og OpenAI håndterer det på samme måde: gennem adgangskontrol frem for at holde modellen tilbage.

Konsekvenserne for almindelige brugere er konkrete:

  • Standardudgaven afviser avanceret sikkerhedsarbejde. Det gælder blandt andet søgning efter sårbarheder. Fuld adgang gives kun til godkendte forsvarere gennem Daybreak Blue, som udvides i de kommende uger.
  • Sikkerhedstjek i API'en stopper opgaven. Den sættes ikke på pause og afventer godkendelse. Den afbrydes.
  • Der kan komme falske positiver. OpenAIs Mia Glaese advarede direkte om, at brugere uden for de betroede programmer kan opleve opbremsninger, pauser og blokeringer under sikkerhedsarbejde, og nogle gange under helt urelateret arbejde. "Det er noget, folk bør forvente ved lanceringen", sagde hun.
  • Modstanden mod jailbreaks er styrket. Astra afviste 91,5 procent af forsøgene i OpenAIs cyber-jailbreak-test mod 59 procent for Sol.

De rapporterede cyberresultater er i øvrigt målt med Daybreak Blue-adgang, ikke i den konfiguration, kunderne får som standard.

Mere kapabel, men sværere at kigge over skulderen

OpenAIs påstand om, at Astra er den bedst alignede model, hviler blandt andet på en intern test, hvor modellen gik uden for det tilladte mål i 0 procent af de umulige opgaver mod 48,2 procent for Sol. OpenAI beskriver dog selv den ældre model som kørt "uden produktionssikring", så sammenligningen er ikke helt ren.

Mere interessant er det, OpenAI selv indrømmer. I tests designet til at fremkalde omgåelse af overvågning var Astras skriftlige ræsonnement sværere at overvåge end Sols. Forklaringen er, at modellen har større kontrol over det, den skriver, og løser opgaver med færre skriftlige mellemregninger. Forskningschef Jakub Pachocki sagde det uden omsvøb: "Fremskridt i intelligens garanterer ikke fremskridt i alignment". Han tilføjede, at OpenAI vil holde igen med at skalere, indtil selskabet igen har tilstrækkelig tillid til, at det kan overvåge fremtidige modeller.

Det er samme model, der er trænet med hjælp fra sine forgængere, og som OpenAI nu erklærer som starten på AGI-æraen. Brockman var selv forsigtig: "Jeg overlader det til læseren selv at afgøre, om det kvalificerer for dem. For mig personligt mener jeg, vi er der." Termen er ifølge ham ikke længere knyttet til en kontraktuel udløser i aftalen med Microsoft, men et "missionsbegreb eller spirituelt begreb".

Det, der reelt er nyt, står ikke i benchmarktabellen

ChatGPT 6 Astra er en Fable 5.1-klasse model til Fable 5.1-pris. På kodning og agentarbejde er forskellen til Opus 5, Fable 5.1 og Muse Spark 1.3 inden for måleusikkerheden, og har man allerede en model, der fungerer, giver torsdagens tal ingen grund til at skifte. Det interessante ligger i tre ting, som ikke er scorer:

  • Arbejde i programmer uden API. Astra løser OSWorld-opgaver på gennemsnitligt 40 minutter mod 75 for Sol og demonstreres i Excel, Power BI, Blender og KiCad. Det er første gang, en model fra OpenAI gør skrivebordsautomatisering hurtig nok til at være praktisk, og det er den største enkeltforbedring i lanceringen.
  • Codex husker på tværs af kontekstvinduer. Astra gemmer noter og søger i tidligere beskeder i stedet for at komprimere alt til et resumé, der smider detaljer væk. Den kan også stille et spørgsmål og arbejde videre på det, der ikke afhænger af svaret. Funktionen er eksperimentel nu og bliver standard i de kommende uger.
  • Sikkerhedsfiltrene rammer bredere end sikkerhedsarbejde. OpenAI har selv varslet afbrydelser og falske positiver, også på urelateret arbejde. Alt, der rører drift, netværk eller sårbarhedsscanning, skal testes grundigt mod Astra, før det sættes i produktion.

Og så er der AGI-erklæringen. Brockman kalder det en begyndelse, ikke en afslutning, og hans egen forskningschef siger i samme åndedrag, at modellen er blevet sværere at overvåge. Det er en usædvanlig kombination at sende ud på en lanceringsdag. Den uafhængige rangliste, hvor Astra ligger som nummer otte, og OpenAIs egen, hvor den ligger nummer et, måler ikke det samme, og ingen af dem måler, om AGI-æraen er begyndt.

Kilder: The New Stack · The Decoder · Vellum · The Next Web

Michael Nielsen

Michael Nielsen

Michael Nielsen er AI-konsulent hos Nordium ApS og skriver om AI fra et praktisk standpunkt - hvad virker, hvad er hype, og hvordan danske virksomheder kan bruge teknologien til at skabe reel værdi. Han følger udviklingen tæt og dækker alt fra konkrete værktøjer og automatisering til de større tendenser, der former fremtidens arbejdsmarked.