Det mest konkrete svar på hvor langt vi er fra AGI er ikke et årstal. Det er en varighed, og den er vokset fra fire minutter til over tolv timer på tre år.
METR, det amerikanske institut der måler AI-modellers selvstændighed, opgør hvor lange opgaver en model kan gennemføre med 50 procents succesrate. GPT-4 lå på fire minutter i marts 2023. Claude Opus 4.5 nåede knap fem timer i november 2025, og Claude Opus 4.6 ligger et kvartal senere på omkring tolv timer. Fordoblingstiden er godt seks måneder set over hele perioden, men nede på cirka fire måneder for modeller udgivet siden 2023. Det er accelerationen, sat i tal.
Forbeholdene er større end selve tallet. Hæver man kravet fra 50 til 80 procents pålidelighed, skrumper horisonten til mellem en fjerdedel og en tiendedel: Opus 4.6 falder fra tolv timer til 70 minutter. Årsagen er den samme hver gang, nemlig at en tidlig fejl vælter hele kæden uden at modellen opdager det.
Usikkerheden på selve målingen er mindst lige så stor. Det 95 procents interval omkring de tolv timer går fra fem til tres timer. METR skriver selv, at målinger over 16 timer ikke er troværdige med den nuværende opgavesamling, og den højeste offentliggjorte måling, en tidlig udgave af Claude Mythos, ligger på 17 timer. Kurven er med andre ord løbet ud over den lineal der måler den, og for de allernyeste modeller, Astra iberegnet, findes der slet ikke et offentligt tal.
De tal alle citerer, måler ikke det man tror
Benchmarks er holdt op med at kunne svare på spørgsmålet, og det bedste eksempel er den model der udløste hele debatten. Ved lanceringen af ChatGPT 6 Astra oplyste OpenAI en score på 98,6 procent på ARC-AGI-3, testen der er designet specifikt til at måle generel intelligens. Da ARC Prize kørte den samme model gennem sin egen neutrale opsætning, blev resultatet 62,7 procent. Forskellen er 36 procentpoint på identisk model og identisk test, og den skyldes udelukkende teknisk opsætning.
Værre er det, som forskere fra Berkeley RDI dokumenterede i april 2026. Syv ud af otte af de store agent-benchmarks kan presses mod 100 procent uden at opgaven reelt løses. På SWE-bench kan ti linjer i en conftest.py-fil få alle 500 tests til at bestå. METR har målt, at modellen o3 gør netop den slags i 30,4 procent af 128 kørsler, uden at være bedt om det.
Det giver et marked hvor to seriøse ranglister kan uddele førstepladsen til hver sin model. Astra lå oprindeligt nummer otte på Artificial Analysis' intelligensindeks, rykkede til nummer to efter en metodeopdatering og lå stadig bag Claude Fable 5.1. På Epoch AIs sammensatte indeks med over 50 tests lå den nummer et ud af 267 modeller. Begge dele er korrekte. Ingen af dem måler AGI.
Derfor kalder OpenAI ChatGPT 6 for AGI
Greg Brockman afsluttede pressemødet med "Welcome to the AGI era" og tilføjede om Astra, at "I think it might be about this model". I samme åndedrag kaldte han AGI "a gray, fuzzy thing" uden nogen fælles definition. Det er ikke en teknisk påstand. Det er en beslutning om ordvalg.
Beslutningen blev billigere at træffe i april 2026. Frem til da indeholdt aftalen mellem OpenAI og Microsoft en klausul om, at Microsoft mistede sin licensadgang den dag OpenAI erklærede AGI. I oktober 2025 blev den blødt op, så en erklæring skulle bekræftes af et uafhængigt ekspertpanel. I april blev den fjernet helt. Fra det tidspunkt kostede ordet ingenting.
Til gengæld er der noget at vinde. OpenAI lukkede i marts 2026 en runde på 122 milliarder dollars til en værdiansættelse på 852 milliarder, skal finansiere Stargate-programmet på 500 milliarder dollars og havde et nettotab på 38,5 milliarder dollars i 2025. En børsnotering peger mod 2027 til over en billion dollars. AI-forskeren Toby Walsh formulerede sammenhængen tørt: Altman har selv kaldt AGI et dårligt defineret og irrelevant marketingbegreb, men "it is not so meaningless to OpenAI, who need to achieve it to continue to raise funds successfully".
Selskabets egne målestokke er heller ikke enige med festtalen. OpenAIs charter definerer AGI som systemer der overgår mennesker på det meste økonomisk værdifulde arbejde, og selskabets femtrinsskala placerer AGI på niveau fem, hvor AI kan varetage en hel organisations funktion. Rapporteringen placerer de nuværende systemer omkring niveau to til tre. Forskningschef Mark Chen sagde i august 2026, at OpenAI er "80 procent af vejen".
Det AI stadig ikke kan, og som ingen keynote nævner
I oktober 2025 udgav en gruppe med blandt andre Dan Hendrycks, Yoshua Bengio, Gary Marcus og Max Tegmark et forsøg på at gøre AGI måleligt. De brød menneskelig kognition op i ti domæner efter en etableret psykometrisk model og scorede modellerne domæne for domæne. GPT-4 landede på 27 procent. GPT-5 på 57.
Det interessante er ikke gennemsnittet, men formen. Begge modeller scorede nul procent på langtidshukommelse. Profilen er takket, ikke jævn: en model kan ligge på ekspertniveau i matematisk ræsonnement og samtidig være ude af stand til at lære noget nyt og beholde det. Den mangel er ikke kosmetisk. Den er grunden til, at en model kan løse en svær opgave i dag og starte forfra i morgen, og den er den mest konkrete forskel på det vi har nu og det ordet AGI beskriver.
De øvrige huller er lige så konkrete. På ARC-AGI-3 løser mennesker opgaverne ved første forsøg, mens modellerne skal have langt flere eksempler for at nå halvvejs, hvilket er selve definitionen på dårlig generalisering. I den fysiske verden er afstanden endnu større: Epoch AI gennemgik i juli 2026 Figures opvaskerobot og fandt, at den ikke håndterer bestik, arbejder omkring 40 procent langsommere end et menneske og ikke har vist overførsel til nye køkkener.
Samtidig er den akse, der løftede modellerne fra 2020 til 2024, ved at flade ud. Ilya Sutskever satte ord på det i november 2025, da han beskrev 2020 til 2025 som "the age of scaling" og erklærede feltet på vej tilbage til "the age of research". Det der har erstattet skaleringen, er reinforcement learning og regnekraft brugt på selve svaret, og den akse virker målbart. Epochs kapacitetsindeks steg omkring seks point om året før ræsonneringsmodellerne og cirka 14 efter. Men arbejde præsenteret på ICLR 2026 peger på, at RL-skalering følger en mættende kurve frem for den lige linje i log-log-diagrammet, som pretraining fulgte. Vi har altså skiftet motor, og vi ved endnu ikke hvor langt den nye kan køre.
Tusindvis af agenter der forbedrer sig selv er stadig et rygte
Forestillingen om agentsværme, der arbejder døgnet rundt på supercomputere med at gøre sig selv klogere, er den mest udbredte version af hvordan AGI ankommer. Der findes ingen dokumenteret forekomst af den. Andrej Karpathys autoresearch-projekt, som ofte nævnes som eksemplet, kører på en enkelt GPU, og den passage om en sværm i tiende tusinde generation, der citeres flittigt, er af forfatteren selv markeret som fiktion.
Det der faktisk er dokumenteret, er mindre og mere interessant. Anthropic oplyste i juni 2026, at over 80 procent af den kode selskabet merger i produktion, er skrevet af Claude, mod lave encifrede procenter halvandet år tidligere. Mere sigende er et andet af deres tal: Claudes vurdering af hvilken forskningsretning der var værd at forfølge, matchede menneskers valg 51 procent af tiden i november 2025 og 64 procent i april 2026. Google DeepMinds AlphaEvolve har kørt i produktion i over et år og henter løbende omkring 0,7 procent af Googles globale regnekraft hjem gennem bedre planlægning, foruden at slå en 56 år gammel rekord for multiplikation af 4x4-matricer. OpenAI oplyste ved lanceringen af GPT-5.3-Codex, at tidlige versioner af modellen hjalp med at fejlsøge sin egen træning.
Grænsen viser sig tydeligst i NanoGPT-speedrunnet, hvor deltagere kappes om at træne en sprogmodel hurtigst muligt. Træningstiden faldt fra 45 minutter til 1 minut og 43 sekunder på under to år. Men da METR gennemgik de 77 rekorder i april 2026, var kun fire sat af AI, og de blev vurderet som overfladiske til moderate tilpasninger af kendte teknikker. Prime Intellect lod agenter køre autonomt i to uger med omkring 10.000 kørsler og fik en ny rekord ud af det, men konklusionen var, at agenterne "struggle to come up with new ideas on their own".
METRs egne forskningstests siger det samme med tal. Får en model to timer til en ML-forskningsopgave, klarer den sig omkring fire gange bedre end en menneskelig ekspert på samme tid. Får begge parter otte timer, scorer modellen 0,5 til 0,8 hvor eksperten er 1,0. AI vinder sprinten og taber maratonet, og AI-forskning er et maraton.
Regnestykket bag en tidslinje
Hvis kapaciteten er usikker, er pengene det ikke. Microsoft, Alphabet, Amazon og Meta brugte tilsammen omkring 135 milliarder dollars på infrastruktur i 2023. For 2026 lyder de samlede udmeldinger på cirka 725 milliarder, godt fem billioner kroner. Det er en femdobling på tre år, og guidance blev hævet undervejs i både april og juli 2026.
Regnekraften til de største træningsforløb vokser fire til fem gange om året, hvilket svarer til en fordobling hver femte måned, og tempoet i udgivelserne følger med: der gik i gennemsnit 37,5 dage mellem to frontier-modeller i 2023 og 11 dage i 2026.
Den slags kurver kan ikke fortsætte ret længe, og bremsen er hverken chips eller idéer. Den er strøm. Køen af projekter, der venter på nettilslutning hos den texanske netoperatør ERCOT, voksede fra 63 til 226 gigawatt på et år, og den typiske ventetid er fordoblet til over fire år. Leveringstiden på store transformere er strakt fra to et halvt til mellem tre og fem år. HBM-hukommelse, som acceleratorerne ikke kan undvære, er udsolgt hos Samsung, SK Hynix og Micron helt ind i 2027.
Hvor meget den udbygning fylder, ses i nationalregnskabet. Investeringer i it-udstyr og software stod for 92 procent af den amerikanske BNP-vækst i første halvår 2025. Trækker man dem fra, voksede økonomien 0,1 procent. Væksten hviler altså på en anlægsøkonomi med lange leveringstider, ikke på en softwareøkonomi.
Med det for øje ser prognoserne sådan ud:
| Kilde | Forventning | Bemærkning |
|---|---|---|
| Demis Hassabis, Google DeepMind | Omkring 2030 | "Give or take a year", maj 2026 |
| Daniel Kokotajlo, AI Futures | Median 2031 | Forfatteren bag AI 2027, egen revision feb. 2026 |
| Metaculus, samlet forudsigelse | 50 procent inden 2033 | 25 procent inden 2029 |
| Dario Amodei, Anthropic | Inden 2036 | 90 procents konfidens, feb. 2026 |
| Gary Marcus | 2034 til 2041 | Afviser at nuværende erklæringer betyder noget |
| Yann LeCun, AMI Labs | Ikke ad denne vej | Kalder LLM-sporet til menneskeniveau "complete nonsense" |
Medianen i markedsbaserede og samlede forudsigelser ligger omkring 2031 med et 80 procents interval fra 2027 til 2044. Det interval er den ærlige version af svaret.
Kommer USA eller Kina først
USA fører, men mindre end retorikken antyder. Epoch AI har målt afstanden mellem den bedste kinesiske og den bedste amerikanske model siden 2023, og gennemsnittet er syv måneder med udsving fra fire til fjorten. Stanfords AI Index opgjorde i april 2026 forskellen på standardbenchmarks til 2,7 procentpoint, mod mellem 17 og 32 procentpoint i 2023. Den amerikanske AI-rådgiver David Sacks satte forspringet til seks til ni måneder, og Jensen Huang har formuleret det som at Kina er "nanoseconds behind America".
Forskellen ligger i regnekraft. USA råder over omkring 75 procent af verdens AI-supercomputerkapacitet mod Kinas cirka 15 procent. Eksportkontrollen virker delvist: Nvidias H20-salg til Kina endte på nul dollars i et kvartal, fordi kinesiske myndigheder selv frarådede brugen, mens Epoch AI anslår, at omkring 660.000 H100-ækvivalenter alligevel fandt vej ind i landet i 2025, svarende til en tredjedel af Kinas samlede kapacitet. Huaweis Ascend 910C yder omkring en tredjedel af en Nvidia B200, og produktionsmålet på 600.000 enheder i 2026 bremses reelt til 250.000 til 300.000 af mangel på hukommelse.
Til gengæld har Kina det, USA er ved at løbe tør for. Kinesisk elproduktion er over 10.000 terawatt-timer om året mod USA's godt 4.200, datacenterkapaciteten går fra 32 til 40 gigawatt i løbet af 2026, og strøm er som nævnt den bindende begrænsning i den amerikanske ende.
Kinesiske modeller står for 41 procent af alle downloads på Hugging Face og har dermed overhalet de amerikanske, og Qwen og DeepSeek udgiver frit vægtene på modeller der ligger få point fra toppen. Kina indleverede over 43.000 patentfamilier inden for generativ AI i 2024 og 2025 mod USA's 4.380. Om talent er billedet blandet: 38 procent af verdens topforskere tog deres bachelor i Kina, men 72 procent af dem arbejder i USA.
Jeffrey Ding fra RAND har argumenteret for, at hele spørgsmålet er stillet forkert. Historisk er teknologiske kapløb ikke afgjort af hvem der byggede først, men af hvem der fik teknologien bredt i brug. Kinesiske modellers andel af den globale AI-trafik gik fra 3 til 13 procent på to måneder i efteråret 2025. Den samme logik gælder på virksomhedsniveau, hvor udbyttet afhænger af hvor mange processer der reelt er lagt om, ikke af hvilken model man har adgang til, og hvor de fleste projekter stadig falder på AI-rådgivning og prioritering frem for på modellernes evner.
Det bringer os tilbage til de tolv timer. Kurven for hvor længe en model kan arbejde selvstændigt, er stejl og bliver stejlere, men den måler noget helt andet end det ord der blev sagt fra scenen i San Francisco. Astra kan formentlig arbejde længere i træk end nogen model før den. Den kan stadig ikke huske noget fra i går. Den dag nogen med rette kan erklære AGI, bliver det ikke fordi et tal er passeret, men fordi hukommelse, pålidelighed og selvstændighed er nået samme sted hen, og lige nu er det ikke idéerne der afgør hvornår. Det er en transformerstation i Texas med fire års leveringstid.
Kilder: METR · A Definition of AGI · ARC Prize · Epoch AI · Anthropic · Axios


