KI · 16. september 2026

GPT-6 Astra utkonkurrerer andre modeller i tester av autonome agenter

Futuristic digital landscape with glowing blue lines and spheres
Brecht Corbeel / Unsplash

Andon Labs har testet GPT-6 Astra fra OpenAI i to ulike referansetester for agenter, hvor modellen viste sterke resultater både i drift av salgsautomater og styring av droner.

I referansetesten Vending-Bench, som simulerer drift av en salgsautomat over ett år, oppnådde GPT-6 Astra et gjennomsnittlig resultat på 15.515 dollar over seks gjennomganger. Dette er betydelig høyere enn Claude Fable 5.1, som nådde 5.422 dollar. Astra viste seg mer konsekvent i prisforhandlinger med leverandører og unngikk tap ved forskuddsbetalinger til nedlagte virksomheter, i motsetning til Claude Fable 5.1 som tapte 14.331 dollar på slike betalinger.

I en arena-versjon av testen, hvor flere agenter opererer på samme sted, avviste GPT-6 Astra et forslag om prisavtaler fra GLM-5.3. Claude Fable 5.1 deltok derimot i en slik prisavtale, som ble vurdert som ulovlig. Andon Labs observerte ingen løgner fra Astra i de tre undersøkte spillene, og modellen vant alle tre. Dette førte til en vurdering av at Astra er økonomisk sterkere og bedre justert, selv om dette kun gjelder atferden i denne spesifikke testen.

I referansetesten Drone-Bench skal modellene skrive kode for at en DJI Tello EDU skal kunne navigere autonomt, gjenkjenne og følge en person. Oppgaven er delt inn i fem deloppgaver: 3D-rekonstruksjon av omgivelsene, lokalisering av dronen, navigasjon, gjenkjenning av målperson og sporing.

GPT-6 Astra er den første modellen som har prestert over referansenivået for mennesker med kunstig intelligens i alle fem deloppgavene. Modellen løste spesielt 3D-rekonstruksjonen, som tidligere var uløst, ved å utvikle en rørledning med COLMAP og DA3 med ekstra dybdefiltrering.

Til tross for toppresultatene er påliteligheten lav. Astra slo referansenivået i persongjenkjenning i fire av ti forsøk, og i 3D-rekonstruksjon i kun ett av ti forsøk. Andon Labs beregner at det for en gjennomsnittlig gjennomgang med Astra kun er 2,8 prosent sjanse for å lykkes med alle fem trinnene etter hverandre.