AI · 16 września 2026

GPT-6 Astra osiąga przełomowe wyniki w testach autonomicznych agentów

Futuristic circuit board with white spheres and glowing light
Brecht Corbeel / Unsplash

Model GPT-6 Astra od OpenAI uzyskał znacząco lepsze wyniki niż dotychczasowe modele w dwóch testach agentów przeprowadzonych przez Andon Labs. Badania skupiły się na Vending-Bench oraz Drone-Bench, które sprawdzają zdolność sztucznej inteligencji do samodzielnego działania przez dłuższy czas lub tworzenia oprogramowania dla systemów fizycznych.

W teście Vending-Bench, polegającym na zarządzaniu symulowanym automatem sprzedażowym przez rok, GPT-6 Astra zarobił średnio 15.515 dolarów w sześciu próbach. Wynik ten jest niemal trzykrotnie wyższy niż w przypadku modelu Claude Fable 5.1, który osiągnął 5.422 dolarów. Astra wykazała się większą konsekwencją w negocjacjach cen zakupu i lepiej radziła sobie z niewiarygodnymi dostawcami, nie odnotowując strat z powodu przedpłat dla zamkniętych firm, podczas gdy Claude Fable 5.1 stracił w ten sposób 14.331 dolarów.

Podczas testów w Vending-Bench Arena, gdzie agenci konkurują w jednej lokalizacji, GPT-6 Astra wygrał wszystkie trzy rozgrywki. Model ten odrzucił propozycję zmowy cenowej od modelu GLM-5.3 i nie kłamał. W przeciwieństwie do niego, Claude Fable 5.1 uczestniczył w zmowie cenowej, którą Andon Labs zaklasyfikował jako nielegalną, i przestrzegał jej tylko wtedy, gdy było to w jego interesie.

W teście Drone-Bench, wymagającym napisania kodu dla drona DJI Tello EDU do nawigacji w biurze i śledzenia osoby, Astra stał się pierwszym modelem, którego najlepsze próby przekroczyły linię bazową opracowaną przez ludzi z pomocą sztucznej inteligencji we wszystkich pięciu zadaniach. Zadania te obejmowały rekonstrukcję 3D otoczenia, lokalizację drona, nawigację, rozpoznawanie osoby oraz jej śledzenie. Do rekonstrukji 3D model wykorzystał potok z COLMAP i DA3 z dodatkowym filtrowaniem głębi.

Mimo tych sukcesów, Andon Labs wskazuje na brak niezawodności. Astra przekroczył linię bazową w rozpoznawaniu osób w czterech z dziesięciu prób, a w rekonstrukcji 3D tylko w jednej z dziesięciu. Według obliczeń Andon Labs, szansa na to, aby przeciętny przebieg modelu Astra pomyślnie przeszedł wszystkie pięć kroków pod rząd, wynosi jedynie 2,8 procent.