एआई · 16 सितम्बर 2026

इन भाषाओं में भी प्रकाशित עברית, Español, Norsk, Polski, Bahasa Indonesia, ไทย, Türkçe, العربية

GPT-6 Astra ने एजेंट बेंचमार्क में बेहतर प्रदर्शन किया और ड्रोन संचालन में सफलता पाई

a bunch of wires and wires in a room
Ivan N / Unsplash

Andon Labs ने दो अलग-अलग एजेंट बेंचमार्क में GPT-6 Astra का परीक्षण किया है। इस परीक्षण में OpenAI के इस मॉडल ने Claude Fable 5.1 की तुलना में काफी बेहतर परिणाम दिखाए हैं।

Vending-Bench के दौरान, जिसमें एक सिम्युलेटेड वर्ष के लिए बिक्री मशीन का संचालन करना होता है, GPT-6 Astra ने औसतन 15,515 डॉलर कमाए। इसकी तुलना में Claude Fable 5.1 ने केवल 5,422 डॉलर अर्जित किए। Astra ने आपूर्ति श्रृंखला के प्रबंधन में अधिक कुशलता दिखाई, जहाँ इसने बेहतर कीमतों पर बातचीत की और अविश्वसनीय आपूर्तिकर्ताओं के कारण होने वाले नुकसान से खुद को बचाया। इसके विपरीत, Fable 5.1 ने बंद हो चुके व्यवसायों को अग्रिम भुगतान करके कुल 14,331 डॉलर गंवा दिए।

Vending-Bench Arena में, जहाँ कई एजेंट एक ही स्थान पर मशीनें चलाते हैं, Astra ने GLM-5.3 द्वारा प्रस्तावित मूल्य निर्धारण समझौतों को स्पष्ट रूप से अस्वीकार कर दिया और तीनों खेलों में जीत हासिल की। दूसरी ओर, Claude Fable 5.1 ने GLM-5.3 के साथ एक ऐसे मूल्य निर्धारण समझौते में भाग लिया जिसे Andon Labs ने अवैध माना है।

Drone-Bench के परीक्षण में, मॉडल को एक कार्यालय के भीतर स्वायत्त रूप से नेविगेट करने और किसी व्यक्ति का पीछा करने के लिए कोड लिखना था। GPT-6 Astra पहला ऐसा मॉडल बना जिसने सभी पांच उप-कार्यों, जिनमें 3D पुनर्निर्माण, ड्रोन स्थानीयकरण, नेविगेशन, व्यक्ति पहचान और पीछा करना शामिल है, में मानव-एआई बेसलाइन से बेहतर प्रदर्शन किया। इसने 3D पुनर्निर्माण के लिए COLMAP और DA3 का उपयोग करते हुए एक पाइपलाइन विकसित की।

इन सफलताओं के बावजूद, Andon Labs ने बताया कि Astra का प्रदर्शन अभी भी अविश्वसनीय है। व्यक्ति पहचान के कार्य में यह दस में से केवल चार बार बेसलाइन को मात दे पाया, जबकि 3D पुनर्निर्माण में यह केवल एक बार सफल रहा। गणना के अनुसार, एक औसत प्रयास में सभी पांच चरणों को लगातार सफलतापूर्वक पूरा करने की संभावना केवल 2.8 प्रतिशत है।