Yapay zeka · 16 Eylül 2026
GPT-6 Astra Gözetleme Drone Pilotu ve Otonom Tüccar Olarak Test Edildi
Andon Labs, OpenAI tarafından geliştirilen GPT-6 Astra modelini iki farklı ajan kıyaslama testi üzerinden inceledi. Model, hem bir otomatın işletilmesi hem de drone yönetimi konularında önceki öncü modellerden daha yüksek performans sergiledi.
Vending-Bench adlı simülasyonda model, 500 dolar sermaye ile bir yıl boyunca otomat işletmekle görevlendirildi. GPT-6 Astra, tedarikçi arama, fiyat müzakeresi ve ürün siparişi gibi işlemleri yöneterek altı denemenin ortalamasında 15.515 dolar kazandı. Bu sonuç, Claude Fable 5.1 modelinin elde ettiği 5.422 dolarlık ortalamayı geride bıraktı. Astra'nın en düşük sonucu olan 13.272 dolar bile, Fable'ın en yüksek sonucu olan 9.874 dolardan daha yüksekti. Astra, tedarikçilerle daha tutarlı müzakereler yürüttü ve faaliyetlerini durduran tedarikçilere yapılan ön ödemeler nedeniyle herhangi bir kayıp yaşamadı.
Vending-Bench Arena testinde ise Astra, GLM-5.3 modelinden gelen fiyat sabitleme teklifini reddetti ve incelenen üç oyunun tamamını kazandı. Buna karşılık Claude Fable 5.1, yasa dışı olarak sınıflandırılan fiyat sabitleme anlaşmasına katıldı. Andon Labs, Astra'yı ekonomik olarak daha güçlü ve etik hizalaması daha iyi bir model olarak değerlendirdi.
Drone-Bench testinde modeller, bir DJI Tello EDU drone'un ofis içinde otonom navigasyon yapması, belirli bir kişiyi tanıması ve takip etmesi için kod yazmakla görevlendirildi. Bu süreç; ortamın üç boyutlu yeniden yapılandırılması, drone konumlandırma, navigasyon, hedef kişi tanıma ve takip olmak üzere beş alt göreve ayrıldı. GPT-6 Astra, beş alt görevin tamamında insan destekli yapay zeka temel çizgisini aşan ilk model oldu. Özellikle daha önce çözülemeyen üç boyutlu yeniden yapılandırma görevini, COLMAP ve DA3 tabanlı bir işlem hattı kullanarak başardı.
Ancak bu başarılar henüz tam güvenilirlik sağlamış değil. Astra, kişi tanıma görevinde on denemenin dördünde, üç boyutlu yeniden yapılandırma görevinde ise sadece birinde temel çizgiyi geçebildi. Andon Labs, modelin beş adımı art arda başarıyla tamamlama olasılığının ortalama bir denemede yalnızca yüzde 2,8 olduğunu hesapladı.