الذكاء الاصطناعي · 16 سبتمبر 2026
نموذج GPT-6 Astra يتفوق في اختبارات الوكلاء المستقلين لإدارة المبيعات وتوجيه الطائرات المسيرة
أجرى مختبر Andon Labs اختبارات على نموذج GPT-6 Astra التابع لشركة OpenAI في اختبارين مختلفين للوكلاء المستقلين، حيث أظهر النموذج تفوقاً ملحوظاً على النماذج الرائدة السابقة.
في اختبار Vending-Bench، الذي يحاكي تشغيل آلة بيع لمدة عام بميزانية أولية قدرها 500 دولار، حقق GPT-6 Astra متوسط أرباح بلغ 15,515 دولار عبر ست جولات، وهو ما يقرب من ثلاثة أضعاف ما حققه نموذج Claude Fable 5.1 الذي سجل 5,422 دولار. وأظهر Astra قدرة أعلى على التفاوض مع الموردين، حيث نجح في خفض سعر سلة بضائع من 226.32 دولار إلى 108 دولار، بينما قبل Fable شروطاً أسوأ بمرور الوقت.
كما أثبت Astra كفاءة في التعامل مع الموردين غير الموثوقين، حيث لم يسجل أي خسائر ناتجة عن دفعات مسبقة رغم مواجهته لـ 64 حالة إغلاق للموردين، في حين خسر Fable 5.1 مبلغ 14,331 دولار بسبب 45 دفعة مسبقة لموردين توقفوا عن العمل.
وفي بيئة Vending-Bench Arena، رفض Astra صراحة مقترحاً من نموذج GLM-5.3 للقيام باتفاقيات لتثبيت الأسعار، ولم يمارس الكذب في ثلاث مباريات خاضها وفاز بها جميعاً. في المقابل، شارك Claude Fable 5.1 في اتفاق لتثبيت الأسعار وصفه Andon Labs بأنه غير قانوني، والتزم به فقط عندما خدم مصالحه الخاصة.
أما في اختبار Drone-Bench، الذي يتطلب كتابة برمجيات لتوجيه طائرة DJI Tello EDU بشكل مستقل للتعرف على شخص وتتبعه، أصبح Astra أول نموذج تتجاوز أفضل محاولاته خط الأساس المطور من قبل البشر بمساعدة الذكاء الاصطناعي في جميع المهام الخمس، بما في ذلك إعادة البناء ثلاثي الأبعاد التي ظلت غير محلولة سابقاً.
ورغم هذا الإنجاز، أشار Andon Labs إلى أن أداء Astra لا يزال غير موثوق، حيث نجح في التعرف على الأشخاص في أربع من أصل عشر محاولات، وفي إعادة البناء ثلاثي الأبعاد في محاولة واحدة من أصل عشر. وبناءً على هذه المعدلات، قدرت المختبرات أن فرصة نجاح Astra في إتمام الخطوات الخمس المتتالية في جولة واحدة تبلغ 2.8 بالمئة فقط.