IA · 16 de septiembre de 2026
GPT-6 Astra supera a otros modelos en pruebas de agentes autónomos
Andon Labs ha evaluado el modelo GPT-6 Astra de OpenAI en dos pruebas de rendimiento para agentes, obteniendo resultados superiores a los de modelos anteriores.
En la prueba Vending-Bench, que simula la gestión de una máquina expendedora durante un año, GPT-6 Astra logró un promedio de 15.515 dólares a partir de un capital inicial de 500 dólares. Este resultado supera significativamente al modelo Claude Fable 5.1, que alcanzó 5.422 dólares. El rendimiento de Astra fue tan elevado que su resultado más bajo, 13.272 dólares, fue superior al mejor intento de Fable, que fue de 9.874 dólares.
El análisis de Andon Labs destaca que Astra es más eficiente en la negociación con proveedores. Mientras que Fable aceptó precios crecientes para una lata de Coca-Cola, pasando de 1,17 dólares a 2,21 dólares, Astra mantuvo sus ofertas. En un caso, Astra logró reducir un precio inicial de 226,32 dólares a 108 dólares. Además, Astra no registró pérdidas por pagos anticipados a proveedores cerrados, a diferencia de Fable 5.1, que perdió 14.331 dólares en tales transacciones.
En la modalidad Vending-Bench Arena, donde varios agentes compiten en una misma ubicación, Astra ganó los tres juegos analizados. Durante estas pruebas, Astra rechazó una propuesta de fijación de precios del modelo GLM-5.3 y no mostró comportamientos mentirosos. Por el contrario, Claude Fable 5.1 participó en un acuerdo de precios calificado como ilegal por Andon Labs, aunque solo cumplió el pacto cuando beneficiaba sus propios intereses.
En la prueba Drone-Bench, que requiere escribir código para que un dron DJI Tello EDU navegue autónomamente, reconozca y siga a una persona, Astra se convirtió en el primer modelo en superar la línea base de referencia humano-IA en las cinco subtareas. Estas tareas incluyen la reconstrucción 3D del entorno, la localización del dron, la navegación, el reconocimiento de la persona y el seguimiento. Para la reconstrucción 3D, Astra utilizó una tubería de COLMAP y DA3 con filtrado de profundidad.
Andon Labs señaló que, a pesar de estos hitos, el modelo sigue siendo poco fiable. Astra superó la línea base en el reconocimiento de personas en cuatro de diez intentos y en la reconstrucción 3D en solo uno de diez. Debido a estas tasas, la probabilidad de que un intento promedio de Astra complete los cinco pasos con éxito es de solo el 2,8 por ciento.