IA · 29 septembre 2026
Nvidia réduit les coûts de jetons des agents de codage grâce à une optimisation de la couche de contrôle
Nvidia a développé un système nommé SoL-Pi qui optimise automatiquement la couche de contrôle, appelée Harness, des agents de codage pour réduire la consommation de jetons.
Le système utilise un agent de recherche pour analyser les traces d'un autre agent, proposer des modifications à la couche de contrôle et les tester dans des environnements préparés. Cette approche, inspirée de l'auto-amélioration récursive, a permis d'explorer 152 directions d'approche au sein de 535 environnements exécutables. Le processus a impliqué plus de 3 000 cycles et 60 000 interactions entre l'agent et son environnement, incluant 495 tâches dérivées de paires de demandes de pull et de problèmes GitHub, ainsi que 40 cas de test synthétiques.
L'optimisation a abouti à quatre mécanismes spécifiques. L'Action Fusion combine deux étapes consécutives, comme une modification de code et son test, pour supprimer un appel au modèle de langage. L'Online Context Compact réduit le contexte accumulé après chaque étape de planification. L'ObservationPack archive les sorties d'outils volumineuses et n'insère que des résumés. Enfin, l'Evidence-Preserving Reducer utilise un modèle moins coûteux pour condenser les journaux d'erreurs et de tests sans perdre d'informations cruciales.
Selon les chercheurs, la variante la plus économe de SoL-Pi réduit la consommation de jetons de 49 pour cent tout en conservant 93,7 pour cent du score du Harness Pi original. Globalement, la consommation de jetons diminue de 44,7 à 49 pour cent selon la variante choisie. Sur le benchmark EdgeBench, SoL-Pi a économisé 50 pour cent par rapport à Codex et 54,3 pour cent par rapport à Claude Code.
En termes financiers, les auteurs estiment l'économie entre 8,75 et 13,50 dollars américains par heure par rapport aux Harness natifs de Codex et Claude Code, et entre 4,36 et 5,71 dollars américains par rapport à Pi. Le système a été développé avec GPT-5.6 Sol et appliqué sans ajustement à Opus 5, où il a maintenu 94,3 pour cent de la performance de Pi.
Les résultats varient sur d'autres tests. Sur Terminal-Bench 4, SoL-Pi a résolu 15 tâches sur 63, contre 18 pour Codex et Pi, bien que les coûts totaux aient été réduits d'un quart par rapport à Pi.