AI · 29 września 2026
Dostępne również w العربية
Nvidia opracowała system redukujący koszty tokenów w agentach programistycznych
Nvidia stworzyła metodę automatycznej optymalizacji warstwy sterującej agentów programistycznych, znanej jako Harness, co pozwala na zmniejszenie zużycia tokenów o niemal połowę przy zachowaniu zbliżonej wydajności.
Nowy system o nazwie SoL-Pi koncentruje się na optymalizacji interakcji między modelem a środowiskiem, takimi jak Codex, Claude Code lub OpenClaw, zamiast modyfikować sam model. Rozwiązanie to wykorzystuje agenta badawczego, który analizuje ślady działania innego agenta, proponuje zmiany w logice sterowania i testuje je w przygotowanych środowiskach. Proces ten jest inspirowany rekurencyjną samopoprawą.
Podczas prac system zbadał 152 kierunki podejścia w 535 wykonywalnych środowiskach. Testy objęły 495 zadań pochodzących z par pull request i problemów z GitHub oraz 40 syntetycznych przypadków testowych, co przełożyło się na ponad 3000 przebiegów i ponad 60 000 interakcji. Aby uniknąć nadmiernego dopasowania do zadań treningowych, badacze oddzielili proces wyszukiwania od oceny, wykorzystując do finalnej weryfikacji benchmark EdgeBench.
Optymalizacja doprowadziła do stworzenia czterech mechanizmów. Action Fusion łączy dwa kolejne kroki w jeden, eliminując jedno wywołanie modelu. Online Context Compact skraca zgromadzony kontekst po każdym kroku planowania. ObservationPack archiwizuje długie wyjścia z narzędzi, wstawiając jedynie krótkie podsumowania. Evidence-Preserving Reducer przesyła obszerne logi błędów do tańszego modelu w celu ich streszczenia.
Według badaczy, najbardziej oszczędna wersja SoL-Pi zużywa o 49 procent mniej tokenów, osiągając 93,7 procent wyniku oryginalnego systemu Pi. W zależności od konfiguracji, zużycie tokenów spada o 44,7 do 49 procent. W porównaniu do Codex i Claude Code, SoL-Pi oszczędza odpowiednio 50 procent i 54,3 procent na EdgeBench.
Szacowane oszczędności finansowe przy obecnych cenach interfejsów programistycznych wynoszą od 8,75 do 13,50 dolarów amerykańskich na godzinę w stosunku do natywnych rozwiązań Codex i Claude Code, oraz od 4,36 do 5,71 dolarów amerykańskich w porównaniu do Pi. System opracowano przy użyciu GPT-5.6 Sol, a następnie zastosowano go do Opus 5, gdzie zachowano 94,3 procent wydajności Pi.
Wyniki na innych benchmarkach są mniej spójne. W Terminal-Bench 4 SoL-Pi rozwiązał 15 z 63 zadań procesora, podczas gdy Codex i Pi rozwiązały po 18, choć całkowite koszty w porównaniu do Pi były o ponad jedną czwartą niższe.