AI · 7 października 2026
Badacze Google opracowali metodę zapobiegającą zapamiętywaniu zadań przez agentów sztucznej inteligencji
Badacze z Google Cloud AI Research oraz kilku uniwersytetów opracowali nową metodę, która ma zapobiegać nadmiernej specjalizacji agentów sztucznej inteligencji w zadaniach testowych podczas optymalizacji ich środowiska pracy.
Współcześni agenci opierają się na tzw. rusztowaniu, czyli strukturze składającej się z podpowiedzi, planów przebiegu, narzędzi, pamięci oraz sterowania widocznością danych dla modelu. To rusztowanie decyduje o tym, czy agent poprawnie odczyta plik przed jego zmianą, jak poradzi sobie z błędem oraz czy dostarczy wyniki w odpowiedniej formie. Według publikacji naukowej większość ostatnich postępów w tej dziedzinie wynika z pracy nad tymi strukturami, a nie z tworzenia nowych modeli.
Nowoczesne podejścia automatyzują proces ulepszania rusztowania, wykorzystując model językowy do wprowadzania zmian na podstawie informacji zwrotnych z zadań testowych. Badacze określają to jako praktyczną formę rekursywnej samodoskonalenia. Zauważyli oni jednak, że proces ten prowadzi do sytuacji, w której agent de facto uczy się zadań testowych na pamięć. Powoduje to wzrost wydajności w zadaniach treningowych, ale zyski znikają lub maleją w przypadku nowych, nieznanych wcześniej zadań.
Rozwiązaniem ma być metoda RRSI, czyli uregulowana rekursywna samodoskonalenie rusztowań agentów. System ten wprowadza ograniczenia w dwóch punktach pętli optymalizacji. Po pierwsze, budżet ogranicza liczbę niezależnych dostosowań, jakie może wprowadzić kandydat, a limit ten maleje z czasem. Po drugie, krytyk odrzuca propozycje zawierające nazwy zadań, rozwiązania lub inne sztuczki specyficzne dla konkretnych testów. Dodatkowo wyższe koszty obliczeniowe są akceptowane tylko przy mierzalnym wzroście wydajności, a nieużyteczne komponenty są usuwane.
Metoda RRSI została przetestowana na ośmiu zestawach testowych w obszarach programowania, pracy biurowej i projektowania inżynieryjnego, przy użyciu zamrożonego modelu Claude Opus 4.8. Wyniki wykazały zysk do 14,1 punktu w zadaniach treningowych oraz do 4,7 punktu w pięciu nieznanych wcześniej testach. Jednocześnie zużycie tokenów w działaniu było o około 30 procent niższe niż w wersji nieuregulowanej. RRSI osiągnęła najmniejszy wzrost w treningu spośród wszystkich badanych metod, ale jako jedyna znacząco przekroczyła wartość początkową w zadaniach nieznanych.
Badania wykazały również, że zoptymalizowane rusztowanie pomaga słabszym modelom. Rusztowanie do kodowania zoptymalizowane przez Gemini 3.5 Flash podniosło dokładność modelu Gemini 3.1 Flash Lite z 11,2 do 14,6 punktu. Autorzy zaznaczają, że ich analiza ogranicza się do rusztowań z modelami o stałych wagach.