AI · 7 oktober 2026

Även publicerad på Indonesia, Italiano, Polski, العربية

Google-forskare utvecklar metod för att förhindra att AI-agenter memorerar testuppgifter

a robotic hand that is holding a laptop
Bernd 📷 Dittrich / Unsplash

Forskare från Google Cloud AI Research och flera universitet har utvecklat en ny metod för att stoppa AI-agenter från att enbart memorera sina testuppgifter under självoptimering. Problemet uppstår när agenter som optimerar sin egen arbetsmiljö specialiserar sig för hårt på specifika testuppgifter, vilket leder till att prestandan sjunker eller försvinner helt när de möter nya, tidigare osedda uppgifter.

Moderna AI-agenter använder ett ramverk, kallat harness, som består av instruktioner, arbetsflöden, verktyg och minne kring en fast språkmodell. Detta ramverk styr hur agenten läser filer, hanterar fel och levererar resultat. Tidigare har förbättringar av detta ramverk skett manuellt, men nyare metoder automatiserar processen genom att låta en språkmodell ändra ramverket baserat på feedback från testuppgifter, vilket beskrivs som en form av rekursiv självförbättring.

Den nya metoden, kallad RRSI, inför begränsningar i optimeringscykeln. Ett budgetsystem styr hur många oberoende anpassningar som får göras samtidigt, där budgeten minskar över tid för att gå från stora ombyggnationer till mindre, tydliga ändringar. Systemet sparar även tidigare försök för att undvika upprepning av misslyckade idéer och experimenterar med orörda delar av ramverket när framstegen avstannar.

För att säkerställa kvaliteten granskar en kritiker alla förslag och förkastar sådana som bygger på specifika knep kopplade till uppgiftsnamn eller lösningar. Dessutom accepteras högre beräkningskostnader endast om det finns en mätbar prestandavinst, medan komponenter utan nytta tas bort.

RRSI testades på åtta referensmått inom programmering, kontorsarbete och ingenjörsdesign med modellen Claude Opus 4.8. Resultaten visar att RRSI ökade prestandan med upp till 14,1 poäng på träningsuppgifter och upp till 4,7 poäng på fem osedda referensmått. Metoden använde dessutom cirka 30 procent färre tokens i drift jämfört med den oreglerade varianten. RRSI var den enda metoden som låg betydligt över utgångsvärdet på de osedda uppgifterna, trots att den hade den minsta vinsten på träningsuppgifterna.

Forskarna visade även att ett ramverk optimerat med Gemini 3.5 Flash kunde höja noggrannheten för den svagare modellen Gemini 3.1 Flash Lite från 11,2 till 14,6 poäng. Detta tyder på att de hittade mekanismerna inte är beroende av prestandanivån hos den modell som skapade dem. Författarna noterar att studien är begränsad till ramverk med fasta modeller och inte täcker fall där modellvikter ändras.