---
title: Ricercatori di Google sviluppano metodo per evitare che gli agenti di intelligenza artificiale memorizzino i test
url: https://www.dataloco.com/it/ricercatori-di-google-sviluppano-metodo-per-evitare-che-gli-agenti-di-intelligenza-artificiale-memorizzino-i-test
published: 2026-10-07T12:31:52+00:00
language: it
section: IA
source: https://the-decoder.de/wie-google-forscher-verhindern-wollen-dass-sich-selbst-verbessernde-ki-agenten-nur-auswendig-lernen/
organizations: Google Cloud AI Research
publisher: Dataloco
---

# Ricercatori di Google sviluppano metodo per evitare che gli agenti di intelligenza artificiale memorizzino i test

Ricercatori di Google Cloud AI Research e diverse università hanno creato un nuovo metodo per impedire che gli agenti di intelligenza artificiale si specializzino eccessivamente nei compiti di test durante i processi di auto ottimizzazione.

Gli agenti moderni utilizzano un'impalcatura composta da prompt, piani di flusso, strumenti, memoria e sistemi di controllo che circonda un modello linguistico fisso. Questa struttura determina come l'agente interagisce con i file, gestisce gli errori e consegna i risultati. Mentre in passato queste strutture venivano modificate manualmente dagli esseri umani, i metodi recenti automatizzano il processo permettendo a un modello linguistico di modificare l'impalcatura in base ai feedback dei test, in una forma di auto miglioramento ricorsivo.

Il documento di ricerca evidenzia che l'auto ottimizzazione può portare l'agente a memorizzare i compiti di test a causa dell'uso di set di dati limitati. Ciò comporta un aumento delle prestazioni sui compiti di addestramento, ma una riduzione o scomparsa dei guadagni su compiti nuovi e non visti. Questo fenomeno accade perché il sistema memorizza schemi specifici per un singolo benchmark, preferisce candidati fortunati o accumula complessità inutile.

Il metodo RRSI, ovvero auto miglioramento ricorsivo regolarizzato delle impalcature degli agenti, introduce dei freni in due punti del ciclo di ottimizzazione. In primo luogo, limita il numero di adattamenti indipendenti che un candidato può raggruppare, riducendo questo budget nel tempo per permettere solo modifiche piccole e chiare nelle fasi finali. In secondo luogo, un critico scarta i suggerimenti che includono trucchi specifici per i benchmark, come nomi di compiti o soluzioni integrate. Inoltre, l'aumento dei costi di calcolo è accettato solo se accompagnato da un guadagno di prestazioni misurabile.

I test di RRSI sono stati condotti su otto benchmark in programmazione, lavoro d'ufficio agentico e progettazione ingegneristica utilizzando il modello Claude Opus 4.8. RRSI ha ottenuto guadagni fino a 14,1 punti nei compiti di addestramento e fino a 4,7 punti in cinque benchmark non visti, con un consumo di token inferiore di circa 30 percento rispetto alla variante non regolata. Al contrario, altre varianti di ottimizzazione hanno visto le prestazioni scendere sotto il valore iniziale nei compiti non visti.

La ricerca ha dimostrato che un'impalcatura di programmazione ottimizzata con Gemini 3.5 Flash ha aumentato la precisione di Gemini 3.1 Flash Lite da 11,2 a 14,6 punti, indicando che i meccanismi trovati non dipendono dal livello di prestazioni del modello che li ha sviluppati. Gli autori precisano che lo studio si limita a impalcature con modelli fissi e non copre i casi con pesi del modello modificati.

## This story in other languages

- [Indonesia](https://www.dataloco.com/id/peneliti-google-mengembangkan-metode-untuk-mencegah-agen-kecerdasan-buatan-menghafal-tugas-uji)
- [Svenska](https://www.dataloco.com/sv/google-forskare-utvecklar-metod-for-att-forhindra-att-ai-agenter-memorerar-testuppgifter)
- [Polski](https://www.dataloco.com/pl/badacze-google-opracowali-metode-zapobiegajaca-zapamietywaniu-zadan-przez-agentow-sztucznej-inteligencji)
- [العربية](https://www.dataloco.com/ar/bahthon-mn-google-ytoron-tryk-lmnaa-oklaaa-althkaaa-alastnaaay-mn-alhfth-alsm-athnaaa-althsyn-althaty)
