AI · 7 Oktober 2026

Peneliti Google Mengembangkan Metode untuk Mencegah Agen Kecerdasan Buatan Menghafal Tugas Uji

blue industrial robot arm in factory
Homa Appliances / Unsplash

Peneliti dari Google Cloud AI Research bersama beberapa universitas telah menciptakan metode baru untuk mencegah agen kecerdasan buatan yang melakukan optimasi mandiri agar tidak hanya menghafal tugas pengujian mereka.

Agen kecerdasan buatan modern menggunakan kerangka kerja yang terdiri dari perintah, rencana alur, alat, memori, dan kontrol penglihatan model. Kerangka ini menentukan kemampuan agen dalam membaca berkas, pulih dari kesalahan, dan memberikan hasil. Kemajuan terbaru pada agen lebih banyak berasal dari pengembangan kerangka kerja ini daripada dari model baru. Saat ini, proses optimasi kerangka kerja sering dilakukan secara otomatis oleh model bahasa berdasarkan umpan balik dari tugas pengujian, yang disebut sebagai bentuk peningkatan diri rekursif.

Namun, optimasi mandiri ini memiliki kelemahan karena agen cenderung menghafal set tugas pengujian yang terbatas. Hal ini menyebabkan kinerja meningkat pada tugas pelatihan, tetapi keuntungan tersebut berkurang atau hilang sepenuhnya pada tugas baru yang belum pernah dilihat. Fenomena ini terjadi karena sistem mengingat pola yang hanya cocok untuk satu tolok ukur, memilih kandidat berdasarkan keberuntungan, atau menambah kompleksitas yang tidak perlu.

Metode baru yang disebut RRSI atau Peningkatan Diri Rekursif Terregulasi mengatasi masalah ini dengan membatasi siklus optimasi. Sistem ini membatasi jumlah penyesuaian independen yang dapat dikelompokkan oleh kandidat, di mana anggaran penyesuaian akan menurun seiring waktu. Selain itu, sistem mencatat upaya sebelumnya untuk menghindari ide yang gagal dan bereksperimen pada bagian kerangka yang belum tersentuh jika kemajuan terhenti.

RRSI juga menggunakan pengkritik untuk membuang saran yang memasukkan trik spesifik tolok ukur, seperti nama tugas atau solusi. Biaya komputasi yang lebih tinggi hanya diterima jika ada peningkatan kinerja yang terukur, sementara komponen yang tidak berguna akan dihapus.

Dalam pengujian pada delapan tolok ukur di bidang pemrograman, pekerjaan kantor agen, dan desain teknik menggunakan model Claude Opus 4.8, RRSI menunjukkan hasil positif. Metode ini meraih peningkatan hingga 14,1 poin pada tugas pelatihan dan hingga 4,7 poin pada lima tolok ukur yang tidak terlihat. Selain itu, penggunaan token berkurang sekitar 30 persen dibandingkan varian yang tidak teregulasi. RRSI menjadi satu satunya metode yang kinerjanya tetap berada di atas nilai awal pada tugas yang tidak terlihat.

Penelitian ini juga menunjukkan bahwa kerangka kerja yang dioptimalkan dapat membantu model yang lebih lemah. Kerangka pengodean yang dioptimalkan dengan Gemini 3.5 Flash meningkatkan akurasi Gemini 3.1 Flash Lite dari 11,2 menjadi 14,6 poin. Para penulis mencatat bahwa studi ini terbatas pada kerangka dengan model tetap dan tidak mencakup kasus dengan bobot model yang berubah.