AI · 29 September 2026

Hugging Face Rilis Lingkungan Pembelajaran Penguatan untuk Analisis Data

blue circuit board
Umberto / Unsplash

Hugging Face telah mengumumkan peluncuran lingkungan pembelajaran penguatan bernama SmolDataEnvs. Lingkungan ini dirancang khusus untuk melatih model kecerdasan buatan berskala kecil agar mampu melakukan analisis data menggunakan kode. Pengumuman ini disampaikan pada tanggal 24 September melalui platform media sosial X.

Lingkungan ini menyediakan lebih dari 5.000 tugas yang didasarkan pada kumpulan data dan kompetisi dari platform analisis data Kaggle. Setiap tugas mencakup file data yang menjadi objek analisis serta pertanyaan terkait data tersebut. Model kecerdasan buatan bertindak sebagai agen yang menggunakan alat untuk memeriksa isi data dan menjalankan kode guna menemukan jawaban. Tugas-tugas ini diklasifikasikan ke dalam tiga tingkat kesulitan, yaitu mudah, sedang, dan sulit. Salah satu contoh tugas yang tersedia adalah menghitung persentase hasil seri dari data pertandingan sepak bola.

Sistem penilaian dalam lingkungan ini menggunakan program untuk membandingkan jawaban agen dengan jawaban yang benar. Program ini tidak hanya memeriksa kesamaan teks secara persis, tetapi juga menilai apakah nilai numerik berada dalam batas toleransi yang diizinkan. Sistem ini juga mampu mengidentifikasi jawaban yang benar meskipun format daftar atau persentase berbeda. Proses penilaian ini sepenuhnya dilakukan oleh program tanpa menggunakan model bahasa besar, dan hasil penilaian tersebut digunakan sebagai imbalan untuk melatih model melalui pembelajaran penguatan.

Selama proses pembuatan tugas, setiap tugas diuji dengan membiarkan agen menyelesaikannya. Tugas yang memiliki pertanyaan ambigu atau jawaban yang tidak dapat diverifikasi telah dihapus dari kumpulan data. Selain 5.000 tugas untuk pelatihan, tersedia 250 tugas untuk pengujian kemampuan model dan 144 tugas untuk validasi selama pelatihan. Tugas pengujian dan validasi memiliki proporsi tugas yang lebih sulit dibandingkan tugas pelatihan.

Lingkungan ini juga menyediakan data untuk penyetelan halus dengan pengawasan. Data ini mencakup rekaman proses penyelesaian untuk 4.677 tugas dari total tugas pelatihan. Rekaman ini menunjukkan pemanggilan alat untuk memeriksa data, hasil eksekusi, dan jawaban akhir. Data ini berfungsi sebagai contoh bagi model untuk belajar proses penyelesaian masalah. Lingkungan eksekusi disusun mengikuti format tugas dari kerangka kerja Harbor, yang mencakup lingkungan kontainer untuk menjalankan kode, data analisis, dan program penilaian.

Kode terkait tersedia di repositori FineEnvs di GitHub. SmolDataEnvs merupakan salah satu proyek dalam repositori tersebut dan memiliki direktori khusus yang berisi buku catatan dan skrip untuk mencoba penyetelan halus dan pembelajaran penguatan. Dokumen panduan menjelaskan langkah-langkah untuk mengevaluasi model sebelum pelatihan, melakukan penyetelan halus dan pembelajaran penguatan, serta mengevaluasi model kembali. Buku catatan yang tersedia menggunakan kartu grafis T4 dari Google Colab untuk penyetelan halus dan satu kartu grafis A100 untuk pembelajaran penguatan. Lisensi untuk repositori GitHub adalah Apache License 2.0, sedangkan data tugas, data penyetelan halus, dan lingkungan eksekusi yang didistribusikan melalui Hugging Face menggunakan lisensi MIT.