SENIN, 28 SEPTEMBER 2026

Home  ›  Tekno  ›  Riset Microsoft: Model AI Frontier Pun Masih Beran...

Tekno

Riset Microsoft: Model AI Frontier Pun Masih Berantakan di Tugas Panjang

Peneliti Microsoft Research menemukan model AI terbaik sekalipun kehilangan rata-rata 25% konten dokumen setelah 20 interaksi, dengan tingkat kerusakan katastrofik di lebih dari 80% pengujian.

Peneliti Microsoft Ungkap Masalah Besar AI untuk Tugas Jangka Panjang

Klaim bahwa agen AI sudah siap bekerja mandiri layaknya karyawan digital agaknya masih perlu dicermati ulang. Penelitian terbaru dari Microsoft Research memperlihatkan gambaran yang jauh lebih suram dibanding narasi marketing yang selama ini beredar di kalangan vendor teknologi.

Tim peneliti yang terdiri dari Philippe Laban, Tobias Schnabel, dan Jennifer Neville merancang sistem pengujian bernama DELEGATE-52, sebuah benchmark yang mensimulasikan pekerjaan profesional di 52 bidang, mulai dari pemrograman, akuntansi, kristalografi, hingga notasi musik. Setiap skenario dirancang untuk meniru alur kerja nyata yang panjang dan bertahap, bukan sekadar tugas satu-dua langkah.

Hasilnya cukup menampar. Model-model frontier seperti Gemini 3.1 Pro, Claude 4.6 Opus, dan GPT 5.4 tercatat kehilangan rata-rata 25% konten dokumen selama 20 interaksi yang didelegasikan. Kalau dihitung rata-rata di seluruh model yang diuji, degradasinya mencapai 50%. Separuh konten, hilang atau rusak.

Salah satu skenario yang diujikan adalah pekerjaan akuntansi standar: memisahkan data keuangan ke beberapa file berdasarkan kategori, lalu menggabungkannya kembali menjadi satu dokumen kronologis. Tugas yang bagi akuntan junior terasa rutin itu ternyata cukup untuk membuat model AI kelas atas tersandung.

Microsoft menetapkan ambang batas yang masuk akal. Model dianggap layak beroperasi mandiri jika mampu mempertahankan akurasi minimal 98% setelah 20 interaksi. Dari 52 bidang yang diuji, hanya satu yang lolos: pemrograman Python. Lima puluh satu bidang lainnya dinyatakan belum siap tanpa pengawasan manusia.

Lebih mengkhawatirkan, lebih dari 80% pengujian mengalami apa yang para peneliti sebut sebagai "kerusakan katastrofik", kondisi ketika kualitas output AI ambruk secara drastis, bukan melemah perlahan. Entah kebetulan atau tidak, pola ini justru lebih sering muncul pada model yang lebih canggih. Mereka tidak lebih aman, hanya menunda momen berantakannya ke tahap yang lebih akhir.

"Semakin panjang proses yang didelegasikan, semakin besar peluang isi dokumen berubah, hilang, atau hancur," lapor para peneliti, dikutip dari The Register. Temuan ini patut jadi catatan serius bagi perusahaan yang sedang mempertimbangkan otomasi berbasis AI untuk alur kerja dokumen yang kompleks.

Bagi investor yang menaruh harapan besar pada tesis AI-as-employee, ini bisa jadi sinyal bahwa jalan menuju agen AI yang benar-benar andal masih lebih panjang dari yang diantisipasi pasar. Segmen pemrograman memang menjanjikan. Tapi itu baru satu dari 52 bidang. Pekerjaan rumahnya, kalau data ini bisa dipercaya, masih menggunung.