Langsung ke isi
· Kabar AI, jernih dan terverifikasiNewsletter  ·  Majalah
Tampilan
Pengaturan tampilan
Tema

Kabar AI yang mudah dibaca.

Pilihan tersimpan di perangkat Anda.

Langganan
Terkini
Trending

Riset Argo-Bench: AI Masih Kerap Salah Mengambil Keputusan Data Perusahaan

Uji coba simulasi data 81 juta transaksi membuktikan model AI tercanggih sekalipun belum mampu mengambil keputusan bisnis secara akurat.

Deretan rak server di dalam pusat data untuk pemrosesan informasi

Foto: simon.carr via Flickr (CC BY-SA 2.0)

Poin penting

  • Argo-Bench menguji AI pada simulasi data bisnis berisi 81 juta pesanan dan 7,5 miliar baris data.
  • Model terkuat Claude Opus 5.5 hanya meraih nilai 95 ke atas pada 34,8 persen tugas data.
  • Sebanyak 9 dari 14 model AI yang diuji mencatat nilai rata-rata di bawah 35 dari 100 poin.

Banyak perusahaan mulai melirik kecerdasan buatan (AI) untuk mengolah data bisnis. Namun, kemampuan AI dalam mengambil keputusan penting ternyata masih rendah.

Temuan ini terungkap dalam laporan riset terbaru di arXiv. Tim peneliti merilis sistem pengujian baru bernama Argo-Bench.

Pengujian ini melihat kemampuan AI saat bekerja di lingkungan data perusahaan. Hasilnya menunjukkan model AI belum siap bekerja secara mandiri.

Menguji AI di Sistem Basis Data Rumit

Tolok ukur lama dinilai kurang tepat untuk dunia kerja nyata. Peneliti menyebut tolok ukur lama hanya menguji pembuatan kode pencarian data sederhana.

Padahal, tugas data perusahaan jauh lebih luas. Analis harus membuat perkiraan bisnis dan melatih sistem pendeteksi kecurangan.

Kunci jawaban tolok ukur lama juga sering salah. Audit menemukan 62,8 persen jawaban Spider 2.0-Snow dan 52,8 persen jawaban BIRD Mini-Dev keliru.

Argo-Bench membuat simulasi bisnis pesan antar makanan di New York. Simulasi mencakup 81 juta pesanan dan 3,4 juta pelanggan aktif.

Datanya tersimpan dalam 235 tabel dengan 7,5 miliar baris data. Formatnya meniru Oracle EBS, perangkat lunak pengelola operasional bisnis.

Skor Model AI Masih Rendah

Argo-Bench memuat 210 tugas analisis data bisnis. AI diminta mengambil tindakan nyata, seperti memblokir akun penipuan dan membagi anggaran insentif kurir.

Sistem lalu menilai dampak keputusan AI tersebut. Penilaian menghitung kerugian penipuan yang dicegah dan potensi hilangnya pemasukan dari salah blokir.

Hasilnya cukup mengejutkan. Model terkuat, Claude Opus 5.5, hanya meraih nilai 95 ke atas pada 34,8 persen tugas.

Rata-rata nilai model tersebut hanya 59,5 poin. Dari 14 model yang diuji, sebanyak 9 model mencatat nilai rata-rata di bawah 35 poin.

Peneliti melaporkan bahwa AI sering salah menganalisis data. Model AI juga kerap mengejar tujuan yang keliru bagi bisnis.

Risiko bagi Pengambil Keputusan Bisnis

Temuan riset ini menjadi catatan penting bagi pemilik bisnis dan direktur. Penyerahan otomatisasi data skala besar ke AI masih berisiko tinggi.

Kesalahan perkiraan anggaran atau pemblokiran pelanggan bisa langsung merugikan pendapatan bisnis Anda.

Pimpinan perusahaan sebaiknya tidak menyerahkan keputusan strategis sepenuhnya kepada AI. Verifikasi oleh tenaga ahli manusia tetap sangat dibutuhkan.

✓ Lolos pemeriksaan redaksi AI. Artikel ini ditulis AI, 8 klaimnya dicocokkan dengan sumber, dan diuji keterbacaannya sebelum terbit. Menemukan kekeliruan? Laporkan ke redaksi.
Lihat hasil pemeriksaan
Pembuka: 8/10Kejelasan: 7/10Struktur: 8/10Manfaat: 8/10Bahasa: 8/10
KlaimPutusanDasar di sumber
Argo-Bench adalah kerangka pengujian baru berbasis simulasi data bisnis berskala besar yang diperkenalkan dalam riset di arXiv.Didukung“We introduce Argo-Bench, an evaluation framework comprising 210 data science and analytics tasks.”
Disebutkan dalam abstrak makalah riset arXiv tersebut.
Audit menemukan 62,8 persen jawaban rilis Spider 2.0-Snow dan 52,8 persen jawaban BIRD Mini-Dev keliru.Didukung“In a recent audit, 62.8% of Spider 2.0-Snow’s released gold queries and 52.8% of BIRD Mini-Dev’s were found to be erroneous”
Disebutkan pada bagian Pendahuluan (Introduction) makalah riset arXiv.
Simulasi Argo-Bench mencakup 81 juta pesanan, 3,4 juta pelanggan aktif, 235 tabel, dan 7,5 miliar baris data dengan format meniru Oracle EBS.Didukung“comprising 235 mutually constraining tables, 81 million orders, 3.4 million active customers, and 7.5 billion rows”
Disebutkan pada bagian kontribusi makalah riset arXiv.
Argo-Bench memuat 210 tugas analisis dan ilmu data bisnis.Didukung“A benchmark of 210 such tasks, from publishing a dashboard data source to fitting forecasts and banning fraudulent accounts”
Disebutkan pada bagian kontribusi makalah riset arXiv.
Tugas mencakup aksi nyata seperti memblokir akun penipuan dan membagi anggaran insentif kurir.Didukung“the agent files actions such as banning fraudulent accounts, allocating courier incentive budgets, or issuing back pay”
Disebutkan dalam abstrak makalah riset arXiv.
Model terkuat Claude Opus 5.5 hanya meraih nilai 95 ke atas pada 34,8 persen tugas dan rata-rata mencatat 59,5 poin.Didukung“The strongest, Claude Opus 5.5, solves 34.8% of tasks and averages 59.5 points.”
Disebutkan pada bagian Pendahuluan (Introduction) makalah riset arXiv.
Sebanyak 9 dari 14 model frontier dan bobot terbuka yang diuji mencatat nilai rata-rata di bawah 35 poin.Didukung“Nine of the fourteen average below 35.”
Disebutkan pada bagian Pendahuluan (Introduction) makalah riset arXiv.
Model AI sering kali menganalisis kuantitas yang salah atau mengoptimalkan tujuan yang keliru.Didukung“Models often analyze the wrong quantity or optimize the wrong objective.”
Disebutkan pada bagian Pendahuluan (Introduction) makalah riset arXiv.

Tanya jawab

Apa itu Argo-Bench?

Argo-Bench adalah sistem pengujian tolok ukur baru yang dirilis di arXiv untuk menguji kemampuan AI dalam mengambil keputusan di lingkungan data perusahaan.

Bagaimana hasil pengujian model AI di Argo-Bench?

Hasil pengujian menunjukkan model AI belum siap bekerja mandiri karena sering salah menganalisis data, dengan model terkuat Claude Opus 5.5 hanya mencatat nilai rata-rata 59,5 poin.

Berapa banyak model AI yang diuji dalam riset Argo-Bench?

Riset Argo-Bench menguji sebanyak 14 model AI, dengan 9 model di antaranya mencatatkan nilai rata-rata di bawah 35 poin.

Sumber: arXiv: Argo-Bench: Evaluating Data Agents on Enterprise-Scale Workflows

Baca juga