0% dibaca

Tingkat Halusinasi Gemini 4 Argon: Arti Angka 15.1%

5 Okt 2026

Gemini 4 Argon belum menyelesaikan masalah halusinasi. Data 5 Oktober 2026 dari Artificial Analysis mencatat tingkat halusinasi 15.1% dan akurasi 49.9% pada AA-Omniscience. Keduanya adalah metrik yang berbeda, dan angka 15.1% bukan persentase semua jawaban yang salah.

Snapshot 5 Oktober

Catatan model Artificial Analysis menunjukkan:

Field AA-OmniscienceArgon (High)
Akurasi49.9% (0.499)
Tingkat halusinasi15.1% (0.1506986)
Tingkat non-halusinasi pendampingSekitar 84.9%

Angka pendamping tersebut kira-kira sama dengan satu dikurangi tingkat halusinasi yang dilaporkan. Jika Artificial Analysis memperbarui catatan model, periksa kembali tanggal dan nilainya sebelum menganggapnya sebagai skor terkini.

Grafik perbandingan tingkat halusinasi AA-Omniscience, dengan Gemini 4 Argon High pada 15% dan jawaban benar pada 50%.

Sumber: @rdominguezibar. Judul grafik mengikuti kata-kata pada post tersebut. Catatan kakinya memberi tanggal batang sebagai data Artificial Analysis AA-Omniscience pada 30 September 2026, serta membulatkan Argon (High) menjadi halusinasi 15% dan jawaban benar 50%. Catatan itu juga mengatakan Argon belum tersedia untuk publik dan hanya konfigurasi High yang diuji. Tabel di atas memakai catatan model per 5 Oktober: 15.1% (0.1506986) dan akurasi 49.9%.

Apa yang dihitung oleh penyebutnya?

Menurut metodologi AA-Omniscience, akurasi adalah jawaban benar dibagi semua pertanyaan. Tingkat halusinasi dihitung dengan:

incorrect / (incorrect + partial + not attempted)

Jawaban benar dikeluarkan dari penyebut halusinasi. Metrik ini menanyakan seberapa sering model menyatakan jawaban yang salah di antara kasus yang tidak mendapat skor benar; ini bukan tingkat kesalahan dari semua jawaban.

Grafik halusinasi AA-Omniscience Artificial Analysis dengan Gemini 4 Argon High pada 15%.

Sumber: @Cozycanvas53144, tangkapan layar grafik Artificial Analysis. Argon (High) berada pada 15% dan ditandai belum tersedia untuk publik. Definisi pada grafik sama dengan rumus di atas: jawaban salah dibagi jawaban salah, jawaban sebagian, dan pertanyaan yang tidak dicoba.

Contoh perhitungan

Pembagian 1.000 pertanyaan berikut adalah contoh hipotetis untuk menjelaskan rumus, bukan jumlah jawaban Argon yang diamati:

Hasil ilustratifJumlah
Benar800
Salah30
Sebagian benar atau tidak dicoba170

Tingkat halusinasi bersyaratnya adalah 30 / (30 + 170) = 15%. Porsi jawaban yang salah secara langsung dari semua pertanyaan adalah 30 / 1,000 = 3%. Akurasi AA-Omniscience Argon pada data tersebut sekitar 49.9%, jadi contoh 800/30/170 tidak boleh disajikan sebagai pembagian Argon.

Apa yang didukung oleh skor ini?

Kesimpulan terbatasnya: dalam evaluasi ini, tingkat jawaban salah di antara hasil yang tidak benar adalah sekitar 15.1%. Ini tidak menunjukkan bahwa setiap jawaban dapat dipercaya, model selalu menolak menjawab saat tidak tahu, atau halusinasi sudah hilang. Akurasi di bawah 50% pada catatan yang sama juga berarti model tidak menjawab sekitar setengah evaluasi dengan benar.

Untuk evaluasi Argon lainnya, lihat benchmark berdasarkan sumber. Untuk harga token dan waktu akses, lihat harga API dan status rilis. Gemma 4 adalah model open-weight yang terpisah; panduan troubleshooting praktisnya ada di sini.

gemma4 — interact

Coba Gemma 4 secara online

~/gemma4 $ Coba Gemma 4 di browser sebelum memasangnya di perangkat Anda.

Buka playground Gemma 4 />
Gemma 4 AI

Gemma 4 AI

Panduan Terkait