Gemini 4 Argon High dan GPT-6 Astra Max sama-sama mendapat skor 53 pada data Artificial Analysis Intelligence Index tanggal 5 Oktober 2026. Detail evaluasinya terbelah: Argon unggul di AutomationBench-AA, sedangkan Astra unggul di Terminal-Bench 4.0, GDP.pdf, dan AA-LCR. Estimasi biaya per tugas Argon juga lebih rendah. Hasil ini membantu memperkirakan kecocokan tugas, tetapi tidak membuktikan pemenang coding yang universal.
Sumber: Logan Kilpatrick, dari grafik peluncuran Google pada 30 September. Kolom AutomationBench ini menunjukkan Argon 51.3%, Astra 41.4%, Fable 5.1 31.4%, dan Opus 5.5 42.5%. Ini bukan AutomationBench-AA dari Artificial Analysis. Tabel di bawah adalah snapshot AA, yang mencantumkan Argon dan Astra masing-masing 78% dan 68%.
Argon High vs Astra Max sekilas
Perbandingan Artificial Analysis memakai Gemini 4 Argon High dan GPT-6 Astra Max. Angka di bawah adalah data pada halaman tersebut per 5 Oktober 2026; kolom biaya adalah estimasi biaya evaluasi per tugas.
| Evaluasi | Gemini 4 Argon High | GPT-6 Astra Max |
|---|---|---|
| Artificial Analysis Intelligence Index | 53 | 53 |
| Estimasi biaya per tugas | $1.99 | $3.26 |
| AutomationBench-AA | 78% | 68% |
| Terminal-Bench 4.0 | 57% | 59% |
| GDP.pdf | 22% | 31% |
| AA-LCR v1.1 | 80% | 81% |
Indeks yang sama menyembunyikan detail yang berguna. Argon unggul 10 poin persentase di AutomationBench-AA. Astra unggul 2 poin di Terminal-Bench 4.0, 9 poin di GDP.pdf, dan 1 poin di AA-LCR v1.1.
Apa yang disarankan skor ini tentang kecocokan tugas?
Ini adalah inferensi dari evaluasi, bukan spesialisasi produk yang ditetapkan vendor:
- Pilih Argon untuk workflow dengan otomasi end-to-end sebagai pengujian utama. Hasil AutomationBench-AA Argon adalah 78% dalam data ini.
- Uji Astra lebih dulu jika eksekusi terminal, penalaran berbasis dokumen yang diukur GDP.pdf, atau set AA-LCR menjadi inti pekerjaan. Astra unggul di ketiganya.
- Anggap skor indeks 53 sebagai alasan untuk memeriksa hasil per tugas, bukan bukti bahwa kedua model berperilaku sama.
Angka-angka ini tidak mendukung klaim bahwa satu model adalah model frontend dan yang lain model backend. Pekerjaan repository nyata juga dipengaruhi prompt, tools, konteks, tes, serta kemampuan memulihkan diri dari kegagalan. Jalankan versi kecil dari workload-mu sendiri sebelum memilih provider.
Harga token dan biaya tugas menjawab pertanyaan berbeda
Perbandingan yang sama mencantumkan harga token berikut untuk konfigurasi yang dievaluasi:
| Item harga | Gemini 4 Argon High | GPT-6 Astra Max |
|---|---|---|
| Input / output per 1M token | $2 / $10 | $10 / $50 |
| Input cache per 1M token | $0.10 | $1.00 |
Angka $1.99 dan $3.26 adalah biaya evaluasi berbobot, bukan tarif tetap untuk setiap permintaan pelanggan. Satu workflow agent yang panjang bisa memakai jumlah token dan tools yang berbeda dari tugas yang dipakai menghitung indeks. Bandingkan rate card dan biaya terukur per tugas yang selesai.
Akses juga memengaruhi pilihan praktis
Menurut pengumuman Google 30 September, Argon pertama-tama diberikan kepada pembela siber tepercaya melalui Fairwind dan digunakan secara internal. Rilis lebih luas dimulai dari pelanggan API berbayar dan pelanggan Google AI Ultra. Google tidak menyebut urutan API sebelum Ultra. Cek status rilis Argon saat ini sebelum menjadikan perbandingan benchmark sebagai keputusan pembelian.
Bacaan terkait
Coba Gemma 4 secara online
~/gemma4 $ Coba Gemma 4 di browser sebelum memasangnya di perangkat Anda.
Buka playground Gemma 4 />

