Pengumuman Google mencantumkan harga API perkenalan Gemini 4 Argon sebesar $2 per juta token input dan $10 per juta token output. Harga berikutnya adalah $4 dan $20, tanpa tanggal berakhir untuk periode perkenalan. Input yang di-cache 95% lebih murah, sementara output maksimum naik dari 64K menjadi 1 juta token.
Sumber: Google DeepMind. Kartu ini tidak menampilkan harga $2 dan $10. Harga tersebut tercantum dalam teks pengumuman di bawah. Post peluncuran Logan Kilpatrick juga menyebutkan harga perkenalan di dalam teks post, bukan pada kartu harga terpisah.
Harga dan batas Gemini 4 Argon
| Spesifikasi | Nilai | Sumber dan tanggal pemeriksaan |
|---|---|---|
| Input perkenalan | $2 per 1M token | Pengumuman Google, 30 September 2026 |
| Output perkenalan | $10 per 1M token | Pengumuman Google, 30 September 2026 |
| Input setelahnya | $4 per 1M token | Pengumuman Google; tanggal berakhir tidak disebutkan |
| Output setelahnya | $20 per 1M token | Pengumuman Google; tanggal berakhir tidak disebutkan |
| Input yang di-cache | Diskon 95% dari harga input | Pengumuman Google |
| Output maksimum | 1M token, naik dari 64K | Pengumuman Google |
| Context window | 1M token yang digunakan bersama input dan output | Catatan model Artificial Analysis, diperiksa 5 Oktober |
Harga per token pada 5 Oktober 2026 adalah data harga saat itu, bukan janji bahwa periode perkenalan berakhir pada tanggal tertentu. Status rilis menjelaskan pihak yang disebut Google sebagai penerima akses; pada tanggal pemeriksaan itu, pengguna biasa belum bisa memanggil Argon.
Cara kerja diskon cache 95%
“Diskon 95%” berarti input yang di-cache hanya dikenai 5% dari harga input yang tercantum. Pada harga perkenalan $2, biayanya sekitar $0.10 per juta token input cache. Pada harga berikutnya $4, biayanya sekitar $0.20. Diskon berlaku untuk pembacaan input cache, bukan untuk harga output.
Untuk menghitung tagihan, bayangkan permintaan dengan 100,000 token input baru dan 20,000 token output pada harga perkenalan. Sebelum memperhitungkan efek cache, biayanya $0.20 + $0.20 = $0.40. Input yang digunakan ulang dikenai harga diskon jika memenuhi syarat cache; permintaan nyata bisa memiliki jumlah token dan perilaku cache yang berbeda.
Kapasitas output berbeda dari kapasitas konteks
Pengumuman Google menaikkan batas output dari 64K menjadi 1M token dalam satu respons. Catatan Artificial Analysis juga mencantumkan context window 1M token yang dibagi antara input dan output. Keduanya adalah batas yang berbeda: output menunjukkan berapa banyak yang dapat dihasilkan model dalam satu respons, sedangkan konteks menunjukkan kapasitas gabungan yang tersedia untuk satu permintaan.
Batas output 1M bukan berarti satu permintaan bisa memakai 1M token input ditambah 1M token output sekaligus. Batas tersebut memberi ruang lebih besar untuk pekerjaan panjang sebelum respons terpotong, sementara kualitas, latensi, dan jumlah token yang praktis untuk suatu tugas tetap bergantung pada permintaan.
Hal yang tidak dijelaskan oleh harga per token
Artificial Analysis mencantumkan perkiraan biaya $1.99 per tugas Intelligence Index. Itu adalah estimasi evaluasi berbobot, bukan biaya tetap bagi pelanggan dan bukan ramalan untuk semua workload. Untuk skor yang dipisahkan berdasarkan sumber, lihat benchmark Gemini 4 Argon. Untuk metrik di balik angka 15.1% yang banyak dibagikan, baca arti tingkat halusinasi Argon.
Jika membutuhkan model lokal tanpa tagihan API per token, download Gemma 4 dan lihat opsi setup-nya. Gemma 4 dan Gemini 4 Argon adalah lini model yang berbeda.
Coba Gemma 4 secara online
~/gemma4 $ Coba Gemma 4 di browser sebelum memasangnya di perangkat Anda.
Buka playground Gemma 4 />

