0% dibaca

Harga API Gemini 4 Argon dan Spesifikasi Output 1M Token

5 Okt 2026

Pengumuman Google mencantumkan harga API perkenalan Gemini 4 Argon sebesar $2 per juta token input dan $10 per juta token output. Harga berikutnya adalah $4 dan $20, tanpa tanggal berakhir untuk periode perkenalan. Input yang di-cache 95% lebih murah, sementara output maksimum naik dari 64K menjadi 1 juta token.

Kartu peluncuran biru dengan logo Gemini dan tulisan Gemini 4 Argon.

Sumber: Google DeepMind. Kartu ini tidak menampilkan harga $2 dan $10. Harga tersebut tercantum dalam teks pengumuman di bawah. Post peluncuran Logan Kilpatrick juga menyebutkan harga perkenalan di dalam teks post, bukan pada kartu harga terpisah.

Harga dan batas Gemini 4 Argon

SpesifikasiNilaiSumber dan tanggal pemeriksaan
Input perkenalan$2 per 1M tokenPengumuman Google, 30 September 2026
Output perkenalan$10 per 1M tokenPengumuman Google, 30 September 2026
Input setelahnya$4 per 1M tokenPengumuman Google; tanggal berakhir tidak disebutkan
Output setelahnya$20 per 1M tokenPengumuman Google; tanggal berakhir tidak disebutkan
Input yang di-cacheDiskon 95% dari harga inputPengumuman Google
Output maksimum1M token, naik dari 64KPengumuman Google
Context window1M token yang digunakan bersama input dan outputCatatan model Artificial Analysis, diperiksa 5 Oktober

Harga per token pada 5 Oktober 2026 adalah data harga saat itu, bukan janji bahwa periode perkenalan berakhir pada tanggal tertentu. Status rilis menjelaskan pihak yang disebut Google sebagai penerima akses; pada tanggal pemeriksaan itu, pengguna biasa belum bisa memanggil Argon.

Cara kerja diskon cache 95%

“Diskon 95%” berarti input yang di-cache hanya dikenai 5% dari harga input yang tercantum. Pada harga perkenalan $2, biayanya sekitar $0.10 per juta token input cache. Pada harga berikutnya $4, biayanya sekitar $0.20. Diskon berlaku untuk pembacaan input cache, bukan untuk harga output.

Untuk menghitung tagihan, bayangkan permintaan dengan 100,000 token input baru dan 20,000 token output pada harga perkenalan. Sebelum memperhitungkan efek cache, biayanya $0.20 + $0.20 = $0.40. Input yang digunakan ulang dikenai harga diskon jika memenuhi syarat cache; permintaan nyata bisa memiliki jumlah token dan perilaku cache yang berbeda.

Kapasitas output berbeda dari kapasitas konteks

Pengumuman Google menaikkan batas output dari 64K menjadi 1M token dalam satu respons. Catatan Artificial Analysis juga mencantumkan context window 1M token yang dibagi antara input dan output. Keduanya adalah batas yang berbeda: output menunjukkan berapa banyak yang dapat dihasilkan model dalam satu respons, sedangkan konteks menunjukkan kapasitas gabungan yang tersedia untuk satu permintaan.

Batas output 1M bukan berarti satu permintaan bisa memakai 1M token input ditambah 1M token output sekaligus. Batas tersebut memberi ruang lebih besar untuk pekerjaan panjang sebelum respons terpotong, sementara kualitas, latensi, dan jumlah token yang praktis untuk suatu tugas tetap bergantung pada permintaan.

Hal yang tidak dijelaskan oleh harga per token

Artificial Analysis mencantumkan perkiraan biaya $1.99 per tugas Intelligence Index. Itu adalah estimasi evaluasi berbobot, bukan biaya tetap bagi pelanggan dan bukan ramalan untuk semua workload. Untuk skor yang dipisahkan berdasarkan sumber, lihat benchmark Gemini 4 Argon. Untuk metrik di balik angka 15.1% yang banyak dibagikan, baca arti tingkat halusinasi Argon.

Jika membutuhkan model lokal tanpa tagihan API per token, download Gemma 4 dan lihat opsi setup-nya. Gemma 4 dan Gemini 4 Argon adalah lini model yang berbeda.

gemma4 — interact

Coba Gemma 4 secara online

~/gemma4 $ Coba Gemma 4 di browser sebelum memasangnya di perangkat Anda.

Buka playground Gemma 4 />
Gemma 4 AI

Gemma 4 AI

Panduan Terkait