Gemini 4 ArgonのGoogle発表では、初期API価格を入力100万トークンあたり$2、出力100万トークンあたり$10としています。その後の料金は$4と$20ですが、初期料金の終了日は示されていません。キャッシュ入力は95%安くなり、最大出力は64Kから100万トークンに増えます。
出典: Google DeepMind。このカードに$2と$10の料金は表示されていません。料金は下の発表本文に記載されています。Logan Kilpatrickのローンチ投稿も、専用の価格カードではなく投稿本文で初期料金を説明しています。
Gemini 4 Argonの価格と上限
| 仕様 | 値 | 出典・確認日 |
|---|---|---|
| 初期入力 | 1Mトークンあたり$2 | Google発表、2026年9月30日 |
| 初期出力 | 1Mトークンあたり$10 | Google発表、2026年9月30日 |
| その後の入力 | 1Mトークンあたり$4 | Google発表。終了日は未記載 |
| その後の出力 | 1Mトークンあたり$20 | Google発表。終了日は未記載 |
| キャッシュ入力 | 入力価格から95%引き | Google発表 |
| 最大出力 | 1Mトークン、64Kから増加 | Google発表 |
| コンテキストウィンドウ | 入出力合計で1Mトークン | Artificial Analysisのモデル記録、10月5日確認 |
2026年10月5日時点の料金は価格のスナップショットであり、初期料金の提供期間が特定の日に終わるという約束ではありません。公開状況では、Googleがアクセス対象として挙げた利用者を確認できます。この時点では、一般ユーザーはArgonを呼び出せませんでした。
95%のキャッシュ割引の仕組み
「95%引き」とは、キャッシュされた入力が表示価格の5%になるという意味です。初期料金の$2では、キャッシュ入力100万トークンあたり約$0.10です。その後の$4では約$0.20になります。割引はキャッシュ入力の読み取りに適用され、出力料金は下がりません。
請求額を計算するため、初期料金で新たに処理する入力が100,000トークン、出力が20,000トークンの仮想リクエストを考えます。キャッシュの影響を除けば、$0.20 + $0.20 = $0.40です。再利用された入力は、キャッシュ対象になれば割引料金で請求されます。実際のリクエストではトークン数やキャッシュの挙動が異なる場合があります。
出力容量とコンテキスト容量は別物
Googleの発表では、1回の応答で生成できる出力上限が64Kから1Mトークンに変わります。Artificial Analysisの記録には、入力と出力で共有する1Mトークンのコンテキストウィンドウも記載されています。これは別の上限です。出力は1回の応答で生成できる量、コンテキストは1リクエストで利用できる入出力の合計容量を表します。
1Mの出力上限は、1Mの入力トークンと1Mの出力トークンを同時に使えるという意味ではありません。応答が途中で切れるまでの余地を長い作業に与える一方、品質、レイテンシ、実際のタスクで使われるトークン数はリクエストによって変わります。
表示価格だけでは分からないこと
Artificial Analysisは、Intelligence Indexの1タスクあたりの推定コストを$1.99としています。これは重み付き評価の推定値であり、顧客に請求される一律料金でも、あらゆるワークロードの予測でもありません。出典別のスコアはGemini 4 Argonベンチマークを、広く共有された15.1%という数値の指標はArgonのハルシネーション率の意味を確認してください。
トークン単位のAPI請求なしでローカルモデルを使うなら、Gemma 4をダウンロードして設定方法を確認してください。Gemma 4とGemini 4 Argonは別のモデル系列です。


