已阅读 0%

Gemini 4 Argon API 价格与 100 万输出上限

2026年10月5日

Google 公告列出的 Gemini 4 Argon API 首发优惠价为每百万输入 Token 2 美元、每百万输出 Token 10 美元。公告还列出后续的 4 美元和 20 美元价格,但没有说明优惠期何时结束。缓存输入便宜 95%,最大输出量则从 64K 提高到 100 万 Token。

蓝色发布卡片上有 Gemini 标志和 Gemini 4 Argon 字样。

来源:Google DeepMind。这张卡片没有显示 2 美元和 10 美元的价格;这些价格写在下方的公告正文中。Logan Kilpatrick 的发布贴文也在正文中说明了首发价格,并非另有价格卡片。

Gemini 4 Argon 价格与限制

规格数值数据来源(截至日期)
首发输入价格每 1M Token 2 美元Google 公告,2026 年 9 月 30 日
首发输出价格每 1M Token 10 美元Google 公告,2026 年 9 月 30 日
后续输入价格每 1M Token 4 美元Google 公告;未说明结束日期
后续输出价格每 1M Token 20 美元Google 公告;未说明结束日期
缓存输入输入价格优惠 95%Google 公告
最大输出量1M Token,之前为 64KGoogle 公告
上下文窗口1M Token,由输入与输出共用Artificial Analysis 模型记录,10 月 5 日查看

这些首发优惠价是截至目前的价格数据,不代表优惠期会在某个特定日期结束。发布状态页面说明了 Google 列出的访问对象;截至 2026 年 10 月 5 日,一般用户仍无法调用 Argon。

95% 缓存折扣怎么算?

“优惠 95%”表示缓存输入只按标价的 5% 计费。按首发输入价格 2 美元计算,每百万缓存输入 Token 约为 0.10 美元;按后续价格 4 美元计算则约为 0.20 美元。折扣只适用于缓存输入读取,不会降低输出价格。

举例来说,假设一次请求使用 100,000 个新处理的输入 Token 和 20,000 个输出 Token,按首发优惠价计算就是 0.20 美元 + 0.20 美元 = 0.40 美元,不考虑缓存影响。符合缓存条件的重复输入会按折扣价计费;实际请求的 Token 数量和缓存行为可能不同。

输出容量不等于上下文容量

Google 公告将单次任务的输出上限从 64K 提高到 1M Token。Artificial Analysis 记录的上下文窗口也是 1M Token,但它由输入和输出共用。这是两个不同的限制:输出上限表示一次回复最多生成多少内容,上下文表示一次请求可用的输入与输出总容量。

1M 输出上限不表示一次请求可以同时使用 1M 输入 Token 和 1M 输出 Token。它为长时间运行的任务提供了更多空间,避免回复过早截断;质量、延迟和任务实际使用的 Token 数量仍取决于请求本身。

标价没有告诉你的事

Artificial Analysis 列出的 Intelligence Index 单次任务成本约为 1.99 美元。这是加权评测成本估算,不是每位客户都要支付的固定费用,也不是所有工作负载的成本预测。不同来源的跑分见Gemini 4 Argon 基准测试;15.1% 数字的含义请看Argon 幻觉率解读。

如果你需要不按 Token 计费的本地模型,可以下载 Gemma 4并查看安装方案。Gemma 4 与 Gemini 4 Argon 属于不同模型系列。

gemma4 — interact

在线体验 Gemma 4

~/gemma4 $ 先在浏览器中体验 Gemma 4,再决定是否在本地安装。

打开 Gemma 4 在线体验 />
Gemma 4 AI

Gemma 4 AI

相关指南