在截至 2026 年 10 月 5 日的 Artificial Analysis Intelligence Index 数据中,Gemini 4 Argon High 与 GPT-6 Astra Max 都是 53 分。详细评测则各有领先:Argon 领先 AutomationBench-AA,Astra 领先 Terminal-Bench 4.0、GDP.pdf 和 AA-LCR。Argon 的估算单次任务成本也更低。这些结果提示了不同的适用场景,但不能证明谁是普遍的代码赢家。
来源:Logan Kilpatrick,图片来自 Google 9 月 30 日的发布图表。这一列 AutomationBench 的数值为 Argon 51.3%、Astra 41.4%、Fable 5.1 31.4%、Opus 5.5 42.5%。它不是 Artificial Analysis 的 AutomationBench-AA;下表是 AA 快照,其中 Argon 和 Astra 分别为 78% 和 68%。
Argon High 与 Astra Max 一览
Artificial Analysis 对比使用 Gemini 4 Argon High 和 GPT-6 Astra Max。下表是该页面截至 2026 年 10 月 5 日的数据;成本列是估算的评测单次任务成本。
| 评测 | Gemini 4 Argon High | GPT-6 Astra Max |
|---|---|---|
| Artificial Analysis Intelligence Index | 53 | 53 |
| 估算的单次任务成本 | $1.99 | $3.26 |
| AutomationBench-AA | 78% | 68% |
| Terminal-Bench 4.0 | 57% | 59% |
| GDP.pdf | 22% | 31% |
| AA-LCR v1.1 | 80% | 81% |
相同的指数分数掩盖了有用的细节。Argon 在 AutomationBench-AA 上高 10 个百分点;Astra 在 Terminal-Bench 4.0 上高 2 分,在 GDP.pdf 上高 9 分,在 AA-LCR v1.1 上高 1 分。
这些成绩对适用场景有什么提示?
以下是基于评测结果的推断,不是厂商给模型指定的产品专长:
- 如果端到端自动化是主要测试,可以选择 Argon;在这份快照中,它的 AutomationBench-AA 成绩为 78%,更高。
- 如果终端执行、GDP.pdf 衡量的基于文档的推理能力,或 AA-LCR 集合是核心,可以先测试 Astra;它在这三列都领先。
- 53 分打平时,应查看任务级结果,而不是据此认定两个模型行为完全相同。
这些数字不支持“一个模型天生适合前端、另一个天生适合后端”的说法。真实仓库工作还取决于提示词、工具、上下文、测试,以及从失败操作中恢复的能力。在承诺使用某个供应商前,应先运行自己工作负载的小型版本。
Token 价格与任务成本回答不同问题
同一份对比列出了这些评测配置的 Token 价格:
| 价格项目 | Gemini 4 Argon High | GPT-6 Astra Max |
|---|---|---|
| 每 1M Token 输入 / 输出 | $2 / $10 | $10 / $50 |
| 每 1M Token 缓存输入 | $0.10 | $1.00 |
1.99 美元和 3.26 美元是加权评测成本,不是每位客户每次请求都要支付的固定费用。长时间运行的智能体可能使用与计算指数的任务不同数量的 Token 和工具。应同时比较价格表和自己测得的每个已完成任务成本。
可用性仍会影响实际选择
Google 的 9 月 30 日公告表示,Argon 首先提供给 Fairwind 中的可信网络安全防御人员并供内部使用,之后从付费 API 客户和 Google AI Ultra 订阅者开始扩大访问。公告没有说明 API 是否先于 Ultra。把这份基准比较当成购买决定前,请查看当前 Argon 发布详情。


