在 2026 年 10 月 5 日的 Artificial Analysis Intelligence Index 数据中,Claude Opus 5.5 的分数高于 Gemini 4 Argon,并在该比较列出的四项详细评测中领先三项。Argon 在 AutomationBench-AA 上领先,估算的单次任务成本更低。这是可测量的取舍,但不能说明哪个模型天生擅长某类软件开发。
来源:Sundar Pichai,2026 年 9 月 30 日。在这张 Google 表格中,Terminal-bench 4.0 的 Argon 为 57.4%、Opus 5.5 为 66.4%,Opus 的单元格带有阴影。该行的 Astra 为 58.2%,Fable 5.1 为 57.9%。这些百分比不是下表中的 Artificial Analysis Terminal-Bench 4.0 数字,后者分别为 57% 和 60%。
Argon High 与 Opus 5.5 一览
Artificial Analysis 对比评测的是 Gemini 4 Argon High 与 Claude Opus 5.5 Max, Default Fallback。下表是截至 2026 年 10 月 5 日的数据。
| 评测 | Gemini 4 Argon High | Claude Opus 5.5 Max, Default Fallback |
|---|---|---|
| Artificial Analysis Intelligence Index | 53 | 58 |
| 估算的单次任务成本 | $1.99 | $5.98 |
| AutomationBench-AA | 78% | 70% |
| Terminal-Bench 4.0 | 57% | 60% |
| GDP.pdf | 22% | 26% |
| AA-LCR v1.1 | 80% | 85% |
Opus 在指数上高 5 分,在 Terminal-Bench 4.0 上高 3 分,在 GDP.pdf 上高 4 分,在 AA-LCR v1.1 上高 5 分。Argon 在 AutomationBench-AA 上高 8 分。在这份数据中,单次任务估算成本是 Argon 1.99 美元、Opus 5.98 美元。
如何理解适用场景差异?
这张表可以作为测试起点:
- 如果 78% 的 AutomationBench-AA 成绩对应你的系统所需操作,可以把 Argon 放进自动化程度较高的工作流。
- 如果终端执行、文档推理或 AA-LCR 任务族更重要,而且更高的成绩值得额外成本,可以让 Opus 负责这类工作流。
- 用自己的提示词测量已完成的工作。基准分数不能证明谁是日常编程、界面工作或长文写作的普遍赢家。
这些评测配置不足以给模型贴上前端或后端标签。工具权限、上下文、测试和重试行为都可能改变实际结果。
Token 价格与单次任务成本是两回事
同一份 Artificial Analysis 对比列出了这些评测配置的价格:
| 价格项目 | Gemini 4 Argon High | Claude Opus 5.5 Max, Default Fallback |
|---|---|---|
| 每 1M Token 输入 / 输出 | $2 / $10 | $4 / $20 |
| 每 1M Token 缓存输入 | $0.10 | $0.20 |
单次任务数字是加权评测成本,并不是每位客户每次请求都要支付的固定费用。生产运行可能有不同的 Token 组合、工具路径和完成长度。预算应使用价格表,单位经济性则应使用有代表性的任务集测量。
可用性也是比较的一部分
Google 的9 月 30 日公告表示,Argon 首先提供给 Fairwind 中的可信网络安全防御人员并供内部使用,之后从付费 API 客户和 Google AI Ultra 订阅者开始扩大访问。公告没有承诺每个账户的发布日期。在把一个可以调用的模型与一个可能仍受限的模型比较前,请查看 Argon 访问详情。



