已阅读 0%

Gemini 4 Argon 与 Claude Opus 5.5:怎么选?

2026年10月5日

在 2026 年 10 月 5 日的 Artificial Analysis Intelligence Index 数据中,Claude Opus 5.5 的分数高于 Gemini 4 Argon,并在该比较列出的四项详细评测中领先三项。Argon 在 AutomationBench-AA 上领先,估算的单次任务成本更低。这是可测量的取舍,但不能说明哪个模型天生擅长某类软件开发。

Google 对比表中,Terminal-bench 4.0 的 Gemini 4 Argon 为 57.4%,Claude Opus 5.5 为 66.4%。

来源:Sundar Pichai,2026 年 9 月 30 日。在这张 Google 表格中,Terminal-bench 4.0 的 Argon 为 57.4%、Opus 5.5 为 66.4%,Opus 的单元格带有阴影。该行的 Astra 为 58.2%,Fable 5.1 为 57.9%。这些百分比不是下表中的 Artificial Analysis Terminal-Bench 4.0 数字,后者分别为 57% 和 60%。

Argon High 与 Opus 5.5 一览

Artificial Analysis 对比评测的是 Gemini 4 Argon High 与 Claude Opus 5.5 Max, Default Fallback。下表是截至 2026 年 10 月 5 日的数据。

评测Gemini 4 Argon HighClaude Opus 5.5 Max, Default Fallback
Artificial Analysis Intelligence Index5358
估算的单次任务成本$1.99$5.98
AutomationBench-AA78%70%
Terminal-Bench 4.057%60%
GDP.pdf22%26%
AA-LCR v1.180%85%

Opus 在指数上高 5 分,在 Terminal-Bench 4.0 上高 3 分,在 GDP.pdf 上高 4 分,在 AA-LCR v1.1 上高 5 分。Argon 在 AutomationBench-AA 上高 8 分。在这份数据中,单次任务估算成本是 Argon 1.99 美元、Opus 5.98 美元。

如何理解适用场景差异?

这张表可以作为测试起点:

  • 如果 78% 的 AutomationBench-AA 成绩对应你的系统所需操作,可以把 Argon 放进自动化程度较高的工作流。
  • 如果终端执行、文档推理或 AA-LCR 任务族更重要,而且更高的成绩值得额外成本,可以让 Opus 负责这类工作流。
  • 用自己的提示词测量已完成的工作。基准分数不能证明谁是日常编程、界面工作或长文写作的普遍赢家。

这些评测配置不足以给模型贴上前端或后端标签。工具权限、上下文、测试和重试行为都可能改变实际结果。

Token 价格与单次任务成本是两回事

同一份 Artificial Analysis 对比列出了这些评测配置的价格:

价格项目Gemini 4 Argon HighClaude Opus 5.5 Max, Default Fallback
每 1M Token 输入 / 输出$2 / $10$4 / $20
每 1M Token 缓存输入$0.10$0.20

单次任务数字是加权评测成本,并不是每位客户每次请求都要支付的固定费用。生产运行可能有不同的 Token 组合、工具路径和完成长度。预算应使用价格表,单位经济性则应使用有代表性的任务集测量。

可用性也是比较的一部分

Google 的9 月 30 日公告表示,Argon 首先提供给 Fairwind 中的可信网络安全防御人员并供内部使用,之后从付费 API 客户和 Google AI Ultra 订阅者开始扩大访问。公告没有承诺每个账户的发布日期。在把一个可以调用的模型与一个可能仍受限的模型比较前,请查看 Argon 访问详情。

延伸阅读

gemma4 — interact

在线体验 Gemma 4

~/gemma4 $ 先在浏览器中体验 Gemma 4,再决定是否在本地安装。

打开 Gemma 4 在线体验 />
Gemma 4 AI

Gemma 4 AI

相关指南