已阅读 0%

Gemini 4 Argon 与 GPT-6 Astra:哪个适合你的工作?

2026年10月5日

在截至 2026 年 10 月 5 日的 Artificial Analysis Intelligence Index 数据中,Gemini 4 Argon High 与 GPT-6 Astra Max 都是 53 分。详细评测则各有领先:Argon 领先 AutomationBench-AA,Astra 领先 Terminal-Bench 4.0、GDP.pdf 和 AA-LCR。Argon 的估算单次任务成本也更低。这些结果提示了不同的适用场景,但不能证明谁是普遍的代码赢家。

Google AutomationBench 图表:Gemini 4 Argon 51.3%、GPT-6 Astra 41.4%、Claude Fable 5.1 31.4%、Claude Opus 5.5 42.5%。

来源:Logan Kilpatrick,图片来自 Google 9 月 30 日的发布图表。这一列 AutomationBench 的数值为 Argon 51.3%、Astra 41.4%、Fable 5.1 31.4%、Opus 5.5 42.5%。它不是 Artificial Analysis 的 AutomationBench-AA;下表是 AA 快照,其中 Argon 和 Astra 分别为 78% 和 68%。

Argon High 与 Astra Max 一览

Artificial Analysis 对比使用 Gemini 4 Argon High 和 GPT-6 Astra Max。下表是该页面截至 2026 年 10 月 5 日的数据;成本列是估算的评测单次任务成本。

评测Gemini 4 Argon HighGPT-6 Astra Max
Artificial Analysis Intelligence Index5353
估算的单次任务成本$1.99$3.26
AutomationBench-AA78%68%
Terminal-Bench 4.057%59%
GDP.pdf22%31%
AA-LCR v1.180%81%

相同的指数分数掩盖了有用的细节。Argon 在 AutomationBench-AA 上高 10 个百分点;Astra 在 Terminal-Bench 4.0 上高 2 分,在 GDP.pdf 上高 9 分,在 AA-LCR v1.1 上高 1 分。

这些成绩对适用场景有什么提示?

以下是基于评测结果的推断,不是厂商给模型指定的产品专长:

  • 如果端到端自动化是主要测试,可以选择 Argon;在这份快照中,它的 AutomationBench-AA 成绩为 78%,更高。
  • 如果终端执行、GDP.pdf 衡量的基于文档的推理能力,或 AA-LCR 集合是核心,可以先测试 Astra;它在这三列都领先。
  • 53 分打平时,应查看任务级结果,而不是据此认定两个模型行为完全相同。

这些数字不支持“一个模型天生适合前端、另一个天生适合后端”的说法。真实仓库工作还取决于提示词、工具、上下文、测试,以及从失败操作中恢复的能力。在承诺使用某个供应商前,应先运行自己工作负载的小型版本。

Token 价格与任务成本回答不同问题

同一份对比列出了这些评测配置的 Token 价格:

价格项目Gemini 4 Argon HighGPT-6 Astra Max
每 1M Token 输入 / 输出$2 / $10$10 / $50
每 1M Token 缓存输入$0.10$1.00

1.99 美元和 3.26 美元是加权评测成本,不是每位客户每次请求都要支付的固定费用。长时间运行的智能体可能使用与计算指数的任务不同数量的 Token 和工具。应同时比较价格表和自己测得的每个已完成任务成本。

可用性仍会影响实际选择

Google 的 9 月 30 日公告表示,Argon 首先提供给 Fairwind 中的可信网络安全防御人员并供内部使用,之后从付费 API 客户和 Google AI Ultra 订阅者开始扩大访问。公告没有说明 API 是否先于 Ultra。把这份基准比较当成购买决定前,请查看当前 Argon 发布详情。

延伸阅读

gemma4 — interact

在线体验 Gemma 4

~/gemma4 $ 先在浏览器中体验 Gemma 4,再决定是否在本地安装。

打开 Gemma 4 在线体验 />
Gemma 4 AI

Gemma 4 AI

相关指南