Gemini 4 Argon 没有一个可以概括一切的基准排名。Google 的发布表格、Artificial Analysis 模型记录和 FrontierSWE V2 榜单评测的是不同任务,证据类型也不同。下面将成绩分表呈现,避免把一项评测的结果说成所有任务上的胜负。
来源:Sundar Pichai,2026 年 9 月 30 日。这是 Google 的发布对比表。阴影单元格表示该行由另一模型领先。图片上印出的评测方法页面是 deepmind.google/models/evals-methodology/gemini-4-argon。
Google 9 月 30 日表格中的成绩
Google 公告报告了以下成绩:
| 评测 | Argon 成绩 | Google 公告中的说法 |
|---|---|---|
| DeepSWE v1.1 | 77.9% | 长时程软件工程达到新的最高成绩 |
| AutomationBench(Zapier) | 51.3% | 端到端业务任务执行排名第一 |
| LVBench | 91.7% | 长视频理解达到最高成绩 |
| CWE-bench v1 | 68% | 修复安全漏洞并列第一 |
公告文章重点列出了这四行。发布表格还印出了同一发布内容中的更多项目。从图片看,Argon 的 Vals Index 为 68.9%,Harvey’s Legal Agent Benchmark 为 19.6%。FrontierSWE v2 中 Argon 为 55.0%,Astra 为 65.5%,Astra 的单元格有阴影。Terminal-bench 4.0 中 Argon 为 57.4%,Opus 5.5 为 66.4%,Opus 的单元格有阴影。这些数字读取自上方图片,并不是本页另行添加的第二组成绩。
Artificial Analysis 快照
2026 年 10 月 5 日查看的 Artificial Analysis 模型记录给出了另一组摘要:
| Artificial Analysis 字段 | 快照值 |
|---|---|
| Intelligence Index v4.3.2 | 53(底层值 52.5606) |
| Intelligence Index 单次任务成本 | 约 1.99 美元 |
| 上下文窗口 | 1M Token |
| 访问标记 | 尚未公开提供 |
Intelligence Index 是综合评测,因此不能把四舍五入后的 53 与 Google 的任务专项百分比合并解读。单次任务成本是评测估算,不是固定客户收费。Token 价格见 API 价格与输出限制。
FrontierSWE V2:主要的代码评测榜单
FrontierSWE V2 榜单报告了另一项代码评测结果。其主表使用 proximus harness,覆盖全部 34 个任务,每个任务试验 5 次,时间预算为 20 小时。成绩是 mean@5;须线表示 worst@5 到 best@5,并非置信区间。
| 模型 | FrontierSWE V2 mean@5 |
|---|---|
| Gemini 4 Argon | 55.0% |
| GPT-6 Astra | 65.5% |
| Claude Opus 5.5 | 62.3% |
在这套设置下,Astra 比 Argon 高 10.5 个百分点。FrontierSWE 不是 DeepSWE,也不是 Artificial Analysis Terminal-Bench 4.0,因此这张表不能改写 Google 的 DeepSWE 结果,也不能建立一个适用于所有场景的代码排名。
第三方 Text Arena 图表
来源:@AI_Screening。这是该账号发布的图表,不是 arena.ai 导出的数据,也不属于上面三张表使用的三类来源。图表将 Gemini 4 Argon(High)标为 Elo 1,525、排名第 1。第二根柱形代表 Claude Opus 4.6,不是 Opus 5.5。应把它看作该帖中的偏好榜图像。
如何理解这些差距?
更准确的结论不是“Argon 赢下所有评测”。Argon 的成绩取决于任务、harness、模型配置和评分规则。15.1% 的 AA-Omniscience 数字请看幻觉率的含义;Argon 与 Gemma 4 的差别请看 Gemma 4 与 Gemini。



