已阅读 0%

Gemini 4 Argon 跑分争议:基准测试能代表编程能力吗?

2026年10月5日

“基准刷分”(benchmaxxing)是一个有争议的说法,用来描述基准测试成绩与日常编程之间可能存在的差距。截至 2026 年 10 月 5 日,现有证据支持一个更谨慎的结论:Gemini 4 Argon 有很强的公开成绩,但这些成绩不能说明它在每个真实代码仓库或界面任务中的表现。

Google 发布表格中,Astra 在 FrontierSWE v2、Opus 5.5 在 Terminal-bench 4.0 的领先单元格带有阴影。

来源:Sundar Pichai,2026 年 9 月 30 日。阴影单元格表示另一模型在该项基准测试中领先。FrontierSWE v2 中 Astra 为 65.5%、Argon 为 55.0%;Terminal-bench 4.0 中 Opus 5.5 为 66.4%、Argon 为 57.4%。同一表格中的 DeepSWE v1.1 为 Argon 的 77.9%。下一张表中的 Artificial Analysis 数字为 57%,来源不同,不是这里的 57.4% 单元格。

三份基准记录,三个不同问题

这些结果应当分开看,因为它们测量的任务不同,来源也不同。

来源与评测Argon 成绩测量内容
Google 公告:DeepSWE v1.177.9%Google 的长时程软件工程成绩
Artificial Analysis 模型记录:Terminal-Bench 4.057%AA Intelligence Index 评测集中的一项
FrontierSWE V2 榜单:proximus harness55.0% mean@534 个任务、每项 5 次试验、20 小时预算

在同一套主榜设置下,FrontierSWE 页面还报告 GPT-6 Astra 为 65.5%,Claude Opus 5.5 为 62.3%。它的成绩是 mean@5;须线表示最差和最好试验结果,并非置信区间。FrontierSWE 与 Google 的 DeepSWE v1.1、Artificial Analysis 的 Terminal-Bench 4.0 是不同评测。

这些成绩能说明什么,不能说明什么?

实际结论是:这些指标都不是日常编程排行榜。它们不能回答模型有多常保留现有 UI、避免回归、从工具调用失败中恢复,或让代码仓库最终通过测试。在某项基准上更高,完全可能与另一类任务中令人沮丧的工作流并存。

现有主要来源也没有证明 Argon 是在测试集上训练的,因此这种猜测无法解决代码能力问题。

如何公平测试 Argon 的真实工作流?

当 Argon 对你的工作负载开放后,可以建立一套固定评测集,反映你实际要做的工作:

  1. 选择没有出现在提示示例中的仓库和任务,先记录基线测试与构建结果。
  2. 纳入需要视觉检查、键盘和指针行为、响应式状态及无障碍检查的界面改动,不要只靠检查生成代码来判断。
  3. 每次改动后运行完整回归测试,记录新增失败、修复和回滚。
  4. 注入真实的工具失败或缺失上下文,测量模型能否在不做危险编辑、不反复陷入死循环的情况下恢复。
  5. 除通过率外,同时记录输入 Token、输出 Token、工具调用、耗时、重试次数和审阅者修正。

这份清单能把“代码写得好吗?”转化为可观察的结果,也让团队可以在同一批工作上比较 Argon、Astra、Opus 或 Sol,而不是把无关的基准百分比当成同一个指标。

实际上应如何使用“基准刷分”这个词?

把它用作一个关于“基准能否迁移到工作流”的问题,而不是对 Argon 的训练方式或诚实程度下结论。证据支持报告基准、配置和局限。要称得上日常编程赢家,需要来自读者关心的工作负载、可重复的任务结果。

延伸阅读

gemma4 — interact

在线体验 Gemma 4

~/gemma4 $ 先在浏览器中体验 Gemma 4,再决定是否在本地安装。

打开 Gemma 4 在线体验 />
Gemma 4 AI

Gemma 4 AI

相关指南