在 2026 年 10 月 5 日的 Artificial Analysis Intelligence Index 資料中,Claude Opus 5.5 的分數高於 Gemini 4 Argon,並在該比較列出的四項詳細評測中領先三項。Argon 在 AutomationBench-AA 上領先,估算的單次任務成本較低。這是可測量的取捨,但不能說明哪個模型天生擅長某類軟體開發。
來源:Sundar Pichai,2026 年 9 月 30 日。在這張 Google 表格中,Terminal-bench 4.0 的 Argon 為 57.4%、Opus 5.5 為 66.4%,Opus 的儲存格帶有陰影。該列的 Astra 為 58.2%,Fable 5.1 為 57.9%。這些百分比不是下表中的 Artificial Analysis Terminal-Bench 4.0 數字,後者分別為 57% 和 60%。
Argon High 與 Opus 5.5 一覽
Artificial Analysis 比較評測的是 Gemini 4 Argon High 與 Claude Opus 5.5 Max, Default Fallback。下表是截至 2026 年 10 月 5 日的資料。
| 評測 | Gemini 4 Argon High | Claude Opus 5.5 Max, Default Fallback |
|---|---|---|
| Artificial Analysis Intelligence Index | 53 | 58 |
| 估算的單次任務成本 | $1.99 | $5.98 |
| AutomationBench-AA | 78% | 70% |
| Terminal-Bench 4.0 | 57% | 60% |
| GDP.pdf | 22% | 26% |
| AA-LCR v1.1 | 80% | 85% |
Opus 在指數上高 5 分,在 Terminal-Bench 4.0 上高 3 分,在 GDP.pdf 上高 4 分,在 AA-LCR v1.1 上高 5 分。Argon 在 AutomationBench-AA 上高 8 分。在這份資料中,單次任務估算成本是 Argon 1.99 美元、Opus 5.98 美元。
如何理解適用情境差異?
這張表可以作為測試起點:
- 如果 78% 的 AutomationBench-AA 成績對應你的系統所需操作,可以把 Argon 放進自動化程度較高的工作流。
- 如果終端執行、文件推理或 AA-LCR 任務族更重要,而且更高的成績值得額外成本,可以讓 Opus 負責這類工作流。
- 用自己的提示詞測量已完成的工作。基準分數不能證明誰是日常程式設計、介面工作或長文寫作的普遍贏家。
這些評測配置不足以給模型貼上前端或後端標籤。工具權限、上下文、測試和重試行為都可能改變實際結果。
Token 價格與單次任務成本是兩回事
同一份 Artificial Analysis 比較列出了這些評測配置的價格:
| 價格項目 | Gemini 4 Argon High | Claude Opus 5.5 Max, Default Fallback |
|---|---|---|
| 每 1M Token 輸入 / 輸出 | $2 / $10 | $4 / $20 |
| 每 1M Token 快取輸入 | $0.10 | $0.20 |
單次任務數字是加權評測成本,並不是每位客戶每次請求都要支付的固定費用。正式環境執行可能有不同的 Token 組合、工具路徑和完成長度。預算應使用價格表,單位經濟性則應使用有代表性的任務集測量。
可用性也是比較的一部分
Google 的9 月 30 日公告表示,Argon 首先提供給 Fairwind 中的可信網路安全防禦人員並供內部使用,之後從付費 API 客戶和 Google AI Ultra 訂閱者開始擴大存取。公告沒有承諾每個帳號的發布日期。在把一個可以呼叫的模型與一個可能仍受限的模型比較前,請查看 Argon 存取詳情。



