0% 読了

Gemini 4 Argonのベンチマーク:GoogleとFrontierSWE

2026年10月5日

Gemini 4 Argonに単一のベンチマーク順位はありません。Googleの発表表、Artificial Analysisのモデル記録、FrontierSWE V2のリーダーボードは異なるタスクを測り、異なる種類の根拠を示します。以下では、ある評価の結果がすべての評価での勝利として扱われないよう、表を分けています。

Gemini 4 Argon、GPT-6 Astra、Claude Fable 5.1、Claude Opus 5.5のGoogle比較表。

出典: Sundar Pichai、2026年9月30日。この画像はGoogleのローンチ比較表です。網掛けは別のモデルが上回る行を示します。画像に記載された方法論のURLはdeepmind.google/models/evals-methodology/gemini-4-argonです。

Googleの9月30日発表にあるスコア

Googleの発表には、次のスコアが掲載されています。

評価ArgonのスコアGoogleの投稿での説明
DeepSWE v1.177.9%長期ソフトウェアエンジニアリングで新たな最高水準
AutomationBench (Zapier)51.3%エンドツーエンドのビジネスタスク実行で1位
LVBench91.7%長時間動画理解で最高水準
CWE-bench v168%セキュリティ脆弱性の修正で1位タイ

発表記事が取り上げているのは、この4行です。投稿された表には、同じローンチに含まれるより広い結果が載っています。画像では、Vals IndexがArgon 68.9%、Harvey’s Legal Agent Benchmarkが19.6%です。FrontierSWE v2はArgon 55.0%、Astra 65.5%で、Astraのセルが網掛けです。Terminal-bench 4.0はArgon 57.4%、Opus 5.5が66.4%で、Opusのセルが網掛けです。これらは上の画像から読み取った数値で、このページに別のスコアを追加しているわけではありません。

Artificial Analysisのスナップショット

2026年10月5日に確認したArtificial Analysisのモデル記録には、別の概要が掲載されています。

Artificial Analysisの項目スナップショット
Intelligence Index v4.3.253(基礎値52.5606)
Intelligence Index 1タスクのコスト約$1.99
コンテキストウィンドウ1Mトークン
アクセス表示一般公開されていない

Intelligence Indexは複合評価です。その丸めた53を、Googleのタスク別パーセンテージと混ぜてはいけません。タスクコストは評価上の推定値で、顧客に固定請求される料金ではありません。トークン料金はAPI価格と出力上限で確認できます。

FrontierSWE V2:一次情報のコーディングリーダーボード

FrontierSWE V2のリーダーボードは、別のコーディング結果を示します。見出しの表はproximusハーネス、全34タスク、1タスクあたり5試行、20時間の予算で構成されています。スコアはmean@5で、ひげはworst@5からbest@5を示し、信頼区間ではありません。

モデルFrontierSWE V2 mean@5
Gemini 4 Argon55.0%
GPT-6 Astra65.5%
Claude Opus 5.562.3%

この設定では、AstraはArgonを10.5パーセントポイント上回ります。FrontierSWEはDeepSWEでもArtificial Analysis Terminal-Bench 4.0でもありません。そのため、この表だけでGoogleのDeepSWE結果を書き換えたり、普遍的なコーディング順位を決めたりはできません。

サードパーティのText Arenaチャート

Gemini 4 Argon HighをElo 1,525、1位と示すサードパーティのText Arenaチャート。

出典: @AI_Screening。これはそのアカウントが投稿したチャートであり、arena.aiのエクスポートではありません。上の3つの表の出典にも含まれません。チャートはGemini 4 Argon(High)をElo 1,525、1位と表示しています。2本目のバーはOpus 5.5ではなくClaude Opus 4.6です。この投稿にある選好リーダーボードの画像として読み取ってください。

数値の差をどう読むか

「Argonが何でも勝つ」という結論より、狭い結論の方が有用です。Argonの報告結果は、タスク、ハーネス、モデル設定、採点ルールによって変わります。別の15.1%というAA-Omniscienceの数値については、ハルシネーション率が測るものを読んでください。ArgonとGemma 4の違いはGemma 4とGeminiの比較で説明しています。

gemma4 — interact

Gemma 4 をブラウザで試す

~/gemma4 $ ローカル環境に導入する前に、ブラウザで Gemma 4 を試してみましょう。

Gemma 4 を試す />
Gemma 4 AI

Gemma 4 AI

関連ガイド