Gemini 4 Argonはハルシネーションを解決したわけではありません。2026年10月5日のスナップショットで、Artificial AnalysisはAA-Omniscienceのハルシネーション率を15.1%、正答率を49.9%としています。この2つは異なる指標であり、15.1%はすべての回答のうち誤りだった割合ではありません。
10月5日のスナップショット
Artificial Analysisのモデル記録には次のように表示されています。
| AA-Omniscienceの項目 | Argon(High) |
|---|---|
| 正答率 | 49.9% (0.499) |
| ハルシネーション率 | 15.1% (0.1506986) |
| 付随する非ハルシネーション率 | 約84.9% |
付随する数値は、報告されたハルシネーション率を1から引いた概算です。Artificial Analysisがモデル記録を更新した場合は、現在のスコアとして扱う前に日付と数値を再確認してください。
出典: @rdominguezibar。見出しはその投稿の文言です。脚注は棒グラフの日付を2026年9月30日のArtificial Analysis AA-Omniscienceとし、Argon(High)をハルシネーション15%、正答50%に丸めています。また、Argonは一般公開されておらず、High設定だけがテストされたと説明しています。上の表は10月5日のモデル記録に基づき、15.1%(0.1506986)と正答率49.9%を示しています。
分母に含まれるもの
AA-Omniscienceの方法論によると、正答率は全問題に対する正答の割合です。ハルシネーション率は次の式で計算します。
incorrect / (incorrect + partial + not attempted)このハルシネーションの分母には正答が含まれません。つまり、正答の評価を受けなかったケースのうち、モデルが誤った回答を断定した頻度を測る指標です。全回答に対する誤答率ではありません。
出典: @Cozycanvas53144。Artificial Analysisのチャートのスクリーンショットです。Argon(High)は15%で、一般公開されていないと表示されています。チャートに記載された定義は上の式と同じで、誤答を、誤答・部分正答・未試行の合計で割った比率です。
計算例
次の1,000問の内訳は式を示すための仮想例であり、Argonが観測された回答数ではありません。
| 仮想的な結果 | 件数 |
|---|---|
| 正答 | 800 |
| 誤答 | 30 |
| 部分正答または未試行 | 170 |
条件付きハルシネーション率は 30 / (30 + 170) = 15%です。全問題に対する明確な誤答の割合は 30 / 1,000 = 3%です。スナップショットでのArgonのAA-Omniscience正答率は約49.9%なので、800/30/170の例をArgonの内訳として提示してはいけません。
このスコアから言えること
このスコアから言えるのは、今回の評価では、正答ではなかった結果の中で誤答だった割合が約15.1%という限定的な内容です。すべての回答が信頼できること、知識がないときに必ず回答を控えること、ハルシネーションが消えたことは示しません。同じ記録の正答率が50%未満であることから、その評価の約半分には正しく答えていません。
Argonの他の評価は出典別のベンチマークで確認できます。トークン料金とアクセス時期はAPI価格と公開状況を参照してください。Gemma 4は別のオープンウェイトモデルで、実用上のトラブルシューティングガイドはこちらです。


