已閱讀 0%

Gemini 4 Argon 幻覺率:15.1% 到底代表什麼?

2026年10月5日

Gemini 4 Argon 並沒有解決幻覺問題。在 2026 年 10 月 5 日的資料中,Artificial Analysis 列出的 AA-Omniscience 幻覺率為 15.1%,準確率為 49.9%。這是兩個不同的指標,15.1% 也不是所有回答中錯誤回答的占比。

10 月 5 日資料

Artificial Analysis 模型紀錄顯示:

AA-Omniscience 欄位Argon (High)
準確率49.9%(0.499)
幻覺率15.1%(0.1506986)
配套的非幻覺率約 84.9%

配套數字約等於 1 減去報告的幻覺率。如果 Artificial Analysis 更新模型紀錄,應重新核對日期和數值,再把它當作目前成績引用。

AA-Omniscience 幻覺率比較圖,Gemini 4 Argon(High)的幻覺率為 15%,答對率為 50%。

來源:@rdominguezibar。圖中標題是該貼文的原文。腳註註明,圖表採用 2026 年 9 月 30 日的 Artificial Analysis AA-Omniscience 資料;Argon(High)的成績經過四捨五入,顯示為 15% 幻覺率和 50% 答對率。該貼文還表示 Argon 當時尚未公開提供,且只測試了 High 設定。上表使用 10 月 5 日的模型紀錄:15.1%(0.1506986)和 49.9% 準確率。

這個分母統計什麼?

根據 AA-Omniscience 方法說明,準確率是正確回答數除以全部問題數。幻覺率的公式是:

incorrect / (incorrect + partial + not attempted)

正確回答不計入幻覺率分母。這個指標衡量的是:在模型沒有獲得「正確」評分的情況下,它有多大比例會直接斷言一個錯誤答案;它不是所有回答的錯誤率。

Artificial Analysis AA-Omniscience 幻覺率圖,Gemini 4 Argon(High)為 15%。

來源:@Cozycanvas53144,這是 Artificial Analysis 圖表的截圖。Argon(High)為 15%,並標註為尚未公開提供。圖表上的定義與上方公式相同:錯誤回答數除以錯誤、部分回答和未嘗試回答的總數。

一個用來說明的計算

下面的 1,000 題分布只是解釋公式的假設示例,並不是 Argon 的實際答題數量:

示意結果數量
正確800
錯誤30
部分回答或未嘗試170

條件幻覺率為 30 / (30 + 170) = 15%。全部問題中的直接錯誤占比為 30 / 1,000 = 3%。資料中的 Argon 實際 AA-Omniscience 準確率約為 49.9%,因此不能把 800/30/170 這個示例說成 Argon 的實際分布。

這個成績能說明什麼?

這個成績支持一個有限的結論:在這項評測中,Argon 在非正確結果中的錯誤回答率約為 15.1%。它不能證明每個回答都可靠,不能證明模型在不知道時總會拒答,也不能證明幻覺已經消失。同一紀錄中的準確率低於 50%,也表示模型在這項評測中大約有一半問題沒有答對。

Argon 的其他評測請看按來源整理的基準測試。Token 價格與存取時間請看 API 價格和發布狀態。Gemma 4 是獨立的開放權重模型;實際執行時的問題排查可參考疑難排解指南。

gemma4 — interact

線上體驗 Gemma 4

~/gemma4 $ 先在瀏覽器中試用 Gemma 4,再決定是否在本機安裝。

開啟 Gemma 4 線上體驗 />
Gemma 4 AI

Gemma 4 AI

相關指南