vectara/hallucination-leaderboard:用 HHEM 量測摘要幻覺的公開榜單
Leaderboard Comparing LLM Performance at Producing Hallucinations when Summarizing Short Documents
秒懂
- 它是什麼?
- 這個 Python 專案以 Vectara 自家的 HHEM 模型為裁判,對各家 LLM 在短文件摘要任務上產生幻覺的頻率排名,並把資料集版本與模型版本一併公開。它適合用來做初步篩選,但榜單數字只在它定義的那一組任務與裁判模型下成立。
- 適合誰用?
- 如果你的團隊正在為摘要類應用挑模型,這份榜單可以當成第一輪淘汰名單:先看 Hallucination Rate 與 Answer Rate 兩欄,把拒答率極低卻幻覺率不低的模型剔除,再進自己的資料集實測。若你的任務不是短文件摘要,或你的輸入遠長於榜單所用文件,這份榜單的排名不該直接搬到你的選型會議上。
- 可以商用嗎?
- 可以。Apache-2.0 是寬鬆授權:你可以使用、修改並販售以它為基礎的軟體,只需保留著作權與授權聲明。
- 還在維護嗎?
- 有在維護。儲存庫最近一次提交在 127 天前。
- 用什麼語言寫的?
- 主要是 Python(依據 GitHub 的語言統計)。
以上回答依據專案的 GitHub 資料(最近同步於 2026年9月15日)與我們的分析,不構成法律意見。
開源專案深度解析
榜單要回答的問題:摘要任務裡模型有多常自己編內容
多數模型評測問的是「答得對不對」,這份榜單問的是另一件事:在給定一份短文件、要求模型產生摘要的前提下,摘要裡有多少內容是原文沒有的。README 的說明是評估「how often an LLM introduces hallucinations when summarizing a document」,也就是把幻覺當成一個可量測的比率,而不是用個案舉例。
目標讀者有兩類。一類是要選摘要模型的工程團隊,需要一個跨模型的可比數字,省下自己對每一家跑一輪的成本。另一類是關心評測方法本身的人,想知道用模型當裁判(LLM-as-judge)在幻覺這個題目上能做到什麼程度。榜單把 Factual Consistency Rate 與 Hallucination Rate 並列,兩者互補,前者高代表摘要與原文一致,後者高代表模型加了原文沒說的事。
真正讓這份榜單有別於一般排行榜的是第三欄 Answer Rate。它記錄模型願意給出摘要的比例。一個模型可以幻覺率很低,代價是它常常拒答或給出極短的回應。少了這一欄,低幻覺率會被誤讀成高品質。
HHEM 當裁判:分數是模型給的,不是人給的
整個榜單的分數來自 Vectara 的 Hallucination Evaluation Model,簡稱 HHEM。流程是:把文件與模型產生的摘要一起送進 HHEM,由它判斷摘要是否與原文一致,再匯總成比率。這代表榜單的數字不是人工標註的結果,而是另一個模型的判斷輸出。
這個設計的含義值得說清楚。HHEM 的判斷邊界就是整份榜單的判斷邊界。當裁判換版,同一份摘要可能得到不同分數。README 保留了兩條歷史分支:hhem-1.0-final 是基於 HHEM-1.0 的第一版,hhem-2.3-old-dataset 是基於先前資料集的版本。分支同時變動了裁判模型與資料集,所以跨分支的數字沒有可比性。想在專案內比較模型表現,必須鎖定同一條分支。
表格本身提供了幾個可交叉檢查的欄位。Average Summary Length (Words) 讓你看見不同模型的輸出長度差距很大,從 54.7 字到 254.4 字都有。摘要越長,能出錯的位置越多,這個欄位是解讀幻覺率時的必要背景。Answer Rate 則從 62.7% 到 100.0% 不等,跨度不小。
榜單的資料流:從文件與摘要到一行排名
從 README 可見的結構推斷,資料流是:一份固定的短文件集合,加上每個受測模型對這些文件產生的摘要,逐筆送進 HHEM 得到一致性判定,再聚合成該模型的幻覺率與事實一致性率。README 沒有公開文件集合的抽樣方式、文件長度分布與語言組成,這些是評估這份榜單外部效度時會想知道的資訊,但材料裡沒有。
表格由 <!-- LEADERBOARD_START --> 這類標記標出區塊,README 顯示的更新日期是 May 11, 2026,圖檔名為 top25_hallucination_rates_2026-04-20.png。這說明更新是滾動的,榜單會隨模型與裁判模型改版而變動。對使用者的實務影響是:引用榜單數字時要連同日期一起引用,單獨寫「某模型幻覺率 3.1%」而沒有日期,過幾個月就可能對不上。
排名本身也值得多看一層。表格依幻覺率排序,但同一段區間內多個模型並列同一個數字,例如 5.1%、5.2%、5.3%、9.3% 都各有多個模型。在並列區間內,名次先後不該被當成有意義的差距。
動手跑之前:README 給了什麼、沒給什麼
需要先講明一件事:這份榜單的 README 是一份結果頁,不是安裝指南。它提供互動版入口(Hugging Face Space vectara/leaderboard)、歷史版本分支連結、以及表格本身,但沒有在提供的內容裡出現安裝指令、Python 套件名稱、requirements 檔案或推論腳本。
因此能從材料確認的操作只有兩類。第一,直接開 Hugging Face Space 看互動榜單。第二,用 git 切換分支讀歷史結果,README 給出的分支名是 hhem-1.0-final 與 hhem-2.3-old-dataset。若你的目的是自己重跑評測,材料不足以告訴你怎麼做,需要另外查 HHEM 模型本身的說明。把「clone 這個 repo 就能重現分數」當成前提是錯的。
表格欄位倒是給了明確的解析契約:Model、Hallucination Rate、Factual Consistency Rate、Answer Rate、Average Summary Length (Words)。要寫程式抓這張表,就得處理百分比字串與帶逗號的模型識別碼。
低幻覺率的代價:拒答與長度兩個被忽略的變數
榜單最容易誤用的地方,是只看第一欄。把 Answer Rate 與幻覺率放在一起看,會看到完全不同的圖像。snowflake/snowflake-arctic-instruct 的幻覺率 4.3%,但 Answer Rate 只有 62.7%。microsoft/Phi-4 的幻覺率 3.7%,Answer Rate 80.7%。相對地,amazon/nova-micro-v1:0 的 Answer Rate 是 100.0%,幻覺率 5.5%。
這不是說哪一種一定更好,而是說兩種模型在產品裡的行為不同。一個常常拒答的模型,在需要覆蓋率的摘要流程裡會製造大量人工接手;一個總是回答的模型,則把風險轉移到內容正確性上。榜單把兩個數字並列,正是要讓這個取捨可見。
Average Summary Length 是第二個變數。mistralai/ministral-8b-2410 的幻覺率 7.4%,平均摘要長度 196.0 字;openai/gpt-5.4-mini-2026-03-17 的幻覺率 5.5%,長度 54.7 字。輸出長度差了三倍以上,直接比較幻覺率等於把「寫得多」和「寫得準」混在一起。
什麼時候這份榜單不適用
第一個明確的邊界是任務類型。榜單量的是短文件摘要。如果你的場景是長文件、多輪對話、檢索增強生成裡的引用標註,或結構化抽取,這份榜單沒有涵蓋。把摘要幻覺率當成通用的事實性指標,是對結果的過度延伸。
第二個邊界是裁判模型。分數由 HHEM 產生,HHEM 的判斷偏好會系統性地反映在排名上。Vectara 同時是榜單發布者與裁判模型提供者,README 也明說會隨自家模型更新而更新榜單。這不代表數字有問題,但代表這是一份由單一機構、單一方法論產出的排名,缺少第二個獨立裁判的交叉驗證。
第三個邊界是資料集版本的斷裂。README 保留舊分支的理由,正是因為新舊版本不能直接比。若你的團隊在半年前記錄了某模型的分數,現在要對照新表,必須先確認兩邊是不是同一條分支、同一個裁判版本。
替代做法:自己建評測集,或改用可自持的評測框架
與其依賴公開榜單,另一條路是用 OpenAI Evals、promptfoo 這類可自持的評測框架,在自己的文件上跑自己的裁判。差別在於控制權:你可以決定文件長度分布、語言、領域,也能換裁判模型做敏感度分析。代價是你得自己處理裁判模型的校準問題,而這正是 HHEM 幫你做完的部分。
兩者的取捨很清楚。公開榜單的優勢是跨模型可比、零建置成本,劣勢是任務與資料集固定、裁判不可換、更新節奏由發布方決定。自建評測的優勢是貼合真實分布,劣勢是每個團隊各自一套標準,跨團隊無法對照。
對多數團隊,合理順序是先看榜單縮小候選範圍,再用自己的評測集做最終決定。把榜單當成篩子而不是判決,它的價值就成立;把它當成判決,爭議會落在 HHEM 的判斷邊界上,而那不在你的控制範圍內。
維護成本與授權:Apache-2.0 涵蓋的是什麼
repository 的授權是 Apache-2.0,這是寬鬆授權,允許商業使用、修改與再散布,條件包括保留著作權與授權聲明、標明修改,並附上 NOTICE 檔案(若原專案有提供)。專利授權條款也包含在內。這裡只描述條款內容,不構成法律意見;要把榜單資料嵌入產品或對外發布衍生排名,應由法務確認。
需要分清楚的是授權涵蓋範圍。Apache-2.0 涵蓋的是這個 repository 裡的程式與內容。榜單上的模型名稱、各模型的輸出,以及 HHEM 裁判模型本身,各有自己的授權與使用條款,不在這個 repository 的授權之內。README 沒有說明 HHEM 模型的可取得性與授權,材料不足以判斷。
維護面上,這個專案沒有檢索到任何 release,更新以 README 內容與分支的形式進行。對使用者的實際含義是:沒有版本號可以鎖定,引用時只能靠日期與分支名。若你要把榜單數字寫進內部文件,記下 README 上的 Last updated 日期與 branch 名稱,是唯一可追溯的作法。
編輯結論
如果你的團隊正在為摘要類應用挑模型,這份榜單可以當成第一輪淘汰名單:先看 Hallucination Rate 與 Answer Rate 兩欄,把拒答率極低卻幻覺率不低的模型剔除,再進自己的資料集實測。若你的任務不是短文件摘要,或你的輸入遠長於榜單所用文件,這份榜單的排名不該直接搬到你的選型會議上。採用前先確認三件事:HHEM 裁判模型的版本是否與你要對齊的那一版一致、榜單當下的資料集分支是哪一條、以及你想比較的模型是否在表上;HHEM-1.0 與 hhem-2.3-old-dataset 兩條分支的數字不可混用。
社群筆記