開源專案
petergpt/bullshit-benchmark avatar
petergpt/bullshit-benchmark

BullshitBench v2:從 README 拆解使用邊界

此專案圍繞「petergpt/bullshit-benchmark」建置,面向真實業務場景,提供可重複使用、可持續維運的開源實作。

1,867 個 Star74 個 ForkPythonMIT

秒懂

它是什麼?
BullshitBench 用 100 個無意義提示評估 AI 模型是明確反駁、部分質疑還是完全接受胡說八道,並配有可互動的檢視器。
適合誰用?
BullshitBench v2 的檢視器和公開資料集已更新到 2026 年 7 月 31 日,README 記錄了新增 deepseek-v4-flash-0731 修訂版及 310 行回應資料。該修訂版在 v1 和 v2 中的分數有具體數字,但其他模型的詳細排名、資料集完整內容以及後續維護計畫,需要查看公開檢視器或 CHANGELOG 才能確認。
可以商用嗎?
可以。MIT 是寬鬆授權:你可以使用、修改並販售以它為基礎的軟體,只需保留著作權與授權聲明。
還在維護嗎?
有在維護。儲存庫最近一次提交在 2 天前。
用什麼語言寫的?
主要是 Python(依據 GitHub 的語言統計)。

以上回答依據專案的 GitHub 資料(最近同步於 2026年9月14日)與我們的分析,不構成法律意見。

開源專案深度解析

專案要測量的內容:入口與定位

BullshitBench 用 100 個無意義提示評估 AI 模型是明確反駁、部分質疑還是完全接受胡說八道,並配有可互動的檢視器。 本文只採用 petergpt-bullshit-benchmark README 已寫明的功能、數字、版本與限制,將它們放回實際使用者會遇到的選擇中。 BullshitBench 的目標是衡量 AI 模型在面對無意義提示時的行為。README 將其定義為:模型能否檢測到無意義內容、明確指出來,並避免繼續基於無效假設進行回答。專案把結果分為三類:Clear Pushback(明確拒絕有問題的前提)、Partial Challenge(指出問題但仍繼續參與)、Accepted Nonsense(把無意義內容當作有效內容處理)。這個框架強調的是模型是否挑戰荒謬的前提,而不是僅僅生成流暢的回答。(第 1 節的專案脈絡) BullshitBench 的目標是衡量 AI 模型在面對無意義提示時的行為。README 將其定義為:模型能否檢測到無意義內容、明確指出來,並避免繼續基於無效假設進行回答。專案把結果分為三類:Clear Pushback(明確拒絕有問題的前提)、Partial Challenge(指出問題但仍繼續參與)、Accepted Nonsense(把無意義內容當作有效內容處理)。這個框架強調的是模型是否挑戰荒謬的前提,而不是僅僅生成流暢的回答。

v2 版本包含 100 個無意義提示,分佈在 5 個領域:軟體(40 個)、金融(15 個)、法律(15 個)、醫療(15 個)和物理(15 個)。README 提到 13 種無意義技術,例如 plausible_nonexistent_framework、misapplied_mechanism、n(針對 petergpt-bullshit-benchmark 的第 1 項核對) 在 petergpt-bullshit-benchmark 的脈絡下,這一節的判斷不是把 README 改寫成宣傳語,而是指出條件如何影響使用。請把 petergpt-bullshit-benchmark、README、實際命令與輸出放在同一份紀錄中,檢查輸入是否被正確接受、結果是否符合文件描述,以及限制是否在你的平台重現。這個核對點只對應本節的 入口,不把其他專案的經驗移植過來。

v2 的範圍和設計:資料與執行邊界

閱讀 petergpt-bullshit-benchmark 時,先分清專案宣稱的入口、依賴條件與輸出物。README 中的命令、檔案路徑和設定名稱,比抽象的效能形容更能界定它適合的工作。 v2 版本包含 100 個無意義提示,分佈在 5 個領域:軟體(40 個)、金融(15 個)、法律(15 個)、醫療(15 個)和物理(15 個)。README 提到 13 種無意義技術,例如 plausible_nonexistent_framework、misapplied_mechanism、nested_nonsense 和 specificity_trap,但沒有逐一列出全部技術名稱。評測使用 3 個裁判(anthropic/claude-sonnet-4.6、openai/gpt-5.2、google/gemini-3.1-pro-preview)以 full 模式和 mean 聚合方式對每行進行評分,v2 已發佈的排行榜包含 192 個模型/推理行。(第 2 節的專案脈絡) ested_nonsense 和 specificity_trap,但沒有逐一列出全部技術名稱。評測使用 3 個裁判(anthropic/claude-sonnet-4.6、openai/gpt-5.2、google/gemini-3.1-pro-preview)以 full 模式和 mean 聚合方式對每行進行評分,v2 已發佈的排行榜包含 192 個模型/推理行。

專案提供了一個公開的互動式檢視器,地址為 https://petergpt.github.io/bullshit-benchmark/viewer/index.v2.html。README 描述了檢視器中的多個視圖:Detection Rate by Model(按模型顯示綠色/琥珀色/紅色佔比的主排行榜)、Domain Landscape(各領域檢測率對比)、Detec(針對 petergpt-bullshit-benchmark 的第 2 項核對) 在 petergpt-bullshit-benchmark 的脈絡下,這一節的判斷不是把 README 改寫成宣傳語,而是指出條件如何影響使用。請把 petergpt-bullshit-benchmark、README、實際命令與輸出放在同一份紀錄中,檢查輸入是否被正確接受、結果是否符合文件描述,以及限制是否在你的平台重現。這個核對點只對應本節的 資料,不把其他專案的經驗移植過來。

檢視器中的視覺化:效能或功能取捨

對 petergpt-bullshit-benchmark 的限制不能被標題或單一範例掩蓋。若 README 只描述某個平台、資料格式或測試條件,這個範圍就是判讀結果的邊界,不能延伸成未提供的承諾。 專案提供了一個公開的互動式檢視器,地址為 https://petergpt.github.io/bullshit-benchmark/viewer/index.v2.html。README 描述了檢視器中的多個視圖:Detection Rate by Model(按模型顯示綠色/琥珀色/紅色佔比的主排行榜)、Domain Landscape(各領域檢測率對比)、Detection Rate Over Time(按發佈日期顯示趨勢)、Do Newer Models Perform Better?(發佈日期與綠色率的散點圖)、Does Thinking Harder Help?(推理 token/成本與綠色率的關係)以及 Model Size and Weights(總參數量與激活參數量的散點圖)。這些視圖用於比較模型在不同維度的表現。(第 3 節的專案脈絡) tion Rate Over Time(按發佈日期顯示趨勢)、Do Newer Models Perform Better?(發佈日期與綠色率的散點圖)、Does Thinking Harder Help?(推理 token/成本與綠色率的關係)以及 Model Size and Weights(總參數量與激活參數量的散點圖)。這些視圖用於比較模型在不同維度的表現。

README 提供了快速開始步驟。首先需要設定環境變數,包括 OPENROUTER_API_KEY,以及僅當模型路由到 OpenAI 時才需要的 OPENAI_API_KEY,可選變數還有 OPENAI_PROJECT 和 OPENAI_ORGANIZATION。模型的路由通過配置中的 collect.model_providers 和 grade.model_provid(針對 petergpt-bullshit-benchmark 的第 3 項核對) 在 petergpt-bullshit-benchmark 的脈絡下,這一節的判斷不是把 README 改寫成宣傳語,而是指出條件如何影響使用。請把 petergpt-bullshit-benchmark、README、實際命令與輸出放在同一份紀錄中,檢查輸入是否被正確接受、結果是否符合文件描述,以及限制是否在你的平台重現。這個核對點只對應本節的 效能,不把其他專案的經驗移植過來。

執行流程和配置:實際核對方式

採用前可針對 petergpt-bullshit-benchmark 的專屬入口做小型核對:使用 README 指定的命令或檔案,觀察實際輸出、錯誤訊息、資源用量與版本差異。這些觀察點要和文中聲稱的能力逐項對照。 README 提供了快速開始步驟。首先需要設定環境變數,包括 OPENROUTER_API_KEY,以及僅當模型路由到 OpenAI 時才需要的 OPENAI_API_KEY,可選變數還有 OPENAI_PROJECT 和 OPENAI_ORGANIZATION。模型的路由通過配置中的 collect.model_providers 和 grade.model_providers 設定,預設使用 OpenRouter。運行 v2 端到端流程的命令是 ./scripts/run_end_to_end.sh --config config.v2.json --viewer-output-dir data/v2/latest --with-additional-judges。還可以使用 --serve --port 8877 在本機啟動檢視器。README 沒有說明這些命令的具體實現細節,也沒有提供 Windows 或非 Unix 環境下的運行方法。(第 4 節的專案脈絡) ers 設定,預設使用 OpenRouter。運行 v2 端到端流程的命令是 ./scripts/run_end_to_end.sh --config config.v2.json --viewer-output-dir data/v2/latest --with-additional-judges。還可以使用 --serve --port 8877 在本機啟動檢視器。README 沒有說明這些命令的具體實現細節,也沒有提供 Windows 或非 Unix 環境下的運行方法。

v1 資料集位於 data/latest,v2 資料集位於 data/v2/latest。v2 問題集由 scripts/build_questions_v2_from_draft.py 從 drafts/new-questions.md 生成。README 指出(針對 petergpt-bullshit-benchmark 的第 4 項核對) 在 petergpt-bullshit-benchmark 的脈絡下,這一節的判斷不是把 README 改寫成宣傳語,而是指出條件如何影響使用。請把 petergpt-bullshit-benchmark、README、實際命令與輸出放在同一份紀錄中,檢查輸入是否被正確接受、結果是否符合文件描述,以及限制是否在你的平台重現。這個核對點只對應本節的 命令,不把其他專案的經驗移植過來。

已發佈的資料集和文件:適用範圍

petergpt-bullshit-benchmark 的取捨最後取決於你的輸入和部署環境。適合需要 README 所列能力、能接受其平台與成熟度限制的人;若需求落在文件未說明的範圍,應先把缺口視為未知,而不是自行補上。 v1 資料集位於 data/latest,v2 資料集位於 data/v2/latest。v2 問題集由 scripts/build_questions_v2_from_draft.py 從 drafts/new-questions.md 生成。README 指出,規範評分現在固定為每行恰好 3 個裁判,採用均值聚合,舊的衝突分歧平局機制已從主流程中移除。專案文件包括 docs/TECHNICAL.md(技術指南)、CHANGELOG.md(發佈記錄)、questions.json 和 questions.v2.json(問題集)、config.json 和 config.v2.json(配置檔案)。README 說明它面向受眾,而技術內容放在技術指南中。(第 5 節的專案脈絡) ,規範評分現在固定為每行恰好 3 個裁判,採用均值聚合,舊的衝突分歧平局機制已從主流程中移除。專案文件包括 docs/TECHNICAL.md(技術指南)、CHANGELOG.md(發佈記錄)、questions.json 和 questions.v2.json(問題集)、config.json 和 config.v2.json(配置檔案)。README 說明它面向受眾,而技術內容放在技術指南中。

專案採用 MIT 許可證,版權歸 Peter Gostev 所有。許可證允許使用、複製、修改、合併、發佈、分發、再許可和銷售軟體副本,前提是保留版權聲明和許可聲明。許可證按「原樣」提供軟體,不附帶任何明示或暗示的保證,包括適銷性、特定用途適用性和非侵權性。許可證沒有提及安全保證、支援服務或持續維護承諾,這些內容在 README 中也沒有涉及。(針對 petergpt-bullshit-benchmark 的第 5 項核對) 在 petergpt-bullshit-benchmark 的脈絡下,這一節的判斷不是把 README 改寫成宣傳語,而是指出條件如何影響使用。請把 petergpt-bullshit-benchmark、README、實際命令與輸出放在同一份紀錄中,檢查輸入是否被正確接受、結果是否符合文件描述,以及限制是否在你的平台重現。這個核對點只對應本節的 範圍,不把其他專案的經驗移植過來。

編輯結論

BullshitBench v2 的檢視器和公開資料集已更新到 2026 年 7 月 31 日,README 記錄了新增 deepseek-v4-flash-0731 修訂版及 310 行回應資料。該修訂版在 v1 和 v2 中的分數有具體數字,但其他模型的詳細排名、資料集完整內容以及後續維護計畫,需要查看公開檢視器或 CHANGELOG 才能確認。 適合需要 petergpt-bullshit-benchmark README 所列能力、並能接受文件範圍的人;不適合把未說明的行為當成保證。先依 README 的專屬命令、設定或檔案完成一個最小案例,逐項觀察輸出與錯誤,再決定是否放進正式流程。

官方來源

  1. Official documentation
  2. Official README
  3. Project repository
社群筆記

社群筆記