petergpt/bullshit-benchmark:README に基づく導入ガイド
README、メタデータ、ライセンスに基づく petergpt/bullshit-benchmark の導入と確認ガイドです。
プロジェクトの範囲
petergpt/bullshit-benchmark の README はプロジェクトを「BullshitBench measures whether AI models challenge nonsensical prompts instead of confidently answering them, created by Peter Gostev.」と説明しています。ここではリポジトリで確認できる事実だけを整理します。star 数やバッジは注目度の手掛かりであり、品質の証明ではありません。「README」には次の説明があります。BullshitBench measures whether models detect nonsense, call it out clearly, and avoid confidently continuing with invalid assumptions.。これは範囲の説明であり、本番検証の結果ではありません。
向いている用途
README の「Latest Changelog Entry (2026-07-31)」にある内容から、用途が合うかを先に判断できます。In v1, xhigh scored 0.9212 versus 0.5939 for none; in v2, xhigh scored 1.0700 versus 0.6600 for none.。目的が違うなら、人気だけで採用する理由にはなりません。プロジェクト名やコマンドは原文のまま残し、一次資料へ戻って用語を確認できるようにしています。 README には次の確認可能な項目もあります。Added the July 31 re-post-trained deepseek/deepseek-v4-flash-0731 revision to both published benchmark tracks at none and xhigh reasoning.。初回テストの材料にはなりますが、実際の環境での確認を省略する理由にはなりません。
動作の考え方
動作の説明は「1. Detection Rate by Model (Main Chart)」など複数の箇所に分かれています。確認できる情報は次の通りです。Primary leaderboard-style view showing each model's green/amber/red split. The screenshot uses the viewer's 30-day new-model filter so recent additions remain legible.。書かれていない構成、性能、セキュリティを推測で補いません。導入時はディレクトリ、設定ファイル、release 履歴を確認してください。
インストールと初回起動
初回導入は README の入口から始めます。確認できるコマンドは次の通りです。 README 没有给出可直接复制的安装命令。 実行可能なコマンドがない場合は手順を作らず、「v2 Changelog Highlights」で依存関係、待受ポート、初回設定を確認します。
設定と日常運用
日常運用は公式文書の範囲に限ります。「2. Domain Landscape」にはDetection mix by domain to compare overall performance vs each domain at a glance.とあります。設定、環境変数、権限、データ保存先は明記されたものだけを扱います。未記載の既定値は隔離環境で確認し、戻せる設定を保存してください。 同じ資料にはAppended 310 response rows and their canonical three-judge aggregate rows with no collection, grading, consensus, refusal, or identity errors.ともあります。