モデル / データセット
SemiAnalysisAI/InferenceX avatar
SemiAnalysisAI/InferenceX

InferenceXの継続ベンチマークを結果の読み方から評価する

オープンソースの連続推論ベンチマーク研究プラットフォーム、Kimi K2.7 コード、MiniMax M3、DeepSeekv4、GLM5 - GB200 NVL72 対 MI355X 対 B200 対 GB300 NVL72、近々 TPUv6e/v7/Trainium2/3 | 、君 K2.7-コード MiniMax M3 DeepSeekv4 GLM5 - GB200 NVL72 対 MI355X 対 B200 対 GB300 NVL72 TPUv6e/v7/Trainium2/3。

スター 1,676フォーク 294PythonApache-2.0

ひと目でわかる

これは何?
オープンソース推論フレームワークとモデル、GPUシステムの性能を継続的に分析するApache-2.0の研究プラットフォームです。
誰に向いている?
InferenceXは、vLLMやSGLangなどの推論スタックをハードウェア別に追い、公開結果の変化を研究したい人に向きます。採用前に公式リポジトリと非公式フォークを区別し、inferencex.semianalysis.comの同一プリセットで測定時点、モデル、GPU、ソフトウェア版、指標を確認してください。
商用利用できる?
できます。Apache-2.0 は寛容なライセンスで、著作権表示とライセンス表示を残せば、使用・改変・販売が可能です。
今もメンテナンスされている?
されています。最後のコミットは 1 日前です。
何の言語で書かれている?
主に Python です(GitHub の言語統計による)。

回答はプロジェクトの GitHub データ(最終同期:2026年9月14日)と当サイトの分析に基づくもので、法的助言ではありません。

オープンソース詳細解説

固定結果ではなく更新を追う研究基盤

InferenceXは旧称InferenceMAXの推論性能研究プラットフォームです。READMEは、オープンソース推論フレームワークの実性能を継続的にベンチマークし、ソフトウェアスタックの改善をほぼリアルタイムに追うことを目的にしています。公開ダッシュボードと、別リポジトリのオープンソースアプリへのリンクがあります。

推論性能はGPUなどのハードウェアだけでなく、SGLang、vLLM、TensorRT-LLM、CUDA、ROCmのカーネル最適化、分散実行、スケジューリングにも左右されます。一回限りの測定が古くなるという問題設定は明確ですが、実行スケジュールや全ワークロードはREADMEにありません。

公式の`SemiAnalysisAI/InferenceX`とフォークのURLを分けて記録し、結果画面の公式表示を確認します。

semianalysisai-inferencex-deep-analysisの第1章を確認するときは、実行前の版と設定を保存し、成功した結果だけでなく失敗した入力も残します。READMEの説明、端末の出力、生成物の差分を別々に記録することで、機能の存在と自分の環境での再現性を区別できます。

公式結果とフォークを混同しない

READMEは、公式のInferenceX結果を含むのは`SemiAnalysisAI/InferenceX`だけで、他のフォークやリポジトリは非公式だと明記しています。非公式の機械やクラウド設定は異なり、結果が劣る可能性があるため、フォークは免責文を削除できないという条件もあります。

結果を引用するときは、リポジトリの所有者、ダッシュボードのURL、プリセット、測定日を同じ記録に残します。名前が似た結果を一つの系列として結合せず、公式と非公式の表示を画面上で確認することが最低限の再現条件になります。

同じモデル名でもプリセット、GPU SKU、ソフトウェア版が違えば比較を止め、ダッシュボードの条件を先に保存します。

semianalysisai-inferencex-deep-analysisの第2章を確認するときは、実行前の版と設定を保存し、成功した結果だけでなく失敗した入力も残します。READMEの説明、端末の出力、生成物の差分を別々に記録することで、機能の存在と自分の環境での再現性を区別できます。

対応GPUの一覧と近日対応項目

公式サポートにはGB300 NVL72、GB200 NVL72、MI355X、B300、B200、MI325X、MI300X、H200、H100が列挙されています。TPUv7x Ironwood Ghostfish、MI455 UALoE72、Vera Rubin NVL72、Rubin NVL8などは近日対応とされますが、予定日は示されていません。

ニュース欄にはMiniMax M3、DeepSeek V4 Pro 1.6T、Qwen3.5 397B、Kimi K2.5、GLM5などの継続ベンチマークが記載されています。モデル名が同じでも世代やプリセットが違えば比較できないため、ダッシュボードのモデル設定とハードウェアSKUを照合してからグラフを読みます。

GB300 NVL72など対応済みの項目とTPUv7xなど近日対応の項目を分け、予定日がないものを導入計画へ入れません。

semianalysisai-inferencex-deep-analysisの第3章を確認するときは、実行前の版と設定を保存し、成功した結果だけでなく失敗した入力も残します。READMEの説明、端末の出力、生成物の差分を別々に記録することで、機能の存在と自分の環境での再現性を区別できます。

測定結果から不足している情報

READMEは継続測定の目的と対応対象を説明しますが、レイテンシ、スループット、同時実行数、入力と出力の長さ、量子化、推論フレームワークの版を標準化した表は載せていません。したがって、公開グラフの一つの数値から費用対効果や自社の応答時間を計算することはできません。

検証では同じダッシュボードプリセットを開き、表示された単位、時間範囲、モデル、GPU、ソフトウェア情報を保存します。ローカルのベンチマークを行う場合は、READMEの不足部分を自分の実験計画で明示し、InferenceXの公式値とは別系列として記録します。

スループットやレイテンシの単位が画面にどう表示されるかを確認し、READMEにない指標の定義を推測しません。

semianalysisai-inferencex-deep-analysisの第4章を確認するときは、実行前の版と設定を保存し、成功した結果だけでなく失敗した入力も残します。READMEの説明、端末の出力、生成物の差分を別々に記録することで、機能の存在と自分の環境での再現性を区別できます。

貢献、支援者、Apache-2.0

PRは歓迎され、`CONTRIBUTING.md`にレビューの流れ、`docs/PR_REVIEW_CHECKLIST.md`にチェックリスト、マージ手順があるとREADMEは案内します。謝辞にはAMD、NVIDIA、SGLang、vLLM、TensorRT-LLM、複数の計算資源提供者が挙げられていますが、各組織の権限や測定設計への関与は説明されていません。

ライセンスはApache-2.0です。再利用の検討材料にはなりますが、ベンチマークの監査、保証、サポート義務を意味しません。公式結果を研究や設備選定に使う場合は、数値だけでなく設定、取得時点、結果の更新履歴を保存し、READMEにない前提を自分で補っていることを明記します。

PRを送る場合は`CONTRIBUTING.md`と`docs/PR_REVIEW_CHECKLIST.md`を読み、支援者の謝辞を権限や監査の根拠にしません。

semianalysisai-inferencex-deep-analysisの第5章を確認するときは、実行前の版と設定を保存し、成功した結果だけでなく失敗した入力も残します。READMEの説明、端末の出力、生成物の差分を別々に記録することで、機能の存在と自分の環境での再現性を区別できます。

編集部の結論

InferenceXは、vLLMやSGLangなどの推論スタックをハードウェア別に追い、公開結果の変化を研究したい人に向きます。採用前に公式リポジトリと非公式フォークを区別し、inferencex.semianalysis.comの同一プリセットで測定時点、モデル、GPU、ソフトウェア版、指標を確認してください。READMEにはローカル実行手順や測定方法の詳細がないため、ダッシュボードの数値を自社環境の性能保証として扱えません。

公式情報源

  1. Official documentation
  2. Official README
  3. Project repository
  4. Release notes
コミュニティノート

コミュニティノート