模型 / 資料集
SemiAnalysisAI/InferenceX avatar
SemiAnalysisAI/InferenceX

SemiAnalysisAI/InferenceX:InferenceX 的推理測量對象

開源連續推理基準研究平台、Kimi K2.7-Code、MiniMax M3、DeepSeekv4、GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 以及即將推出的 TPUv6e/v7/Trainium2/300505,005 代碼NVL72 vs MI355X vs B200 vs GB300 NVL72 TPUv6e/v7/Trainium2/3。

1,676 個 Star294 個 ForkPythonApache-2.0

秒懂

它是什麼?
圍繞 SemiAnalysisAI/InferenceX 的 README、版本信息和許可證,梳理它的實際邊界、啟動入口與項目專屬核驗點。
適合誰用?
適合需要Open Source Continuous Inference Benchmark Research Platform, Kimi K2.7-Code, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 & soon TPUv6e/v7/Trainium2/3並願意按 README 建立試運行記錄的開發者或維護者;不適合把倉庫描述直接當成兼容性或生產保證的團隊。先按項目命令完成最小流程,再觀察README 的重點是 InferenceX 與 TileRT 的推理測試和測量流程。
可以商用嗎?
可以。Apache-2.0 是寬鬆授權:你可以使用、修改並販售以它為基礎的軟體,只需保留著作權與授權聲明。
還在維護嗎?
有在維護。儲存庫最近一次提交在 1 天前。
用什麼語言寫的?
主要是 Python(依據 GitHub 的語言統計)。

以上回答依據專案的 GitHub 資料(最近同步於 2026年9月14日)與我們的分析,不構成法律意見。

開源專案深度解析

項目與公開儀表盤 · semianalysisai-inferencex-deep-analysis

InferenceX 原名為 InferenceMAX,是一個推理性能研究平臺。README 將其描述為一個持續運行的基準測試,針對大型模型運營方常用的開源推理框架,目標是在軟件棧不斷變化時記錄真實性能。項目公開儀表盤地址是 inferencex.com,倉庫元數據中的 homepage 也是這個地址;README 還鏈接到一個獨立的開源儀表盤倉庫,並在徽章中提供了 DeepWiki 和 GitHub star 的入口。倉庫元數據顯示主要語言為 Python,收集時共有 1,318 個 star、247 個 fork 和 210 個 open issue。README 頂部的徽章同時列出 Apache 2.0 許可、PRs welcome、性能儀表盤和 DeepWiki 鏈接。README 特別說明,只有 SemiAnalysisAI/InferenceX 倉庫包含官方 InferenceX 結果,其他 fork 或倉庫都屬於非官方,並且必須明確標註為非官方;fork 不得移除這條免責聲明。

為什麼基準必須持續更新 · semianalysisai-inferencex-deep-analysis

項目要解決的問題是推理性能有兩種變化速度。硬件在新型 GPU 或加速系統發佈時產生臺階式提升,而軟件通過較小版本持續改進,有時相隔只有幾天。README 提到 SGLang、vLLM、TensorRT-LLM、CUDA 和 ROCm,認為這些框架通過內核級優化、分佈式推理策略和調度改動持續擴大性能邊界。一次性的基準測試很快就會過時,無法反映最新軟件包能達到的性能。因此 InferenceX 被設計成一個自動化、持續運行的基準,而不是固定時間點的快照。README 強調這種持續改進本身是項目存在的理由,還使用了 Speed is the Moat 這個說法,但沒有給出具體的自動化調度頻率,也沒有定義測試負載、併發數或評測指標,更沒有區分硬件和軟件各自貢獻多少性能提升。

已支持硬件與新聞中的模型 · semianalysisai-inferencex-deep-analysis

README 列出的官方支持硬件包括 GB300 NVL72、GB200 NVL72、MI355X、B300、B200、MI325X、MI300X、H200 和 H100。標記為即將推出的項目包括 TPUv7x Ironwood Ghostfish、MI455 UALoE72、Vera Rubin NVL72、Rubin NVL8,以及來自四個未命名硬件廠商的四款芯片;這些條目沒有給出預計日期。新聞條目提到 MiniMax M3、DeepSeek V4 Pro 1.6T、Qwen3.5 397B、Kimi K2.5、GLM5 和 MiniMax M2.5 都從發佈首日起有連續基準,並附有儀表盤鏈接。新聞日期跨度從 2025 年 10 月到 2026 年 6 月。GB300 NVL72 在 2026 年 2 月的新聞中被列為已加入並持續測試,README 還鏈接了 SGLang 維護者關於 GB300 的 LMSYS 博客。README 沒有說明測量指標、併發設置、延遲和吞吐量的定義,這些細節需要從倉庫源碼或儀表盤本身進一步驗證。

倉庫狀態與貢獻流程 · semianalysisai-inferencex-deep-analysis

倉庫元數據顯示該項目有 1,318 個 star、247 個 fork 和 210 個 open issue,默認分支為 main,代碼語言為 Python。README 歡迎提交 pull request,並指向 CONTRIBUTING.md 瞭解審查流程,指向 docs/PR_REVIEW_CHECKLIST.md 查看審查清單,同時說明存在合併流程。頂部徽章也標出 PRs welcome。它沒有列出維護者姓名、預期響應時間或行為準則。README 也沒有說明如何在本地安裝、運行基準測試或啟動儀表盤,因此安裝命令和用法不在當前可驗證範圍內。元數據同樣沒有給出最近提交日期或活躍維護者數量,也沒有提到持續集成或測試配置。

致謝與硬件支持 · semianalysisai-inferencex-deep-analysis

致謝部分感謝 AMD 的 Lisa Su 和 Anush Elangovan 提供 MI355X 和 CDNA3 GPU,感謝 NVIDIA 的 Jensen Huang 和 Ian Buck 通過 OCI 幫助提供 GB200 NVL72 機架和 B200 GPU。項目還感謝 AMD 許多貢獻者響應快速,並參與調試、優化和驗證 AMD GPU 上的性能;感謝 NVIDIA 推理團隊和 Dynamo 團隊的未具名貢獻者,感謝 SGLang、vLLM 和 TensorRT-LLM 的維護者,以及 Crusoe、CoreWeave、Nebius、TensorWave、Oracle 和 TogetherAI 提供的計算資源。README 附有 supporters 和 quotes 的完整列表鏈接。它沒有說明這些組織是否參與項目治理或是否擁有提交權限,也沒有說明硬件捐贈者是否會影響基準測試設計或結果選擇。

Apache-2.0 與未說明的部分 · semianalysisai-inferencex-deep-analysis

根據元數據,倉庫採用 Apache-2.0 許可證。許可證摘錄授予永久、全球、非排他、免費、免版稅的版權許可,允許複製、準備衍生作品、公開展示和表演、再許可和分發。它還就貢獻授予專利許可,如果針對被許可方提起專利訴訟,該許可會終止。摘錄包含定義、版權許可和專利許可,還定義了衍生作品和貢獻兩個術語,但再分發條款只展示到第 4 節開頭,沒有包含完整的保修和責任限制部分。README 和許可證摘錄都沒有提供保修、支持承諾、安全保證或基準方法學標準,也沒有說明官方結果如何被審計。

採用前要釐清的比較邊界 · semianalysisai-inferencex-deep-analysis

InferenceX 的價值在於把不同硬件與推理框架放到同一個公開研究脈絡中,但 README 沒有把比較條件寫成可直接執行的規格。閱讀 GB200 NVL72、MI355X、B200 或 GB300 NVL72 的條目時,不能只看圖表上的名次,還要確認模型版本、量化方式、輸入輸出長度、批次或併發設定,以及使用的是 SGLang、vLLM 還是 TensorRT-LLM。這些欄位若沒有同時出現,跨硬件的數字就只能當作項目展示的結果,不能直接推導成通用排名。

README 把官方結果與非官方 fork 分開,是閱讀資料時最具體的來源邊界。使用 inferencex.com 的圖表時,應把圖表連回 SemiAnalysisAI/InferenceX 的模型、硬件和新聞條目,並記下頁面所標示的日期;同一硬件在軟件版本變動後可能出現不同結果。README 沒有提供本地執行命令、固定資料集、延遲百分位或吞吐量公式,因此不能把它當成可在任意環境重建的測試套件。對需要採購或容量規劃的團隊,現有材料最多支持建立比較問題清單,尚不足以單獨支持硬件選型。

支援清單也要按狀態閱讀。GB300 NVL72、MI355X、B200 等項目標示為已支援,TPUv7x Ironwood Ghostfish、MI455 UALoE72、Vera Rubin NVL72 和 Rubin NVL8 則標為即將推出;後者沒有日期,不能排入已驗證硬件。新聞中的 MiniMax M3、DeepSeek V4 Pro 1.6T、Qwen3.5 397B、Kimi K2.5、GLM5 和 MiniMax M2.5 是 README 宣稱有連續基準的模型名稱,並不等於每個模型在每個硬件組合都有同等資料。

編輯結論

適合需要Open Source Continuous Inference Benchmark Research Platform, Kimi K2.7-Code, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 & soon TPUv6e/v7/Trainium2/3並願意按 README 建立試運行記錄的開發者或維護者;不適合把倉庫描述直接當成兼容性或生產保證的團隊。先按項目命令完成最小流程,再觀察README 的重點是 InferenceX 與 TileRT 的推理測試和測量流程。可複核內容應包括倉庫給出的安裝入口、模型或硬件參數、隊列設置和結果文件;若某項沒有在 README 中寫明,就保留,確認輸入、輸出和失敗信息都與預期一致後再擴大使用範圍。

官方來源

  1. Official documentation
  2. Official README
  3. Project repository
  4. Release notes
社群筆記

社群筆記