InferenceX:把推理基准从快照变成持续运行的仪表盘
开源连续推理基准研究平台、Kimi K2.7-Code、MiniMax M3、DeepSeekv4、GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 以及即将推出的 TPUv6e/v7/Trainium2/3 | ,Kimi K2.7-代码 MiniMax M3 DeepSeekv4 GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 TPUv6e/v7/Trainium2/3。
秒懂
- 它是什么?
- SemiAnalysis 开源的 InferenceX 是一个持续推理基准研究平台,跟踪 SGLang、vLLM、TensorRT-LLM 在 GB200、MI355X 等硬件上的真实性能变化。它解决的是静态基准很快过时的问题,但部署和解读门槛并不低。
- 适合谁用?
- 适合需要长期跟踪推理性能趋势的团队,比如运营大规模推理集群的厂商、研究框架优化的工程师、以及做硬件选型决策的架构师。不适合只需要一次性能快照的普通用户,因为它的价值在于持续运行和趋势分析,单次结果与官方仪表盘相比没有增量信息。
- 能商用吗?
- 可以。Apache-2.0 是宽松许可证:你可以使用、修改并销售基于它的软件,只需保留版权和许可证声明。
- 还在维护吗?
- 在维护。仓库最近一次提交在 1 天前。
- 用什么语言写的?
- 主要是 Python(依据 GitHub 的语言统计)。
以上回答依据项目的 GitHub 数据(最近同步于 2026年9月14日)和我们的分析,不构成法律意见。
开源项目深度解析
静态基准的失效速度,就是 InferenceX 要解决的问题
推理性能由硬件和软件共同决定。硬件每年跳跃一次,软件却每天都在变。SGLang、vLLM、TensorRT-LLM 这些框架通过内核优化、分布式推理策略和调度改进,每隔几天就能推高性能的帕累托前沿。结果是,一个在特定时间点做的基准,很快就不再代表当前软件栈的真实水平。InferenceX 的定位就是对抗这种时效性。它把基准从一次性快照变成持续运行的仪表盘,跟踪主流开源推理框架在真实集群上的性能变化。它的目标用户很明确:运营大规模推理服务的团队、做框架优化的开发者,以及需要对比硬件和软件组合的架构师。
持续运行,而不是跑一次就结束
InferenceX 的核心机制是持续基准测试。它不是一个在固定日期发布报告的项目,而是一个长期运行的研究平台。根据 README 的描述,它从模型发布的第一天就开始记录性能,比如 DeepSeek V4 Pro 从 Day 0 到 Day 43 的性能变化都有记录。这种做法的价值在于,它能捕捉软件栈的渐进式改进。比如某个框架发布了一个新版本,优化了某个 kernel,InferenceX 的仪表盘上就能看到吞吐量或延迟的变化。它本质上是一个性能监控系统,只是监控对象是推理框架和硬件的组合。对于想要复现结果的人,这意味着你需要运行长时间的基准任务,而不是跑一次就完事。
支持的硬件清单和当前状态
官方支持的硬件列表很具体,而且状态明确。已经支持的有 GB300 NVL72、GB200 NVL72、MI355X、B300、B200、MI325X、MI300X、H200、H100。即将支持的有 TPUv7x Ironwood Ghostfish、MI455 UALoE72、Vera Rubin NVL72、Rubin NVL8,以及来自未具名硬件厂商的芯片。这个列表反映了项目的两个特点。第一,它紧跟最新硬件,GB300 在 2026 年 2 月就被加入并开始持续基准测试。第二,它依赖硬件厂商的配合,比如 AMD 提供了 MI355X 和 CDNA3 GPU,NVIDIA 提供了 GB200 NVL72 机架和 B200 GPU。如果你没有这些硬件,只能使用云服务商提供的实例,这会影响基准的复现性。
如何获取和运行:仓库结构与命令线索
InferenceX 的代码仓库以 Python 为主,许可证是 Apache-2.0,默认分支是 main。最近的发布版本是 tilert-v0.1.5.post2-inferencex.1,这是一个 TileRT 0.1.5.post2 的队列 backport,说明项目会同步上游框架的补丁。要运行它,你需要从 GitHub 克隆仓库,然后按照文档配置。文档目录 docs/index.md 提供了架构、配置、工作流、eval、runner 和故障排除的入口。具体命令在 README 中没有给出,但可以推断,你需要设置基准任务、指定模型和硬件,然后启动一个持续运行的进程。由于项目强调“持续”,你可能需要配置定时任务或守护进程来定期执行基准。建议直接查阅 docs 目录下的配置参考,因为项目结构复杂,没有现成的快速启动命令。
官方结果与非官方复现的边界
一个关键的约束是,只有 SemiAnalysisAI/InferenceX 仓库产生的基准结果才被视为官方结果。README 明确说,其他 fork 和仓库的结果都是非官方的,因为基准设置和机器质量可能不同,导致结果不佳。它还要求非官方结果必须明确标注。这对使用者意味着什么?如果你自己部署 InferenceX 来测试你的集群,你的结果不能直接与官方仪表盘上的数字对比,除非你严格控制环境。这个限制是合理的,因为推理基准对硬件配置、驱动版本、框架版本、甚至网络拓扑都极其敏感。但这也意味着,对于大多数团队来说,直接参考官方仪表盘可能比自建更可靠。如果你要自建,务必记录所有环境细节,并明确标注结果的性质。
与静态基准的对比:一个真正的替代方案
InferenceX 的替代方案是传统的静态基准,比如 MLPerf Inference 或者某个模型发布时的官方 benchmark。静态基准的特点是固定数据集、固定硬件、固定软件版本,在某个时间点跑一次,然后发布报告。它的优势是可控性强,结果容易复现。劣势是时效性差,软件更新后结果很快就过时。InferenceX 的差异在于,它把时间维度纳入考量,持续跟踪性能变化。但这也带来了新问题:持续运行意味着结果不断变动,你需要理解趋势而不是单个数字。对于需要向管理层汇报一次性性能数据的团队,静态基准可能更合适。对于需要优化长期运行成本的团队,InferenceX 的持续跟踪更有价值。
维护成本与许可注意事项
维护 InferenceX 的成本不低。首先,你需要持续关注上游框架的更新,因为项目会同步 TileRT 等组件的补丁,比如最近的发布版本就是针对 TileRT 的 backport。其次,硬件支持依赖厂商提供资源,如果你的硬件不在官方列表中,你可能需要自行适配,这涉及驱动和框架的兼容性工作。第三,持续运行基准会消耗大量计算资源和存储空间。许可方面,Apache-2.0 允许商用、修改和分发,但需要保留版权声明和免责声明。README 特别强调,fork 不能移除免责声明,这虽然不是法律建议,但说明项目维护者对结果完整性有严格要求。如果你计划基于 InferenceX 做二次开发,务必遵守许可证条款。
编辑结论
适合需要长期跟踪推理性能趋势的团队,比如运营大规模推理集群的厂商、研究框架优化的工程师、以及做硬件选型决策的架构师。不适合只需要一次性能快照的普通用户,因为它的价值在于持续运行和趋势分析,单次结果与官方仪表盘相比没有增量信息。在采用之前,先确认你能访问官方支持的硬件型号,并准备好足够的存储和算力来运行长时间的基准任务。还要注意,只有官方仓库的基准结果被视为有效,任何自建环境的结果都需要明确标注为非官方,否则可能误导团队决策。最后,Apache-2.0 许可允许商用和修改,但如果你计划分发修改版本,务必保留原始免责声明,并遵守许可证的署名要求。
社区笔记