ライブラリ / SDK
microsoft/MInference avatar
microsoft/MInference

MInference

[NeurIPS'24 Spotlight, ICLR'25, ICML'25] To speed up Long-context LLMs' inference, approximate and dynamic sparse calculate the attention, which reduces inference latency by up to 10x for pre-filling on an A100 while maintaining accuracy.

スター 1,229フォーク 82PythonMIT

ひと目でわかる

これは何?
[NeurIPS'24 Spotlight, ICLR'25, ICML'25] To speed up Long-context LLMs' inference, approximate and dynamic sparse calculate the attention, which reduces inference latency by up to 10x for pre-filling on an A100 while maintaining accuracy.
商用利用できる?
できます。MIT は寛容なライセンスで、著作権表示とライセンス表示を残せば、使用・改変・販売が可能です。
今もメンテナンスされている?
されています。最後のコミットは 5 日前です。
何の言語で書かれている?
主に Python です(GitHub の言語統計による)。

回答はプロジェクトの GitHub データ(最終同期:2026年9月15日)と当サイトの分析に基づくもので、法的助言ではありません。

情報の鮮度

編集ステータス

このプロジェクトの完全な編集分析はまだ公開されていません。上の事実はプロジェクトの公開 GitHub メタデータに基づきます。本番利用の前に、リポジトリ、ライセンス、Issue トラッカーを確認してください。

コミュニティノート

コミュニティノート