flashinfer
FlashInfer : bibliothèque de noyau pour le service LLM. Il fournit des API unifiées pour les opérations Attention, GEMM et MoE avec plusieurs implémentations backend, notamment FlashAttention-2/3, cuDNN, CUTLASS et TensorRT-LLM.
Le problème qu’il résout
FlashInfer : bibliothèque de noyau pour le service LLM. Il fournit des API unifiées pour les opérations Attention, GEMM et MoE avec plusieurs implémentations backend, notamment FlashAttention-2/3, cuDNN, CUTLASS et TensorRT-LLM.
Le contexte du projet sur cette page est accessible gratuitement. Le dépôt GitHub d’origine reste la référence ; la connexion n’est nécessaire que pour enregistrer ou rejoindre la discussion.
Notes de la communauté