flashinfer-ai
★ 6 038flashinfer
FlashInfer : bibliothèque de noyau pour le service LLM. Il fournit des API unifiées pour les opérations Attention, GEMM et MoE avec plusieurs implémentations backend, notamment FlashAttention-2/3, cuDNN, CUTLASS et TensorRT-LLM.