flashinfer-ai
★ 6.038flashinfer
FlashInfer: Kernel-Bibliothek für LLM-Serving. Es bietet einheitliche APIs für Aufmerksamkeits-, GEMM- und MoE-Operationen mit mehreren Backend-Implementierungen, darunter FlashAttention-2/3, cuDNN, CUTLASS und TensorRT-LLM.