flashinfer
FlashInfer: Kernel-Bibliothek für LLM-Serving. Es bietet einheitliche APIs für Aufmerksamkeits-, GEMM- und MoE-Operationen mit mehreren Backend-Implementierungen, darunter FlashAttention-2/3, cuDNN, CUTLASS und TensorRT-LLM.
Welches Problem es löst
FlashInfer: Kernel-Bibliothek für LLM-Serving. Es bietet einheitliche APIs für Aufmerksamkeits-, GEMM- und MoE-Operationen mit mehreren Backend-Implementierungen, darunter FlashAttention-2/3, cuDNN, CUTLASS und TensorRT-LLM.
Der Projektkontext auf dieser Seite ist kostenlos lesbar. Das ursprüngliche GitHub-Repository bleibt maßgeblich; nur zum Speichern oder Diskutieren ist eine Anmeldung nötig.
Community-Notizen