0xSero/turboquant
turboquant
TurboQuant: Near-optimal KV cache quantization for LLM inference (3-bit keys, 2-bit values) with Triton kernels + vLLM integration
1 770 étoiles197 forksPythonGPL-3.0
En bref
- De quoi s’agit-il ?
- TurboQuant: Near-optimal KV cache quantization for LLM inference (3-bit keys, 2-bit values) with Triton kernels + vLLM integration
- Puis-je l’utiliser commercialement ?
- Oui, sous conditions. GPL-3.0 est une licence copyleft : si vous distribuez un logiciel qui l’inclut, vous devez publier le code source de ce logiciel sous la même licence. Un usage interne, sans distribution, ne déclenche pas cette obligation.
- Est-il encore maintenu ?
- Oui. Les derniers commits datent d’il y a 13 jours.
- En quel langage est-il écrit ?
- Principalement Python, d’après les statistiques de langage de GitHub.
Ces réponses reposent sur les données GitHub du projet (dernière synchronisation le 15 septembre 2026) et sur notre analyse. Elles ne constituent pas un avis juridique.
Fraîcheur des données
Statut éditorial
Une analyse éditoriale complète de ce projet n'est pas encore publiée. Les faits ci-dessus proviennent des métadonnées GitHub publiques. Vérifiez le dépôt, la licence et le suivi des tickets avant de l'adopter en production.
Notes de la communauté