Modell / Datensatz
0xSero/turboquant avatar
0xSero/turboquant

turboquant

TurboQuant: Near-optimal KV cache quantization for LLM inference (3-bit keys, 2-bit values) with Triton kernels + vLLM integration

1.770 Sterne197 ForksPythonGPL-3.0
GitHub

Auf einen Blick

Was ist das?
TurboQuant: Near-optimal KV cache quantization for LLM inference (3-bit keys, 2-bit values) with Triton kernels + vLLM integration
Darf ich es kommerziell nutzen?
Ja, unter Bedingungen. GPL-3.0 ist eine Copyleft-Lizenz: Wenn Sie Software weitergeben, die sie enthält, müssen Sie deren Quellcode unter derselben Lizenz veröffentlichen. Wer sie nur intern betreibt, ohne sie weiterzugeben, löst diese Pflicht nicht aus.
Wird es noch gepflegt?
Ja. Die letzten Commits kamen vor 12 Tagen.
In welcher Sprache ist es geschrieben?
Hauptsächlich Python, laut der Sprachstatistik von GitHub.

Die Antworten beruhen auf den GitHub-Daten des Projekts (zuletzt abgeglichen am 15. September 2026) und auf unserer Analyse. Sie sind keine Rechtsberatung.

Datenaktualität

Redaktionsstatus

Eine vollständige redaktionelle Analyse dieses Projekts ist noch nicht veröffentlicht. Die obigen Fakten stammen aus den öffentlichen GitHub-Metadaten. Prüfen Sie Repository, Lizenz und Issue-Tracker, bevor Sie es in Produktion einsetzen.

Community-Notizen

Community-Notizen