shimmy
Le moteur d'inférence Pure-Rust WebGPU, compatible OpenAI-API, natif GGUF, fonctionne sur n'importe quel GPU. Pas de Python. Pas de lama.cpp. Binaire unique.
Le problème qu’il résout
Le moteur d'inférence Pure-Rust WebGPU, compatible OpenAI-API, natif GGUF, fonctionne sur n'importe quel GPU. Pas de Python. Pas de lama.cpp. Binaire unique.
Le contexte du projet sur cette page est accessible gratuitement. Le dépôt GitHub d’origine reste la référence ; la connexion n’est nécessaire que pour enregistrer ou rejoindre la discussion.
Notes de la communauté