llama.cpp
llama.cpp exécute l'inférence LLM en C/C++ pur et sert les modèles localement via une API REST et une interface web, avec prise en charge multimodale dans llama-server.
Le problème qu’il résout
llama.cpp exécute l'inférence LLM en C/C++ pur et sert les modèles localement via une API REST et une interface web, avec prise en charge multimodale dans llama-server.
Le contexte du projet sur cette page est accessible gratuitement. Le dépôt GitHub d’origine reste la référence ; la connexion n’est nécessaire que pour enregistrer ou rejoindre la discussion.
Notes de la communauté