Outils

Calculateur de VRAM pour LLM

Estimez la mémoire GPU dont un modèle ouvert a besoin sous llama.cpp ou Ollama — poids, cache KV et surcoût — et les cartes graphiques qui peuvent l’accueillir.

S’exécute dans le navigateurOutils de développement IA128,3 k
Gratuit

Résultat

Le résultat apparaîtra ici.

Qu’un modèle tourne ou non sur votre carte graphique dépend de trois nombres : les poids quantifiés, le cache KV qui grandit avec la longueur du contexte, et les tampons propres au moteur d’exécution. Ce calculateur les évalue pour 24 modèles à poids ouverts populaires — Llama, Qwen, les distillations de DeepSeek-R1, Mistral, Gemma et Phi — pour n’importe quelle quantification GGUF, longueur de contexte et nombre de séquences parallèles, de la façon dont llama.cpp (ggml-org/llama.cpp, MIT) et les outils construits dessus, comme Ollama et LM Studio, allouent la mémoire. Les caractéristiques d’architecture sont lues dans le config.json de chaque modèle sur Hugging Face.

Comment ça marche

  • Les poids valent le nombre de paramètres multiplié par le nombre effectif de bits par poids de la quantification, tiré des tailles de fichier listées par l’outil quantize de llama.cpp : Q4_K_M fait en moyenne 4,9 bits, et non 4, car les K-quants gardent certains tenseurs en plus haute précision.
  • Le cache KV vaut 2 × couches × têtes KV × taille de tête × tokens en cache × octets par élément ; l’attention à requêtes groupées, le type de cache et le contexte s’y reflètent donc tous. Sur Gemma 2 et 3, les couches à fenêtre glissante ne mettent jamais en cache que leur fenêtre.
  • Le surcoût comprend un demi-gigaoctet pour le contexte CUDA ou Metal, plus un tampon de calcul dimensionné sur le micro-lot de 512 tokens par défaut de llama.cpp, ce qui explique qu’un grand vocabulaire ajoute de la mémoire.
  • Le tableau des GPU marque une carte ✓ sous 90 % d’utilisation, ≈ entre 90 et 100 %, et ✗ ×N avec le nombre de cartes identiques nécessaires pour répartir le modèle ; les Mac sont comptés à environ trois quarts de leur mémoire unifiée, la part que macOS laisse au GPU par défaut.

Où vont vos données

Nulle part. Cet outil s’exécute entièrement dans votre navigateur : le texte collé est traité par la page, jamais transmis à un serveur ni consigné dans un journal.

Cet outil est gratuit et ne demande aucun compte. Ses résultats n’existent que dans la page ouverte et ne sont enregistrés nulle part.

Ce que ça coûte

Cet outil est gratuit, sans connexion ni points.

Questions fréquentes

Quelle est la précision de l’estimation ?
Pour un seul GPU avec toutes les couches déchargées, les poids et le cache KV correspondent à quelques pour cent près à ce qu’alloue llama.cpp ; pour Llama 3.1 8B en Q4_K_M avec 8 192 tokens, l’outil donne 4,58 Gio de poids et exactement 1 Gio de cache KV, les chiffres que rapporte llama.cpp. Gardez 5 à 10 % de marge pour le pilote, le bureau et les autres programmes.
Que signifient les séquences parallèles, et quel rapport avec le contexte d’Ollama ?
C’est le nombre de conversations que le serveur tient en même temps, chacune avec son propre cache KV : OLLAMA_NUM_PARALLEL dans Ollama, ou -np dans llama-server. Le champ contexte est par séquence, donc 8 192 × 4 met en cache 32 768 tokens ; en termes de llama-server, cela donne -c 32768 -np 4.
Faut-il quantifier le cache KV ?
q8_0 divise le cache par deux avec une perte difficile à mesurer, et c’est un bon compromis pour les longs contextes ; q4_0 le divise par quatre mais peut dégrader nettement la qualité. Dans llama.cpp, un cache V quantifié nécessite la flash attention, activée automatiquement sur les GPU qui la prennent en charge ; l’estimation suppose la flash attention partout.
Pourquoi l’outil avertit-il au sujet du contexte natif ?
Chaque modèle est entraîné jusqu’à une certaine longueur — 40 960 tokens pour Qwen3, 131 072 pour Llama 3.1. Au-delà, l’estimation mémoire reste valable, mais le modèle a besoin d’une mise à l’échelle RoPE comme YaRN pour fonctionner tout court, et la qualité baisse en général ; l’outil vous prévient donc lorsque vous l’avez dépassée.

L’open source derrière

Cet outil est une implémentation autonome, sans bibliothèque tierce. ggml-org/llama.cpp (MIT) fait le même travail sous forme de bibliothèque : pour l’intégrer à votre programme, commencez par là plutôt que d’appeler une page web.

ggml-org/llama.cpp

Aussi appelé

  • calculateur VRAM LLM
  • combien de VRAM pour Llama
  • mémoire GPU LLM local
  • VRAM GGUF
  • taille cache KV
  • configuration requise Ollama
  • llm vram calculator