LLM-VRAM-Rechner
Schätzen Sie, wie viel GPU-Speicher ein offenes Modell unter llama.cpp oder Ollama braucht – Gewichte, KV-Cache und Overhead – und in welche Grafikkarten es passt.
Ergebnis
Das Ergebnis erscheint hier.Ob ein Modell auf Ihrer Grafikkarte läuft, hängt an drei Zahlen: den quantisierten Gewichten, dem KV-Cache, der mit der Kontextlänge wächst, und den eigenen Puffern der Laufzeit. Dieser Rechner ermittelt sie für 24 verbreitete Open-Weight-Modelle – Llama, Qwen, DeepSeek-R1-Distills, Mistral, Gemma und Phi – bei beliebiger GGUF-Quantisierung, Kontextlänge und Zahl paralleler Sequenzen, so wie llama.cpp (ggml-org/llama.cpp, MIT) und die darauf aufbauenden Werkzeuge wie Ollama und LM Studio Speicher belegen. Die Architekturwerte stammen aus der config.json jedes Modells auf Hugging Face.
So arbeitet es
- Gewichte sind Parameterzahl mal effektive Bits pro Gewicht der Quantisierung, entnommen den Dateigrößen, die das quantize-Werkzeug von llama.cpp auflistet: Q4_K_M liegt im Mittel bei 4,9 Bit, nicht bei 4, weil K-Quants einige Tensoren genauer speichern.
- Der KV-Cache ist 2 × Schichten × KV-Heads × Head-Größe × gecachte Tokens × Bytes pro Element – Grouped-Query-Attention, Cache-Typ und Kontext schlagen sich also darin nieder. Bei Gemma 2 und 3 cachen die Sliding-Window-Schichten immer nur ihr Fenster.
- Der Overhead besteht aus einem halben Gigabyte für den CUDA- oder Metal-Kontext plus einem Rechenpuffer, der sich nach dem Standard-Mikrobatch von 512 Tokens in llama.cpp richtet – deshalb kostet ein großes Vokabular zusätzlichen Speicher.
- Die GPU-Tabelle markiert eine Karte mit ✓ unter 90 % Auslastung, mit ≈ zwischen 90 und 100 % und mit ✗ ×N samt der Zahl solcher Karten, auf die das Modell verteilt werden müsste; Macs werden mit etwa drei Vierteln ihres gemeinsamen Speichers gerechnet, dem Anteil, den macOS der GPU standardmäßig überlässt.
Wohin Ihre Daten gehen
Nirgendwohin. Dieses Werkzeug läuft vollständig in Ihrem Browser: Der eingefügte Text wird von der Seite verarbeitet und weder an einen Server übertragen noch protokolliert.
Dieses Tool ist kostenlos und braucht kein Konto. Die Ergebnisse existieren nur in Ihrer geöffneten Seite und werden nirgends gespeichert.
Was es kostet
Dieses Werkzeug ist kostenlos, ohne Anmeldung und ohne Punkte.
Häufige Fragen
- Wie genau ist die Schätzung?
- Bei einer einzelnen GPU, auf die alle Schichten ausgelagert sind, liegen Gewichte und KV-Cache nur wenige Prozent neben dem, was llama.cpp belegt; für Llama 3.1 8B in Q4_K_M mit 8.192 Tokens gibt das Tool 4,58 GiB Gewichte und genau 1 GiB KV-Cache an – die Werte, die llama.cpp meldet. Planen Sie 5–10 % Reserve für Treiber, Desktop und andere Programme ein.
- Was bedeuten parallele Sequenzen, und wie hängen sie mit dem Kontext in Ollama zusammen?
- Es ist die Zahl der Unterhaltungen, die der Server gleichzeitig hält, jede mit eigenem KV-Cache: OLLAMA_NUM_PARALLEL in Ollama oder -np in llama-server. Das Kontextfeld gilt pro Sequenz, 8.192 × 4 cacht also 32.768 Tokens; in llama-server entspricht das -c 32768 -np 4.
- Soll ich den KV-Cache quantisieren?
- q8_0 halbiert den Cache bei einem kaum messbaren Verlust und lohnt sich bei langen Kontexten; q4_0 viertelt ihn, kann die Qualität aber spürbar verschlechtern. In llama.cpp braucht ein quantisierter V-Cache Flash Attention, die auf unterstützten GPUs automatisch aktiv ist; die Schätzung setzt durchgehend Flash Attention voraus.
- Warum warnt das Tool vor dem nativen Kontext?
- Jedes Modell ist bis zu einer bestimmten Länge trainiert – 40.960 Tokens bei Qwen3, 131.072 bei Llama 3.1. Darüber stimmt die Speicherschätzung weiterhin, aber das Modell braucht RoPE-Skalierung wie YaRN, um überhaupt zu funktionieren, und die Qualität sinkt meist; deshalb sagt Ihnen das Tool, wenn Sie darüber liegen.
Das Open Source dahinter
Dieses Werkzeug ist eine eigenständige Implementierung ohne fremde Bibliothek. ggml-org/llama.cpp (MIT) erledigt dieselbe Aufgabe als Bibliothek — wer sie im eigenen Programm braucht, fängt dort an, statt eine Webseite aufzurufen.
ggml-org/llama.cppAuch bekannt als
- LLM VRAM Rechner
- GPU Speicher LLM berechnen
- wie viel VRAM für Llama
- GGUF VRAM
- KV Cache Größe
- Ollama VRAM Bedarf