ツール
結果
結果はここに表示されます。モデルがお使いのグラフィックカードで動くかどうかは、3 つの数字で決まります。量子化された重み、コンテキスト長に応じて増える KV キャッシュ、そしてランタイム自身のバッファです。この計算ツールは、Llama、Qwen、DeepSeek-R1 の蒸留モデル、Mistral、Gemma、Phi など人気のオープンウェイトモデル 24 種について、任意の GGUF 量子化、コンテキスト長、並列シーケンス数でこれらを算出します。計算方法は llama.cpp(ggml-org/llama.cpp、MIT)と、それを基盤とする Ollama や LM Studio などのツールがメモリを確保する方法に沿っています。アーキテクチャの数値は、Hugging Face 上の各モデルの config.json から読み取っています。
動作のしくみ
- 重みはパラメーター数 × 量子化の実効ビット数で、ビット数は llama.cpp の quantize ツールが示すファイルサイズから取っています。K-quant は一部のテンソルを高い精度のまま残すため、Q4_K_M の平均は 4 ビットではなく 4.9 ビットです。
- KV キャッシュは 2 × レイヤー数 × KV ヘッド数 × ヘッドサイズ × キャッシュするトークン数 × 要素あたりのバイト数なので、Grouped-Query Attention、キャッシュの型、コンテキストがすべて反映されます。Gemma 2 と 3 のスライディングウィンドウ層は、ウィンドウ分しかキャッシュしません。
- オーバーヘッドは、CUDA または Metal のコンテキスト用の 0.5 GB に、llama.cpp のデフォルトである 512 トークンのマイクロバッチで決まる計算バッファを加えたものです。語彙が大きいとメモリが増えるのはこのためです。
- GPU 表では、使用率 90% 未満のカードに ✓、90〜100% に ≈、収まらないカードには ✗ ×N を付け、N でモデルを分割するのに必要な枚数を示します。Mac は、macOS がデフォルトで GPU に使わせるユニファイドメモリの約 4 分の 3 で計算しています。
データの行き先
どこにも行きません。このツールは完全にブラウザ内で動作します。貼り付けたテキストはページが処理し、サーバーに送信されることも、ログに記録されることもありません。
このツールは無料で登録不要です。結果は開いているページの中にだけあり、どこにも保存されません。
必要なポイント
このツールは無料です。ログインもポイントも必要ありません。
よくある質問
- 見積もりはどのくらい正確ですか?
- 全レイヤーをオフロードした単一 GPU の場合、重みと KV キャッシュは llama.cpp が確保する量と数パーセント以内で一致します。Llama 3.1 8B を Q4_K_M、8,192 トークンで計算すると、重み 4.58 GiB、KV キャッシュちょうど 1 GiB となり、llama.cpp が報告する値と同じです。ドライバー、デスクトップ、ほかのプログラムのために 5〜10% の余裕を残してください。
- 並列シーケンスとは何ですか?Ollama のコンテキストとの関係は?
- サーバーが同時に保持する会話の数で、それぞれが独自の KV キャッシュを持ちます。Ollama では OLLAMA_NUM_PARALLEL、llama-server では -np にあたります。コンテキスト欄はシーケンスあたりの値なので、8,192 × 4 なら 32,768 トークンをキャッシュします。llama-server で言えば -c 32768 -np 4 です。
- KV キャッシュは量子化すべきですか?
- q8_0 はキャッシュを半分にし、品質の低下は測定が難しいほど小さいので、長いコンテキストでは良い選択です。q4_0 は 4 分の 1 になりますが、品質が目に見えて落ちることがあります。llama.cpp で V キャッシュを量子化するには flash attention が必要で、対応する GPU では自動的に有効になります。この見積もりは常に flash attention を前提としています。
- ネイティブコンテキストについて警告が出るのはなぜですか?
- どのモデルも一定の長さまでで学習されています。Qwen3 なら 40,960 トークン、Llama 3.1 なら 131,072 トークンです。それを超えてもメモリの見積もり自体は成り立ちますが、そもそも動作させるには YaRN などの RoPE スケーリングが必要で、品質もたいてい落ちます。そのため、その長さを超えたときにツールが知らせます。
背後にあるオープンソース
このツールは外部ライブラリを同梱しない独自実装です。ggml-org/llama.cpp(MIT)はコードとして同じ仕事をします。自分のプログラムで同じことをしたいなら、Web ページを呼ぶのではなくそちらから始めてください。
ggml-org/llama.cpp別の呼び方
- LLM VRAM 計算
- ローカル LLM 必要 VRAM
- GPU メモリ 計算 LLM
- GGUF VRAM
- KV キャッシュ サイズ
- Ollama VRAM