CLIツール
Michael-A-Kuykendall/shimmy avatar
Michael-A-Kuykendall/shimmy

ShimmyはGGUFをWebGPUで配信するRust製推論サーバー

Pure-Rust WebGPU 推論エンジン、OpenAI-API 互換、GGUF ネイティブ、任意の GPU 上で動作します。パイソンはありません。ラマ.cppはありません。単一のバイナリ。

スター 5,876フォーク 569RustApache-2.0
GitHub

ひと目でわかる

これは何?
ShimmyはPythonやllama.cppを前提にせず、単一バイナリのRustエンジンからOpenAI API互換のローカル推論エンドポイントを提供する。
誰に向いている?
Shimmyは、GGUFモデルをローカルGPUで動かし、既存のOpenAI API向けクライアントから接続したい人に適した候補である。対応モデル、GPUバックエンド、量子化、同時実行時の挙動はREADMEの認定範囲を超えて推測できない。
商用利用できる?
できます。Apache-2.0 は寛容なライセンスで、著作権表示とライセンス表示を残せば、使用・改変・販売が可能です。
今もメンテナンスされている?
されています。最後のコミットは 16 日前です。
何の言語で書かれている?
主に Rust です(GitHub の言語統計による)。

回答はプロジェクトの GitHub データ(最終同期:2026年9月14日)と当サイトの分析に基づくもので、法的助言ではありません。

オープンソース詳細解説

単一バイナリが担う推論経路

Shimmyは、GGUFモデル向けのOpenAI互換エンドポイントを提供する単一バイナリです。READMEは100% OpenAI互換と説明しており、既存のAIツールをポイントすれば、ローカルかつプライベートに動作します。内部では、ゼロから構築された純RustのWebGPU(WGSL)トランスフォーマーエンジンであるAirframe上で動作し、C++ツールチェーンやコンパイルステップは不要です。リポジトリメタデータでは言語はRustです。READMEはまた、エンジンが全体でF32精度を使用して決定論的な出力を実現し、モデル仕様はGGUFメタデータから自動導出され、ハードコードされたモデルごとの定数はないと述べています。拡張コンテキストはYaRN RoPEスケーリングで処理され、SHIMMY_MAX_CTX環境変数で制御されます。READMEは、WebGPUコンピュートシェーダーがNVIDIA、AMD、Intel、統合グラフィックスを含む任意のGPUで動作すると主張しています。

ShimmyのOpenAI互換という表現は、接続側のAPI形式を合わせやすいという意味であり、モデル品質、ツール呼び出し、ストリーミング、認証の全互換を意味しない。READMEが認定モデルとして列挙する範囲を最初の試験対象に絞るのが妥当である。

ShimmyはGGUFをWebGPUで配信するRust製推論サーバーでは、単一バイナリが担う推論経路を導入判断の確認対象として切り分け、READMEに明記された範囲と実際の環境で変わる部分を別々に記録する。単一バイナリが担う推論経路に関する版、入力、出力を残せば、同じ確認を後からやり直せる。

GGUFと認定モデルの境界

READMEは11のモデルファミリーと25の認定モデル/量子化組み合わせを挙げています。各モデルは、逆量子化、構造的ピール、数値、デコード≡プリフィル、ロジットという5ゲートのGPU数学検証パイプラインを通過し、認定台帳に対してチェックされます。テーブルにはLlama 3.2 1Bおよび3B、Qwen3 0.6Bから8B、Phi-3 mini、Gemma-2 2Bおよび9B、DeepSeek-R1蒸留、Ministral、StarCoder2などのモデルが含まれます。量子化形式にはQ4_K_M、Q6_K、Q4_0があります。READMEは、GGUFファイルは再コンパイルやハードコードされたモデルごとの定数なしでそのまま読み込まれると述べています。完全なリストはテーブルとSUPPORTED_MODELS.mdドキュメントにあります。認証方法論はdocs/CERTIFICATION.mdに記載されており、READMEはモデルが数学的に検証される仕組みを説明するためにリンクしています。

WebGPUは利用するOS、GPU、ドライバ、wgpuのバックエンドで結果が変わる。起動ログに選ばれたアダプターが出るか、短いプロンプトが応答するか、長いコンテキストでメモリが増え続けないかを同じモデルで記録すると、単一バイナリの利点を現実の条件で評価できる。

ShimmyはGGUFをWebGPUで配信するRust製推論サーバーでは、GGUFと認定モデルの境界を導入判断の確認対象として切り分け、READMEに明記された範囲と実際の環境で変わる部分を別々に記録する。GGUFと認定モデルの境界に関する版、入力、出力を残せば、同じ確認を後からやり直せる。

OpenAI互換エンドポイントの意味

機能リストには、TurboShimmy INT4 KVキャッシュが含まれます。READMEは、単一のフラグ(--kv-quant int4)でKV VRAMを約7倍削減すると主張しています。また、OpenAI SDK互換性は、VSCode Copilot、Cursor、Continue.devなどのクライアントのドロップイン代替として説明されています。拡張コンテキストはSHIMMY_MAX_CTXを介してYaRN RoPEスケーリングを使用します。READMEにはv1.xからの移行ガイドも含まれており、llama.cppバックエンドはv2.0で削除されたと記載されています。Mixture-of-Experts CPUオフロードはAirframeのロードマップにあり、まだ実装されていません。ドキュメントハブには、構成、APIリファレンス、チャットテンプレート、GPUパイプライン、量子化内部などのファイルがリストされています。完全な機能リストはdocs/FEATURES.mdにあり、構成リファレンスはdocs/CONFIGURATION.mdにあり、環境変数と構成オプションをカバーしています。

ShimmyはGGUFをWebGPUで配信するRust製推論サーバーでは、OpenAI互換エンドポイントの意味を導入判断の確認対象として切り分け、READMEに明記された範囲と実際の環境で変わる部分を別々に記録する。OpenAI互換エンドポイントの意味に関する版、入力、出力を残せば、同じ確認を後からやり直せる。

WebGPUバックエンドを起動時に確かめる

READMEは、Windowsの例を使った30秒のクイックスタートを提供しています。curlでプリビルドバイナリをダウンロードし、SHIMMY_BASE_GGUF環境変数をGGUFファイルに設定し、serveサブコマンドを実行し、'shimmy list'で登録モデルをリストし、http://127.0.0.1:11435/v1/chat/completionsのOpenAI互換チャット補完エンドポイントにテストリクエストを送信します。正確なコマンドはREADMEに再現されています。JSONペイロードとjqを使ってレスポンスを抽出するcurlコマンドも含まれています。また、完全なインストール、モデル取得、GPU、VRAMサイジングについてはdocs/quickstart.mdにリンクしています。READMEは、この例のバイナリはプリビルドのWindows版であり、ドキュメントには別のWindows GPUビルドガイドがあると述べています。

ShimmyはGGUFをWebGPUで配信するRust製推論サーバーでは、WebGPUバックエンドを起動時に確かめるを導入判断の確認対象として切り分け、READMEに明記された範囲と実際の環境で変わる部分を別々に記録する。WebGPUバックエンドを起動時に確かめるに関する版、入力、出力を残せば、同じ確認を後からやり直せる。

開発用ビルドとテストの位置づけ

開発テストのセクションには2つのcargoテストコマンドがあります。デフォルト機能(GPUエンジン)を使用する完全なテストスイートは、'cargo test --features airframe,huggingface'で実行します。GPUを必要としないクイックCPUのみのテストには、READMEは'cargo test --lib --no-default-features --features huggingface -- --test-threads=1'を提案しています。包括的なテストと、プロパティベースおよび不変条件テストについて言及しており、詳細はdocs/ppt-invariant-testing.mdにあります。READMEはまた、テスト哲学として、包括的な検証とプロパティベースのテストによる信頼性を述べています。リポジトリメタデータは5729スター、550フォーク、9つのオープンイシューを示していますが、READMEはバグレポートとコミュニティサポートのためにGitHub IssuesとDiscussionsを指す以外に、イシュートラッキングについては議論していません。

ShimmyはGGUFをWebGPUで配信するRust製推論サーバーでは、開発用ビルドとテストの位置づけを導入判断の確認対象として切り分け、READMEに明記された範囲と実際の環境で変わる部分を別々に記録する。開発用ビルドとテストの位置づけに関する版、入力、出力を残せば、同じ確認を後からやり直せる。

性能表現を実測から切り離して読む

READMEには比較テーブルがあり、Shimmyは100ms以内に起動し、メモリ使用量は50MB、一方Ollamaは5-10秒と200MB+、Shimmyは100% OpenAI API互換で、Ollamaは部分的な互換と主張しています。これらは自己報告の数値であり、独立に検証されていません。ライセンスについて、READMEは「MITライセンス - 永遠に」と述べ、プロジェクトが有料製品になることは決してないと約束し、スポンサーシップティアを提供しています。しかし、リポジトリメタデータとリポジトリ内のライセンスファイルはApache-2.0を示しており、MITではありません。Apache-2.0の抜粋は著作権と特許ライセンスを付与していますが、サポート、保証、セキュリティ保証については何も述べていません。この不一致は、プロジェクトを採用する前に確認する価値があります。READMEはまた、インフラストラクチャは不可視であるべきという哲学を述べ、'フォーエバーメンテナー'と有料製品になることは決してないという約束をリストしています。

ShimmyはGGUFをWebGPUで配信するRust製推論サーバーでは、性能表現を実測から切り離して読むを導入判断の確認対象として切り分け、READMEに明記された範囲と実際の環境で変わる部分を別々に記録する。性能表現を実測から切り離して読むに関する版、入力、出力を残せば、同じ確認を後からやり直せる。

編集部の結論

Shimmyは、GGUFモデルをローカルGPUで動かし、既存のOpenAI API向けクライアントから接続したい人に適した候補である。対応モデル、GPUバックエンド、量子化、同時実行時の挙動はREADMEの認定範囲を超えて推測できない。導入前に指定バージョンのバイナリを起動し、モデルパス、API応答、WebGPUアダプター、メモリ使用量を一つずつ確認してから接続先を切り替えたい。

公式情報源

  1. Official README
  2. Project repository
  3. Release notes
コミュニティノート

コミュニティノート