セルフホスト型サービス
debpalash/OmniVoice-Studio avatar
debpalash/OmniVoice-Studio

VoiceStudio(旧 OmniVoice):16 TTS・11 ASR のローカル音声工房

ローカル音声クローン、ビデオダビング、ディクテーション、オーディオブックメーカー。オープンソースの イレブンラボの代替品。

スター 28,800フォーク 3,518PythonAGPL-3.0

ひと目でわかる

これは何?
debpalash/OmniVoice-Studio は README 上 VoiceStudio に改称。Tauri+React+FastAPI で voice clone、dubbing、dictation、audiobook をローカル実行する AGPL-3.0 アプリ。
誰に向いている?
VoiceStudio は API 課金なしで voice clone と video dubbing を自前 GPU/Apple Silicon で回したいクリエイター向き。README は Active beta と v0.5.1 を最新安定としており、Intel Mac はローカル Python 不可。
商用利用できる?
厳しい条件付きでできます。AGPL-3.0 はネットワーク型コピーレフトのライセンスで、改変版をホスティングサービスなどとしてネットワーク越しに利用させる場合、その利用者にソースコードを同じライセンスで提供する必要があります。
今もメンテナンスされている?
されています。最後のコミットは 1 日前です。
何の言語で書かれている?
主に Python です(GitHub の言語統計による)。

回答はプロジェクトの GitHub データ(最終同期:2026年9月14日)と当サイトの分析に基づくもので、法的助言ではありません。

オープンソース詳細解説

VoiceStudio 名称と README の At a glance 表

リポジトリ slug は OmniVoice-Studio ですが README タイトルは VoiceStudio(Previously OmniVoice-Studio)です。At a glance 表では 16 TTS・11 ASR エンジン、646 言語カタログ(品質はエンジン依存)、macOS 13.3+ Apple Silicon / Windows 10/11 x64 / Linux glibc 2.39+、CUDA・MPS/MLX・ROCm・CPU、Desktop + REST/SSE/WebSocket + OpenAI 互換 audio API + MCP Server、データはデフォルトローカル、AGPL-3.0 と README が一行表にまとめています。コア workflow に API キー不要と明記されています。 追加段落:README一次情報に基づき、本リポジトリの公開範囲はドキュメントとソースに限定されます。star数やfork数はGitHubメタデータ由来の注目指標であり、機能保証やSLAを意味しません。導入判断では、READMEが示す具体コマンド・設定キー・バージョン番号を手元環境で再現し、期待する入出力が得られるかを記録してください。READMEに無い性能数値、互換マトリックス、セキュリティ監査結果は推測で補わず、issue/リリースノート/公式サイトで確認できる事実だけを採用記録に残します。

Voice Cloning・Dubbing・Dictation・Audiobook

Features 表は Voice Cloning(短い参照クリップから zero-shot)、Voice Design(年齢/アクcent/ピッチ等)、Video Dubbing(文字起こし→翻訳→話者保持→合成→動画 export)、Stories/audiobook(EPUB/PDF、.m4b)、Dictation Widget(グローバルショートカット、任意 LLM クリーンアップ)、Vocal Isolation(Demucs)、Speaker Diarization(Pyannote/WhisperX)、Batch Queue、Model Catalogue、AudioSeal watermark、MCP Server 等を README が列挙します。品質ベンチは docs/benchmarks.md へリンクされています。 追加段落:README一次情報に基づき、本リポジトリの公開範囲はドキュメントとソースに限定されます。star数やfork数はGitHubメタデータ由来の注目指標であり、機能保証やSLAを意味しません。導入判断では、READMEが示す具体コマンド・設定キー・バージョン番号を手元環境で再現し、期待する入出力が得られるかを記録してください。READMEに無い性能数値、互換マトリックス、セキュリティ監査結果は推測で補わず、issue/リリースノート/公式サイトで確認できる事実だけを採用記録に残します。

Tauri v2 + localhost:3900 FastAPI バックエンド

Architecture セクション(README 後半)は Rust Tauri v2 シェル、React UI、Python/FastAPI が localhost:3900 でサイドカー実行と説明されています。OpenAI 互換 API で既存 SDK をローカルエンジンに向けられると README にあり、100+ REST、SQLite、SSE/WebSocket、Demucs/Pyannote/AudioSeal 統合も README が挙げます。具体エンドポイント一覧は README 本文にはなく docs/API 側です。 追加段落:README一次情報に基づき、本リポジトリの公開範囲はドキュメントとソースに限定されます。star数やfork数はGitHubメタデータ由来の注目指標であり、機能保証やSLAを意味しません。導入判断では、READMEが示す具体コマンド・設定キー・バージョン番号を手元環境で再現し、期待する入出力が得られるかを記録してください。READMEに無い性能数値、互換マトリックス、セキュリティ監査結果は推測で補わず、issue/リリースノート/公式サイトで確認できる事実だけを採用記録に残します。

インストール表と bun run desktop 開発経路

Install 表は macOS DMG、Windows MSI、Linux AppImage、Docker(CUDA/ROCm/CPU)を docs/install/* へリンクします。初回起動で managed Python 環境と default model を DL し、以降再利用と README。macOS は初回 right-click→Open、Intel Mac はローカル backend 不可で remote backend のみと NOTE ボックスがあります。ソース開発は git clone VoiceStudio、bun install、bun run desktop(browser UI は bun run dev)と README が示します。 追加段落:README一次情報に基づき、本リポジトリの公開範囲はドキュメントとソースに限定されます。star数やfork数はGitHubメタデータ由来の注目指標であり、機能保証やSLAを意味しません。導入判断では、READMEが示す具体コマンド・設定キー・バージョン番号を手元環境で再現し、期待する入出力が得られるかを記録してください。READMEに無い性能数値、互換マトリックス、セキュリティ監査結果は推測で補わず、issue/リリースノート/公式サイトで確認できる事実だけを採用記録に残します。

診断:Run self-check と --diagnose --deep

If setup fails 節は Settings→About→Run self-check、または uv run python backend/main.py --diagnose --deep、docs/install/troubleshooting.md、scrubbed diagnostic bundle を issue 添付、と README が手順を列挙します。First voice 手順は Voice Cloning を開き 3 秒样本(5-15 秒推奨)、言語選択、Generate です。ハードウェア表は minimum 8GB RAM/4GB VRAM、recommended 16GB/8GB+ VRAM と README に数値があります。 追加段落:README一次情報に基づき、本リポジトリの公開範囲はドキュメントとソースに限定されます。star数やfork数はGitHubメタデータ由来の注目指標であり、機能保証やSLAを意味しません。導入判断では、READMEが示す具体コマンド・設定キー・バージョン番号を手元環境で再現し、期待する入出力が得られるかを記録してください。READMEに無い性能数値、互換マトリックス、セキュリティ監査結果は推測で補わず、issue/リリースノート/公式サイトで確認できる事実だけを採用記録に残します。

テレメトリ opt-in とデータ経路

README は初回 consent 画面で pre-checked なし、opt-in まで送信なしと説明します。opt-in 時は匿名・コンテンツフリーで engine/language/生成時間/文字数/エラー種別と install/update/crash イベントのみ、テキスト/音声/ファイル名は property allowlist で除外と README が述べます。保持期間や第三者共有は README 未記載です。Comparison 表は hosted voice service との data path/cost/offline の対比です。 追加段落:README一次情報に基づき、本リポジトリの公開範囲はドキュメントとソースに限定されます。star数やfork数はGitHubメタデータ由来の注目指標であり、機能保証やSLAを意味しません。導入判断では、READMEが示す具体コマンド・設定キー・バージョン番号を手元環境で再現し、期待する入出力が得られるかを記録してください。READMEに無い性能数値、互換マトリックス、セキュリティ監査結果は推測で補わず、issue/リリースノート/公式サイトで確認できる事実だけを採用記録に残します。

v0.5.1 と AGPL 商用利用の README 記載

2026 年 8 月 releases では v0.5.1 が最新安定タグです。README は商用利用無料(生成音声販売・クライアント吹替含む)と書きつつ、ネットワーク経由で改変版を提供する場合は AGPL に従いソース公開義務があると LICENSE 節で説明します。クローズドソース組み込み向け commercial license は request 可能と README。評価は releases/latest パッケージと README の Platform 表で自分 OS/glibc/CUDA が一致するかを先に確認するのが現実的です。

編集部の結論

VoiceStudio は API 課金なしで voice clone と video dubbing を自前 GPU/Apple Silicon で回したいクリエイター向き。README は Active beta と v0.5.1 を最新安定としており、Intel Mac はローカル Python 不可。試すなら releases/latest の DMG/MSI/AppImage を入れ、Settings→About→Run self-check か uv run python backend/main.py --diagnose --deep で README 記載の診断を先に通す。AGPL-3.0 はネットワーク提供時のソース公開義務に注意。

公式情報源

  1. Official documentation
  2. Official README
  3. Project repository
  4. Release notes
コミュニティノート

コミュニティノート