セルフホスト型サービス
jamiepine/voicebox avatar
jamiepine/voicebox

Voicebox:ローカルファーストのAI音声スタジオ。クローン作成、ディクテーション、エージェント音声

Voicebox は、音声の録音、複製、ディクテーション、音声生成を行うためのローカル AI 音声スタジオです。

スター 53,792フォーク 6,728TypeScriptMIT

ひと目でわかる

これは何?
音声クローン、マルチエンジンTTS、ディクテーション、MCPベースのエージェント音声出力を組み合わせたオープンソースのデスクトップアプリ。すべてローカルで動作。
誰に向いている?
Voicebox は MIT ライセンスで公開されており、使用、複製、変更、結合、公開、配布、サブライセンス、販売を許可しますが、ソフトウェアは何の保証もなく提供されます。README には、Windows と Linux の自動貼り付けや追加の音声認識エンジンなど、いくつかの計画機能が記載されていますが、目標日はありません。
商用利用できる?
できます。MIT は寛容なライセンスで、著作権表示とライセンス表示を残せば、使用・改変・販売が可能です。
今もメンテナンスされている?
されています。最後のコミットは 38 日前です。
何の言語で書かれている?
主に TypeScript です(GitHub の言語統計による)。

回答はプロジェクトの GitHub データ(最終同期:2026年9月15日)と当サイトの分析に基づくもので、法的助言ではありません。

オープンソース詳細解説

jamiepine-voicebox:ローカルファーストの音声スタジオとしてのVoicebox

Voicebox はオープンソースのデスクトップアプリケーションで、README ではローカルファーストのAI音声スタジオと説明されています。音声入出力の両方を処理します。短い音声サンプルから声をクローンし、7つのテキスト読み上げエンジンで音声を生成できるほか、音声を書き起こして任意のアプリケーションにディクテーションできます。README では、出力側の ElevenLabs と入力側の WisprFlow に対する無料のオープンソース代替として位置付けられており、スタック全体がユーザーのマシン上で動作します。また、モデル、音声データ、キャプチャがマシンから出ることはないと主張しています。リポジトリは TypeScript で書かれ、デスクトップシェルに Tauri(Rust)、バックエンドに Python FastAPI を使用しています。ライセンスは MIT です。

jamiepine-voicebox:音声クローンと7つのTTSエンジン

README には7つのTTSエンジンが記載されています:Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox Multilingual、Chatterbox Turbo、HumeAI TADA、Kokoro。各エンジンは言語カバレッジと強みが異なります。例えば、Chatterbox Multilingual は23言語をサポートし、LuxTTS は英語のみで軽量なCPU推論を主張しています。Voicebox は参照サンプルからのゼロショットクローンと、Kokoro と Qwen CustomVoice による50以上の厳選されたプリセット音声をサポートします。[laugh] や [sigh] のような表現タグは Chatterbox Turbo でのみ解釈され、README は他のエンジンがそれらを文字通りテキストとして読むと述べています。生成後には、ピッチシフト、リバーブ、ディレイ、コーラス、コンプレッサー、ゲイン、フィルターなどの後処理エフェクトを適用できます。

jamiepine-voicebox:グローバルディクテーションと音声認識

音声入力のために、Voicebox はプッシュトゥトークとタップトゥトグルモードを備えたグローバルホットキーを提供します。macOS では、アクセシビリティ検証済みのインジェクションを使用して、フォーカスされたテキストフィールドに文字起こしを貼り付け、アトミックなクリップボードの保存/復元を行います。アプリにはすべてのテキストフィールドにアプリ内マイクボタンもあります。音声認識は OpenAI Whisper を実行し、base、small、medium、large、turbo のサイズがあります。turbo バリアントは Whisper Large より約8倍速く、品質の損失は最小限と説明されています。すべてのディクテーション、アプリ内録音、アップロードされた音声ファイルは Captures タブに保存され、文字起こしとペアになり、ローカルLLMで再書き起こしまたはリファインできます。

jamiepine-voicebox:エージェント音声出力とMCP統合

Voicebox は REST API と組み込みの Model Context Protocol(MCP)サーバーを公開します。単一のツール呼び出し voicebox.speak により、Claude Code、Cursor、Cline などの MCP 対応エージェントがクローンされた声で話すことができます。README には TypeScript の例と POST /speak の curl コマンドが示されています。クライアントごとの音声バインディングは MCP の設定で構成され、各エージェントが独自の音声プロファイルを持つことができます。MCP サーバーには4つのツールがあります:voicebox.speak、voicebox.transcribe、voicebox.list_captures、voicebox.list_profiles。ディクテーションに使用される同じ OS レベルのピルがエージェントの話している状態も表示するため、ユーザーはどの音声プロファイルが話しているかを確認できます。

jamiepine-voicebox:生成ワークフロー、バージョン、ストーリーズエディタ

生成はノンブロッキングで、GPUの競合を避けるためにシリアル実行キューで実行されます。テキストは文の境界で自動的に分割され、チャンク化され、クロスフェードされて無制限の長さの音声が生成されます。最大入力長は50,000文字です。各生成は複数のバージョンをサポートします:元のTTS出力、エフェクトバージョン、新しいシードで再生成されたテイク、系統のソーストラッキング。ストーリーズエディタは会話やポッドキャスト用のマルチトラックタイムラインで、ドラッグアンドドロップ、インライントリミングと分割、同期再生、トラックごとのバージョンピン留めが可能です。Spotify の pedalboard ライブラリを利用した8つのオーディオエフェクトは、生成後に適用してプリセットとして保存できます。

jamiepine-voicebox:技術スタック、GPUバックエンド、開発

技術スタックには、Tauri(Rust)、React、TypeScript、Tailwind CSS、Zustand、React Query、FastAPI、SQLite、WaveSurfer.js、librosa が含まれます。GPU サポートは、Apple Silicon の MLX、Windows と Linux NVIDIA の CUDA、AMD の ROCm、Windows の DirectML、Intel Arc の IPEX/XPU、そして通常の CPU をカバーしています。モデル管理では、GPU メモリを解放するためのモデルごとのアンロード、VOICEBOX_MODELS_DIR によるカスタムモデルディレクトリ、ダウンロードのキャンセルが可能です。開発については、README にクイックスタートコマンドが示されています:git clone、just setup、just dev。前提条件には、Bun、Rust、Python 3.11 以降、Tauri の前提条件、macOS での Xcode が含まれます。ライセンスは MIT で、ソフトウェアの使用と配布の広い許可を与えますが、保証や責任は含まれません。

編集部の結論

Voicebox は MIT ライセンスで公開されており、使用、複製、変更、結合、公開、配布、サブライセンス、販売を許可しますが、ソフトウェアは何の保証もなく提供されます。README には、Windows と Linux の自動貼り付けや追加の音声認識エンジンなど、いくつかの計画機能が記載されていますが、目標日はありません。

公式情報源

  1. Official documentation
  2. Official README
  3. Project repository
  4. Release notes
コミュニティノート

コミュニティノート