CLIツール
pnnbao97/VieNeu-TTS avatar
pnnbao97/VieNeu-TTS

VieNeu-TTS: オンデバイス向けベトナム語テキスト読み上げと音声クローン

pnnbao97/VieNeu-TTSは実運用向けに使える実用的なオープンソース実装で、再利用可能な導入ルートを持つプロジェクトです。

スター 2,573フォーク 777PythonApache-2.0

ひと目でわかる

これは何?
v2とv3 Turboのリリース、Python SDK、Dockerサーバーモードについて説明します。
誰に向いている?
VieNeu-TTSはPython製のベトナム語テキスト読み上げプロジェクトで、CPUまたはGPUで動作し、インスタント音声クローンとマルチスピーカー会話モードを備えています。v3 Turboは早期アクセス版で、ゼロから構築された新しいアーキテクチャです。
商用利用できる?
できます。Apache-2.0 は寛容なライセンスで、著作権表示とライセンス表示を残せば、使用・改変・販売が可能です。
今もメンテナンスされている?
されています。直近 1 日以内に新しいコミットがあります。
何の言語で書かれている?
主に Python です(GitHub の言語統計による)。

回答はプロジェクトの GitHub データ(最終同期:2026年9月15日)と当サイトの分析に基づくもので、法的助言ではありません。

オープンソース詳細解説

VieNeu-TTSのベトナム語音声モデル

VieNeu-TTSはPythonで書かれたベトナム語テキスト読み上げプロジェクトです。READMEはVieNeu-TTS-v2を現在の完全な高忠実度バイリンガルアーキテクチャとして説明し、ゼロから構築された48kHzアーキテクチャを持つ早期アクセス版のv3 Turboを挙げています。READMEで主張されている主な機能には、10,000時間以上の英語・ベトナム語トレーニングデータ、3〜5秒の参照クリップからのインスタント音声クローン、マルチスピーカー対話のためのポッドキャストまたは会話モードが含まれます。READMEは、v3 Turboが内蔵のデフォルト音声、読み上げスタイル、実験的な感情キュー、バッチ生成を追加したと述べています。

VieNeu-TTSのオンデバイスという説明は、音声生成を外部APIへ送らずに動かせる構成を示すものですが、READMEの例だけではすべての端末で同じ速度や品質になるとは判断できません。CPU推論を選ぶ場合はモデルサイズ、入力文の長さ、ストリーミングの分割単位が待ち時間とメモリ使用量を左右します。24kHzの出力形式が示されていても、録音環境や再生経路まで整うわけではありません。音声クローンは参照音声の条件と話者の同意を別に管理する必要があり、READMEは権利処理や本人確認の運用を定義していません。Web UIで試す場合は生成音声を保存する場所、Python SDKで組み込む場合は例外と同時実行数を、対象アプリ側で確認する必要があります。

Web UIで音声を生成する手順

READMEはインストールにuvパッケージマネージャーを推奨しています。CPUのみのセットアップでは、リポジトリをクローンした後に'uv sync'を実行すると述べています。これにより、torchフリーのONNXスタックがインストールされ、v3 TurboがCPU上で48kHzで実行されます。GPUの場合は'uv sync --group gpu'を実行すると述べており、CUDA 12.8またはApple Silicon MPSが必要です。Web UIは'uv run vieneu-web'で起動し、http://127.0.0.1:7860でアクセスします。READMEは、これらのコマンド以外のPythonバージョンやシステム要件を指定していません。

Python APIと24kHz出力

vieneu SDKはデフォルトで48kHzのv3 Turboを使用します。最小インストールはCPU上でtorchフリーで、ONNX Runtimeを使用します。CUDAマシンでは自動的にPyTorchに切り替わります。クイックスタートの例では、pipで'vieneu'をインストールし、Vieneuインスタンスを作成して、テキストと音声名を指定してinfer()を呼び出します。READMEには、リアルタイムファクターを測定し、内蔵音声を一覧表示するコードが含まれています。また、バッチ生成用のinfer_batch()も示されており、CPUでは順次実行され、バッチの利点はCUDAでのみ現れると述べています。READMEは、短いインタラクティブな呼び出しにはCPUを、長文や高スループットの作業にはGPUを推奨しています。

ストリーミングと読み上げスタイル

v3 Turboはフレームレベルのストリーミングをサポートしており、オーディオは約300ミリ秒で開始され、生成は再生に追いつきません。READMEは、ストリーミングはONNX/CPUエンジンで実行され、リアルタイム使用にはbackend='onnx'を強制することを推奨しています。このエンジンには、ベトナムの3つの地域(北部、中部、南部)をカバーする14のプリセット音声が含まれています。各音声は、自然、ニュース、ストーリーテリングの3つの読み上げスタイルをサポートしており、styleパラメータで選択します。インラインの感情キューは実験的なもので、テキストに直接挿入されます。例えば、'[cười]'は笑い、'[thở dài]'はため息、'[hắng giọng]'は咳払いを表します。

短い音声からのクローンとサーバー

音声クローンは3〜8秒の参照クリップを使用し、自動的にノイズ除去と8秒へのトリミングを行います。READMEでは、infer()でref_audioを使用したクローンと、add_voice()で音声を登録して再利用する方法を示しています。denoise()メソッドは単独で呼び出すことができます。READMEは、denoise、add_voice、音声クローンは現在PyTorch(GPU)エンジンを必要とすると述べています。サーバー展開については、LMDeployを搭載した高性能APIサーバーを実行するDockerイメージが説明されています。コマンド'docker run --gpus all -p 23333:23333 ... pnnbao/vieneu-tts:latest'でサーバーが起動し、SDKは軽量クライアントでリモートモードに接続できます。

モデルサイズ、CPU実行、未確認の品質

READMEにはモデルの表が含まれています。VieNeu-TTS-v3-Turbo(早期アクセス)はGPU/CPUで動作し、48kHzオーディオとクローンを備えています。VieNeu-TTS-v2はGPUで動作し、ポッドキャストとコード切り替えを備えています。VieNeu-v2-CPUとVieNeu-v2-TurboはCPU/エッジでGGUF/ONNXを使用して動作します。VieNeu-TTS v1はベトナム語のみの安定版です。ロードマップには、v2、コーデック、Turboクローン、v3 Turbo早期アクセスなどの完了済み項目がリストされています。保留中の項目は、品質を確定し感情制御を安定させた完全版v3と、Android/iOS向けモバイルSDKです。READMEはこれらの日付やリリーススケジュールを提供していません。

編集部の結論

VieNeu-TTSはPython製のベトナム語テキスト読み上げプロジェクトで、CPUまたはGPUで動作し、インスタント音声クローンとマルチスピーカー会話モードを備えています。v3 Turboは早期アクセス版で、ゼロから構築された新しいアーキテクチャです。

公式情報源

  1. Official documentation
  2. Official README
  3. Project repository
  4. Release notes
コミュニティノート

コミュニティノート