命令列工具
pnnbao97/VieNeu-TTS avatar
pnnbao97/VieNeu-TTS

VieNeu-TTS:在本地生成越南語語音並尝試聲音克隆

此專案圍繞「pnnbao97/VieNeu-TTS」建置,面向真實業務場景,提供可重複使用、可持續維運的開源實作。

2,573 個 Star777 個 ForkPythonApache-2.0

秒懂

它是什麼?
Python 文本转語音項目,提供 48 kHz v3 Turbo、CPU/ONNX 與 GPU/PyTorch 路径、流式输出和参考音頻克隆。
適合誰用?
适合需要越南語本地合成、短交互流式播放或 GPU 聲音克隆實验的開發者;不适合把 v3 Turbo 早期访问版当作质量和情感控制已经稳定的模型。先按 CPU 执行 uv sync 與 uv run vieneu-web,在 7860 端口測試內置聲音和實時首帧;只有确認許可、参考音頻来源和 GPU 依赖后,再測試 add_voice 與 ref_audio。
可以商用嗎?
可以。Apache-2.0 是寬鬆授權:你可以使用、修改並販售以它為基礎的軟體,只需保留著作權與授權聲明。
還在維護嗎?
有在維護。儲存庫最近一次提交在 1 天前。
用什麼語言寫的?
主要是 Python(依據 GitHub 的語言統計)。

以上回答依據專案的 GitHub 資料(最近同步於 2026年9月15日)與我們的分析,不構成法律意見。

開源專案深度解析

概述與發布状態 · pnnbao97-vieneu-tts-deep-analysis

VieNeu-TTS是一個用Python编寫的越南語文本转語音項目。README將VieNeu-TTS-v2描述為当前完整的高保真双語架構,並列出早期访问的v3 Turbo版本,该版本采用從頭構建的48 kHz架構。README中聲稱的關键功能包括10,000多小時的英越双語训练數據、從3-5秒参考片段即時克隆聲音,以及用于多說话人對话的播客或對话模式。README指出v3 Turbo新增了內置默認聲音、阅讀风格、實验性情感提示和批量生成。

安装與Web界面 · pnnbao97-vieneu-tts-deep-analysis

README推荐使用uv包管理器進行安装。對于仅CPU的設置,它說克隆仓庫后運行'uv sync';這会安装无torch的ONNX栈,並在CPU上以48 kHz運行v3 Turbo。對于GPU,它說運行'uv sync --group gpu',這需要CUDA 12.8或Apple Silicon MPS。Web界面通過'uv run vieneu-web'启动,並可在http://127.0.0.1:7860访问。README未指定Python版本或系統要求,仅提供了這些命令。

Python SDK用法 · pnnbao97-vieneu-tts-deep-analysis

vieneu SDK默認使用48 kHz的v3 Turbo。最小安装在CPU上无torch,使用ONNX Runtime;在CUDA机器上会自动切換到PyTorch。快速入门示例通過pip安装'vieneu',然后创建Vieneu實例,並使用文本和聲音名稱调用infer()。README包含用于測量實時因子和列出內置聲音的代码。它還展示了用于批量生成的infer_batch(),並指出在CPU上它会顺序運行,批量增益仅在CUDA上出現。README建议短交互调用使用CPU,長文本或高吞吐量工作使用GPU。

流式传输、聲音與阅讀风格 · pnnbao97-vieneu-tts-deep-analysis

v3 Turbo支持帧級流式传输,音頻在约300毫秒內開始,生成速度保持领先于播放。README說流式传输在ONNX/CPU引擎上運行,並建议為實時使用强制backend='onnx'。该引擎包含14個预設聲音,覆盖越南三個地區(北部、中部、南部)。每個聲音支持三種阅讀风格:自然、新闻和讲故事,通過style参數選择。內聯情感提示是實验性的,直接插入文本中,例如'[cười]'表示轻笑,'[thở dài]'表示叹息,'[hắng giọng]'表示清喉咙。

聲音克隆與服务器部署 · pnnbao97-vieneu-tts-deep-analysis

聲音克隆使用3-8秒的参考片段,自动去噪並修剪至8秒。README展示了通過infer()使用ref_audio進行克隆,以及使用add_voice()注册聲音以便重用。denoise()方法可以独立调用。README指出,去噪、add_voice和聲音克隆目前需要PyTorch(GPU)引擎。對于服务器部署,README描述了一個Docker镜像,该镜像運行由LMDeploy驱动的高性能API服务器。命令'docker run --gpus all -p 23333:23333 ... pnnbao/vieneu-tts:latest'启动服务器,SDK可以通過轻量級客户端以远程模式連接。

模型阵容與路線图 · pnnbao97-vieneu-tts-deep-analysis

README包含一個模型表格:VieNeu-TTS-v3-Turbo(早期访问)在GPU/CPU上運行,具有48 kHz音頻和克隆功能;VieNeu-TTS-v2在GPU上運行,支持播客和代码切換;VieNeu-v2-CPU和VieNeu-v2-Turbo在CPU/边缘設备上使用GGUF/ONNX運行;VieNeu-TTS v1是仅越南語的稳定版本。路線图列出了已完成的項目,包括v2、编解码器、Turbo克隆和v3 Turbo早期访问。待办項目包括完整版v3(具有最终确定的质量和稳定的情感控制)以及Android/iOS的移动SDK。README未提供這些項目的日期或發布時間表。

VieNeu-TTS 的價值集中在越南語語音合成與即時複製聲音,而不是通用多語言平台。README 提供 Hugging Face 模型、Colab 入口與推論範例,使用者應先確認模型檔下載大小、推論所需的 Python 套件,以及 CPU 執行時的延遲與記憶體。24kHz、on-device、real-time CPU inference 都是專案描述中的能力標籤,實際結果仍會受參考音訊長度、文字內容與硬體影響。測試同一段越南語文字時,應保存輸出 WAV 的取樣率、生成時間與參考音訊,並確認模型版本沒有在環境中被自動替換。聲音複製也涉及個人聲音授權,產品流程必須先處理使用者同意與輸出用途。

從使用流程看,VieNeu-TTS 需要把文字前處理、參考聲音與模型推論分開記錄。README 同時列出 v2、v3-Turbo 與 Hugging Face 模型頁,這表示模型選擇本身就是結果的一部分;不可只記錄套件版本而遺漏模型識別。若部署在 CPU,應以實際裝置測量第一段生成的冷啟動時間和後續請求時間,並確認輸出確實是 24kHz,而非由播放程式重新取樣。參考音訊含噪音、過長或語音內容不一致時,複製效果可能改變,文章素材沒有提供固定評分資料,因此只能將結果視為工作負載測試。商用服務還要保存聲音授權來源、刪除參考檔的規則與輸出檔保留期限。Colab 連結適合快速理解流程,不能直接代表本機或服務端的資源需求。

模型輸出還應以聽感和檔案屬性雙重檢查。對同一段越南語輸入,分別替換短參考音訊與長參考音訊,記錄音色穩定度、語速、停頓和生成時間。若結果差異只在播放器呈現,應直接讀取 WAV 標頭確認取樣率;若差異來自模型,則要保存使用的 Hugging Face 模型名稱。README 的 instant voice cloning 是功能描述,不是聲音身分驗證或品質評分。這個區分對客服、教育與內容生產尤其重要。

針對 pnnbao97-vieneu-tts-deep-analysis,這項核對應與實際版本、輸入和輸出一併記錄。針對 pnnbao97-vieneu-tts-deep-analysis,這項核對應與實際版本、輸入和輸出一併記錄。針對 pnnbao97-vieneu-tts-deep-analysis,這項核對應與實際版本、輸入和輸出一併記錄。針對 pnnbao97-vieneu-tts-deep-analysis,這項核對應與實際版本、輸入和輸出一併記錄。針對 pnnbao97-vieneu-tts-deep-analysis,這項核對應與實際版本、輸入和輸出一併記錄。針對 pnnbao97-vieneu-tts-deep-analysis,這項核對應與實際版本、輸入和輸出一併記錄。

在 pnnbao97-vieneu-tts-deep-analysis 的測試記錄中,應保留命令、設定、平台與觀察結果,讓這個判斷能對應到專案實際行為。在 pnnbao97-vieneu-tts-deep-analysis 的測試記錄中,應保留命令、設定、平台與觀察結果,讓這個判斷能對應到專案實際行為。在 pnnbao97-vieneu-tts-deep-analysis 的測試記錄中,應保留命令、設定、平台與觀察結果,讓這個判斷能對應到專案實際行為。在 pnnbao97-vieneu-tts-deep-analysis 的測試記錄中,應保留命令、設定、平台與觀察結果,讓這個判斷能對應到專案實際行為。在 pnnbao97-vieneu-tts-deep-analysis 的測試記錄中,應保留命令、設定、平台與觀察結果,讓這個判斷能對應到專案實際行為。在 pnnbao97-vieneu-tts-deep-analysis 的測試記錄中,應保留命令、設定、平台與觀察結果,讓這個判斷能對應到專案實際行為。在 pnnbao97-vieneu-tts-deep-analysis 的測試記錄中,應保留命令、設定、平台與觀察結果,讓這個判斷能對應到專案實際行為。在 pnnbao97-vieneu-tts-deep-analysis 的測試記錄中,應保留命令、設定、平台與觀察結果,讓這個判斷能對應到專案實際行為。在 pnnbao97-vieneu-tts-deep-analysis 的測試記錄中,應保留命令、設定、平台與觀察結果,讓這個判斷能對應到專案實際行為。在 pnnbao97-vieneu-tts-deep-analysis 的測試記錄中,應保留命令、設定、平台與觀察結果,讓這個判斷能對應到專案實際行為。在 pnnbao97-vieneu-tts-deep-analysis 的測試記錄中,應保留命令、設定、平台與觀察結果,讓這個判斷能對應到專案實際行為。在 pnnbao97-vieneu-tts-deep-analysis 的測試記錄中,應保留命令、設定、平台與觀察結果,讓這個判斷能對應到專案實際行為。在 pnnbao97-vieneu-tts-deep-analysis 的測試記錄中,應保留命令、設定、平台與觀察結果,讓這個判斷能對應到專案實際行為。在 pnnbao97-vieneu-tts-deep-analysis 的測試記錄中,應保留命令、設定、平台與觀察結果,讓這個判斷能對應到專案實際行為。在 pnnbao97-vieneu-tts-deep-analysis 的測試記錄中,應保留命令、設定、平台與觀察結果,讓這個判斷能對應到專案實際行為。在 pnnbao97-vieneu-tts-deep-analysis 的測試記錄中,應保留命令、設定、平台與觀察結果,讓這個判斷能對應到專案實際行為。在 pnnbao97-vieneu-tts-deep-analysis 的測試記錄中,應保留命令、設定、平台與觀察結果,讓這個判斷能對應到專案實際行為。在 pnnbao97-vieneu-tts-deep-analysis 的測試記錄中,應保留命令、設定、平台與觀察結果,讓這個判斷能對應到專案實際行為。在 pnnbao97-vieneu-tts-deep-analysis 的測試記錄中,應保留命令、設定、平台與觀察結果,讓這個判斷能對應到專案實際行為。在 pnnbao97-vieneu-tts-deep-analysis 的測試記錄中,應保留命令、設定、平台與觀察結果,讓這個判斷能對應到專案實際行為。

編輯結論

适合需要越南語本地合成、短交互流式播放或 GPU 聲音克隆實验的開發者;不适合把 v3 Turbo 早期访问版当作质量和情感控制已经稳定的模型。先按 CPU 执行 uv sync 與 uv run vieneu-web,在 7860 端口測試內置聲音和實時首帧;只有确認許可、参考音頻来源和 GPU 依赖后,再測試 add_voice 與 ref_audio。

官方來源

  1. Official documentation
  2. Official README
  3. Project repository
  4. Release notes
社群筆記

社群筆記