CLI-Tool
pnnbao97/VieNeu-TTS avatar
pnnbao97/VieNeu-TTS

VieNeu-TTS: On-Device vietnamesische Text-to-Speech mit Stimmklonen

pnnbao97/VieNeu-TTS bietet eine praxistaugliche Open-Source-Implementierung mit stabiler Einsatzbarkeit für reale Anwendungsfälle.

2.573 Sterne777 ForksPythonApache-2.0

Auf einen Blick

Was ist das?
Ein Blick auf die v2- und v3-Turbo-Versionen, das Python-SDK und den Docker-Servermodus.
Für wen ist es gedacht?
VieNeu-TTS ist ein Python-Projekt für vietnamesische Text-to-Speech, das auf CPU oder GPU läuft, mit sofortigem Stimmklonen und einem Multi-Sprecher-Konversationsmodus. Das v3 Turbo ist eine Early-Access-Version mit einer neuen, von Grund auf neu gebauten Architektur.
Darf ich es kommerziell nutzen?
Ja. Apache-2.0 ist eine freizügige Lizenz: Sie dürfen darauf aufbauende Software nutzen, verändern und verkaufen, solange Sie die Urheberrechts- und Lizenzhinweise beibehalten.
Wird es noch gepflegt?
Ja. Das Repository hat innerhalb des letzten Tages neue Commits erhalten.
In welcher Sprache ist es geschrieben?
Hauptsächlich Python, laut der Sprachstatistik von GitHub.

Die Antworten beruhen auf den GitHub-Daten des Projekts (zuletzt abgeglichen am 15. September 2026) und auf unserer Analyse. Sie sind keine Rechtsberatung.

TIEFGEHENDE OPEN-SOURCE-ANALYSE

Überblick und Versionsstand

VieNeu-TTS ist ein in Python geschriebenes vietnamesisches Text-to-Speech-Projekt. Die README beschreibt VieNeu-TTS-v2 als die aktuelle vollständige High-Fidelity-Zweisprachenarchitektur und listet eine Early-Access-Version v3 Turbo mit einer von Grund auf neu gebauten 48-kHz-Architektur auf. Zu den in der README genannten Hauptfunktionen gehören über 10.000 Stunden englisch-vietnamesischer Trainingsdaten, sofortiges Stimmklonen aus einem 3-5 Sekunden langen Referenzclip und ein Podcast- oder Konversationsmodus für Mehrsprecher-Dialoge. Die README gibt an, dass das v3 Turbo integrierte Standardstimmen, Lesestile, experimentelle Emotionshinweise und Batch-Generierung hinzufügt. Prüfpunkt 1.1 für pnnbao97-vieneu-tts-deep-analysis.

Für die praktische Einordnung zählt der konkrete Ablauf des Projekts. Die angegebenen Schnittstellen sollten mit einem kleinen, nachvollziehbaren Beispiel gestartet werden. Dabei sind Eingabe, Ausgabe, Fehlermeldung und Ressourcenverbrauch getrennt zu notieren. Das README beschreibt die vorgesehenen Optionen, aber nicht jede Kombination aus Betriebssystem, Version und externem Dienst. Genau diese Randbedingungen können die Entscheidung beeinflussen. Eine lokale Probe mit der vorhandenen Konfiguration ist deshalb aussagekräftiger als eine allgemeine Leistungsannahme. Änderungen sollten anschließend gegen die Dokumentation und die Release-Hinweise des jeweiligen Projekts gelesen werden. Projekt: pnnbao97-vieneu-tts-deep-analysis.

Installation und Web-UI

Die README empfiehlt den uv-Paketmanager für die Installation. Für ein reines CPU-Setup heißt es, nach dem Klonen des Repositorys 'uv sync' auszuführen; dies installiert den torch-freien ONNX-Stack und führt v3 Turbo auf der CPU mit 48 kHz aus. Für GPU heißt es, 'uv sync --group gpu' auszuführen, was CUDA 12.8 oder Apple Silicon MPS erfordert. Das Web-UI wird mit 'uv run vieneu-web' gestartet und ist unter http://127.0.0.1:7860 erreichbar. Die README spezifiziert keine Python-Version oder Systemanforderungen über diese Befehle hinaus. Prüfpunkt 2.1 für pnnbao97-vieneu-tts-deep-analysis.

Python-SDK-Nutzung

Das vieneu-SDK verwendet standardmäßig v3 Turbo bei 48 kHz. Die minimale Installation ist auf der CPU torch-frei und verwendet ONNX Runtime; auf einer CUDA-Maschine wechselt sie automatisch zu PyTorch. Das Schnellstartbeispiel installiert 'vieneu' über pip, erstellt dann eine Vieneu-Instanz und ruft infer() mit Text und einem Stimmnamen auf. Die README enthält Code zur Messung des Echtzeitfaktors und zur Auflistung integrierter Stimmen. Es zeigt auch infer_batch() für Batch-Generierung, wobei es darauf hinweist, dass es auf der CPU sequenziell läuft und der Batch-Gewinn nur auf CUDA erscheint. Die README empfiehlt CPU für kurze interaktive Aufrufe und GPU für Langtext oder Hochdurchsatzarbeiten. Prüfpunkt 3.1 für pnnbao97-vieneu-tts-deep-analysis.

Streaming, Stimmen und Lesestile

v3 Turbo unterstützt Frame-Level-Streaming, wobei Audio in etwa 300 ms beginnt und die Generierung der Wiedergabe voraus bleibt. Die README sagt, dass Streaming auf der ONNX/CPU-Engine läuft und empfiehlt, für Echtzeitgebrauch backend='onnx' zu erzwingen. Die Engine enthält 14 voreingestellte Stimmen, die drei vietnamesische Regionen abdecken (Norden, Mitte, Süden). Jede Stimme unterstützt drei Lesestile: natürlich, Nachrichten und Geschichtenerzählen, ausgewählt über den style-Parameter. Inline-Emotionshinweise sind experimentell und werden direkt in den Text eingefügt, wie '[cười]' für Kichern, '[thở dài]' für Seufzen und '[hắng giọng]' für Räuspern. Prüfpunkt 4.1 für pnnbao97-vieneu-tts-deep-analysis.

Stimmklonen und Serverbereitstellung

Das Stimmklonen verwendet einen 3-8 Sekunden langen Referenzclip, mit automatischer Rauschunterdrückung und Zuschneiden auf 8 Sekunden. Die README zeigt das Klonen über infer() mit ref_audio und das Registrieren einer Stimme mit add_voice() zur Wiederverwendung. Die denoise()-Methode kann separat aufgerufen werden. Die README weist darauf hin, dass denoise, add_voice und Stimmklonen derzeit die PyTorch-Engine (GPU) erfordern. Für die Serverbereitstellung beschreibt die README ein Docker-Image, das einen leistungsstarken API-Server mit LMDeploy ausführt. Der Befehl 'docker run --gpus all -p 23333:23333 ... pnnbao/vieneu-tts:latest' startet den Server, und das SDK kann sich im Remote-Modus mit einem leichten Client verbinden. Prüfpunkt 5.1 für pnnbao97-vieneu-tts-deep-analysis.

Modellaufstellung und Roadmap

Die README enthält eine Tabelle von Modellen: VieNeu-TTS-v3-Turbo (Early Access) läuft auf GPU/CPU mit 48-kHz-Audio und Klonen; VieNeu-TTS-v2 läuft auf GPU mit Podcast und Code-Switching; VieNeu-v2-CPU und VieNeu-v2-Turbo laufen auf CPU/Edge mit GGUF/ONNX; und VieNeu-TTS v1 ist eine stabile nur-vietnamesische Version. Die Roadmap listet abgeschlossene Elemente auf, darunter v2, den Codec, Turbo-Klonen und v3 Turbo Early Access. Ausstehende Elemente sind eine vollständige v3-Version mit finalisierter Qualität und stabiler Emotionssteuerung sowie ein mobiles SDK für Android/iOS. Die README gibt keine Daten oder Zeitpläne für diese an. Prüfpunkt 6.1 für pnnbao97-vieneu-tts-deep-analysis.

VieNeu-TTS im konkreten Einsatz

Für eine erste Prüfung eignet sich `uv run vieneu-web`: Dabei sollte die Oberfläche auf `127.0.0.1:7860` erreichbar sein. Bei kurzen Dialogen ist die CPU-Variante laut README der passendere Ausgangspunkt, während `infer_batch()` seinen Vorteil laut Dokumentation auf CUDA zeigt.

VieNeu-TTS im konkreten Einsatz 8

Die Auswahl zwischen v2 und `Vieneu(mode="v3turbo")` ist eine Produktentscheidung. v3 Turbo bringt 48-kHz-Ausgabe und Standardstimmen, befindet sich laut README aber im Early Access. Für eine Veröffentlichung müssen daher die konkrete Stimme, die Aussprache vietnamesischer Wörter und die Reaktion auf `[cười]` oder `[thở dài]` im eigenen Audiomaterial geprüft werden.

Redaktionelles Fazit

VieNeu-TTS ist ein Python-Projekt für vietnamesische Text-to-Speech, das auf CPU oder GPU läuft, mit sofortigem Stimmklonen und einem Multi-Sprecher-Konversationsmodus. Das v3 Turbo ist eine Early-Access-Version mit einer neuen, von Grund auf neu gebauten Architektur.

Offizielle Quellen

  1. Official documentation
  2. Official README
  3. Project repository
  4. Release notes
Community-Notizen

Community-Notizen