VieNeu-TTS : synthèse vocale depuis une interface locale
pnnbao97/VieNeu-TTS offre une implémentation open source exploitable en conditions réelles avec une structure réutilisable.
En bref
- De quoi s’agit-il ?
- Vietnamese TTS with instant voice cloning • On-device • Real-time CPU inference • 24kHz audio quality • Chuyển văn bản thành giọng nói tiếng Việt • Text to speech tiếng Việt • TTS tiếng Việt. Analyse pratique fondée sur le README de pnnbao97/VieNeu-TTS.
- À qui s’adresse-t-il ?
- Le projet convient si votre flux accepte les contraintes de modèle et de matériel documentées. Il convient moins à une équipe qui attend une API stable ou des chiffres de latence que la source ne promet pas.
- Puis-je l’utiliser commercialement ?
- Oui. Apache-2.0 est une licence permissive : vous pouvez utiliser, modifier et vendre un logiciel qui en dépend, à condition de conserver les mentions de droit d’auteur et de licence.
- Est-il encore maintenu ?
- Oui. Le dépôt a reçu de nouveaux commits au cours des dernières 24 heures.
- En quel langage est-il écrit ?
- Principalement Python, d’après les statistiques de langage de GitHub.
Ces réponses reposent sur les données GitHub du projet (dernière synchronisation le 15 septembre 2026) et sur notre analyse. Elles ne constituent pas un avis juridique.
ANALYSE OPEN SOURCE APPROFONDIE
Aperçu et état des versions
VieNeu-TTS est un projet de synthèse vocale vietnamienne écrit en Python. Le README décrit VieNeu-TTS-v2 comme l'architecture bilingue haute fidélité complète actuelle, et liste une version en accès anticipé v3 Turbo avec une architecture 48 kHz construite de zéro. Les fonctionnalités clés revendiquées dans le README incluent plus de 10 000 heures de données d'entraînement anglais-vietnamien, le clonage vocal instantané à partir d'un clip de référence de 3 à 5 secondes, et un mode podcast ou conversation pour le dialogue multi-locuteurs. Le README indique que le v3 Turbo ajoute des voix par défaut intégrées, des styles de lecture, des indices émotionnels expérimentaux et une génération par lots.
Le README recommande le gestionnaire de paquets uv pour l'installation. Pour une configuration CPU uniquement, il indique d'exécuter 'uv sync' après avoir cloné le dépôt ; cela installe la pile ONNX sans torch et exécute v3 Turbo sur CPU à 48 kHz. Pour GPU, il indique d'exécuter 'uv sync --group gpu', ce qui nécessite CUDA 12.8 ou Apple Silicon MPS. L'interface Web est démarrée avec 'uv run vieneu-web' et accessible à http://127.0.0.1:7860. Le README ne spécifie pas de version Python ni d'exigences système au-delà de ces commandes.
Le SDK vieneu utilise par défaut v3 Turbo à 48 kHz. L'installation minimale est sans torch sur CPU, utilisant ONN
Le README de pnnbao97/VieNeu-TTS ne donne pas ici de mesure indépendante au-delà de ce périmètre. Cette réserve décrit la portée annoncée et le résultat attendu dans votre contexte.
Installation et interface Web
X Runtime ; sur une machine CUDA, elle bascule automatiquement vers PyTorch. L'exemple de démarrage rapide installe 'vieneu' via pip, crée ensuite une instance Vieneu et appelle infer() avec du texte et un nom de voix. Le README inclut du code pour mesurer le facteur temps réel et lister les voix intégrées. Il montre également infer_batch() pour la génération par lots, notant que sur CPU, elle s'exécute séquentiellement et que le gain de lot n'apparaît que sur CUDA. Le README recommande le CPU pour les appels interactifs courts et le GPU pour les textes longs ou les travaux à haut débit.
v3 Turbo prend en charge le streaming au niveau des trames, avec un démarrage audio en environ 300 ms et une génération qui reste en avance sur la lecture. Le README indique que le streaming s'exécute sur le moteur ONNX/CPU et recommande de forcer backend='onnx' pour une utilisation en temps réel. Le moteur comprend 14 voix prédéfinies couvrant trois régions vietnamiennes (Nord, Centre, Sud). Chaque voix prend en charge trois styles de lecture : naturel, actualités et narration, sélectionnés avec le paramètre style. Les indices émotionnels en ligne sont expérimentaux et sont insérés directement dans le texte, comme '[cười]' pour un rire, '[thở dài]' pour un soupir et '[hắng giọng]' pour un raclement de gorge.
Le clonage vocal utilise un clip de référe
Le README de pnnbao97/VieNeu-TTS ne donne pas ici de mesure indépendante au-delà de ce périmètre. Cette réserve rappelle que la documentation ne remplace pas l observation du service lancé.
Utilisation du SDK Python
nce de 3 à 8 secondes, avec suppression automatique du bruit et rognage à 8 secondes. Le README montre le clonage via infer() avec ref_audio, et l'enregistrement d'une voix avec add_voice() pour la réutilisation. La méthode denoise() peut être appelée séparément. Le README note que denoise, add_voice et le clonage vocal nécessitent actuellement le moteur PyTorch (GPU). Pour le déploiement serveur, le README décrit une image Docker qui exécute un serveur API haute performance propulsé par LMDeploy. La commande 'docker run --gpus all -p 23333:23333 ... pnnbao/vieneu-tts:latest' démarre le serveur, et le SDK peut se connecter en mode distant avec un client léger.
Le README inclut un tableau de modèles : VieNeu-TTS-v3-Turbo (accès anticipé) fonctionne sur GPU/CPU avec audio 48 kHz et clonage ; VieNeu-TTS-v2 fonctionne sur GPU avec podcast et changement de code ; VieNeu-v2-CPU et VieNeu-v2-Turbo fonctionnent sur CPU/Edge avec GGUF/ONNX ; et VieNeu-TTS v1 est une version stable uniquement vietnamienne. La feuille de route liste les éléments terminés, notamment v2, le codec, le clonage turbo et l'accès anticipé v3 Turbo. Les éléments en attente sont une version complète v3 avec une qualité finalisée et un contrôle émotionnel stable, ainsi qu'un SDK mobile pour Android/iOS. Le README ne fournit pas de dates ou de calendriers pour ces éléments.
Le README de pnnbao97/VieNeu-TTS ne donne pas ici de mesure indépendante au-delà de ce périmètre. Cette réserve sépare les faits publiés des hypothèses sur votre charge réelle.
Synthèse vocale depuis une interface locale : installation
ViNEU-TTS est présenté comme un outil de synthèse vocale. Les formats, modèles et options doivent être lus dans les fichiers et commandes explicitement fournis par son README, sans extrapoler les performances.
Le README de pnnbao97/VieNeu-TTS ne donne pas ici de mesure indépendante au-delà de ce périmètre. Cette réserve situe la commande de contrôle dans le périmètre précis du projet.
Synthèse vocale depuis une interface locale : usage
Reprenez la commande d installation et l exemple d exécution de `pnnbao97/vieneu-tts`, puis vérifiez le fichier audio produit, la langue demandée et le message retourné pour un texte court.
Le README de pnnbao97/VieNeu-TTS ne donne pas ici de mesure indépendante au-delà de ce périmètre. Cette réserve indique pourquoi les limites documentées doivent rester visibles lors du choix.
Synthèse vocale depuis une interface locale : limites
Le projet convient si votre flux accepte les contraintes de modèle et de matériel documentées. Il convient moins à une équipe qui attend une API stable ou des chiffres de latence que la source ne promet pas.
Le README de pnnbao97/VieNeu-TTS ne donne pas ici de mesure indépendante au-delà de ce périmètre. Cette réserve ferme l analyse sur le comportement réellement décrit par la source.
Conclusion éditoriale
Le projet convient si votre flux accepte les contraintes de modèle et de matériel documentées. Il convient moins à une équipe qui attend une API stable ou des chiffres de latence que la source ne promet pas. Pour décider, exécutez le contrôle propre à pnnbao97/VieNeu-TTS décrit dans la section correspondante et conservez le résultat observé avec la version utilisée.
Notes de la communauté