Outils

Transcription audio (Whisper dans le navigateur)

Transcrivez de l’audio ou de la vidéo avec Whisper d’OpenAI exécuté dans votre onglet, en texte brut ou en sous-titres SRT.

S’exécute dans le navigateurOutils de développement IA16,3 k
Gratuit
Déposez vos fichiers ici

Ou choisissez-les. Les fichiers sont traités dans cet onglet et jamais téléversés sur un serveur.

Whisper, publié par OpenAI sous le nom openai/whisper, est le modèle vocal ouvert sur lequel reposent la plupart des outils de transcription. Cette page l’exécute dans l’onglet avec huggingface/transformers.js : le navigateur décode la piste audio de votre enregistrement, la rééchantillonne en 16 kHz mono, et le modèle la transcrit par fenêtres de 30 secondes. Choisissez tiny pour la vitesse ou base pour la précision, indiquez la langue si vous la connaissez, et obtenez du texte brut ou un fichier SRT horodaté. C’est gratuit et privé, mais plus lent qu’une API cloud.

Comment ça marche

  • Les modèles quantifiés sont téléchargés depuis Hugging Face à la première utilisation, environ 40 Mo pour tiny et 77 Mo pour base, puis mis en cache par le navigateur.
  • Les fichiers longs sont découpés en segments de 30 secondes avec 5 secondes de chevauchement, la méthode standard de Whisper pour l’audio plus long que sa fenêtre.
  • Le mode traduction fait écrire Whisper en anglais quelle que soit la langue parlée ; Whisper ne propose aucune autre langue cible.

Où vont vos données

Nulle part. Cet outil s’exécute entièrement dans votre navigateur : le texte collé est traité par la page, jamais transmis à un serveur ni consigné dans un journal.

Cet outil est gratuit et ne demande aucun compte. Ses résultats n’existent que dans la page ouverte et ne sont enregistrés nulle part.

Ce que ça coûte

Cet outil est gratuit, sans connexion ni points.

Questions fréquentes

Combien de temps cela va-t-il prendre ?
Cela dépend de votre processeur, car le modèle tourne en WebAssembly et non sur le GPU d’un centre de données. Comptez, pour le modèle base, une part non négligeable de la durée de l’enregistrement sur un ordinateur portable récent, et bien plus sur un téléphone. Pour des heures d’audio, une API cloud ou whisper.cpp sur votre propre machine est le choix pratique ; cette page convient aux extraits et aux réunions.
Le téléchargement du modèle ne se termine jamais. Pourquoi ?
Les poids proviennent de huggingface.co et les fichiers ONNX Runtime de jsDelivr. Les deux peuvent être lents ou inaccessibles sur certains réseaux, notamment en Chine continentale, et l’outil ne peut pas démarrer tant que le téléchargement n’est pas terminé. Une fois qu’il a fonctionné, le cache du navigateur lui permet de démarrer sans réseau.
Quels fichiers peut-il lire ?
Tout ce que votre navigateur sait décoder : MP3, WAV, M4A, AAC, OGG et FLAC, ainsi que la piste audio des vidéos MP4 et WebM dans la plupart des navigateurs. Si le décodage échoue, extrayez d’abord l’audio — par exemple avec ffmpeg -i input.mov -vn audio.m4a. Les fichiers sont limités à 100 Mo, car toute la piste décodée est conservée en mémoire.

L’open source derrière

Cet outil fonctionne grâce à huggingface/transformers.js, publié sous licence Apache-2.0. Si vous avez besoin du même comportement dans votre propre programme, c’est cette bibliothèque qu’il faut utiliser.

huggingface/transformers.js

Aussi appelé

  • transcrire audio en texte
  • speech to text gratuit
  • whisper en ligne
  • transcription audio gratuite
  • vidéo en srt
  • convertir audio en texte