Werkzeuge

Sprache zu Text (Whisper im Browser)

Transkribiert Audio oder Video mit OpenAIs Whisper direkt in Ihrem Tab, als reiner Text oder als SRT-Untertitel.

Läuft im BrowserKI-Entwicklertools16.295
Kostenlos
Dateien hierher ziehen

Oder Dateien auswählen. Sie werden in diesem Tab verarbeitet und nie auf einen Server hochgeladen.

Whisper, von OpenAI als openai/whisper veröffentlicht, ist das offene Sprachmodell, auf dem die meisten Transkriptionstools aufbauen. Diese Seite führt es mit huggingface/transformers.js im Tab aus: Der Browser dekodiert die Tonspur Ihrer Aufnahme, rechnet sie auf 16 kHz mono um, und das Modell transkribiert sie in 30-Sekunden-Fenstern. Wählen Sie tiny für Tempo oder base für Genauigkeit, geben Sie die Sprache an, falls Sie sie kennen, und erhalten Sie reinen Text oder eine SRT-Datei mit Zeitstempeln. Das ist kostenlos und privat, aber langsamer als eine Cloud-API.

So arbeitet es

  • Die quantisierten Modelle werden bei der ersten Nutzung von Hugging Face geladen, etwa 40 MB für tiny und 77 MB für base, und vom Browser zwischengespeichert.
  • Lange Dateien werden in 30-Sekunden-Abschnitte mit 5 Sekunden Überlappung geteilt – die übliche Art, wie Whisper Audio verarbeitet, das länger als sein Fenster ist.
  • Im Übersetzungsmodus schreibt Whisper Englisch, gleich welche Sprache gesprochen wird; eine andere Zielsprache kennt Whisper nicht.

Wohin Ihre Daten gehen

Nirgendwohin. Dieses Werkzeug läuft vollständig in Ihrem Browser: Der eingefügte Text wird von der Seite verarbeitet und weder an einen Server übertragen noch protokolliert.

Dieses Tool ist kostenlos und braucht kein Konto. Die Ergebnisse existieren nur in Ihrer geöffneten Seite und werden nirgends gespeichert.

Was es kostet

Dieses Werkzeug ist kostenlos, ohne Anmeldung und ohne Punkte.

Häufige Fragen

Wie lange dauert es?
Das hängt von Ihrer CPU ab, denn das Modell läuft auf WebAssembly statt auf einer Rechenzentrums-GPU. Rechnen Sie damit, dass das base-Modell auf einem aktuellen Laptop einen beträchtlichen Teil der Aufnahmedauer braucht, auf einem Smartphone deutlich länger. Für stundenlanges Audio sind eine Cloud-API oder whisper.cpp auf dem eigenen Rechner die praktische Wahl; diese Seite eignet sich für Clips und Besprechungen.
Der Modell-Download wird nie fertig. Warum?
Die Gewichte kommen von huggingface.co und die ONNX-Runtime-Dateien von jsDelivr. Beide können in manchen Netzen langsam oder unerreichbar sein, auch in Festlandchina, und das Tool kann erst starten, wenn der Download abgeschlossen ist. Hat es einmal funktioniert, startet es dank Browser-Cache auch ohne Netz.
Welche Dateien kann es lesen?
Alles, was Ihr Browser dekodieren kann: MP3, WAV, M4A, AAC, OGG und FLAC sowie in den meisten Browsern die Tonspur von MP4- und WebM-Videos. Schlägt das Dekodieren fehl, extrahieren Sie zuerst die Tonspur – zum Beispiel mit ffmpeg -i input.mov -vn audio.m4a. Dateien sind auf 100 MB begrenzt, weil die gesamte dekodierte Spur im Arbeitsspeicher gehalten wird.

Das Open Source dahinter

Dieses Werkzeug läuft auf huggingface/transformers.js, veröffentlicht unter Apache-2.0. Wer dasselbe Verhalten im eigenen Programm braucht, greift zu dieser Bibliothek.

huggingface/transformers.js

Auch bekannt als

  • sprache zu text
  • audio in text umwandeln
  • whisper online
  • audio transkribieren kostenlos
  • video zu srt
  • transkription online