Audio in Text umwandeln
Deutsche Aufnahmen und Videos als Abschrift und Untertitel, ohne dass der Ton Ihr Gerät verlässt.
Dateien hier ablegen
oder klicken und vom Gerät auswählenUnterstützt: MP3, M4A, AAC, WAV, OGG, OGA, OPUS, FLAC, WEBA, MP4, M4V, WEBM, MOV, MKV
Bis zu 3 Dateien pro VorgangBis zu 20 MB pro Datei10 Vorgänge pro TagLimits mit Pro aufheben✓ Funktioniert offline
Ihre Dateien bleiben auf Ihrem Gerät
Dieses Tool läuft vollständig in Ihrem Browser. Es wird nichts hochgeladen und nichts gespeichert. Sie können sogar die Internetverbindung trennen, bevor Sie beginnen.
So funktioniert es
- Fügen Sie eine Audio- oder Videodatei hinzu: MP3, M4A, WAV, MP4, OPUS und fast alles, was ein Browser abspielen kann.
- Die Sprache steht auf Deutsch. Setzen Sie das Häkchen bei „Zeitangabe vor jede Zeile setzen“, wenn Sie Zeitstempel in der Abschrift möchten.
- Sprechen mehrere Personen, setzen Sie das Häkchen bei „Sprecher trennen“; jede Zeile beginnt dann mit Sprecher 1, Sprecher 2 und so weiter.
- Klicken Sie auf Transkribieren. Beim ersten Mal lädt das Sprachmodell (etwa 250 MB) einmal herunter; danach startet es sofort.
- Kopieren Sie die Abschrift oder laden Sie sie als Textdatei zusammen mit SRT-Untertiteln herunter.
Häufige Fragen
- Wie genau ist es?
- Es nutzt Whisper small (OpenAI, Apache 2.0). Bei vorgelesenem Deutsch aus Hörbüchern (Multilingual LibriSpeech) war in unseren Tests etwa jedes zehnte Wort falsch; bei deutlich gesprochener heutiger Sprache sind es weniger. Rauschen, Dialekt, Durcheinanderreden, Fachwörter und seltene Namen bringen mehr Fehler.
- Setzt es Satzzeichen?
- Ja. Whisper schreibt Groß- und Kleinschreibung, Punkte und Kommas selbst. Neue Zeilen beginnen trotzdem an den Sprechpausen, und die Untertitel sind an denselben Stellen geschnitten.
- Warum ist der Download so groß?
- Weil ein kleineres Modell für Deutsch nicht gut genug war: Whisper base, das für Englisch reicht, machte in denselben Tests doppelt so viele Fehler (etwa jedes fünfte Wort). Die rund 250 MB werden einmal geladen und bleiben danach im Browser.
- Kann es erkennen, wer spricht?
- Setzen Sie das Häkchen bei „Sprecher trennen“, dann beginnt jede Zeile mit Sprecher 1, Sprecher 2 und so weiter. Die Aufnahme wird dafür ein zweites Mal gelesen, von zwei weiteren Modellen, die auf Stimmen hören und nicht auf Wörter – beim ersten Mal kommen 34 MB dazu, und die Wartezeit verdoppelt sich ungefähr. Nummern statt Namen, weil nichts in der Aufnahme sagt, wer wer ist. Zwei deutlich aufgenommene Stimmen kommen richtig heraus; ein einziges Mikrofon im Besprechungsraum, ähnliche Stimmen und langes Durcheinanderreden sind die Schwachstellen.
- Wird meine Aufnahme hochgeladen?
- Nein. Die Erkennung läuft in dieser Seite auf Ihrem eigenen Gerät, deshalb eignet sie sich für Besprechungen, Interviews und alles, was es nicht verlassen soll. Ist das Modell einmal geladen, funktioniert es auch offline.
- Wie lange dauert es?
- Auf einem Computer etwa halb so lange wie die Aufnahme: eine halbe Stunde für eine Stunde. Handys sind langsamer, und eine lange Aufnahme kann dort den Speicher sprengen; schneiden Sie sie vorher in kürzere Teile.
- Welche Sprachen gehen?
- Neun: Deutsch, Englisch, Französisch, Spanisch, Portugiesisch, Italienisch, Koreanisch, Türkisch und Japanisch. Stellen Sie die Sprache der Aufnahme ein – sie wird dem Modell gesagt, nicht erraten, damit eine deutsche Aufnahme nicht plötzlich übersetzt herauskommt.
Für einen bestimmten Zweck
Verwandte Tools
❝ Besprechungsaufnahme zu Protokoll Wer was wann gesagt hat – und die Überschriften für das, was Sie daraus beschließen. ▭ Untertitel ins Video einfügen Eine SRT-Datei ins Bild gebrannt, damit die Worte auf jedem Bildschirm erscheinen. ≋ Hintergrundgeräusche entfernen Ventilator, Rauschen und Brummen unter einer Stimme herausgenommen. ♪ Video in MP3 Der Ton aus Ihrem Video als MP3, erzeugt auf Ihrem Gerät.