Untertitel für ein Video automatisch erstellen

Vidmini hört sich das Video oder die Audiodatei an und schreibt die Untertitel selbst, mit dem quelloffenen Spracherkennungsmodell Whisper, das auf dem eigenen Gerät läuft. Nach dem Prüfen des Textes gibt es eine SRT- oder VTT-Datei zum Download, oder die Untertitel werden ins Video eingebrannt.

Kein UploadKein WasserzeichenKeine Anmeldung

So funktioniert's

  1. 1

    Ein Video oder eine Audiodatei auswählen oder hineinziehen (MP4, MOV, WebM, MKV, MP3, M4A, WAV usw.), die gesprochene Sprache angeben oder die automatische Erkennung lassen und ein Modell wählen.

  2. 2

    Auf Automatische Untertitel klicken und die Transkription abwarten. Beim ersten Mal wird das Spracherkennungsmodell einmalig von vidmini.com geladen.

  3. 3

    Die Zeilen durchlesen, Fehler korrigieren oder Zeilen löschen und dann SRT oder WebVTT herunterladen oder die Untertitel ins Video einbrennen.

Spracherkennung, die auf dem eigenen Gerät läuft

Die meisten Dienste für automatische Untertitel laden die Datei auf einen Server und transkribieren sie dort. Vidmini führt das Whisper-Modell von OpenAI, das Open Source ist, über WebAssembly direkt im Browser aus. Der Ton wird nie verschickt: Heruntergeladen wird nur das Modell selbst, von vidmini.com, und der Browser legt es im Cache ab, damit weitere Videos sofort starten.

Zur Wahl stehen zwei Modelle. Die genauere Variante nutzt Whisper base, ein Download von etwa 102 MB inklusive Laufzeitumgebung. Die schnellere, leichtere Variante nutzt Whisper tiny mit etwa 68 MB: Sie ist früher fertig, macht aber mehr Fehler. Auf einem üblichen Laptop braucht das base-Modell ungefähr so lange wie das Video selbst oder etwas länger; auf dem Smartphone dauert es länger. Die Geschwindigkeit hängt vom Gerät ab, nicht von einer Warteschlange.

Sprachen und Genauigkeit

Die gesprochene Sprache lässt sich automatisch erkennen oder aus der Liste wählen: Deutsch, Englisch, Französisch, Portugiesisch, Spanisch, Italienisch, Niederländisch, Polnisch, Türkisch, Russisch, Ukrainisch, Arabisch, Hindi, Japanisch, Koreanisch und Chinesisch. Whisper kennt rund 100 Sprachen, und die automatische Erkennung deckt auch die ab, die nicht in der Liste stehen. Wer die Sprache selbst angibt, vermeidet bei kurzen Clips eine falsche Erkennung. Das Werkzeug transkribiert in der Originalsprache; es übersetzt nicht.

Bei klarer Sprache ist die Erkennung gut: Sprechertext, Interview, Aufnahme direkt in die Kamera. Schwächer wird sie bei Musik unter der Stimme, Hintergrundgeräuschen, starkem Akzent, mehreren Personen, die gleichzeitig sprechen, sowie bei Namen und Markenbegriffen, die das Modell nicht kennt. Deshalb zeigt Vidmini jede Zeile in einem Editor, bevor etwas exportiert wird.

Jede Zeile prüfen und korrigieren

Nach der Transkription erscheinen die Untertitel als Liste mit ihrer Startzeit. Ein Klick auf eine Zeile genügt, um ein Wort, einen Namen oder die Zeichensetzung zu korrigieren; überflüssige Zeilen, etwa aus der Hintergrundmusik erkannte Liedtexte, lassen sich löschen. Die Zeilen sind bereits lesefreundlich umbrochen: höchstens zwei Zeilen mit rund 42 Zeichen pro Untertitel, die übliche Konvention bei Fernsehen und Streaming.

Als SRT oder WebVTT exportieren oder ins Video einbrennen

SRT ist das Untertitelformat, das fast jedes Schnittprogramm, jeder Player und jede Plattform akzeptiert, darunter YouTube, Premiere Pro, DaVinci Resolve und VLC. WebVTT (.vtt) ist das Format für Videoplayer im Web und das HTML-Video-Element. Beides sind kleine Textdateien, die sich später noch bearbeiten lassen und die Zuschauer ein- und ausschalten können.

Soll der Text fester Teil des Bildes sein, werden die Untertitel ins Video eingebrannt: weiße Schrift mit dunkler Kontur, in klein, mittel oder groß, am unteren oder oberen Bildrand. Dabei wird das Video neu kodiert, und die Untertitel lassen sich nicht mehr ausblenden. Bei Audiodateien stehen nur SRT und WebVTT zur Verfügung.

Barrierefreiheit und Videos für Social Media

Untertitel machen ein Video zugänglich für gehörlose und schwerhörige Menschen, für alle, die in einer Fremdsprache zuschauen, und für jeden, der gerade keinen Ton abspielen kann. In sozialen Netzwerken starten viele Videos im Feed stumm: Mit eingebrannten Untertiteln lassen sich Reels, TikToks oder Shorts auch ohne Ton verfolgen.

Für ein saubereres Ergebnis lohnt es sich, Überflüssiges vor der Transkription zu entfernen. Das Werkzeug Stille entfernen kürzt lange Pausen, und Video schneiden behält nur den Abschnitt, der veröffentlicht werden soll. Dateien bis 3 Stunden Länge werden akzeptiert.

Häufige Fragen

Wird das Video für die Untertitel auf einen Server hochgeladen?

Nein. Das Whisper-Modell wird in den Browser geladen und läuft auf dem eigenen Gerät. Der Ton wird lokal dekodiert und transkribiert und verlässt nie den Computer oder das Smartphone. Unsere Content Security Policy erlaubt der Seite nur die Verbindung zu vidmini.com, für den eigenen Code und die Modelldateien.

Wie genau sind die automatischen Untertitel?

Bei klarer Sprache und wenig Hintergrundgeräuschen stimmen die meisten Zeilen. Musik, Lärm, Akzente, überlappende Stimmen und Eigennamen führen zu mehr Fehlern, und das leichtere Modell irrt sich öfter als das genauere. Vor dem Export sollte der Text im Editor immer kurz geprüft werden; ein paar Wörter sind schnell korrigiert.

Können die Untertitel in eine andere Sprache übersetzt werden?

Nein. Vidmini transkribiert das Gesprochene in der Sprache, in der es gesprochen wird. Für eine Übersetzung die SRT-Datei exportieren und den Text mit einem beliebigen Werkzeug übersetzen; die Zeitangaben bleiben gültig.

Was ist besser: SRT, WebVTT oder eingebrannte Untertitel?

SRT für YouTube, Schnittprogramme und die meisten Player. WebVTT für einen Videoplayer auf einer Website. Eingebrannte Untertitel, wenn die Plattform keine Untertiteldateien annimmt oder der Text immer sichtbar sein soll, etwa in Feeds, in denen Videos stumm starten. Das Einbrennen kodiert das Video neu.

Warum dauert die erste Nutzung länger?

Beim ersten Mal lädt der Browser das Spracherkennungsmodell herunter: etwa 102 MB für die genauere oder etwa 68 MB für die leichtere Variante. Danach liegt es im Browser-Cache, und weitere Videos starten ohne diesen Download.

Gibt es eine maximale Länge?

Dateien bis 3 Stunden werden akzeptiert. Die Dauer der Transkription wächst mit der Länge und hängt vom Gerät ab: Ein Computer ist deutlich schneller als ein Smartphone. Bei langen Aufnahmen spart es Zeit, vorher zu schneiden oder Stille zu entfernen.

Ist das kostenlos, und gibt es ein Wasserzeichen?

Es ist kostenlos, ohne Konto und ohne Wasserzeichen. Die exportierten Untertitel enthalten nur den eigenen Text.