Sous-titrer une vidéo automatiquement

Vidmini écoute votre vidéo ou votre fichier audio et rédige les sous-titres à votre place, grâce au modèle de reconnaissance vocale open source Whisper qui tourne sur votre propre appareil. Relisez le texte, puis téléchargez un fichier SRT ou VTT, ou incrustez les sous-titres dans la vidéo.

Aucun envoiSans filigraneSans inscription

Comment ça marche

  1. 1

    Choisissez ou déposez une vidéo ou un fichier audio (MP4, MOV, WebM, MKV, MP3, M4A, WAV, etc.), indiquez la langue parlée ou laissez la détection automatique, puis choisissez un modèle.

  2. 2

    Cliquez sur Sous-titres automatiques et patientez pendant la transcription. La première fois, le modèle de reconnaissance vocale est téléchargé une seule fois depuis vidmini.com.

  3. 3

    Relisez les lignes, corrigez ou supprimez ce qui ne va pas, puis téléchargez le fichier SRT ou WebVTT, ou incrustez les sous-titres dans la vidéo.

Une reconnaissance vocale qui tourne sur votre appareil

La plupart des services de sous-titrage automatique envoient votre fichier sur un serveur pour le transcrire. Vidmini fait tourner le modèle Whisper d’OpenAI, qui est open source, directement dans votre navigateur grâce à WebAssembly. Votre audio n’est jamais envoyé : le seul téléchargement est celui du modèle lui-même, depuis vidmini.com, et votre navigateur le garde en cache pour que les vidéos suivantes démarrent tout de suite.

Deux modèles sont proposés. Le plus précis utilise Whisper base, un téléchargement d’environ 102 Mo avec le moteur d’exécution. Le plus rapide et léger utilise Whisper tiny, environ 68 Mo : il termine plus vite mais se trompe plus souvent. Sur un ordinateur portable courant, le modèle base transcrit à peu près en temps réel, parfois un peu moins vite ; sur téléphone, c’est plus long. La vitesse dépend de votre appareil, pas d’une file d’attente.

Langues et précision

Laissez la langue parlée en détection automatique ou choisissez-la dans la liste : français, anglais, portugais, espagnol, allemand, italien, néerlandais, polonais, turc, russe, ukrainien, arabe, hindi, japonais, coréen et chinois. Whisper connaît une centaine de langues, et la détection automatique couvre celles qui ne figurent pas dans la liste. Indiquer la langue vous-même évite une erreur de détection sur les clips courts. L’outil transcrit dans la langue d’origine ; il ne traduit pas.

La reconnaissance est bonne pour une parole claire : voix off, interview, prise de parole face caméra. Elle l’est moins avec de la musique sous la voix, du bruit de fond, un accent marqué, plusieurs personnes qui parlent en même temps, ou des noms propres et des marques qu’elle ne connaît pas. C’est pourquoi Vidmini affiche chaque ligne dans un éditeur avant tout export.

Relire et corriger chaque ligne

Après la transcription, les sous-titres s’affichent sous forme de liste avec leur heure de début. Cliquez sur une ligne pour corriger un mot, un nom ou la ponctuation, ou supprimez une ligne inutile, par exemple des paroles de chanson captées dans la musique de fond. Le découpage est déjà prévu pour la lecture : au maximum deux lignes d’environ 42 caractères par sous-titre, la convention habituelle à la télévision et en streaming.

Exporter en SRT ou WebVTT, ou incruster les sous-titres

Le SRT est le fichier de sous-titres accepté par presque tous les logiciels de montage, lecteurs et plateformes : YouTube, Premiere Pro, DaVinci Resolve, VLC. Le WebVTT (.vtt) est le format des lecteurs vidéo web et de la balise vidéo HTML. Ce sont de petits fichiers texte que vous pouvez encore modifier, et que le spectateur peut activer ou désactiver.

Si vous voulez que le texte fasse partie de l’image, incrustez les sous-titres dans la vidéo : texte blanc avec un contour sombre, en petite, moyenne ou grande taille, en bas ou en haut de l’image. La vidéo est alors réencodée et les sous-titres ne peuvent plus être masqués. Pour un fichier audio, seuls les exports SRT et WebVTT sont disponibles.

Accessibilité et vidéos pour les réseaux sociaux

Des sous-titres rendent une vidéo accessible aux personnes sourdes et malentendantes, à celles qui regardent dans une langue qui n’est pas la leur, et à tous ceux qui sont dans un endroit calme. Sur les réseaux sociaux, beaucoup de vidéos démarrent sans le son dans le fil : des sous-titres incrustés permettent de suivre un Reel, un TikTok ou un Short sans activer le son.

Pour un résultat plus propre, coupez ce qui ne sert pas avant la transcription. L’outil Supprimer les silences raccourcit les longues pauses, et Couper une vidéo ne garde que le passage à publier. Les fichiers jusqu’à 3 heures sont acceptés.

Questions fréquentes

Ma vidéo est-elle envoyée sur un serveur pour créer les sous-titres ?

Non. Le modèle Whisper est téléchargé dans votre navigateur et tourne sur votre appareil. L’audio est décodé et transcrit localement, il ne quitte jamais votre ordinateur ou votre téléphone. Notre Content Security Policy n’autorise la page à communiquer qu’avec vidmini.com, pour son propre code et les fichiers du modèle.

Les sous-titres automatiques sont-ils fiables ?

Avec une voix claire et peu de bruit, la plupart des lignes sont justes. La musique, le bruit, les accents, les voix qui se chevauchent et les noms propres provoquent plus d’erreurs, et le modèle léger se trompe plus que le modèle précis. Relisez toujours l’éditeur avant d’exporter : corriger quelques mots ne prend qu’un instant.

Peut-on traduire les sous-titres dans une autre langue ?

Non. Vidmini transcrit la parole dans la langue où elle est prononcée. Pour une traduction, exportez le fichier SRT et traduisez le texte avec l’outil de votre choix : les minutages restent valables.

Quel format choisir : SRT, WebVTT ou incrustation ?

Le SRT pour YouTube, les logiciels de montage et la plupart des lecteurs. Le WebVTT pour un lecteur vidéo sur un site web. L’incrustation quand la plateforme n’accepte pas de fichier de sous-titres ou quand vous voulez un texte toujours visible, comme sur les réseaux où la vidéo démarre en muet. L’incrustation réencode la vidéo.

Pourquoi la première utilisation est-elle plus longue ?

La première fois, votre navigateur télécharge le modèle de reconnaissance vocale : environ 102 Mo pour le modèle précis, environ 68 Mo pour le modèle léger. Il est ensuite mis en cache par le navigateur, et les vidéos suivantes démarrent sans ce téléchargement.

Y a-t-il une durée maximale ?

Les fichiers jusqu’à 3 heures sont acceptés. Le temps de transcription augmente avec la durée et dépend de votre appareil : un ordinateur est bien plus rapide qu’un téléphone. Pour un long enregistrement, couper ou supprimer les silences au préalable fait gagner du temps.

Est-ce gratuit, et y a-t-il un filigrane ?

C’est gratuit, sans compte et sans filigrane. Les sous-titres exportés ne contiennent que votre texte.