Créer des sous-titres pour une vidéo sans l’envoyer en ligne
La plupart des gens regardent les vidéos des réseaux sociaux sans le son, et les réunions enregistrées se parcourent plus vite avec une transcription. Autrefois, les sous-titres automatiques obligeaient à envoyer l’enregistrement à un service en ligne. Aujourd’hui, un modèle de reconnaissance vocale peut tourner directement dans votre navigateur.
Mis à jour:
Comment ça marche
Le générateur de sous-titres exécute le modèle Whisper tiny d’OpenAI sur votre appareil. Il détecte automatiquement la langue parlée, prend en charge 99 langues et peut, si vous le souhaitez, traduire la parole en sous-titres anglais.
Le modèle n’est téléchargé qu’une fois, environ 41 Mo, puis conservé par votre navigateur. Ensuite, les sous-titres peuvent être créés hors ligne, et ni la vidéo ni le son ne quittent votre appareil.
Étape par étape
Les fichiers vidéo comme audio fonctionnent, par exemple un enregistrement de téléphone, un épisode de podcast ou une réunion exportée.
- Ouvrez le générateur de sous-titres et sélectionnez le fichier vidéo ou audio.
- Gardez la détection automatique de la langue, ou choisissez la langue si l’enregistrement commence par de la musique ou un silence.
- Lancez la reconnaissance. Sur un ordinateur portable récent, elle prend en général moins de temps que la durée de l’enregistrement ; les téléphones sont plus lents.
- Relisez les lignes et corrigez noms, termes techniques et minutages dans l’éditeur.
- Téléchargez un SRT, un VTT ou du texte brut, ou créez une nouvelle vidéo avec les sous-titres incrustés.
SRT, VTT ou incrustés ?
Le SRT est le fichier de sous-titres le plus largement pris en charge. Lecteurs vidéo, logiciels de montage et la plupart des formulaires d’envoi des plateformes vidéo l’acceptent. Le VTT est le format des lecteurs vidéo sur le web. Le texte brut sert pour des comptes rendus, des notes ou pour retrouver ce qui a été dit.
Les fichiers de sous-titres séparés peuvent être activés, désactivés et modifiés plus tard. Les sous-titres incrustés font partie de l’image, ce qu’il faut pour les plateformes qui n’acceptent pas de fichier de sous-titres. UseTool écrit alors la vidéo dans un nouveau fichier WebM et laisse l’original intact.
Obtenir de meilleurs résultats
Le modèle tiny est assez petit pour tourner dans un navigateur, et cela a des limites. Une voix claire près du micro fonctionne bien. La musique de fond, plusieurs personnes qui parlent en même temps, les accents marqués et une forte réverbération entraînent davantage d’erreurs.
Les noms et les termes techniques sont les erreurs les plus fréquentes : relire le texte une fois avant publication vaut la peine. Fixer la langue manuellement aide lorsqu’un enregistrement mélange plusieurs langues ou commence par une longue introduction.
Les enregistrements jusqu’à une heure sont pris en charge. Sur téléphone, les enregistrements très longs peuvent manquer de mémoire ; des parties plus courtes y sont plus fiables.
Pourquoi le traitement local compte ici
Les enregistrements de réunions, d’entretiens, de cours ou de séances de thérapie contiennent souvent des informations personnelles sur des gens qui n’ont jamais accepté de les confier à un service de transcription. Traiter le fichier sur votre propre appareil règle entièrement cette question, et aucune minute n’est décomptée d’un quota.
