Guide

Creare i sottotitoli di un video senza caricarlo

La maggior parte delle persone guarda i video sui social senza audio, e le riunioni registrate si scorrono più velocemente con una trascrizione. Un tempo i sottotitoli automatici significavano caricare la registrazione su un servizio online. Oggi un modello di riconoscimento vocale può funzionare direttamente nel browser.

Aggiornato:

Come funziona

Il generatore di sottotitoli esegue sul tuo dispositivo il modello Whisper tiny di OpenAI. Riconosce automaticamente la lingua parlata, supporta 99 lingue e, se vuoi, può tradurre il parlato in sottotitoli in inglese.

Il modello viene scaricato una sola volta, circa 41 MB, e poi conservato dal browser. Da quel momento i sottotitoli si possono creare anche offline, e né il video né l’audio lasciano il tuo dispositivo.

Passo dopo passo

Funzionano sia file video sia file audio, per esempio una registrazione del telefono, un episodio di podcast o una riunione esportata.

  1. Apri il generatore di sottotitoli e seleziona il file video o audio.
  2. Mantieni il riconoscimento automatico della lingua, oppure sceglila tu se la registrazione inizia con musica o silenzio.
  3. Avvia il riconoscimento. Su un portatile recente di solito richiede meno tempo della durata della registrazione; i telefoni sono più lenti.
  4. Rileggi le righe e correggi nomi, termini tecnici e tempi nell’editor.
  5. Scarica SRT, VTT o testo semplice, oppure crea un nuovo video con i sottotitoli impressi.

SRT, VTT o impressi?

SRT è il file di sottotitoli più supportato. Lo accettano i lettori video, i programmi di montaggio e la maggior parte dei moduli di caricamento delle piattaforme video. VTT è il formato dei lettori video sul web. Il testo semplice è utile per verbali, appunti o per cercare cosa è stato detto.

I file di sottotitoli separati si possono attivare, disattivare e modificare in seguito. I sottotitoli impressi fanno parte dell’immagine, ed è ciò che serve per le piattaforme che non accettano file di sottotitoli. UseTool scrive quel video come nuovo file WebM e lascia intatto l’originale.

Ottenere risultati migliori

Il modello tiny è abbastanza piccolo da funzionare in un browser, e questo ha dei limiti. Una voce chiara vicina al microfono funziona bene. Musica di sottofondo, più persone che parlano insieme, accenti marcati e molto riverbero portano a più errori.

Nomi e termini tecnici sono gli errori più comuni, quindi conviene rileggere il testo una volta prima di pubblicarlo. Impostare la lingua a mano aiuta quando una registrazione mescola lingue o inizia con una lunga introduzione.

Sono supportate registrazioni fino a un’ora. Sui telefoni, le registrazioni molto lunghe possono esaurire la memoria, quindi lì sono più affidabili parti più brevi.

Perché qui conta l’elaborazione locale

Le registrazioni di riunioni, interviste, lezioni o sedute di terapia contengono spesso informazioni personali su persone che non hanno mai accettato di condividerle con un servizio di trascrizione. Elaborarle sul proprio dispositivo elimina del tutto la questione, e non vengono scalati minuti da nessuna quota.

Fallo subito

Altre guide