Criar legendas para um vídeo sem o enviar
A maioria das pessoas vê vídeos nas redes sociais sem som, e as reuniões gravadas percorrem-se mais depressa com uma transcrição. Antes, legendas automáticas significavam enviar a gravação para um serviço online. Hoje, um modelo de reconhecimento de voz pode correr diretamente no navegador.
Atualizado:
Como funciona
O gerador de legendas executa no seu dispositivo o modelo Whisper tiny da OpenAI. Deteta automaticamente a língua falada, suporta 99 línguas e pode, se quiser, traduzir a fala para legendas em inglês.
O modelo é transferido uma única vez, cerca de 41 MB, e depois fica guardado pelo navegador. A partir daí as legendas podem ser criadas offline, e nem o vídeo nem o áudio saem do seu dispositivo.
Passo a passo
Funcionam ficheiros de vídeo e de áudio, por exemplo uma gravação do telemóvel, um episódio de podcast ou uma reunião exportada.
- Abra o gerador de legendas e selecione o ficheiro de vídeo ou áudio.
- Mantenha a deteção automática da língua ou escolha-a se a gravação começar com música ou silêncio.
- Inicie o reconhecimento. Num portátil recente costuma demorar menos do que a própria gravação; os telemóveis são mais lentos.
- Leia as linhas e corrija nomes, termos técnicos e tempos no editor.
- Transfira SRT, VTT ou texto simples, ou crie um vídeo novo com as legendas gravadas na imagem.
SRT, VTT ou gravadas na imagem?
O SRT é o ficheiro de legendas mais suportado. Leitores de vídeo, programas de edição e a maioria dos formulários de envio das plataformas de vídeo aceitam-no. O VTT é o formato dos leitores de vídeo na web. O texto simples serve para atas, notas ou para procurar o que foi dito.
Ficheiros de legendas separados podem ser ligados, desligados e editados mais tarde. As legendas gravadas fazem parte da imagem, que é o que precisa para plataformas que não aceitam ficheiros de legendas. O UseTool escreve esse vídeo como um novo ficheiro WebM e deixa o original intacto.
Obter melhores resultados
O modelo tiny é pequeno o suficiente para correr num navegador, e isso tem limites. Voz clara perto do microfone funciona bem. Música de fundo, várias pessoas a falar ao mesmo tempo, sotaques fortes e muita reverberação levam a mais erros.
Nomes e termos técnicos são os erros mais comuns, por isso vale a pena ler o texto uma vez antes de publicar. Definir a língua manualmente ajuda quando uma gravação mistura línguas ou começa com uma introdução longa.
São suportadas gravações até uma hora. Nos telemóveis, gravações muito longas podem ficar sem memória, por isso aí é mais fiável trabalhar com partes mais curtas.
Porque o processamento local importa aqui
Gravações de reuniões, entrevistas, aulas ou sessões de terapia contêm muitas vezes informação pessoal de pessoas que nunca aceitaram partilhá-la com um serviço de transcrição. Processar no próprio dispositivo elimina essa questão por completo, e não são descontados minutos de nenhuma quota.
