不上传视频,也能为它制作字幕
多数人观看社交视频时不开声音,而会议录像有了文字稿也更容易快速浏览。 自动字幕过去意味着把录音上传到在线服务。 如今,语音识别模型可以直接在浏览器中运行。
更新于:
语音识别模型如何下载一次后直接在浏览器和设备中运行
字幕生成器会在你的设备上运行 OpenAI 的 Whisper tiny 模型。 它能自动识别口语,支持 99 种语言,还可按需把语音翻译成英文字幕。
约 41 MB 的模型只需下载一次,随后由浏览器保存。 此后可以离线创建字幕,视频和音频都不会离开设备。
从选择录音到校对文字并下载字幕文件的完整操作步骤
视频和音频文件都可以使用,例如手机录像、播客节目或导出的会议录音。
- 打开字幕生成器,选择视频或音频文件。
- 保留自动语言检测;如果开头是音乐或静音,也可以手动选择语言。
- 开始识别。 在新款笔记本上,通常比录音本身的时长更短;手机会慢一些。
- 通读字幕,并在编辑器中更正姓名、专业术语和时间。
- 下载 SRT、VTT 或纯文本,也可以创建字幕已写入画面的新视频。
根据播放器和发布平台选择 SRT、VTT 或画面内嵌字幕
SRT 是支持范围最广的字幕文件。 视频播放器、剪辑软件和大多数视频平台上传表单都能接受它。 VTT 用于网页视频播放器,纯文本则适合会议记录、笔记或搜索谈话内容。
独立字幕文件可以开关,也能日后编辑。 内嵌字幕是画面的一部分,适用于不接受字幕文件的平台。 UseTool 会把这种视频写为新的 WebM 文件,并保持原件不变。
通过清晰录音、指定语言和人工校对提高自动识别结果
tiny 模型足够小,才能在浏览器中运行,这也意味着它有局限。 靠近麦克风的清晰语音效果很好。 背景音乐、多人同时说话、浓重口音和强烈混响都会增加错误。
姓名和专业术语最容易出错,因此发布前值得完整阅读一次。 如果录音混用多种语言或有很长的片头,手动指定语言会有帮助。
工具支持最长一小时的录音。 手机上处理很长的录音可能耗尽内存,所以分成较短片段会更可靠。
会议、采访和治疗录音中本地处理为何对隐私格外重要
会议、采访、课程或治疗过程的录音经常包含个人信息,而相关人员可能从未同意把它交给转录服务。 在自己的设备上处理,完全避开了这项隐私问题,也不会消耗按分钟计算的额度。
