自动字幕
把视频或音频中的语音转换成字幕和文字稿。语音识别使用 Whisper 在本地运行,不会上传任何内容。
🔒 文件和文字稿始终留在此设备上。
使用方法
使用方法
- 1
放入要处理的内容
把 MP4, MOV, M4V, WebM 等 8 种其他格式 拖到这里,或从设备中选取。
- 2
开始
设置说话语言、英文翻译和字幕文字后开始。全部在本浏览器中完成——不上传、不排队、不注册。
- 3
取走结果
运行结束即可得到 SRT · VTT · TXT · WebM,直接保存到你的设备。
这个工具做什么
- 输入什么
- 读取 MP4, MOV, M4V, WebM 等 8 种其他格式。 一次一个文件。
- 输出什么
- 输出 SRT · VTT · TXT · WebM。
- 质量会怎样
- 只读取你的文件,不做修改。原件保持原样。
- 边界在哪里
- 首次运行会向你的设备下载一个小模型,之后可离线使用。 长视频或高分辨率视频受设备内存限制。手机比笔记本更早力不从心——半小时的 4K 可能就太多了。 支持哪些视频编解码器由浏览器决定。Chrome 和 Edge 支持最多,许多设备上还支持 H.265;Safari 和 Firefox 会拒绝一部分。这里打不开的,通常能在 Chrome 打开。
- 自动字幕
- 在浏览器中运行 OpenAI 的 Whisper tiny 模型:支持 99 种语言并自动识别,可选翻译成英文,时间轴可编辑。模型只需下载一次(约 41 MB),之后离线可用;内嵌字幕会生成新的 WebM 视频。
支持的格式
值得了解
常见问题
字幕准确度如何?
Whisper tiny 是最小的 Whisper 模型。常见语言的清晰语音效果不错;音乐、多人同时说话或口音较重时会出现错误。下载前可以逐行修改。
为什么首次使用前需要下载?
语音识别需要约 41 MB 的模型。它直接来自 usetool.app,会用固定校验值核对,之后保存在浏览器中,所以以后无需联网也能使用。
这里能用哪些文件?
读取 MP4, MOV, M4V, WebM 等 8 种其他格式。 一次一个文件。
我会得到什么?
输出 SRT · VTT · TXT · WebM。
文件会损失质量吗?
只读取你的文件,不做修改。原件保持原样。
什么情况下不行?
首次运行会向你的设备下载一个小模型,之后可离线使用。 长视频或高分辨率视频受设备内存限制。手机比笔记本更早力不从心——半小时的 4K 可能就太多了。 支持哪些视频编解码器由浏览器决定。Chrome 和 Edge 支持最多,许多设备上还支持 H.265;Safari 和 Firefox 会拒绝一部分。这里打不开的,通常能在 Chrome 打开。
视频会损失画质吗?
只有需要重新编码时才会。剪切、合并和去掉声音都是原样复制画面数据,属于无损操作。压缩和加水印会重新编码,所以耗时更长。
视频最长可以多长?
没有固定上限,取决于设备的内存。手机轻松处理几分钟,电脑能处理更多。长视频失败时,通常先分割再逐段处理就可以了。
从设计上保护隐私
你的文件留在你的设备上
文件和文字稿始终留在此设备上。
其他工具
现成方案
