自动字幕

把视频或音频中的语音转换成字幕和文字稿。语音识别使用 Whisper 在本地运行,不会上传任何内容。

将视频或音频文件拖到这里MP4 · MOV · WebM · MP3 · WAV

🔒 文件和文字稿始终留在此设备上。

使用方法

使用方法

  1. 1

    放入要处理的内容

    把 MP4, MOV, M4V, WebM 等 8 种其他格式 拖到这里,或从设备中选取。

  2. 2

    开始

    设置说话语言、英文翻译和字幕文字后开始。全部在本浏览器中完成——不上传、不排队、不注册。

  3. 3

    取走结果

    运行结束即可得到 SRT · VTT · TXT · WebM,直接保存到你的设备。

这个工具做什么

输入什么
读取 MP4, MOV, M4V, WebM 等 8 种其他格式。 一次一个文件。
输出什么
输出 SRT · VTT · TXT · WebM。
质量会怎样
只读取你的文件,不做修改。原件保持原样。
边界在哪里
首次运行会向你的设备下载一个小模型,之后可离线使用。 长视频或高分辨率视频受设备内存限制。手机比笔记本更早力不从心——半小时的 4K 可能就太多了。 支持哪些视频编解码器由浏览器决定。Chrome 和 Edge 支持最多,许多设备上还支持 H.265;Safari 和 Firefox 会拒绝一部分。这里打不开的,通常能在 Chrome 打开。
自动字幕
在浏览器中运行 OpenAI 的 Whisper tiny 模型:支持 99 种语言并自动识别,可选翻译成英文,时间轴可编辑。模型只需下载一次(约 41 MB),之后离线可用;内嵌字幕会生成新的 WebM 视频。

支持的格式

MP4MOVWebMMKVMP3M4AWAV → SRTVTTTXTWebM

值得了解

常见问题

字幕准确度如何?

Whisper tiny 是最小的 Whisper 模型。常见语言的清晰语音效果不错;音乐、多人同时说话或口音较重时会出现错误。下载前可以逐行修改。

为什么首次使用前需要下载?

语音识别需要约 41 MB 的模型。它直接来自 usetool.app,会用固定校验值核对,之后保存在浏览器中,所以以后无需联网也能使用。

这里能用哪些文件?

读取 MP4, MOV, M4V, WebM 等 8 种其他格式。 一次一个文件。

我会得到什么?

输出 SRT · VTT · TXT · WebM。

文件会损失质量吗?

只读取你的文件,不做修改。原件保持原样。

什么情况下不行?

首次运行会向你的设备下载一个小模型,之后可离线使用。 长视频或高分辨率视频受设备内存限制。手机比笔记本更早力不从心——半小时的 4K 可能就太多了。 支持哪些视频编解码器由浏览器决定。Chrome 和 Edge 支持最多,许多设备上还支持 H.265;Safari 和 Firefox 会拒绝一部分。这里打不开的,通常能在 Chrome 打开。

视频会损失画质吗?

只有需要重新编码时才会。剪切、合并和去掉声音都是原样复制画面数据,属于无损操作。压缩和加水印会重新编码,所以耗时更长。

视频最长可以多长?

没有固定上限,取决于设备的内存。手机轻松处理几分钟,电脑能处理更多。长视频失败时,通常先分割再逐段处理就可以了。

从设计上保护隐私

你的文件留在你的设备上

文件和文字稿始终留在此设备上。

其他工具

现成方案

适用于此文件类型的流程