動画をアップロードせずに字幕を作る方法
SNS 動画は音なしで見られることが多く、会議録画も文字起こしがあれば拾い読みできます。 以前の自動字幕はオンラインサービスへの録画送信が前提でした。 今は音声認識モデルをブラウザー内で直接実行できます。
更新日:
仕組み
字幕生成ツールは OpenAI の Whisper tiny モデルを端末上で実行します。 話されている言語を自動判定し、99 言語に対応し、希望すれば音声を英語字幕へ翻訳できます。
約 41 MB のモデルは一度だけ取得され、その後ブラウザーに保存されます。 以後はオフラインでも字幕を作れ、動画も音声も端末から出ません。
手順
スマートフォン録画、ポッドキャスト、書き出した会議など、動画と音声のどちらも使えます。
- 字幕生成ツールを開き、動画または音声ファイルを選びます。
- 自動言語判定を使います。 冒頭が音楽や無音なら言語を手動で指定しても構いません。
- 認識を開始します。 新しいノートパソコンなら通常は録音時間より短く、スマートフォンでは遅くなります。
- 全文を読み、編集画面で名前、専門用語、時刻を直します。
- SRT、VTT、プレーンテキストを保存するか、字幕を焼き込んだ新しい動画を作ります。
SRT、VTT、焼き込みのどれを選ぶか
SRT は最も広く使える字幕ファイルです。 動画プレーヤー、編集ソフト、多くの動画サイトが受け付けます。 VTT はウェブ動画向けで、プレーンテキストは議事録、メモ、発言検索に便利です。
別ファイルの字幕は表示を切り替え、後から編集できます。 焼き込み字幕は映像の一部なので、字幕ファイルを受け付けない場所で必要です。 UseTool は新しい WebM として作り、原本には触れません。
精度を上げる
tiny モデルはブラウザーで動くほど小さい分、限界もあります。 マイクに近い明瞭な声は良好です。 BGM、複数人の同時発話、強い訛り、大きな反響では誤りが増えます。
名前と専門用語は特に間違いやすいため、公開前に一度読みましょう。 複数言語を混ぜた録音や長い前奏では、言語の手動指定が役立ちます。
対応する録音は最長 1 時間です。 スマートフォンでは長時間録音でメモリーが足りなくなることがあるため、短く分けるほうが確実です。
ここでローカル処理が重要な理由
会議、取材、授業、治療の録音には、文字起こしサービスへの提供に同意していない人の個人情報が含まれがちです。 自分の端末で処理すれば、その問題自体を避けられ、分数制の利用枠も消費しません。
