가이드

동영상을 업로드하지 않고 자막 만드는 방법

소셜 동영상은 소리 없이 보는 사람이 많고 녹화 회의도 대본이 있으면 훑어보기 쉽습니다. 예전 자동 자막은 녹화 파일을 온라인 서비스에 올려야 했습니다. 이제 음성 인식 모델을 브라우저에서 직접 실행할 수 있습니다.

업데이트:

작동 방식

자막 생성기는 OpenAI의 Whisper tiny 모델을 기기에서 실행합니다. 말하는 언어를 자동 감지하고 99개 언어를 지원하며 원하면 음성을 영어 자막으로 번역합니다.

약 41 MB인 모델은 한 번 내려받아 브라우저에 저장합니다. 그 뒤에는 오프라인에서도 자막을 만들 수 있고 동영상과 음성 모두 기기를 떠나지 않습니다.

단계별 사용법

휴대전화 녹화, 팟캐스트, 내보낸 회의 등 동영상과 오디오 파일을 모두 사용할 수 있습니다.

  1. 자막 생성기를 열고 동영상이나 오디오 파일을 선택합니다.
  2. 자동 언어 감지를 유지합니다. 시작 부분이 음악이나 무음이면 언어를 직접 골라도 됩니다.
  3. 인식을 시작합니다. 최신 노트북에서는 보통 녹화 시간보다 짧게 걸리지만 휴대전화는 느립니다.
  4. 전체 줄을 읽고 편집기에서 이름, 전문 용어, 시간을 고칩니다.
  5. SRT, VTT, 일반 텍스트를 받거나 자막을 영상에 넣은 새 동영상을 만듭니다.

SRT, VTT, 영상 삽입 중 선택하기

SRT는 가장 널리 지원되는 자막 파일입니다. 동영상 재생기, 편집 프로그램, 대부분의 영상 플랫폼이 받습니다. VTT는 웹 영상용이며 일반 텍스트는 회의록, 메모, 발언 검색에 알맞습니다.

별도 자막은 켜고 끄며 나중에 편집할 수 있습니다. 영상에 넣은 자막은 화면 일부라 자막 파일을 받지 않는 플랫폼에 필요합니다. UseTool은 새 WebM 파일을 만들고 원본을 건드리지 않습니다.

더 나은 결과 얻기

tiny 모델은 브라우저에서 돌 만큼 작은 대신 한계가 있습니다. 마이크에 가까운 또렷한 말은 잘 처리합니다. 배경 음악, 여러 사람의 동시 발화, 강한 억양, 큰 울림은 오류를 늘립니다.

이름과 전문 용어가 가장 자주 틀리므로 공개 전에 한 번 읽을 가치가 있습니다. 여러 언어가 섞였거나 긴 도입부로 시작하면 언어를 직접 지정하는 것이 좋습니다.

최대 1시간 녹화를 지원합니다. 휴대전화는 아주 긴 녹화에서 메모리가 부족할 수 있어 짧은 부분으로 나누는 편이 안정적입니다.

여기서 로컬 처리가 중요한 이유

회의, 인터뷰, 수업, 상담 녹화에는 전사 서비스와 공유하는 데 동의하지 않은 사람의 개인정보가 자주 들어갑니다. 내 기기에서 처리하면 그 문제를 완전히 피하고 분 단위 사용량도 차감되지 않습니다.

바로 처리하기

다른 가이드