전사는 동영상 녹화를 검색 가능한 텍스트로 바꿉니다. 이를 문서에 붙여넣거나 블로그 게시물로 재활용하거나 자막을 생성하거나, 20분짜리 과정을 다시 보지 않고도 훑어볼 수 있습니다.
이 가이드는 동영상 녹화를 전사하는 주요 방법들을 다룹니다 - 무료 내장 도구부터 몇 분 만에 긴 녹화를 처리하는 AI 서비스까지 - 그리고 워크플로에 맞는 도구를 선택하는 방법도 안내합니다.
왜 동영상 녹화를 전사해야 하는가
녹화본의 전사본이 필요한 몇 가지 이유:
- 자막과 자막. 대부분의 시청자는 소리를 끈 상태로 튜토리얼과 데모를 봅니다. 전사본은 정확한 자막의 출발점입니다.
- 검색 가능한 아카이브. 녹화 라이브러리는 탐색하기 어렵습니다. 전사본(transcript)을 사용하면 제작한 모든 회의, 튜토리얼 또는 강좌 동영상을 검색할 수 있습니다.
- 콘텐츠 재사용 녹화된 워크스루를 블로그 게시물, 문서 페이지 또는 지식 기반 기사로 바꾸세요.
- 텍스트로 편집 일부 편집기는 녹취록에서 단어를 삭제하면 해당 영상도 자동으로 잘라 줍니다. 불필요한 말을 다듬는 데 유용합니다.
- 접근성과 준수 전사본은 많은 접근성 표준에 필요하며 시청자가 원본 언어를 사용하지 않는 시장에서 도달 범위를 향상시킵니다.
사용 가능한 전사의 기준은 지난 2년 동안 급격히 상승했습니다. 최신 AI 모델은 깨끗한 오디오 1시간을 1분 이내에 95% 이상의 정확도로 전사합니다. 무료 내장 도구도 따라오고 있지만 여전히 전용 서비스에 뒤쳐져 있습니다.
방법 1: 녹화를 수동으로 전사
무료 옵션은 녹화를 재생하고 들리는 내용을 타이핑하는 것입니다. 간단한 언어의 1분 클립은 약 5분이 소요됩니다. 30분 튜토리얼은 2~3시간이 걸릴 수 있습니다.
수동 전사는 다음과 같은 경우에만 가치가 있습니다:
- 녹화가 1~2분 이내입니다
- 법적 또는 편집상의 이유로 매우 정확한 단어 선택이 필요합니다
- 오디오가 시끄럽거나 AI 모델이 처리하기 어려운 강한 억양이 있습니다.
더 길거나 반복적인 항목은 AI 도구로 이동하세요.
방법 2: macOS 내장 받아쓰기를 임시 해결책으로 사용하기
macOS에는 실시간 받아쓰기가 가능하지만, 저장된 동영상 파일을 직접 전사하는 내장 기능은 없습니다. 일반적인 해결 방법은 녹화를 재생하면서 동시에 받아쓰기를 하는 것이지만, 이 방법은 불안정하고 속도가 느립니다.
macOS에서 보다 깔끔한 무료 옵션은 다음과 같습니다 보이스 메모 시스템 오디오 라우팅과 결합된 앱 - 동영상의 오디오를 음성 메모에 녹화하고, 최근 macOS 버전에서는 앱에서 전사 내용을 보여줍니다.
제한 사항: 이는 실제 전사 파이프라인이 아닙니다. 품질이 일관되지 않으며, 단어 단위 타임스탬프를 얻을 수 없고, 원본 동영상 동기화가 손실됩니다. 마지막 수단으로 무료 옵션으로만 사용하세요.
방법 3: AI 서비스로 전사하기
전용 AI 전사 서비스는 몇 분 이상 길이의 녹화에 대한 표준적인 답변입니다. 주요 옵션:
- ElevenLabs 스크라이브 - 현재 영어 및 90개 이상의 다른 언어에서 가장 정확한 모델 중 하나입니다. 단어 단위 타임스탬프, 화자 분리, 오디오 이벤트 감지 기능 포함. 음성 1시간당 약 $0.40의 종량제 가격.
- OpenAI Whisper - 현대적 정확도 기준을 세운 오픈 소스 모델. 로컬에서 실행하면 무료이며, OpenAI의 API를 통해서는 분당 $0.006에 이용 가능. 영어에 강력하며, 대부분 주요 언어에도 준수함.
- AssemblyAI - 스피커 라벨, 감성, 주제 감지 기능을 갖춘 개발자 중심 API. 가격은 시간당 약 $0.37부터 시작합니다.
- Otter.ai - 회의를 위한 브라우저 및 모바일 앱입니다. 월별 사용 시간 제한이 있는 무료 요금제와 더 긴 녹화를 위한 유료 요금제가 있습니다.
- Rev - AI 자동 전사와 인간 검증 전사 둘 다 제공. 사람을 통한 높은 정확도, 더 높은 비용(분당 $1.50 이상).
- Descript - 내장된 전사 기능이 있는 동영상 편집기. 전사를 편집하면 동영상도 함께 편집됩니다.
대부분의 녹화에서는 워크플로가 동일합니다: 파일을 업로드하고, 기다리고, 전사본을 다운로드합니다 .txt, .srt, 또는 .vtt.
1단계 - 오디오를 내보내거나 동영상을 업로드하기
대부분의 서비스는 일반적인 동영상 형식(MP4, MOV)을 직접 지원합니다. 그렇지 않은 경우, 간단한 FFmpeg 명령어로 오디오를 추출하세요:
ffmpeg -i recording.mp4 -vn -acodec mp3 recording.mp3
2단계 - 업로드하고 옵션 선택하기
소스 언어를 선택하고, 화자 인식 여부와 타임스탬프 필요 여부를 선택하세요. 단어 단위 타임스탬프는 자막 생성 또는 트랜스크립트를 영상과 다시 동기화하려는 경우 유용합니다.
3단계 - 결과 다운로드하기
대부분의 서비스는 대본을 일반 텍스트와 자막용 타이밍 형식(SRT 또는 VTT)으로 반환합니다. 작성된 요약만 필요하다면 일반 텍스트만으로 충분합니다.
독립형 서비스의 단점은 왕복 과정입니다. 하나의 도구에서 녹화하고, 다른 도구에서 전사하고, 세 번째 도구에서 편집합니다. 각 전달 과정에서 시간 차이가 생기거나 형식이 깨질 수 있습니다.
방법 4: 내장 전사 기능이 있는 화면 녹화 프로그램 사용
가장 깔끔한 워크플로는 동일한 앱 안에서 녹화를 필사하는 화면 녹화 프로그램로, 그래서 필사본이 동영상 타임라인에 연결된 상태로 유지됩니다.
Tight Studio

Tight Studio Mac용 화면 녹화 프로그램 및 동영상 편집기로, ElevenLabs Scribe가 지원하는 내장 전사 기능이 있습니다. 흐름은 다음과 같습니다:
- 화면을 녹화하세요 마이크 사용 여부와 상관없이. 다중 테이크 녹음을 통해 필요한 경우 섹션별로 녹음 가능.
- 자막 패널을 엽니다 편집기에서 클릭합니다 자막 생성. 오디오는 전사 서비스로 업로드되며, 단어 단위 타임스탬프와 함께 반환됩니다.
- 전사 내용을 검토하세요 세그먼트별로. 단어는 동영상 타임라인에 연결되어 있어, 단어를 클릭하면 재생 헤드가 이동합니다.
- 텍스트를 인라인으로 수정 잘못 기록된 용어(제품 이름, 약어, 기술 용어)를 수정하려면
- 자막 스타일 지정 및 삽입 내보낸 동영상에 포함시키거나, 문서용으로는 그대로 전사본만 사용하려는 경우
- 내보내기 자막이 포함된 최종 영상 렌더링 또는 텍스트로 전사본 복사.
원고가 에디터 안에 있기 때문에, 다음과 같이 활용할 수도 있습니다:
- 채움 단어 자동으로 자르기
- 실제 내레이션을 교체하기로 결정하면 동일한 스크립트에서 AI 음성을 생성
- 단어 시간을 직접 편집하여 자막 시간 다시 맞추기
Tight Studio는 전사 기능을 위해 ElevenLabs Scribe를 사용하며, 90개 이상의 언어를 지원하고 단어 단위 타임스탬프를 생성합니다. 동영상을 내보내기 전에 자막 패널 내에서 전사 내용을 편집할 수 있습니다.
Descript
Descript는 또 다른 잘 알려진 통합 옵션입니다. 동영상을 녹화하거나 가져오면 앱이 자동으로 스크립트를 생성하고, 텍스트를 편집하여 동영상을 편집할 수 있습니다. 팟캐스트 스타일 콘텐츠와 긴 형식의 동영상에 적합합니다. 화면 녹화보다는 전체 동영상 워크스테이션에 더 가깝습니다.
방법 5: 로컬에서 Whisper를 실행하여 무료로 전사하기
많은 영상을 녹화하고 분 단위로 비용을 지불하고 싶지 않다면 기술적 사용자를 위해 OpenAI의 Whisper 모델을 로컬에서 실행하는 것이 좋은 옵션입니다.
brew install ffmpeg
pipx install openai-whisper
whisper recording.mp4 --model medium --output_format srt
그 medium 모델은 최신 Mac에서 속도와 정확성을 균형 있게 유지함. large-v3 모델은 느리지만 특히 비영어권 언어에서 더 정확함.
트레이드오프:
- 일회성 설정 후 무료
- 클라우드 서비스보다 느림 (가장 큰 모델의 경우 5-10배)
- 비교적 최신 Mac(M1 이상 권장)이 필요합니다.
- 스피커 분리 기능이 기본 제공되지 않음 - 두 번째 도구를 추가해야 합니다
whisperx
매달 수십 시간을 사용하고 분 단위 비용을 전혀 내고 싶지 않다면 이것이 가장 좋은 선택입니다.
동영상 전사 방법 비교
| 방법 | 속도 | 정확성 | 최적 | 비용 |
|---|---|---|---|---|
| 수동 입력 | 매우 느림 | 주의하면 최고 | 작은 클립, 법적 정밀도 | 무료 |
| macOS 받아쓰기 우회 방법 | 느림 | 낮음 | 일회성 짧은 클립 | 무료 |
| AI 서비스 (ElevenLabs, Whisper API, AssemblyAI) | 빠름 | 높음 (클린 오디오에서 95%+) | 대부분의 녹화 | 분당 $0.006-$0.40 |
| 내장형 전사 (Tight Studio) | 빠름 | 높음 (ElevenLabs 스크라이브 사용) | 한 앱에서 끝까지 완료되는 화면 녹화 | 구독과 함께 포함됨 |
| 로컬 Whisper | 중간 | 높게 | 대량 자체 호스팅 사용 | 설정 후 무료 |
| 사람이 검증함 (Rev) | 느림 | 최고 | 법률, 방송, 준수 | 분당 $1.50 이상 |
정확한 동영상 전사를 위한 팁
깨끗한 오디오를 녹음하세요. 조용한 방에서의 지향성 마이크는 어떤 AI 모델의 트릭보다 낫습니다. 최고의 전사도 겹치는 화자와 심한 실내 소음에서는 어려움을 겪습니다.
도구가 지원하면 용어집을 추가하세요. ElevenLabs Scribe와 같은 서비스는 '키텀 프롬프트'를 받습니다 - 모델이 특정 제품 이름이나 기술 용어에 편향되도록 하는 짧은 목록입니다. 이것이 제품 데모와 튜토리얼에서 정확도를 가장 크게 향상시키는 방법입니다.
올바른 언어를 선택하세요. 대부분의 서비스는 언어를 자동 감지하지만, 짧은 클립에서는 자동 감지가 실패할 수 있습니다. 소스 언어를 알고 있다면 명시적으로 설정하세요.
긴 녹화를 분할합니다. 몇 시간짜리 녹화를 하는 경우, 20~30분 단위로 나누면 더 빠른 작업 완성이 가능하고 나머지 부분이 처리되는 동안에도 기록본 편집을 시작할 수 있습니다.
고유 명사와 숫자를 검토하세요. AI 전사(transcription)는 고유 명사, 버전 번호, 약어를 일관되게 잘못 처리합니다. 전사본을 대충 훑어보고 수동으로 수정하세요 - 최종 자막에 그대로 반영되게 두는 것보다 빠릅니다.
자주 묻는 질문
동영상 녹화를 어떻게 전사하나요?
동영상을 AI 전사 서비스(예: ElevenLabs Scribe, OpenAI Whisper, AssemblyAI)에 업로드하세요. 서비스는 타임스탬프가 포함된 전사본을 반환하며, 보통 1시간 동영상 기준 1분 이내에 완료됩니다. Mac에서 녹화하는 경우, Tight Studio와 같은 화면 녹화 도구에는 전사가 내장되어 있어 동일 앱에서 전사 및 편집이 가능합니다.
가장 정확한 동영상 전사 도구는 무엇인가요?
순수 자동 전사에 대해서는, ElevenLabs Scribe와 OpenAI Whisper(large-v3)가 현재 정확도 벤치마크에서 선두를 달리고 있으며, 깨끗한 영어 오디오에서 약 95~97%의 정확도를 보입니다. 최대 정확도를 원한다면 Rev와 같은 인간 검증 서비스가 거의 완벽한 전사를 제공하지만 비용이 상당히 높습니다.
영상을 무료로 자막화할 수 있나요?
네. 두 가지 주요 무료 옵션은 자체 컴퓨터에서 OpenAI Whisper를 로컬로 실행하는 것과 Otter.ai 같은 서비스의 무료 요금제를 사용하는 것(월 몇 백 분으로 제한)입니다. 수동 전사도 무료지만 매우 짧은 클립에만 실용적입니다.
1시간 분량의 동영상을 전사하는 데 얼마나 걸리나요?
클라우드 AI 서비스는 보통 1시간 분량 오디오에 대해 1~5분 내에 스크립트를 반환합니다. 최근 Mac에서 로컬 Whisper 사용 시 모델 크기에 따라 1시간 분량 오디오에 대해 5~15분이 소요됩니다. 수동 전사 작업은 일반적으로 1시간 오디오당 4~6시간이 걸립니다.
대본과 자막의 차이는 무엇인가요?
전사(transcript)는 음성 오디오의 일반 텍스트 버전으로, 읽거나 내용을 재활용할 때 유용합니다. 자막(captions)은 동영상 위에 시간에 맞춰 표시되는 텍스트로, 시청할 때 사용됩니다. 대부분의 전사 도구는 두 가지 모두를 생성할 수 있습니다 - 시간 형식(SRT 또는 VTT)은 자막이고, 일반 텍스트 버전은 전사입니다.
동영상 편집기 안에서 대본을 편집할 수 있나요?
네, 이를 지원하는 편집기에서 가능합니다. Tight Studio와 Descript 모두 영상 타임라인 옆에서 트랜스크립트를 직접 편집할 수 있습니다. 단어는 타임스탬프와 연결되어 있어, 수정해도 자막 타이밍이 깨지지 않습니다. 독립형 전사 도구는 보통 별도로 편집하는 텍스트 파일을 생성합니다.
동영상 전사는 영어 외의 언어에서도 작동하나요?
예. 대부분의 최신 필사 서비스는 50개 이상의 언어를 지원합니다. ElevenLabs Scribe와 OpenAI Whisper는 모두 90개 이상의 언어를 지원합니다. 정확도는 영어와 다른 널리 사용되는 언어에서 가장 높으며, 학습 데이터가 적은 언어의 경우 다소 낮아집니다.
