轉錄可以將影片錄製轉換為可搜尋的文字。你可以將其貼上到檔案中,用於部落格文章,產生字幕,或者只是快速瀏覽,而不用重新觀看 20 分鐘的示範。
本指南介紹了轉錄影片錄製的主要方法——從免費的內建工具到 AI 服務,這些服務可以在幾分鐘內處理長時間的錄製——以及如何為你的工作流程選擇合適的方法。
為什麼要轉錄影片錄影內容
你可能想要錄音逐字稿的幾個原因:
- 字幕和小字幕 大多數觀眾在觀看教學和示範時是靜音的。逐字稿是準確字幕的起點。
- 可搜尋的檔案。 錄影庫難以導覽。逐字稿可以讓你在每一次會議、教學或課程影片中進行搜尋。
- 改造內容 將錄製的操作示範轉換為部落格文章、檔案頁面或知識庫文章。
- 透過文字進行編輯。 有些編輯軟體允許你刪除字幕中的文字,同時自動裁切掉相應的影片片段。可用於去除口頭禪。
- 無障礙體驗和合規性 轉錄對於許多無障礙體驗標準是必需的,並且在觀眾不講原語言的市場中可以提高覆蓋率。
可用轉錄的標準在過去兩年大幅提高。現代 AI 模型可以在一分鐘內轉錄一小時的清晰音訊,準確率超過 95%。免費的內建工具正在趕上,但仍落後於專門的服務。
方法 1:手動轉錄錄音
免費選項是播放錄音並輸入你聽到的內容。對於一個一分鐘的簡單語言片段,大約需要五分鐘。對於三十分鐘的教學,則可能需要兩到三小時。
手動轉錄只有在以下情況下才值得:
- 錄製時長不到一兩分鐘
- 你需要非常精確的措辭,出於法律或編輯原因
- 音訊嘈雜或有重口音,AI 模型難以處理。
對於任何較長或重複的內容,請使用 AI 工具。
方法 2:使用 macOS 內建的聽寫功能作為變通方法
macOS 有即時聽寫功能,但沒有直接轉錄已儲存影片檔案的內建功能。常見的解決方法是將錄影播放出來,然後同時進行聽寫,這種方法脆弱且速度慢。
macOS 上一個更乾淨的免費選項是 語音備忘錄 將應用程式與系統音訊路由結合——將影片音訊錄製到語音備忘錄中,並且最近的 macOS 版本將在應用中顯示逐字稿。
限制:這不是一個真正的轉錄流程。品質不一致,無法獲得逐字時間戳記,並且會遺失原始影片同步。僅在萬不得已的免費選擇時使用。
方法 3:使用 AI 服務進行轉錄
專用 AI 轉錄服務是錄製時間超過幾分鐘的影片的標準解決方案。主要選項:
- ElevenLabs Scribe - 目前是英語及其他 90 多種語言最準確的模型之一。提供單字層級時間戳記、說話人區分和音訊事件檢測。按使用付費,每小時音訊約 $0.40。
- OpenAI Whisper - 設定現代準確性標準的開源模型。如果在本機執行則免費,或透過 OpenAI 的 API 每分鐘 0.006 美元使用。擅長英語,對大多數主要語言表現良好。
- AssemblyAI - 面向開發者的 API,帶有說話者標籤、情感和主題檢測。定價從每小時約 $0.37 起。
- Otter.ai - 面向會議的瀏覽器和行動應用程式。免費方案有每月分鐘限制,付費方案可記錄更長時間。
- 版本 - 提供 AI 轉錄和人工確認的逐字稿。透過人工提高準確性,但成本更高(每分鐘$1.50+)。
- Descript - 內建轉錄功能的影片編輯器。你編輯逐字稿時,影片會隨之編輯。
對於大多數錄影內容,工作流程相同:上傳檔案,等待,下載逐字稿。 .txt, .srt,或者 .vtt.
步驟 1-匯出音訊或上傳影片
大多數服務直接接受常見的影片格式(MP4, MOV)。如果你的服務不支援,可以使用一個簡單的 FFmpeg 命令擷取音訊:
ffmpeg -i recording.mp4 -vn -acodec mp3 recording.mp3
第二步-上傳並選擇選項
選擇源語言、是否檢測說話人,以及是否需要時間戳記。如果你方案產生字幕或將逐字稿同步回影片,逐字時間戳記會很有用。
第 3 步-下載結果
大多數服務會以純文字加上帶時間的格式(SRT 或 VTT)返回字幕。如果你只需要書面摘要,純文字就足夠了。
獨立服務的缺點是往返操作。你在一個工具中錄製,在另一個工具中轉錄,在第三個工具中編輯。每一次交接都是時間偏移或格式損壞的可能點。
方法 4:使用帶內建轉錄功能的螢幕錄影工具
最乾淨的工作流程是使用同一個應用內進行螢幕錄影和轉錄的螢幕錄影工具,這樣字幕就能保持與影片時間軸的關聯。
Tight Studio

Tight Studio 是一個 Mac 螢幕錄影和影片編輯軟體,內建由 ElevenLabs Scribe 驅動的轉錄功能。流程如下:
- 錄製你的螢幕 有或沒有麥克風。多次錄製允許你在需要時單獨錄製各個部分。
- 開啟字幕面板 在編輯器中並點擊 產生字幕。音訊已上傳到轉錄服務,並返回帶有逐字時間戳記的文字。
- 檢視逐字稿 一段一段地處理。單字與影片時間軸繫結,因此點擊某個單字會跳轉播放位置。
- 線上編輯文字 修正任何誤轉錄的術語(產品名稱、縮略語、技術詞彙)
- 樣式與字幕燒錄 如果你希望它們出現在匯出的影片中,或者只是將轉錄內容按原樣用於檔案。
- 匯出 渲染帶字幕的最終影片,或將逐字稿複製為文字。
因為稿件存在於編輯器內,你也可以使用它來:
- 自動修剪贅詞
- 如果你決定替換現場解說,從相同的腳本產生 AI 配音
- 透過直接編輯單字時間來重新調整字幕時間
Tight Studio 使用 ElevenLabs Scribe 進行轉錄,支援 90 多種語言,並產生逐字時間戳記。在匯出影片之前,字幕面板內的文字是可編輯的。
Descript
Descript 是另一款知名的整合選項。你可以錄製或匯入影片,應用會產生逐字稿,你可以透過編輯文字來編輯影片。對播客風格內容和長影片很適合。它更像是一個完整的影片工作站,而不是單純的螢幕錄影工具。
方法 5:在本機執行 Whisper 免費轉錄
如果你錄製大量影片且不想按分鐘付費,本機執行 OpenAI 的 Whisper 模型對技術使用者來說是個不錯的選擇。
brew install ffmpeg
pipx install openai-whisper
whisper recording.mp4 --model medium --output_format srt
該 medium 模型在現代 Mac 上平衡速度和準確性。 large-v3 模型速度較慢但更準確,尤其適用於非英語語言。
權衡:
- 一次性設定後免費
- 比雲服務慢(最大模型慢 5-10 倍)。
- 需要一臺相對現代的 Mac(推薦 M1 或更新機型)
- 開箱即用沒有講者區分 — 你必須附加第二個工具,比如
whisperx
如果你每月需要花費數十小時,並且希望每分鐘成本為零,這是最好的選擇。
比較影片轉錄方法
| 方法 | 速度 | 準確性 | 最適合 | 成本 |
|---|---|---|---|---|
| 手動輸入 | 非常慢 | 如果小心則為最高 | 微小片段,法律精度 | 免費 |
| macOS 語音輸入變通方法 | 慢 | 低 | 一次性短片剪輯 | 免費 |
| AI 服務(ElevenLabs,Whisper API,AssemblyAI) | 快速 | 高(乾淨音訊 ≥ 95%) | 大多數錄音 | 每分鐘 $0.006-$0.40 |
| 內建轉錄(Tight Studio) | 快速 | 高(使用 ElevenLabs Scribe) | 螢幕錄影在一個應用程式中完成端到端 | 隨訂閱提供 |
| 本機 Whisper | 中等 | 高 | 大容量自託管使用 | 設定後免費 |
| 人工驗證 (修訂版) | 慢 | 最高 | 法律、廣播、合規 | 每分鐘 $1.50+ |
精準影片轉錄提示
錄製乾淨的音訊。 在安靜的房間裡,定向麥克風勝過任何 AI 型號的技巧。即使是最好的轉錄也難以處理重疊發言者和嚴重的環境噪音。
如果你的工具支援,請新增術語表。 類似的服務,如 ElevenLabs Scribe,支援「關鍵術語提示」——即一份簡短的產品名稱或技術術語列表,用於引導模型的產生傾向。這是產品示範與教學在準確性方面取得的最顯著提升。
選擇正確的語言。 大多數服務會自動檢測語言,但在短片上自動檢測可能失敗。如果你知道源語言,請明確設定它。
分割長錄音。 對於多小時的錄影內容,將其拆分為 20-30 分鐘的片段可以加快交付速度,並讓你在其餘部分還在處理時就開始編輯逐字稿。
複習專有名詞和數字。 AI 轉錄常常弄錯專有名詞、版本號和縮寫。瀏覽逐字稿並手動修正這些錯誤——這樣比讓它們出現在最終字幕中更快。
常見問題
如何轉錄影片錄影內容?
將影片上傳到 AI 轉錄服務,例如 ElevenLabs Scribe、OpenAI Whisper 或 AssemblyAI。該服務會返回帶時間戳記的逐字稿,通常對於一小時的影片不到一分鐘就可以完成。如果你在 Mac 上錄製,像 Tight Studio 這樣的螢幕錄影軟體內建了轉錄功能,因此你可以在同一個應用中進行轉錄和編輯。
最準確的影片轉錄工具是什麼?
對於純自動轉錄,目前在準確性基準上領先的是 ElevenLabs Scribe 和 OpenAI Whisper(large-v3),在乾淨的英語音訊上,兩者的準確率大約為 95-97%。為了獲得最高的準確性,經過人工驗證的服務如 Rev 可以產生近乎完美的逐字稿,但成本顯著更高。
我可以免費為影片產生轉錄嗎?
是的。兩個主要的免費選項是在你自己的電腦上本機執行 OpenAI Whisper,以及使用像 Otter.ai 這樣的服務的免費等級(每月限制在幾百分鐘)。手動轉錄也是免費的,但只適用於非常短的片段。
轉錄一小時的影片需要多長時間?
雲 AI 服務通常在 1-5 分鐘內返回一小時音訊的轉錄。近期 Mac 上的本機 Whisper 對一小時音訊通常需要 5-15 分鐘,具體取決於模型大小。人工轉錄通常每小時音訊需 4-6 小時。
逐字稿和字幕有什麼區別?
字幕稿是口語音訊的純文字版本,可用於閱讀或重新利用內容。字幕是覆蓋在影片上的定時文字,用於觀看時顯示。大多數轉錄工具可以產生兩者——定時格式(SRT 或 VTT)是字幕,純文字版本是逐字稿。
我可以在影片編輯器中編輯逐字稿嗎?
是的,在支援的編輯器中。Tight Studio 和 Descript 都允許你在影片時間軸旁邊直接編輯逐字稿。單字仍與時間戳記關聯,所以修改不會破壞字幕時間。獨立的轉錄工具通常會產生一個單獨的文字檔案供你編輯。
影片轉錄可以支援除英語以外的語言嗎?
是的。大多數現代轉錄服務支援 50 多種語言。ElevenLabs Scribe 和 OpenAI Whisper 都支援 90 多種語言。準確率在英語和其他廣泛使用的語言中最高,對於訓練資料較少的語言則有所下降。
