转录可以将视频录制转换为可搜索的文字。您可以将其粘贴到文件中,用于博客文章,生成字幕,或者只是快速浏览,而不用重新观看 20 分钟的演示。
本指南介绍了转录视频录制的主要方法——从免费的内置工具到 AI 服务,这些服务可以在几分钟内处理长时间的录制——以及如何为您的工作流程选择合适的方法。
为什么要转录视频录制内容
你可能想要录制内容转录文本的几个原因:
- 字幕和小字幕 大多数观众在观看教程和演示时是静音的。转录文本是准确字幕的起点。
- 可搜索的文件。 录制内容库难以导航。转录文字可以让您在每一次会议、教程或课程视频中进行搜索。
- 改造内容 将录制的演练转换为博客文章、文件页面或知识库文章。
- 通过文字进行编辑。 有些编辑软件允许您删除字幕中的文字,同时自动裁剪掉相应的视频片段。可用于去除口头禅。
- 可访问性和合规性 转录对于许多可访问性标准是必需的,并且在观众不讲原语言的市场中可以提高覆盖率。
可用转录的标准在过去两年大幅提高。现代 AI 模型可以在一分钟内转录一小时的清晰音频,准确率超过95%。免费的内置工具正在赶上,但仍落后于专门的服务。
方法 1:手动转录录制内容
免费选项是回放录制内容并输入你听到的内容。对于一个一分钟的简单语言片段,大约需要五分钟。对于三十分钟的教程,则可能需要两到三小时。
手动转录只有在以下情况下才值得:
- 录制时长不到一两分钟
- 你需要非常精确的措辞,出于法律或编辑原因
- 音频嘈杂或有重口音,AI 模型难以处理。
对于任何较长或重复的内容,请使用 AI 工具。
方法 2:使用 macOS 内置的听写功能作为变通方法
macOS 有实时听写功能,但没有直接转录已保存视频文件的内置功能。常见的解决方法是将录制内容播放出来,然后同时进行听写,这种方法脆弱且速度慢。
macOS 上一个更干净的免费选项是 语音备忘录 将应用与系统音频路由结合——将视频音频录制到语音备忘录中,并且最近的 macOS 版本将在应用中显示转录文字。
限制:这不是一个真正的转录流程。质量不一致,无法获得逐词时间戳,并且会丢失原始视频同步。仅在万不得已的免费选择时使用。
方法 3:使用 AI 服务进行转录
专用 AI 转录服务是录制时间超过几分钟的视频的标准解决方案。主要选项:
- ElevenLabs Scribe - 目前是英语及其他 90 多种语言最准确的模型之一。提供词级时间戳、说话人区分和音频事件检测。按使用付费,每小时音频约 $0.40。
- OpenAI Whisper - 设置现代准确性标准的开源模型。如果在本地执行则免费,或通过 OpenAI 的 API 每分钟 0.006 美元使用。擅长英语,对大多数主要语言表现良好。
- AssemblyAI - 面向开发者的 API,带有说话者标签、情感和主题检测。定价从每小时约 $0.37 起。
- Otter.ai - 面向会议的浏览器和移动应用。免费套餐有每月分钟限制,付费套餐可记录更长时间。
- 版本 - 提供 AI 转录和人工核实的转录文本。通过人工提高准确性,但成本更高(每分钟$1.50+)。
- Descript - 内置转录功能的视频编辑器。你编辑转录文字时,视频会随之编辑。
对于大多数录制内容,工作流程相同:上传文件,等待,下载转录文字。 .txt, .srt,或者 .vtt。
步骤1- 导出音频或上传视频
大多数服务直接接受常见的视频格式(MP4, MOV)。如果你的服务不支持,可以使用一个简单的 FFmpeg 命令提取音频:
ffmpeg -i recording.mp4 -vn -acodec mp3 recording.mp3
第二步- 上传并选择选项
选择源语言、是否检测说话人,以及是否需要时间戳。如果你计划生成字幕或将转录文本同步回视频,逐词时间戳会很有用。
第3 步- 下载结果
大多数服务会以纯文字加上带时间的格式(SRT 或 VTT)返回字幕。如果你只需要书面摘要,纯文字就足够了。
独立服务的缺点是往返操作。你在一个工具中录制,在另一个工具中转录,在第三个工具中编辑。每一次交接都是时间偏移或格式损坏的可能点。
方法 4:使用带内置转录功能的屏幕录制器
最干净的工作流程是使用同一个应用内进行录屏和转录的屏幕录制器,这样字幕就能保持与视频时间线的关联。
Tight Studio

Tight Studio 是一个 Mac 屏幕录制和视频编辑软件,内置由 ElevenLabs Scribe 驱动的转录功能。流程如下:
- 录制您的屏幕 有或没有麦克风。多次录制允许你在需要时单独录制各个部分。
- 打开字幕面板 在编辑器中并点击 生成字幕。音频已上传到转录服务,并返回带有逐词时间戳的文字。
- 查看转录文本 一段一段地处理。单词与视频时间轴绑定,因此点击某个单词会跳转播放位置。
- 直接编辑文字 修正任何误转录的术语(产品名称、缩略语、技术词汇)
- 样式与字幕烧录 如果你希望它们出现在导出的视频中,或者只是将转录内容按原样用于文件。
- 导出 渲染带字幕的最终视频,或将转录文本复制为文字。
因为稿件存在于编辑器内,你也可以使用它来:
- 自动修剪填充词
- 如果你决定替换现场解说,从相同的脚本生成 AI 配音
- 通过直接编辑单词时间来重新调整字幕时间
Tight Studio 使用 ElevenLabs Scribe 进行转录,支持 90 多种语言,并生成逐词时间戳。在导出视频之前,字幕面板内的文字是可编辑的。
Descript
Descript 是另一款知名的集成选项。你可以录制或导入视频,应用会生成转录文字,你可以通过编辑文字来编辑视频。对播客风格内容和长视频很适合。它更像是一个完整的视频工作站,而不是单纯的屏幕录制工具。
方法 5:在本地执行 Whisper 免费转录
如果你录制大量视频且不想按分钟付费,本地执行 OpenAI 的 Whisper 模型对技术用户来说是个不错的选择。
brew install ffmpeg
pipx install openai-whisper
whisper recording.mp4 --model medium --output_format srt
该 medium 模型在现代 Mac 上平衡速度和准确性。 large-v3 模型速度较慢但更准确,尤其适用于非英语语言。
权衡:
- 一次性设置后免费
- 比云服务慢(最大模型慢5-10 倍)。
- 需要一台相对现代的 Mac(推荐 M1 或更新机型)
- 开箱即用没有讲者区分 - 你必须附加第二个工具,比如
whisperx
如果你每月需要花费数十小时,并且希望每分钟成本为零,这是最好的选择。
比较视频转录方法
| 方法 | 速度 | 准确性 | 最适合 | 成本 |
|---|---|---|---|---|
| 手动输入 | 非常慢 | 如果小心则为最高 | 微小片段,法律精度 | 免费版 |
| macOS 语音输入变通方法 | 慢 | 低 | 一次性短片剪辑 | 免费版 |
| AI 服务(ElevenLabs,Whisper API,AssemblyAI) | 快速 | 高(干净音频 ≥ 95%) | 大多数录制内容 | 每分钟 $0.006-$0.40 |
| 内置转录(Tight Studio) | 快速 | 高(使用 ElevenLabs Scribe) | 屏幕录制在一个应用中完成端到端 | 随订阅提供 |
| 本地 Whisper | 中等 | 高 | 大容量自托管使用 | 设置后免费 |
| 人工验证 (修订版) | 慢 | 最高 | 法律、广播、合规 | 每分钟 $1.50+ |
精准视频转录提示
录制干净的音频。 在安静的房间里,定向麦克风胜过任何 AI 型号的技巧。即使是最好的转录也难以处理重叠发言者和严重的环境噪音。
如果您的工具支持,请添加术语表。 类似的服务,如 ElevenLabs Scribe,支持“关键术语提示”——即一份简短的产品名称或技术术语列表,用于引导模型的生成倾向。这是产品演示与教程在准确性方面获取的最显著提升。
选择正确的语言。 大多数服务会自动检测语言,但在短片上自动检测可能失败。如果你知道源语言,请明确设置它。
分割长录制内容。 对于多小时的录制内容,将其拆分为 20-30 分钟的片段可以加快交付速度,并让你在其余部分还在处理时就开始编辑转录稿。
复习专有名词和数字。 AI 转录常常弄错专有名词、版本号和缩写。浏览转录文字并手动修正这些错误——这样比让它们出现在最终字幕中更快。
常见问题
如何转录视频录制内容?
将视频上传到 AI 转录服务,例如 ElevenLabs Scribe、OpenAI Whisper 或 AssemblyAI。该服务会返回带时间戳的转录文本,通常对于一小时的视频不到一分钟就可以完成。如果你在 Mac 上录制,像 Tight Studio 这样的屏幕录制软件内置了转录功能,因此你可以在同一个应用中进行转录和编辑。
最准确的视频转录工具是什么?
对于纯自动转录,目前在准确性基准上领先的是 ElevenLabs Scribe 和 OpenAI Whisper(large-v3),在干净的英语音频上,两者的准确率大约为 95-97%。为了获得最高的准确性,经过人工验证的服务如 Rev 可以生成近乎完美的转录文字,但成本显著更高。
我可以免费为视频生成转录吗?
是的。两个主要的免费选项是在你自己的电脑上本地执行 OpenAI Whisper,以及使用像 Otter.ai 这样的服务的免费版(每月限制在几百分钟)。手动转录也是免费的,但只适用于非常短的片段。
转录一小时的视频需要多长时间?
云 AI 服务通常在 1-5 分钟内返回一小时音频的转录。近期 Mac 上的本地 Whisper 对一小时音频通常需要 5-15 分钟,具体取决于模型大小。人工转录通常每小时音频需 4-6 小时。
转录文本和字幕有什么区别?
字幕稿是口语音频的纯文字版本,可用于阅读或重新利用内容。字幕是覆盖在视频上的定时文字,用于观看时显示。大多数转录工具可以生成两者——定时格式(SRT 或 VTT)是字幕,纯文字版本是转录稿。
我可以在视频编辑器中编辑转录文本吗?
是的,在支持的编辑器中。Tight Studio 和 Descript 都允许您在视频时间轴旁边直接编辑转录文字。单词仍与时间戳关联,所以修改不会破坏字幕时间。独立的转录工具通常会生成一个单独的文字文件供您编辑。
视频转录可以支持除英语以外的语言吗?
是的。大多数现代转录服务支持 50 多种语言。ElevenLabs Scribe 和 OpenAI Whisper 都支持 90 多种语言。准确率在英语和其他广泛使用的语言中最高,对于训练数据较少的语言则有所下降。
