Bản ghi chép bằng văn bản biến một video thành một văn bản có thể tìm kiếm được. Bạn có thể dán nó vào tài liệu, tái sử dụng cho các bài đăng blog, tạo phụ đề, hoặc chỉ lướt qua thay vì xem lại một hướng dẫn dài 20 phút.
Hướng dẫn này bao gồm các cách chính để chuyển văn bản từ các bản ghi video - từ các công cụ tích hợp miễn phí đến các dịch vụ AI xử lý các bản ghi video dài trong vài phút - và cách chọn công cụ phù hợp cho quy trình làm việc của bạn.
Tại sao phải chuyển lời nói trong bản ghi video
Một vài lý do bạn có thể muốn có bản chép lời viết của một video ghi hình:
- Phụ đề và phụ đề. Hầu hết khán giả xem các video hướng dẫn và trình diễn khi tắt âm thanh. Bản ghi chú viết là điểm khởi đầu để có phụ đề chính xác.
- Lưu trữ có thể tìm kiếm. Một thư viện các bản ghi video khó điều hướng. Bản phiên âm bằng văn bản cho phép bạn tìm kiếm trong mọi cuộc họp, hướng dẫn hoặc video khóa học mà bạn đã thực hiện.
- Tái sử dụng nội dung. Biến một buổi hướng dẫn đã quay thành bài đăng blog, trang tài liệu hoặc bài viết cơ sở kiến thức.
- Chỉnh sửa bằng văn bản. Một số trình chỉnh sửa cho phép bạn xóa từ khỏi bản chép lời và tự động cắt video tương ứng. Hữu ích cho việc loại bỏ các từ thừa.
- Khả năng tiếp cận và tuân thủ. Bản chép lời được yêu cầu đối với nhiều tiêu chuẩn tiếp cận và cải thiện phạm vi tiếp cận ở các thị trường mà khán giả không nói ngôn ngữ nguồn.
Tiêu chuẩn cho bản ghi có thể sử dụng đã tăng lên đáng kể trong hai năm qua. Các mô hình trí tuệ nhân tạo hiện đại có thể phiên âm một giờ âm thanh sạch trong chưa đầy một phút với độ chính xác trên 95%. Các công cụ tích hợp miễn phí đang bắt kịp nhưng vẫn còn thua kém các dịch vụ chuyên dụng.
Phương pháp 1: Chuyển đổi văn bản từ video một cách thủ công
Lựa chọn miễn phí là phát lại video đã quay và gõ những gì bạn nghe. Với một đoạn clip một phút sử dụng ngôn ngữ đơn giản, việc này mất khoảng năm phút. Với một hướng dẫn 30 phút, có thể mất hai đến ba giờ.
Phiên âm thủ công chỉ có giá trị khi:
- Bản quay video dưới một hoặc hai phút
- Bạn cần từ ngữ cực kỳ chính xác vì lý do pháp lý hoặc biên tập
- Âm thanh bị ồn hoặc có giọng accent nặng mà các mô hình trí tuệ nhân tạo gặp khó khăn.
Đối với bất cứ điều gì lâu hơn hoặc lặp đi lặp lại, chuyển sang công cụ AI.
Phương pháp 2: Sử dụng chức năng đọc chính tả tích hợp macOS như một cách giải quyết
macOS có chức năng phiên âm trực tiếp nhưng không có tính năng tích hợp để chuyển văn bản từ một file video đã lưu trực tiếp. Giải pháp thường dùng là phát video và đọc phiên âm cùng lúc, điều này không ổn định và chậm.
Một tùy chọn miễn phí gọn gàng trên macOS là Ghi chú giọng nói ứng dụng kết hợp với định tuyến âm thanh hệ thống - ghi lại âm thanh video vào Ghi chú giọng nói, và các phiên bản macOS gần đây sẽ hiển thị bản chép lời trong ứng dụng.
Hạn chế: Đây không phải là quy trình chuyển đổi âm thanh thực sự. Chất lượng không đồng đều, bạn không thể nhận được dấu thời gian ở cấp từ ngữ, và bạn sẽ mất đồng bộ với video gốc. Chỉ sử dụng nó như một tùy chọn miễn phí cuối cùng.
Phương pháp 3: Phiên âm với dịch vụ AI
Các dịch vụ phiên âm chuyên dụng của AI là câu trả lời chuẩn cho các bản ghi video dài hơn vài phút. Các tùy chọn chính:
- ElevenLabs Scribe - Hiện là một trong những mô hình chính xác nhất cho tiếng Anh và hơn 90 ngôn ngữ khác. Thời gian đóng dấu theo từng từ, phân biệt người nói và phát hiện sự kiện âm thanh. Giá trả theo mức tiêu thụ khoảng $0,40 mỗi giờ âm thanh.
- OpenAI Whisper - Mô hình nguồn mở đã thiết lập tiêu chuẩn độ chính xác hiện đại. Miễn phí nếu bạn chạy nó trên thiết bị, hoặc qua OpenAI’s API với giá 0,006 USD mỗi phút. Mạnh về tiếng Anh, tạm ổn với hầu hết các ngôn ngữ lớn.
- AssemblyAI - API tập trung vào nhà phát triển với nhãn người nói, cảm xúc và phát hiện chủ đề. Giá bắt đầu khoảng $ 0,37 mỗi giờ.
- Otter.ai - Ứng dụng trình duyệt và di động hướng đến các cuộc họp. Gói miễn phí có giới hạn phút hàng tháng, các gói trả phí để ghi video dài hơn.
- Rev - Cung cấp cả phiên âm AI và bản chép lời được xác minh bởi con người. Độ chính xác cao hơn nhờ con người, chi phí cao hơn ($1.50+ mỗi phút).
- Descript - Ứng dụng chỉnh sửa video với tính năng chuyển văn bản thành lời. Bạn chỉnh sửa bản chép lời và video cũng được chỉnh sửa theo.
Đối với hầu hết các bản ghi video, quy trình làm việc giống nhau: tải tệp lên, chờ đợi, tải bản phiên âm văn bản xuống dưới dạng .txt, .srt, hoặc .vtt.
Bước 1 - Xuất âm thanh hoặc tải lên video
Hầu hết các dịch vụ chấp nhận các định dạng video phổ biến (MP4, MOV) trực tiếp. Nếu dịch vụ của bạn không chấp nhận, hãy trích xuất âm thanh bằng lệnh FFmpeg nhanh:
ffmpeg -i recording.mp4 -vn -acodec mp3 recording.mp3
Bước 2 - Tải lên và chọn tùy chọn
Chọn ngôn ngữ nguồn, có phát hiện người nói hay không, và có muốn có dấu thời gian không. Dấu thời gian ở mức từ hữu ích nếu bạn định tạo phụ đề hoặc đồng bộ bản chép lời với video.
Bước 3 - Tải xuống kết quả
Hầu hết các dịch vụ trả lại bản chép lời viết dưới dạng văn bản thuần cùng với định dạng thời gian (SRT hoặc VTT) cho phụ đề. Nếu bạn chỉ cần bản tóm tắt bằng văn bản, văn bản thuần là đủ.
Nhược điểm của các dịch vụ độc lập là vòng đi-về. Bạn ghi video trong một công cụ, phiên âm trong công cụ khác, chỉnh sửa trong công cụ thứ ba. Mỗi lần chuyển giao là nơi mà thời gian có thể bị lệch hoặc định dạng bị phá vỡ.
Phương pháp 4: Sử dụng ứng dụng quay màn hình có tính năng phiên âm tích hợp
Quy trình làm việc sạch nhất là một ứng dụng quay màn hình có khả năng phiên âm video ngay trong cùng ứng dụng, để bản chép lời vẫn được liên kết với dòng thời gian video.
Tight Studio

Tight Studio là một ứng dụng quay màn hình Mac và ứng dụng chỉnh sửa video với tính năng chuyển lời nói thành văn bản tích hợp, được hỗ trợ bởi ElevenLabs Scribe. Đây là quy trình:
- Quay màn hình của bạn có hoặc không có micrô. Quay video đa lần cho phép bạn quay các phần video riêng biệt nếu cần.
- Mở bảng phụ đề trong trình chỉnh sửa và nhấp Tạo phụ đề. Âm thanh được tải lên dịch vụ phiên âm và trả về với dấu thời gian ở cấp độ từ.
- Xem lại bản ghi chép viết từng đoạn một. Các từ được liên kết với dòng thời gian video, nên nhấp vào một từ sẽ nhảy con trỏ phát.
- Chỉnh sửa văn bản trực tiếp de sửa bất kỳ thuật ngữ nào được phiên âm sai (tên sản phẩm, từ viết tắt, từ vựng kỹ thuật).
- Định dạng và nhúng phụ đề nếu bạn muốn chúng có trong video xuất ra, hoặc chỉ sử dụng bản chép lời sẵn như hiện tại cho tài liệu của bạn.
- Xuất video cuối cùng với phụ đề được hiển thị, hoặc sao chép bản chép lời ra dưới dạng văn bản.
Bởi vì bản chép lời sống bên trong trình soạn thảo, bạn cũng có thể sử dụng nó để:
- Tự động cắt từ ngữ phụ
- Tạo lồng tiếng AI từ cùng một kịch bản nếu bạn quyết định thay thế phần thuyết minh trực tiếp của mình
- Điều chỉnh lại thời gian phụ đề bằng cách chỉnh sửa trực tiếp thời gian các từ
Tight Studio sử dụng ElevenLabs Scribe để phiên âm, hỗ trợ hơn 90 ngôn ngữ và tạo dấu thời gian theo từng từ. Bản ghi chép có thể chỉnh sửa trong bảng phụ đề trước khi bạn xuất video.
Descript
Descript là tùy chọn tích hợp nổi tiếng khác. Bạn ghi lại video hoặc thêm video, ứng dụng sẽ tạo ra bản chép lời, và bạn có thể chỉnh sửa video bằng cách chỉnh sửa văn bản. Mạnh mẽ cho nội dung kiểu podcast và video dài. Ít giống một ứng dụng quay màn hình và nhiều hơn như một trạm làm việc video đầy đủ.
Phương pháp 5: Chạy Whisper trên thiết bị để phiên âm miễn phí
Nếu bạn quay nhiều video và không muốn trả tiền theo phút, chạy mô hình Whisper của OpenAI trên thiết bị là một lựa chọn tốt cho người dùng kỹ thuật.
brew install ffmpeg
pipx install openai-whisper
whisper recording.mp4 --model medium --output_format srt
The medium mẫu cân bằng tốc độ và độ chính xác trên các máy Mac hiện đại. large-v3 mẫu chậm hơn nhưng chính xác hơn, đặc biệt với các ngôn ngữ không phải tiếng Anh.
Những sự đánh đổi:
- Miễn phí sau một lần thiết lập
- Chậm hơn các dịch vụ đám mây (5-10 lần đối với mô hình lớn nhất)
- Yêu cầu Mac tương đối hiện đại (khuyến nghị M1 hoặc mới hơn)
- Không có phân biệt diễn giả sẵn có - bạn phải gắn thêm một công cụ thứ hai như
whisperx
Đây là lựa chọn tốt nhất nếu bạn đang làm hàng chục giờ mỗi tháng và muốn không tốn chi phí theo phút.
So sánh các phương pháp chuyển đổi video
| Phương pháp | Tốc độ | Độ chính xác | Tốt nhất cho | Chi phí |
|---|---|---|---|---|
| Gõ phím thủ công | Rất chậm | Cao nhất nếu cẩn thận | Clip nhỏ, chính xác về mặt pháp lý | Miễn phí |
| macOS phương pháp nhập liệu bằng giọng nói | Chậm | Thấp | Đoạn clip ngắn một lần | Miễn phí |
| Dịch vụ AI (ElevenLabs, Whisper API, AssemblyAI) | Nhanh | Cao (95%+ trên âm thanh sạch) | Hầu hết các bản ghi video | $0,006-$0,40 mỗi phút |
| Chuyển đổi văn bản thành giọng nói tích hợp (Tight Studio) | Nhanh | Cao (sử dụng ElevenLabs ghi chép) | Video ghi màn hình được thực hiện từ đầu đến cuối trong một ứng dụng | Bao gồm với đăng ký |
| Whisper trên thiết bị | Trung bình | Cao | Sử dụng tự lưu trữ với khối lượng cao | Miễn phí sau khi cài đặt |
| Được xác minh bởi con người (Rev) | Chậm | Cao nhất | Pháp lý, phát sóng, tuân thủ | $1,50+ mỗi phút |
Mẹo để chuyển văn bản video chính xác
Ghi hình video với âm thanh sạch. Một micro định hướng trong một căn phòng yên tĩnh vượt trội hơn bất kỳ mô hình trí tuệ nhân tạo nào. Ngay cả bản chuyển âm chính xác nhất cũng gặp khó khăn với những người nói chồng chéo và tiếng ồn phòng nặng.
Thêm bảng thuật ngữ nếu công cụ của bạn hỗ trợ. Các dịch vụ như ElevenLabs Scribe chấp nhận “keyterm prompts” - một danh sách ngắn các tên sản phẩm hoặc thuật ngữ kỹ thuật để định hướng mô hình. Đây là cải thiện độ chính xác lớn nhất cho các bản demo sản phẩm và hướng dẫn.
Chọn ngôn ngữ phù hợp. Hầu hết các dịch vụ tự động phát hiện ngôn ngữ nhưng việc tự động phát hiện có thể thất bại với các đoạn clip ngắn. Hãy đặt rõ ràng ngôn ngữ nguồn nếu bạn biết nó.
Chia các bản ghi video dài. Đối với các bản ghi video nhiều giờ, chia thành các đoạn 20-30 phút sẽ giúp bạn có phản hồi nhanh hơn và cho phép bạn bắt đầu chỉnh sửa bản ghi chép trong khi phần còn lại vẫn đang xử lý.
Xem xét các danh từ riêng và con số. AI chuyển tự thâu lại thường xuyên sai tên riêng, số phiên bản và từ viết tắt. Hãy đọc lướt bản chép lời và sửa bằng tay - điều này nhanh hơn là để chúng lọt vào phụ đề cuối cùng.
Câu hỏi thường gặp
Làm thế nào để tôi chuyển lời nói thành văn bản từ video đã quay?
Tải video lên một dịch vụ phiên âm AI như ElevenLabs Scribe, OpenAI Whisper, hoặc AssemblyAI. Dịch vụ sẽ trả về bản chép lời kèm dấu thời gian, thường dưới một phút cho video dài một giờ. Nếu bạn quay video trên Mac, các ứng dụng quay màn hình như Tight Studio bao gồm chức năng chuyển văn bản thành lời nói tích hợp sẵn nên bạn có thể phiên âm và chỉnh sửa trong cùng một ứng dụng.
Công cụ phiên âm video chính xác nhất là gì?
Đối với việc nhận dạng tự động hoàn toàn, ElevenLabs Scribe và OpenAI Whisper (large-v3) hiện đang dẫn đầu về các chỉ số đánh giá độ chính xác, cả hai đều đạt khoảng 95-97% trên âm thanh tiếng Anh sạch. Để có độ chính xác tối đa, các dịch vụ xác minh bởi con người như Rev tạo ra bản chuyển âm gần như hoàn hảo nhưng với chi phí cao hơn đáng kể.
Tôi có thể phiên âm video miễn phí không?
Vâng. Hai tùy chọn miễn phí chính là chạy OpenAI Whisper trên thiết bị của bạn trên máy tính của chính bạn, và sử dụng các gói miễn phí của các dịch vụ như Otter.ai (giới hạn chỉ vài trăm phút mỗi tháng). Việc phiên âm thủ công cũng miễn phí nhưng chỉ thực tế cho các đoạn clip rất ngắn.
Mất bao lâu để chuyển thể một giờ video thành văn bản?
Dịch vụ đám mây AI thường trả bản chép lời trong 1-5 phút cho một giờ âm thanh. Whisper trên thiết bị trên một Mac gần đây mất 5-15 phút cho một giờ, tùy thuộc vào kích thước mô hình. Phiên âm thủ công thường mất 4-6 giờ cho mỗi giờ âm thanh.
Sự khác biệt giữa bản chép lời viết và phụ đề là gì?
Bản chép lời là phiên bản văn bản của âm thanh nói, hữu ích để đọc hoặc tái sử dụng nội dung. Phụ đề là văn bản có thời gian hiển thị chồng lên video, được sử dụng khi xem. Hầu hết các công cụ phiên âm có thể tạo cả hai - định dạng có thời gian (SRT hoặc VTT) là phụ đề, phiên bản văn bản thuần túy là bản chép lời.
Tôi có thể chỉnh sửa bản chép lời bên trong ứng dụng chỉnh sửa video không?
Vâng, trong các trình chỉnh sửa hỗ trợ điều đó. Tight Studio và Descript đều cho phép bạn chỉnh sửa bản chép lời trực tiếp bên cạnh dòng thời gian video. Các từ vẫn được liên kết với mốc thời gian của chúng, vì vậy các chỉnh sửa không làm sai lệch thời gian phụ đề. Các công cụ chuyển văn bản độc lập thường tạo ra một tệp văn bản mà bạn phải chỉnh sửa riêng.
Việc chuyển đổi video thành văn bản có hoạt động với các ngôn ngữ khác ngoài tiếng Anh không?
Vâng. Hầu hết các dịch vụ phiên âm hiện đại hỗ trợ hơn 50 ngôn ngữ. ElevenLabs Scribe và OpenAI Whisper đều hỗ trợ hơn 90 ngôn ngữ. Độ chính xác cao nhất cho tiếng Anh và các ngôn ngữ được sử dụng rộng rãi khác, và giảm đi đôi chút đối với các ngôn ngữ có dữ liệu huấn luyện ít hơn.
