文字起こしは動画記録を検索可能なテキストに変換します。ドキュメントに貼り付けたり、ブログ記事に再利用したり、字幕を生成したり、20分のウォークスルーを再視聴する代わりに目を通すだけでも使えます。
このガイドでは、動画録画を文字起こしする主な方法について説明します。無料の内蔵ツールから、長時間の録画を数分で処理するAIサービスまで紹介し、自分のワークフローに合った方法の選び方も解説します。
動画録画を文字起こしする理由
収録の文字起こしが欲しいかもしれないいくつかの理由:
- 字幕と字幕ほとんどの視聴者は音声をオフにしてチュートリアルやデモを見ます。正確な字幕を作る出発点は文字起こしです。
- 検索可能なアーカイブ収録のライブラリはナビゲートが難しいです。文字起こしがあれば、作成したすべてのミーティング、チュートリアル、コース動画を横断して検索できます。
- コンテンツの再利用録画したウォークスルーをブログ記事、ドキュメントページ、またはナレッジベース記事に変換します。
- テキストによる編集一部のエディターでは、文字起こしから単語を削除すると、対応する動画が自動的にカットされます。フィラーワードをトリミングするのに便利です。
- アクセシビリティとコンプライアンス。文字起こしは多くのアクセシビリティ基準で必要とされ、視聴者がソース言語を話さない市場でのリーチ向上に役立ちます。
使える文字起こしの水準は、過去2年間で急上昇しています。最新のAIモデルは、きれいな音声1時間分を1分未満で95%以上の精度で文字起こしできます。無料の内蔵ツールも追いつきつつありますが、専用のサービスにはまだ及びません。
方法1: 録画を手動で文字起こし
無料オプションでは、収録を再生して聞こえた内容を入力します。シンプルな言語の1分間のクリップの場合、これは約5分かかります。30分のチュートリアルでは、2~3時間かかることがあります。
手動書き起こしは次の場合にのみ価値があります:
- 録画は1〜2分未満です
- 法的または編集上の理由で非常に正確な表現が必要です
- 音声にはノイズがあるか、AIモデルが苦手とする強いアクセントがあります。
より長い内容や繰り返しの場合は、AIツールに切り替えてください。
方法2:回避策としてmacOSの内蔵ディクテーションを使用する
macOSにはライブディクテーション機能がありますが、保存された動画ファイルを直接文字起こしする内蔵機能はありません。一般的な回避策は、録画を再生しながら一緒にディクテーションする方法ですが、これは不安定で遅いです。
macOSのよりクリーンな無料オプションはボイスメモアプリとシステム音声ルーティングの組み合わせ:動画の音声をボイスメモに収録し、最近のmacOSバージョンではアプリに文字起こしが表示されます。
制限: これは本物の文字起こしパイプラインではありません。品質は不安定で、単語レベルのタイムスタンプを取得できず、元の動画の同期も失われます。最後の手段としての無料オプションとしてのみ使用してください。
方法3:AIサービスで文字起こしする
専用のAI転写サービスは、数分以上の録音に対する標準的な回答です。主なオプション:
- ElevenLabs書記- 現在、英語および90以上の他の言語で最も正確なモデルの一つです。単語レベルのタイムスタンプ、話者区別、音声イベント検出。使用量に応じた課金で、音声1時間あたり約0.40ドル。
- OpenAI Whisper- 現代の精度の基準を設定したオープンソースモデル。ローカルで実行すれば無料、またはOpenAIのAPIを使えば1分あたり$0.006で利用可能。英語に強く、ほとんどの主要言語にも十分対応。
- AssemblyAI- スピーカーラベル、感情、トピックの検出機能を備えた開発者向けAPI。価格は1時間あたり約0.37ドルからです。
- Otter.ai- ミーティング向けのブラウザおよびモバイルアプリです。月間利用分数の制限があるFreeプラン、長時間録画用の有料プランがあります。
- Rev- AI文字起こしと、人間による確認済みの書き起こしの両方を提供します。人間による確認で精度が高く、コストは高めです(1分あたり$1.50以上)。
- Descript- 文字起こし機能付き動画編集。文字起こしを編集すると、それに合わせて動画も自動で編集されます。
ほとんどの録画においてワークフローは同じです:ファイルをアップロードし、待ち、文字起こしをダウンロードします。.txt、.srt、または.vtt。
ステップ1:音声を書き出すか、動画をアップロードする
ほとんどのサービスは、一般的な動画形式(MP4、MOV)を直接受け入れます。もし自分のサービスが対応していない場合は、簡単なFFmpegコマンドで音声を抽出してください。
ffmpeg -i recording.mp4 -vn -acodec mp3 recording.mp3
ステップ2:アップロードしてオプションを選ぶ
ソース言語を選択し、話者を検出するかどうか、タイムスタンプを取得するかどうかを選択してください。単語レベルのタイムスタンプは、字幕を生成したり、文字起こしを動画に同期させたりする場合に便利です。
ステップ3:結果をダウンロードする
ほとんどのサービスは、文字起こしをプレーンテキストとして返すとともに、字幕用にタイム付きフォーマット(SRTまたはVTT)を提供します。書面による要約だけが必要な場合は、プレーンテキストで十分です。
スタンドアロンのサービスの欠点はラウンドトリップです。1つのツールで録画し、別のツールで文字起こしを行い、さらに別のツールで編集します。各受け渡しでタイミングがずれたり、フォーマットが崩れたりします。
方法4:内蔵文字起こし機能付き画面収録ソフトを使用する
最も効率的なワークフローは、録画を同じアプリ内で文字起こしできる画面収録ソフトを使うことで、文字起こしが動画のタイムラインに紐づいたままになります。
Tight Studio

Tight Studioは、ElevenLabs Scribeによる文字起こしを内蔵したMac画面収録ソフト兼動画エディターです。フローは以下の通りです。
- 画面を録画します。マイクあり/なし、必要に応じてセクションごとに収録可能なマルチテイク収録
- 字幕パネルを開きますしてクリックします字幕を生成。音声は文字起こしサービスにアップロードされ、単語レベルのタイムスタンプ付きで返されます。
- 文字起こしを確認してください。セグメントごとに。単語は動画のタイムラインに結びついているため、単語をクリックすると再生ヘッドがジャンプします。
- インラインでテキストを編集誤って書き起こされた用語(製品名、頭字語、専門用語)を修正する
- 字幕にスタイルを適用して焼き込み書き出された動画に含めたい場合、またはドキュメント用にそのまま文字起こしを使用する場合。
- 書き出し字幕がレンダリングされた最終動画、または文字起こしをテキストとしてコピーする。
文字起こしはエディター内に存在するため、次のことにも使用できます:
- 語尾やフィラーを自動でトリミング
- ライブナレーションを置き換える場合、同じ台本からAIナレーションを生成
- 字幕のタイミングを直接単語のタイミングを編集して再タイミング
Tight Studio書き起こしにはElevenLabs Scribeを使用しており、90以上の言語をサポートし、単語単位のタイムスタンプを生成します。書き起こした内容は、動画を書き出す前に字幕パネル内で編集可能です。
Descript
Descriptはもう一つのよく知られた統合オプションです。動画を録画またはインポートすると、アプリは文字起こしを生成し、テキストを編集することで動画を編集できます。ポッドキャストスタイルのコンテンツや長編動画に強いです。画面収録機能は少なく、より完全な動画ワークステーションに近いです。
方法5:Whisperをローカルで実行して無料で文字起こしを行う
たくさんの動画を録画し、分単位で支払いたくない場合、技術的なユーザーにはローカルでOpenAIのWhisperモデルを実行するのが良い選択です。
brew install ffmpeg
pipx install openai-whisper
whisper recording.mp4 --model medium --output_format srt
そのmediumモデルは最新のMacで速度と精度のバランスを取る。large-v3モデルは遅いが特に非英語の言語でより正確。
トレードオフ:
- 単発の設定後無料
- クラウドサービスより遅い(最大モデルで5~10倍)
- 比較的最新のMac(M1以上推奨)が必要です
- 標準ではスピーカーの発話者区別はなく、第二のツールを追加する必要があります
whisperx
これは、月に数十時間作業を行い、1分あたりのコストをゼロにしたい場合に最適なオプションです。
動画文字起こし方法の比較
| 方法 | 速度 | 正確性 | 向いている用途 | コスト |
|---|---|---|---|---|
| 手動入力 | 非常に遅い | 注意すれば最高 | 小さなクリップ、法的精度 | Free |
| macOS音声入力の回避策 | 遅い | 低 | 単発の短いクリップ | Free |
| AIサービス (ElevenLabs、Whisper API、AssemblyAI) | 速め | 高 (クリーン音声で95%以上) | ほとんどの録音 | 1分あたり0.006〜0.40ドル |
| 内蔵トランスクリプション(Tight Studio) | 速め | 高 (ElevenLabs Scribe使用) | 画面収録は一つのアプリでエンドツーエンドで実行されます | サブスクリプションに含まれる。 |
| ローカルWhisper | 中程度 | 高 | 大量自社ホスティング利用 | 設定後無料 |
| 人間が確認済み(Rev) | 遅い | 最高 | 法的、放送、コンプライアンス | 1分あたり$1.50+ |
正確な動画文字起こしのヒント
クリーンな音声を収録してください。静かな部屋での指向性マイクは、どのAIモデルの工夫よりも優れています。重なり合う話者や騒がしい部屋のノイズでは、最高の文字起こしでも苦戦します。
ツールが対応している場合、用語集を追加します。ElevenLabs Scribeのようなサービスは「キータームプロンプト」を受け入れます:製品名や技術用語の短いリストで、モデルをそれに偏らせることができます。これは製品デモやチュートリアルの精度向上で最も大きな効果があります。
適切な言語を選んでください。ほとんどのサービスは言語を自動検出しますが、短いクリップでは自動検出が失敗することがあります。言語が分かっている場合は、ソース言語を明示的に設定してください。
長時間録音を分割。長時間の録画の場合、20~30分単位に分割すると、より迅速な作業が可能になり、他がまだ処理中でも文字起こしの編集を開始できます。
固有名詞と数字を確認してください。AI転写は固有名詞、バージョン番号、略語を常に誤認します。文字起こしをざっと確認し、手で修正してください:最終字幕に誤りが入るより速いです。
よくある質問
動画録画を文字起こしするにはどうすればよいですか?
ElevenLabs Scribe、OpenAI Whisper、またはAssemblyAIなどのAI書き起こしサービスに動画をアップロードします。サービスは通常、1時間の動画でも1分未満でタイムスタンプ付きの書き起こしを返します。Macで録画している場合、Tight Studioのような画面収録ツールには書き起こし機能が組み込まれているため、同じアプリで書き起こしと編集ができます。
最も正確な動画文字起こしツールは何ですか?
完全に自動化された文字起こしの場合、ElevenLabs ScribeとOpenAI Whisper(large-v3)は現在、精度ベンチマークでリードしており、クリーンな英語音声ではどちらも約95〜97%です。最大の精度を求める場合、Revのような人間による確認済みサービスはほぼ完璧な文字起こしを提供しますが、費用は大幅に高くなります。
動画を無料で文字起こしできますか?
はい。主な無料の方法は、自分のコンピューターでOpenAI Whisperをローカル実行することと、Otter.aiのようなサービスの無料プランを利用すること(1か月あたり数百分に制限あり)です。手動での文字起こしも無料ですが、非常に短いクリップにしか実用的ではありません。
1時間の動画の文字起こしにはどのくらい時間がかかるか。
クラウドAIサービスは通常、1時間の音声で1~5分で文字起こしを返します。最近のMac上のローカルWhisperは、モデルサイズに応じて1時間の音声で5~15分かかります。手動の文字起こしは通常、1時間の音声につき4~6時間かかります。
文字起こしと字幕の違いは何ですか?
文字起こしは、話された音声のプレーンテキストバージョンで、内容を読むためや再利用するために便利です。字幕は、動画上に重ねて表示されるタイム付きテキストで、視聴中に使用されます。ほとんどの文字起こしツールは両方を作成できます:タイム付き形式(SRTまたはVTT)は字幕、プレーンテキストバージョンは文字起こしです。
動画編集内で文字起こしを編集できますか?
はい、対応するエディタで可能です。Tight StudioとDescriptの両方で、動画タイムラインに沿って文字起こしをインラインで編集できます。単語はタイムスタンプにリンクされたままなので、修正しても字幕のタイミングが崩れることはありません。単独の文字起こしツールは通常、別に編集するテキストファイルを生成します。
英語以外の言語でも動画の文字起こしはできますか?
はい。ほとんどの最新の文字起こしサービスは50以上の言語をサポートしています。ElevenLabs ScribeやOpenAI Whisperは90以上の言語をサポートしています。精度は英語や広く話されている言語で最も高く、学習データが少ない言語ではやや低下します。
