Ir al artículo
← Volver a Audio, subtítulos y voz

Cómo transcribir grabaciones de video

Portada de la ilustración para Cómo transcribir grabaciones de video

Una transcripción convierte una grabación de video en texto de búsqueda. Puede pegarlo en documentos, reutilizarlo para publicaciones de blog, generar subtítulos, o simplemente deslizarlo en lugar de volver a ver una guía de 20 minutos.

Esta guía cubre las principales formas de transcribir grabaciones de video - desde herramientas integradas gratuitas hasta servicios AI que manejan grabaciones largas en minutos - y cómo elegir la correcta para su flujo de trabajo.

¿Por qué transcribir una grabación de video?

Algunas razones por las que podría querer una transcripción de una grabación:

  • Títulos y subtítulos. La mayoría de los espectadores ven tutoriales y demos con sonido apagado. Una transcripción es el punto de partida para los subtítulos precisos.
  • Archivos de búsqueda. Una biblioteca de grabaciones es difícil de navegar. Una transcripción le permite grapear a través de cada reunión, tutorial o video del curso que ha hecho.
  • Repurposuponiendo contenido. Convierta un recorrido grabado en un artículo de blog, página de doc o base de conocimiento.
  • Edición por texto. Algunos editores le permiten eliminar palabras de una transcripción y tener el correspondiente corte de video automáticamente. Útil para recortar palabras de relleno.
  • Accesibilidad y cumplimiento. Se requieren transcripciones para muchos estándares de accesibilidad y mejorar el alcance en mercados donde los espectadores no hablan el idioma fuente.

La barra para la transcripción utilizable ha aumentado notablemente en los últimos dos años. Los modelos modernos AI transcriben una hora de audio limpio en menos de un minuto con precisión superior al 95%. Las herramientas gratuitas incorporadas están alcanzando los servicios dedicados, pero todavía están rezagadas.

Método 1: Transcribir una grabación manualmente

La opción gratuita es reproducir la grabación y escribir lo que escuches. Para un clip de un minuto con un lenguaje simple esto toma unos cinco minutos. Para un tutorial de 30 minutos puede tomar de dos a tres horas.

La transcripción manual sólo vale la pena cuando:

  • La grabación es de menos de un minuto o dos
  • Se necesita una redacción extremadamente precisa por una razón legal o editorial
  • El audio es ruidoso o tiene acentos pesados con los que los modelos AI luchan

Para cualquier cosa más larga o repetir, saltar a una herramienta AI.

Método 2: Utilizar la dictado macOS integrado como solución de emergencia

macOS tiene dictado en vivo pero no tiene una función incorporada que transcriba un archivo de video guardado directamente. La solución común es reproducir la grabación en voz alta y dictar junto a ella, que es frágil y lento.

Una opción libre de limpieza en macOS es la Memos de voz aplicación combinada con el sistema de audio de enrutamiento - grabar el audio del video en Memos de voz, y las versiones recientes macOS mostrará una transcripción en la aplicación.

Limitación: Esto no es una tubería de transcripción real. La calidad es inconsistente, no se pueden obtener marcas de tiempo de nivel de palabra, y se pierde la sincronización de video original. Úselo sólo como una opción libre de última reordenación.

Método 3: Transcribir con un servicio AI

Los servicios de transcripción AI dedicados son la respuesta estándar para grabaciones de más de un par de minutos.

  • ElevenLabs Scribe - Actualmente entre los modelos más precisos para el inglés y otros idiomas. Marcas de tiempo a nivel de palabra, diarización de altavoz y detección de eventos de audio. Precio de pago a medida que se va alrededor de $0.40 por hora de audio.
  • Susurro de OpenAI - El modelo de código abierto que establece la barra de precisión moderna. Gratis si lo ejecutas localmente, o a través de API de OpenAI a $0.006 por minuto. Fuerte en inglés, decente en la mayoría de los idiomas principales.
  • AssemblyAI - API centrado en el desarrollador con etiquetas de altavoz, sentimiento y detección de temas. El precio comienza alrededor de $0.37 por hora.
  • Otter.ai - Navegador y aplicación móvil dirigida a reuniones. Nivel gratuito con límites de minutos mensuales, planes pagados para grabaciones más largas.
  • Rev - Ofrece tanto transcripción AI como transcripciones verificadas por humanos. Mayor precisión vía humanos, mayor costo ($1,50+ por minuto).
  • Descript - Editor de video con transcripción incorporada. Edita la transcripción y el video edita junto con ella.

Para la mayoría de las grabaciones el flujo de trabajo es el mismo: subir el archivo, esperar, descargar la transcripción como .txt, .srt, o .vtt.

Paso 1 - Exportar el audio o subir el video

La mayoría de los servicios aceptan formatos de video comunes (MP4, MOV) directamente. Si el suyo no lo hace, extraiga el audio con un comando FFmpeg rápido:

ffmpeg -i recording.mp4 -vn -acodec mp3 recording.mp3

Paso 2 - Opciones de carga y selección

Elija el idioma de origen, si desea detectar altavoces y si desea marcas de tiempo. Las marcas de tiempo a nivel de palabra son útiles si planea generar subtítulos o sincronizar la transcripción de nuevo al video.

Paso 3 - Descargar el resultado

La mayoría de los servicios devuelven la transcripción como texto plano más un formato cronometrado (SRT o VTT) para los subtítulos. Si sólo necesita un resumen escrito, el texto plano es suficiente.

El inconveniente de los servicios independientes es el viaje de ida y vuelta. Grabas en una herramienta, transcribes en otra, editas en una tercera. Cada mano es un lugar donde se rompe el tiempo o el formato.

Método 4: Utilizar un grabador de pantalla con transcripción incorporada

El flujo de trabajo más limpio es un grabador de pantalla que transcribe grabaciones dentro de la misma aplicación, por lo que la transcripción permanece vinculada a la línea de tiempo del video.

Tight Studio

Tight Studio transcribiendo una grabación de pantalla en subtítulos

Tight Studio es un grabador de pantalla y editor de video Mac con transcripción incorporada alimentado por ElevenLabs Scribe. Aquí está el flujo:

  1. Grabe su pantalla con o sin micrófono. La grabación multitake le permite grabar secciones por separado si es necesario.
  2. Abrir el panel de subtítulos en el editor y haga clic en Generar subtítulos. El audio se carga al servicio de transcripción y devuelve con marcas de tiempo de nivel de palabra.
  3. Revisar la transcripción Las palabras están atadas a la línea de tiempo del video, así que haciendo clic en una palabra salta el cabezal de juego.
  4. Editar texto en línea para corregir cualquier término mal transcrito (nombres de producto, siglas, vocabulario técnico).
  5. Estilo y grabación en subtítulos si los quieres en el video exportado, o simplemente usa la transcripción como está para tus documentos.
  6. Exportar el video final con subtítulos o copia la transcripción como texto.

Debido a que la transcripción vive dentro del editor, también se puede utilizar para:

  • Recortar las palabras de relleno automáticamente
  • Generar voz en off AI del mismo script si decides reemplazar tu narración en vivo
  • Re-time subtítulos editando los tiempos de las palabras directamente

Tight Studio utiliza ElevenLabs Scribe para la transcripción, que admite más de 90 idiomas y produce marcas de tiempo a nivel de palabra. La transcripción es editable dentro del panel de subtítulos antes de exportar el video.

Descript

Descript es la otra opción integrada conocida. Grabas o importas video, la aplicación genera una transcripción y puedes editar el video editando el texto. Fuerte para contenido de estilo podcast y video de forma larga. Menos de una grabadora de pantalla y más de una estación de trabajo de video completa.

Método 5: Ejecutar Whisper localmente para la transcripción gratuita

Si grabas mucho video y no quieres pagar por minuto, ejecutar el modelo Whisper de OpenAI localmente es una buena opción para los usuarios técnicos.

brew install ffmpeg
pipx install openai-whisper
whisper recording.mp4 --model medium --output_format srt

Los medium modelo equilibra la velocidad y la precisión en Mac modernos. large-v3 modelo es más lento pero más preciso, especialmente para los idiomas no-Inglés.

Rebajas:

  • Libre después de la configuración de una sola vez
  • Servicios más lentos que en la nube (5-10x para el modelo más grande)
  • Requiere un Mac razonablemente moderno (M1 o más nuevo recomendado)
  • Sin diarización del altavoz fuera de la caja - usted tiene que atornillar en una segunda herramienta como whisperx

Esta es la mejor opción si usted está haciendo docenas de horas por mes y quiere cero por minuto costo.

Comparación de métodos de transcripción de video

MétodoVelocidadPrecisiónMejor paraCosto
Mecanografía manualMuy lentoMás alto si es cuidadosoClips pequeños, precisión jurídicaLibre
macOS dictation worksoverLentaBajaClips cortos únicosLibre
Servicio AI (ElevenLabs, Whisper API, AssemblyAI)RápidoAlto (95%+ en audio limpio)La mayoría de las grabaciones$0,006-$0,40 por minuto
Transcripción incorporada (Tight Studio)Rápidoalta (utiliza ElevenLabs escriba)Grabaciones de pantalla realizadas de extremo a extremo en una aplicaciónIncluido en la suscripción
Susurro localMedioAltaUso auto-acogida de alto volumenLibre después de la configuración
(Rev)LentaMás altoLegal, difusión, cumplimiento$1,50+ por minuto

Consejos para una transcripción precisa de video

Grabar audio limpio. Un micrófono direccional en una habitación tranquila supera cualquier truco del modelo AI. Incluso la mejor transcripción lucha con altavoces superpuestos y ruido de la habitación.

Agregue un glosario si su herramienta lo soporta. Servicios como ElevenLabs Scribe aceptan “prompts de clave” - una lista corta de nombres de productos o términos técnicos para sesgar el modelo hacia. Esta es la mejora de precisión más grande para las demostraciones de productos y tutoriales.

Elige el idioma correcto. La mayoría de los servicios autodetectan lenguaje pero la autodetección puede fallar en clips cortos. Establezca el idioma de origen explícitamente si lo conoce.

Dividir grabaciones largas. Para grabaciones de varias horas, dividir en trozos de 20-30 minutos le da un giro más rápido y le permite empezar a editar la transcripción mientras el resto sigue procesando.

Revisar los sustantivos y números adecuados. La transcripción de AI constantemente hace tambalear los sustantivos, números de versión y siglas. Desliza la transcripción y fija esto a mano - es más rápido que dejar que se deslicen en los subtítulos finales.

Preguntas frecuentes

¿Cómo transcribo una grabación de video?

Sube el video a un servicio de transcripción AI como ElevenLabs Scribe, OpenZQ3Z Whisper o AssemblyAI. El servicio devuelve una transcripción con marcas de tiempo, generalmente en menos de un minuto para un video de una hora. Si estás grabando en Mac, las grabadoras de pantalla como Tight Studio incluyen la transcripción como una función incorporada para que puedas transcribir y editar en la misma aplicación.

¿Cuál es la herramienta de transcripción de video más precisa?

Para la transcripción puramente automatizada, ElevenLabs Scribe y OpenAI Whisper (large-v3) actualmente lideran los parámetros de precisión, ambos alrededor del 95-97% en audio en inglés limpio. Para la máxima precisión, servicios verificados por humanos como Rev producen transcripciones casi perfectas pero a un costo significativamente mayor.

¿Puedo transcribir un video gratis?

Sí. Las dos principales opciones gratuitas son ejecutar OpenAI Whisper localmente en su propio ordenador, y el uso de niveles libres de servicios como Otter.ai (con un límite de unos pocos cientos de minutos al mes).

¿Cuánto tiempo se tarda en transcribir una hora de video?

Los servicios de Cloud AI suelen devolver una transcripción en 1-5 minutos para una hora de audio. Susurro local en un Mac reciente toma 5-15 minutos por una hora, dependiendo del tamaño del modelo. La transcripción manual generalmente toma 4-6 horas por hora de audio.

¿Cuál es la diferencia entre una transcripción y los subtítulos?

Una transcripción es una versión de texto plano del audio hablado, útil para leer o repurponer el contenido. Las letras son texto cronometrado superpuesto en el video, utilizado mientras se mira. La mayoría de las herramientas de transcripción pueden producir ambos - el formato cronometrado (SRT o VTT) es subtítulos, la versión de texto plano es la transcripción.

¿Puedo editar una transcripción dentro del editor de video?

Sí, en editores que lo soportan. Tight Studio y Descript ambos le permiten editar transcripciones en línea junto a la línea de tiempo del video. Las palabras permanecen vinculadas a sus marcas de tiempo, por lo que las correcciones no rompen el tiempo de los subtítulos.

¿La transcripción de video funciona en idiomas distintos del inglés?

Sí. La mayoría de los servicios de transcripción modernos soportan más de 50 idiomas. ElevenLabs Scribe y OpenAI Whisper ambos soportan más de 90 idiomas. La precisión es más alta para el inglés y otros idiomas ampliamente hablados, y disminuye un poco para los idiomas con menos datos de entrenamiento.

compartir en x