Cómo transcribir un vídeo a texto: importar, transcribir, editar, exportar

2026-07-09
KKevin Wong

Para transcribir un vídeo a texto haces cuatro cosas: importar el vídeo, transcribirlo, editar el resultado y exportarlo en el formato que necesites. Todo el trabajo lleva minutos en lugar de las horas que costaría teclearlo a mano. El error que comete la mayoría no está en ninguno de esos pasos, sino en decidir qué tipo de texto quiere en realidad, porque «vídeo a texto» puede significar una transcripción limpia y legible que pegas en un documento, o un archivo de subtítulos SRT con marcas de tiempo que aparece en pantalla sobre el vídeo. Son dos resultados distintos, y elegir el equivocado obliga a repetir el trabajo.

Dirijo Subanana, una aplicación de voz a texto con IA, así que la usaré para recorrer el proceso. Pero los pasos y las decisiones son los mismos sea cual sea la herramienta que elijas. En resumen, por delante: elige primero el resultado correcto, deja luego que la IA haga el trabajo pesado de transcribir y, por último, haz una pasada de revisión humana antes de fiarte del texto.

Cómo transcribir un vídeo a texto: importar, transcribir, editar, exportar

¿Transcripción o subtítulos: qué tipo de texto quieres en realidad?

Antes de transcribir nada, decide el entregable. Una transcripción y un archivo de subtítulos están hechos para tareas distintas:

  • Una transcripción es texto pensado para que lo lea una persona. Tiene puntuación, saltos de párrafo y etiquetas de hablante, de modo que puedes leerla de principio a fin, buscar en ella, anotarla y extraer citas. La exportas como DOCX, TXT o una hoja de cálculo.
  • Los subtítulos son texto pensado para leerse en pantalla sobre un vídeo. Están divididos en líneas cortas con marcas de tiempo que se sincronizan con el audio, escritas por convención sin puntuación (la convención habitual de los subtítulos, no un defecto), y se exportan como SRT o VTT para que un reproductor de vídeo pueda mostrarlas.

Esta es la diferencia práctica, lado a lado:

TranscripciónArchivo de subtítulos SRT
Hecho paraLeer, buscar, citarMostrarse en pantalla sobre el vídeo
Puntuación y párrafosNo (convención de subtítulos)
Marcas de tiempoOpcionales (por línea, en una exportación de tabla)Sí: cada línea va sincronizada al tiempo
Etiquetas de hablanteSí (Hablante 1, Hablante 2…)No
Exportación típicaDOCX, TXT, XLSXSRT, VTT
Úsalo paraEntrevistas, pódcast, clases, actas de reunión, reaprovechar en artículosSubtítulos de YouTube, vídeos de cursos, clips para redes

Si quieres leer o reaprovechar el contenido —convertir un seminario web en una entrada de blog, citar una entrevista, estudiar una clase—, quieres una transcripción, y deberías pasar el vídeo por el modo transcripción. Si quieres subtítulos que se muestren sobre el vídeo, quieres subtítulos, y usarías en su lugar un flujo de subtitulado. El resto de esta guía trata del camino de la transcripción, porque eso es lo que casi siempre significa «transcribir un vídeo a texto».

Una distinción más que conviene tener clara: transcribir no es traducir. Transcribir convierte las palabras habladas de un vídeo en texto en el mismo idioma en que se dijeron. Traducir lleva ese texto a otro idioma. Son pasos separados: puedes transcribir un vídeo en japonés a texto en japonés y, después, si lo necesitas, traducirlo al español en una segunda pasada. No des por hecho que «transcribir» te dará texto en español si quien habla no hablaba español.

¿Cómo transcribir un vídeo a texto, paso a paso?

Este es el flujo de principio a fin. En Subanana se ve así, y la estructura es similar en la mayoría de las herramientas de transcripción con IA:

PasoQué hacesQué obtienes
1. ImportarSube el archivo o pega el enlace de un vídeo públicoEl vídeo en cola para transcribir
2. TranscribirElige el modo transcripción + el idioma habladoUn borrador de transcripción con hablantes y puntuación
3. EditarRevisa, corrige nombres, etiqueta hablantesUna transcripción limpia y exacta
4. ExportarElige tu formato de textoUn archivo utilizable (DOCX / TXT / XLSX…)

Paso 1 — Importar el vídeo

Tienes dos vías de entrada:

  • Sube un archivo. Arrastra un .mp4, .mov, .webm o .ogg. En un plan de pago, los archivos pueden llegar a 15 GB o 3 horas, lo que cubre la mayoría de las grabaciones largas: una clase completa, un seminario web, una entrevista de dos horas.
  • Pega un enlace público. En lugar de descargar primero, puedes pegar una URL pública de YouTube, Instagram o Facebook y la herramienta obtiene el vídeo y lo transcribe por ti. Esto funciona tanto para vídeos normales como para formatos cortos (YouTube Shorts, Reels de Instagram, Reels de Facebook). Si el contenido es privado, tiene restricción de edad, es solo para miembros o está de algún otro modo tras un inicio de sesión, la importación por enlace puede fallar; en ese caso, descarga el archivo y súbelo.

Esta importación por URL resulta de lo más práctica cuando el vídeo ya está alojado en una plataforma: consulta la herramienta de IA «vídeo a texto» para el flujo basado en enlaces.

Paso 2 — Elegir el modo transcripción y el idioma hablado

Este es el paso que decide si obtienes texto legible o un muro de fragmentos de subtítulos. Subanana tiene un modo subtítulos, un modo transcripción y un modo reunión. Para una transcripción legible, elige el modo transcripción: añade puntuación, divide el texto en párrafos según el sentido y pule la redacción. (El modo subtítulos te daría, en cambio, líneas cortas con marcas de tiempo y sin puntuación.)

Luego configura:

  • Idioma de origen: el idioma que realmente se habla en el vídeo. Subanana cubre más de 80 idiomas, así que la mayoría de las grabaciones entran en su alcance, y elige el modelo de reconocimiento de voz con mejor rendimiento para ese idioma concreto en lugar de ceñirse a un único proveedor.
  • Número de hablantes: ponlo en detección automática o escribe la cantidad si ya la conoces. Esto impulsa la identificación de hablantes (diarización).
  • Puntuación y párrafos automáticos: actívalos para un resultado de transcripción. Es la función que hace que el resultado sea realmente legible.

Paso 3 — Editar y revisar

Cuando termina la transcripción, llegas al editor con un borrador que ya tiene los hablantes separados, las muletillas («eh», «o sea») eliminadas y la puntuación puesta. Ahora haces la pasada humana:

  • Etiqueta a los hablantes. Cambia el nombre de Hablante 1 a «Presentador», de Hablante 2 a «Invitado», y toda la transcripción se actualiza a la vez: útil para citar más adelante.
  • Corrige palabras mal entendidas. Haz clic en cualquier palabra y edítala. Para las palabras con más probabilidades de hacer tropezar a cualquier modelo de voz —nombres de personas, nombres de marca, jerga— crea primero un glosario (una lista para todo el espacio de trabajo o una propia de cada proyecto, con importación masiva desde XLSX/CSV), y el sistema preferirá tus grafías mientras transcribe.
  • Chatea con la transcripción. Dentro del editor puedes hacerle preguntas a la IA sobre el contenido —«¿dónde hablan de precios?» o «resume la segunda mitad»—, lo que ahorra tiempo en un vídeo largo.

Una nota sobre las expectativas: la transcripción con IA hace la inmensa mayoría del trabajo, pero no elimina la revisión final. Antes de citar a nadie o publicar el texto, comprueba tú mismo los nombres, los nombres propios y las cifras clave. Una alta exactitud no es lo mismo que cero errores.

Paso 4 — Exportar el texto

Elige el formato que encaje con lo que vas a hacer a continuación:

  • DOCX: un archivo de Word listo para editar, dar formato y entregar.
  • TXT: texto plano para soltar en Obsidian, Notion o cualquier herramienta de notas.
  • XLSX: una hoja de cálculo que dispone marca de tiempo, hablante y texto en columnas, ideal para codificar entrevistas o crear archivos consultables.
  • VTT / SRT / Markdown: también disponibles si los necesitas.

Ese es el ciclo completo. Para los detalles de modelo y exactitud que hay detrás, consulta cómo funciona la transcripción de Subanana o la página dedicada a la herramienta de transcripción de vídeo.

¿Y la exactitud, los acentos y otros idiomas?

Aquí es donde las herramientas de uso general suelen flojear más, así que vale la pena saber en qué fijarse:

  • Exactitud por idioma. La exactitud varía mucho según el idioma y según lo limpio que sea el audio. Subanana evalúa de forma continua los modelos de reconocimiento de voz disponibles y dirige cada transcripción al de mejor rendimiento para el idioma de origen concreto, en lugar de usar un único modelo para todo. Si una transcripción sale mal, el sistema vuelve a ejecutar automáticamente las partes afectadas con otro modelo, y esa nueva ejecución no te cuesta minutos adicionales.
  • Audio con acento o ruido. Ninguna herramienta es inmune a una mala grabación. Cuanto más limpio entre el audio, más limpio sale el texto: un micrófono decente y poco ruido de fondo hacen más por la exactitud que cualquier ajuste.
  • Varios hablantes. La identificación de hablantes separa las voces automáticamente, pero es un paso de «mejor esfuerzo»; en una discusión acalorada entre varias personas que se pisan al hablar, cuenta con corregir a mano algunas atribuciones en el editor.

Si tu vídeo es una reunión grabada y no una sola charla, la transcripción de reuniones con IA de Subanana añade encima un resumen estructurado —decisiones, tareas, responsables—, que suele ser lo que de verdad quieres de la grabación de una reunión.

¿Cuándo conviene usar un archivo de subtítulos SRT en lugar de una transcripción?

Recurre a subtítulos (SRT/VTT), y no a una transcripción, cuando el texto deba aparecer sobre el vídeo en lugar de leerse por sí solo:

  • Publicas el vídeo en YouTube o en una plataforma de cursos y quieres subtítulos que el público pueda activar.
  • Publicas clips de formato corto en redes y quieres subtítulos incrustados para verlos sin sonido.
  • Necesitas líneas con marcas de tiempo y sincronizadas que un reproductor de vídeo pueda mostrar, no párrafos.

En esos casos usarías el flujo de subtitulado, que genera archivos SRT o VTT alineados en el tiempo. Y si los subtítulos deben estar en un idioma distinto al del habla, eso es transcripción más traducción: transcribe el audio y luego añade un idioma de destino de traducción. (Ten en cuenta que el subtitulado en tiempo real, en directo durante un evento, es de nuevo una función aparte —consulta la transcripción en tiempo real con IA— y no forma parte de transcribir un archivo de vídeo ya existente.)

La regla más sencilla: si una persona va a leer el texto, haz una transcripción; si un reproductor de vídeo va a mostrar el texto, haz subtítulos.

Preguntas frecuentes

¿Transcribir un vídeo es lo mismo que añadirle subtítulos? No. Transcribir produce texto legible (una transcripción) que exportas como documento; añadir subtítulos produce líneas de subtítulos con marcas de tiempo (SRT/VTT) que se muestran sobre el vídeo. Misma fuente, resultados distintos: decide cuál necesitas antes de empezar. La tabla comparativa de más arriba en esta guía detalla las diferencias.

¿Puede el plan gratuito transcribir un vídeo entero y dejarme descargar el texto? Puedes ejecutar un vídeo y ver el resultado en vista previa, pero exportar es un paso de pago. El plan gratuito no admite la descarga de archivos de transcripción ni de subtítulos, y tampoco puedes seleccionar y copiar el texto en el editor: su único resultado es un vídeo con marca de agua, solo los primeros 5 minutos, a 720p, con un límite de 3 GB por archivo. Para exportar archivos de texto utilizables (DOCX / TXT / XLSX) necesitas un plan de pago, que además sube el límite a 15 GB / 3 horas por archivo. Consulta los precios para ver los detalles.

¿Qué formatos y duraciones de vídeo admite? Puedes subir archivos .mp4, .mov, .webm y .ogg, o pegar un enlace público de YouTube / Instagram / Facebook. En un plan de pago el tope es de 15 GB o 3 horas por archivo, lo que cubre la mayoría de las grabaciones largas. Los enlaces privados o con acceso restringido puede que no se importen, así que para esos usa la subida de archivo.

¿Transcribirá un vídeo en un idioma distinto del español? Sí. Subanana admite más de 80 idiomas y transcribe en el idioma que realmente se habla. Si además necesitas el texto en otro idioma, eso es un paso de traducción aparte: el modo transcripción admite un único idioma de destino de traducción junto al original. Herramientas como la herramienta de transcripción con IA y la herramienta de voz a texto con IA parten del mismo motor multilingüe.

¿Qué exactitud tiene la transcripción de vídeo con IA? La exactitud depende en gran medida del idioma y de la calidad del audio, y es lo bastante alta como para que el grueso del trabajo quede hecho por ti, pero no es perfecta. Haz siempre una pasada de revisión de nombres, nombres propios y cifras antes de fiarte del texto o publicarlo. Para un recorrido estructurado de los pasos de edición, consulta cómo transcribir una entrevista.

¿Puedo transcribir una reunión grabada y obtener también un resumen? Sí: eso es el modo reunión, en lugar del simple modo transcripción. Produce la transcripción más un resumen estructurado de decisiones y tareas. Consulta la guía de transcripción de Google Meet para ver cómo funciona de principio a fin.

Impulsa Tu Eficiencia con Subanana

No se requiere método de pago
Gratis Trial
Cancelar en Cualquier Momento