Cómo transcribir una entrevista: transcripciones con hablantes y citables

2026-07-15
KKevin Wong

Transcribir una entrevista se reduce, en el fondo, a tres cosas: el texto tiene que ser exacto, tiene que mostrar quién dijo cada línea y tiene que poder citarse tal cual. Tanto si haces investigación cualitativa, entrevistas de UX, periodismo o simplemente entregas un trabajo de clase, no quieres una aproximación tosca: quieres un texto que puedas codificar línea por línea y citar directamente en un artículo o un trabajo.

Hay tres grandes vías: teclearlo a mano, las herramientas gratuitas de subtítulos automáticos y el reconocimiento de voz con IA. Esta guía explica las concesiones de cada una y luego muestra cómo usaría el modo transcripción de Subanana para convertir la grabación de una entrevista en una transcripción con identificación de hablantes, puntuación y párrafos, de modo que la limpieza manual posterior sea lo más pequeña posible. La versión corta de entrada: la transcripción con IA se ocupa de unas nueve décimas partes del trabajo pesado, y a ti te queda una única pasada de revisión final.

Transcribir una entrevista con Subanana — transcripciones con hablantes y citables

¿En qué se diferencia una transcripción de entrevista de unos subtítulos?

Mucha gente, la primera vez que usa una herramienta, trata «los subtítulos» y «una transcripción» como si fueran lo mismo, y acaba con un archivo que no puede aprovechar. Son dos entregables distintos:

  • Los subtítulos están pensados para leerse en pantalla sobre un vídeo: cortados en líneas breves con marca de tiempo, por convención sin puntuación, y exportados como SRT o VTT.
  • Una transcripción está pensada para que la lea una persona: necesita puntuación, párrafos e identificación de hablantes para que puedas leerla de arriba abajo, anotarla y extraer citas.

Una transcripción de entrevista es del segundo tipo. Así que si eliges el modo equivocado en una herramienta —pasando una entrevista por un flujo de subtítulos— obtienes un muro de fragmentos breves, con marca de tiempo y sin puntuación, con los que en realidad cuesta más trabajar. Por eso esta guía insiste una y otra vez: elige el modo transcripción.

Las concesiones entre las tres vías

Vía 1: la transcripción manual

El método más tradicional y el de mayor techo de precisión: escuchas y tecleas tú mismo, línea por línea.

  • A favor: controlas cada palabra. El tono, las pausas, los solapamientos al hablar: puedes anotarlo todo exactamente como lo exige tu investigación.
  • Límite: es lentísimo. Una regla práctica habitual en el sector dice que una hora de audio lleva de cuatro a seis horas de mecanografiado, y es aún más lento con varios hablantes, acentos marcados o mala calidad de grabación. Para un reportero contra reloj o un investigador que lleva varias entrevistas a la vez, ese coste de tiempo suele superar el presupuesto disponible.

Vía 2: las herramientas gratuitas de subtítulos automáticos

Muchas herramientas gratuitas —los subtítulos automáticos de las plataformas de vídeo, los sitios de transcribir en línea— generan texto rápido.

  • A favor: rápidas, gratuitas, con poca barrera de entrada.
  • Límite: con voces acentuadas e idiomas menos comunes, la tasa de error es claramente más alta; la mayoría no separa a los hablantes, así que toda la entrevista se mezcla y no puedes saber quién dijo cada línea; y, por lo general, no añaden puntuación ni párrafos, así que se lee como un bloque compacto. Sirve para un clip corto en inglés, pero para una entrevista que piensas citar, después dedicarás a menudo mucho tiempo a reestructurarla.

Vía 3: las herramientas de reconocimiento de voz con IA

Si lo que quieres es «que la transcripción sea legible y citable en cuanto la recibo», la transcripción con IA es hoy el punto intermedio más práctico. La herramienta vuelve a transcribir el audio con un modelo de reconocimiento de voz, añade puntuación, párrafos e identificación de hablantes, y luego te deja revisar en un editor.

  • A favor: mucho más rápida que teclear a mano; más precisa que las herramientas gratuitas, y separa a los hablantes y añade puntuación y párrafos de forma automática.
  • Concesión (que conviene decir con claridad): la transcripción con IA no sustituye a la revisión final. Antes de citar a alguien textualmente, deberías seguir haciendo una pasada humana: comprobar nombres, nombres propios y cifras clave. Una precisión alta no significa cero errores, y cuanto más peso tiene una cita, más merece la pena verificarla.

La siguiente sección muestra cómo recorrería la tercera vía con Subanana.

¿Cómo convertir el audio de una entrevista en una transcripción con Subanana?

Como dirijo Subanana, lo usaré para recorrer todo el proceso. Donde se gana su sitio para la transcripción de entrevistas es en la precisión multilingüe, la identificación de hablantes (diarización), la eliminación automática de muletillas y la puntuación y división en párrafos automáticas.

El primer paso decisivo es elegir el modo correcto. Subanana tiene un modo subtítulos, un modo transcripción y un modo reunión; para una transcripción de entrevista quieres el modo transcripción, porque es el que añade la puntuación, divide el texto en párrafos por sentido y produce algo legible. El modo subtítulos solo te da líneas de subtítulos breves y con marca de tiempo. El proceso tiene cuatro pasos:

  1. Importar la grabación. Sube el archivo de audio o vídeo de la entrevista (.mp4 / .mov / .webm / .ogg), o pega un enlace público de YouTube / Instagram / Facebook para importarlo directamente. Si la entrevista está tras un enlace privado o de acceso restringido, usa mejor la subida de archivo.
  2. Elegir el modo transcripción y fijar el idioma de origen. Entra en el modo transcripción y elige el idioma de la grabación. Subanana cubre más de 80 idiomas, así que la mayoría de las grabaciones de entrevista están dentro del alcance. Pon el número de hablantes en detección automática (o escribe la cantidad a mano) y activa la puntuación y la división en párrafos automáticas.
  3. Revisar y etiquetar a los hablantes. Cuando termina la transcripción, llegas al editor. El sistema separa las distintas voces en Hablante 1, Hablante 2, y así sucesivamente, elimina las muletillas («eh», «¿sabes?») y depura el texto. Desde aquí puedes:
    • Renombrar a los hablantes: cambia Hablante 1 por «Entrevistador» y Hablante 2 por «Participante A», y toda la transcripción se actualiza al instante, algo práctico para citar y anotar línea por línea más adelante.
    • Corregir palabras mal oídas: haz clic en cualquier palabra y edítala directamente. Para las palabras con más probabilidad de salir mal —nombres de personas, nombres de organizaciones, términos técnicos— crea primero un glosario, y el sistema dará preferencia a tus grafías mientras transcribe.
    • Conversar con la transcripción: dentro del editor puedes preguntarle a la IA directamente —«¿dónde menciona el Participante A X?» o «extrae los tres argumentos principales»—, lo que ahorra mucho tiempo en una entrevista larga.
  4. Exportar. Elige el formato que necesites. Para transcripciones, las opciones más habituales son DOCX (Word, listo para editar) o TXT (para volcarlo en Obsidian, Notion u otra herramienta de notas); para citar, codificar o anotar, XLSX dispone los códigos de tiempo, el hablante y el texto en forma de tabla. También se admiten VTT, SRT y Markdown.

Una vez revisada y exportada, la transcripción de la entrevista encaja directamente en tu trabajo, tu artículo o tu análisis. Para entender cómo están diseñados los modos, consulta Subtitulado y transcripción con IA y Transcripción de reuniones con IA.

¿Y si la entrevista es multilingüe o tiene acentos?

Aquí es precisamente donde las herramientas de voz de uso general suelen ser más débiles: con voces acentuadas e idiomas fuera del grupo habitual en torno al inglés. Conviene comprobar dos cosas al elegir una herramienta:

  • Precisión entre idiomas: Subanana evalúa de forma continua los modelos de reconocimiento de voz disponibles y elige el de mejor rendimiento para cada idioma de origen, en lugar de atarse a un único proveedor. Y si una transcripción sale mal, se vuelve a ejecutar automáticamente en otro modelo, una repetición que no te cuesta minutos adicionales.
  • Traducir la transcripción: una entrevista puede grabarse en un idioma cuando necesitas la transcripción en otro. El modo transcripción admite un único idioma de destino para la traducción, así que puedes transcribir en el idioma de origen y traducir a otro idioma en la misma pasada.

Conviene señalar un límite: el cambio de idioma a mitad de frase —un hablante que pasa de un idioma a otro dentro de una misma frase y la herramienta detecta el cambio en tiempo real— es un punto fuerte de la función de subtítulos en directo de Subanana, no del modo transcripción. Para la transcripción de entrevistas te apoyas en la precisión multilingüe y la identificación de hablantes, no en el cambio de idioma dentro de la frase en tiempo real. Si necesitas subtítulos en directo en un evento real, consulta Transcripción en tiempo real con IA.

Preguntas frecuentes sobre la transcripción de entrevistas

¿El plan gratuito puede producir una transcripción de entrevista completa? Puedes procesar una grabación y previsualizar el resultado, pero exportar es un paso de pago. El plan gratuito no permite descargar los archivos de subtítulos o transcripción, y tampoco puedes seleccionar y copiar el texto en el editor: la única salida es un vídeo con marca de agua, solo los primeros 5 minutos, a 720p, con un límite de 3 GB por archivo. Para exportar archivos de transcripción aprovechables (DOCX / TXT / XLSX) necesitas un plan de pago (que además sube el límite por archivo a 15 GB / 3 horas). Consulta la página de precios para ver el detalle.

¿Distingue quién dijo qué en una entrevista con varios hablantes? Sí. El modo transcripción admite la identificación de hablantes: separa automáticamente Hablante 1, Hablante 2, y así sucesivamente, y puedes renombrarlos con los roles reales (Entrevistador, Participante A) en el editor, con toda la transcripción actualizándose al instante.

¿Puedo citar directamente una transcripción hecha por IA? Yo haría antes una pasada de revisión humana. La transcripción con IA resuelve la gran mayoría del texto y la división en párrafos, pero los puntos donde una palabra equivocada de verdad importa —nombres, nombres propios, cifras clave— merecen una comprobación línea por línea, sobre todo en los pasajes donde vas a citar textualmente a un participante. 3 consejos para la transcripción con IA explica cómo revisar de forma más eficiente.

¿Funciona con una grabación de entrevista larga (de una a dos horas)? Sí. Los planes de pago admiten hasta 15 GB / 3 horas por archivo, lo que cubre la mayoría de las grabaciones de entrevista. Para una entrevista larga usaría primero el chat de IA del editor para localizar los pasajes clave y luego revisaría de cerca las partes que piensas citar.

Impulsa Tu Eficiencia con Subanana

No se requiere método de pago
Gratis Trial
Cancelar en Cualquier Momento