Diarización de hablantes: cómo la IA añade etiquetas de hablante a una transcripción
La diarización de hablantes es el proceso que responde a la pregunta «quién habló y cuándo» en una grabación de audio. Cuando transcribes una entrevista o una reunión, la diarización es la capa que divide el texto corrido en turnos y etiqueta cada uno —Hablante 1, Hablante 2, Hablante 3— para que la transcripción se lea como una conversación en lugar de como un único muro indiferenciado de palabras. Es lo que convierte un dictado en bruto en un registro utilizable de una discusión.
Esta explicación cubre qué es realmente la diarización, cómo asigna la IA las etiquetas por dentro, por qué importa en entrevistas, reuniones e investigación, y los pasos prácticos que hacen esas etiquetas más precisas. Cada afirmación técnica que sigue cita una página de documentación de un servicio de transcripción en vivo, para que puedas comprobar la fuente por ti mismo.

¿Qué es la diarización de hablantes?
La diarización de hablantes es la tarea de dividir un flujo de audio según la identidad de quien habla. El motor de transcripción no necesita saber quiénes son las personas por su nombre: solo determina cuántas voces distintas hay presentes y qué segmentos del habla pertenecen a cada una. La documentación de Cloud Speech-to-Text de Google describe el resultado con claridad: el resultado de la transcripción etiqueta cada palabra con un número asignado a cada hablante individual, y las palabras pronunciadas por el mismo hablante llevan el mismo número. (Documentación de Google Cloud Speech-to-Text)
Conviene separar algunos términos, porque se confunden con frecuencia:
- Transcripción convierte el habla en palabras.
- Diarización agrupa esas palabras por hablante y asigna etiquetas anónimas (Hablante 1, Hablante 2…).
- Identificación de hablantes (o reconocimiento de hablantes) va un paso más allá y asocia una identidad conocida a una voz; esto suele requerir una muestra de voz o un fragmento de referencia de antemano, y la mayoría de los flujos de transcripción lo omiten.
Así que «etiquetas de hablante en una transcripción» es diarización, no identificación. Las etiquetas son marcadores de posición que renombras tú mismo una vez que sabes quién es quién.
También es distinta de la separación por canales. Si cada persona se grabó en su propia pista de audio —un pódcast donde cada invitado tiene un micrófono dedicado, o la grabación de un centro de llamadas con el agente en un canal y el cliente en otro— no necesitas diarización en absoluto. AWS llama a esto identificación de canales y lo trata como un enfoque distinto de la partición por hablante. (Documentación de AWS Transcribe) La diarización es el caso más difícil y más habitual: varias personas en una única pista mezclada.
¿Cómo asigna la IA las etiquetas de hablante?
La diarización no es el mismo modelo que el que escribe las palabras. Se ejecuta como una capa junto a la transcripción y, a grandes rasgos, hace cuatro cosas:
- Detección de actividad de voz: encuentra los tramos que contienen habla y descarta el silencio y el ruido.
- Segmentación: corta el habla en fragmentos cortos y homogéneos, dividiéndola en los puntos donde cambian las características de la voz (un probable cambio de turno de hablante).
- Incrustación (embedding): convierte cada segmento en una huella vocal numérica que captura el tono, el timbre y otros rasgos acústicos, con independencia de las palabras realmente pronunciadas.
- Agrupamiento (clustering): reúne los segmentos con huellas similares. Cada grupo se convierte en una etiqueta de hablante.
Las etiquetas se vuelven a adjuntar entonces a la transcripción. AWS Transcribe, por ejemplo, puede diferenciar entre un máximo de 30 hablantes únicos y etiqueta a cada uno con un valor como spk_0 hasta spk_9, devolviendo una sección speaker_labels aparte con la hora de inicio y de fin de cada intervención. (Documentación de AWS Transcribe) El resultado de Google funciona del mismo modo a nivel de palabra: adjunta un número speakerLabel a cada palabra y señala que un resultado puede incluir números hasta tantos hablantes como Cloud Speech-to-Text pueda identificar de forma única en la muestra de audio. (Documentación de Google Cloud)
Un matiz importante: la diarización no es universal en todos los modelos de voz. La documentación de OpenAI señala que sus modelos base de transcripción no admiten de forma nativa el etiquetado de hablantes, y que la diarización la gestiona un modelo dedicado, con capacidad de diarización, que produce transcripciones con reconocimiento de hablante. (Guía de Speech-to-Text de OpenAI) Dicho de otro modo, el motor que mejor escribe las palabras no es automáticamente el que mejor traza los límites entre hablantes, y es precisamente por eso que un producto de transcripción que evalúa y enruta entre varios modelos tiene aquí una ventaja. Este es el enfoque detrás de la herramienta de transcripción con IA de Subanana: el sistema evalúa de forma continua los modelos de voz y elige el de mejor rendimiento para el idioma de origen y la tarea, en lugar de quedarse atado a un único proveedor.
¿Por qué importan las etiquetas de hablante?
Sin diarización, una grabación con varias personas se transcribe en un único bloque de texto en el que no puedes distinguir una pregunta de su respuesta. Las etiquetas son lo que hace la transcripción navegable y citable. Tres contextos donde esto resulta decisivo:
- Entrevistas y periodismo. La atribución es la cuestión central. Necesitas saber exactamente qué frase dijo la fuente frente a lo que planteó quien entrevistaba, y la necesitas con marca de tiempo para poder verificarla contra el audio antes de publicar una cita.
- Reuniones y actas. El «quién se comprometió a qué» solo funciona si las tareas pendientes están vinculadas a una persona. Una transcripción diarizada te permite recorrer una reunión por hablante y extraer las decisiones y los seguimientos de cada participante.
- Investigación cualitativa y estudios de experiencia de usuario. Quienes codifican grupos focales o entrevistas de usuario analizan las respuestas por participante. Los turnos de hablante son la unidad de análisis; sin ellos, no puedes separar el encuadre del moderador de la reacción del participante.
- Registros legales, médicos y de cumplimiento. Una consulta médico-paciente o una declaración solo sirven como registro si cada afirmación se atribuye correctamente.
En todos estos casos, la calidad de la diarización determina cuánta limpieza manual harás después. Unas buenas etiquetas ahorran horas; unas malas obligan a volver a escuchar el audio para corregir turnos mal atribuidos. Por eso la diarización es una parte central del modo transcripción de Subanana, que produce una transcripción limpia y legible con identificación de hablantes, eliminación automática de muletillas, y puntuación y división en párrafos automáticas del texto de origen.
¿Qué afecta a la precisión de la diarización?
La diarización es más difícil que la transcripción y se degrada bajo condiciones concretas. Los factores más importantes:
| Factor | Efecto sobre las etiquetas de hablante | Qué ayuda |
|---|---|---|
| Habla superpuesta | Que la gente hable a la vez difumina las huellas vocales | Fomentar que hable una persona a la vez; contar con algunas correcciones manuales en los cruces de voces |
| Calidad del audio | El ruido de fondo y la baja tasa de bits enturbian los rasgos acústicos | Grabar cerca del micrófono; reducir el ruido ambiente |
| Voces parecidas | Dos hablantes con tono o timbre próximos pueden fundirse en una sola etiqueta | Más audio por hablante ayuda al modelo a separarlos |
| Turnos muy cortos | Las interjecciones de una sola palabra dan poco material que el modelo pueda usar como huella | Inevitable; se corrige en el editor |
| Número de hablantes desconocido | El modelo tiene que adivinar cuántos grupos formar | Indícale el número de hablantes si lo conoces |
Ese último punto es el consejo con mayor efecto. La mayoría de los motores aceptan una pista con el número de hablantes, y proporcionarla restringe la fase de agrupamiento para que no divida ni de más ni de menos. Speech-to-Text de Google exige fijar los valores min_speaker_count y max_speaker_count según cuántos hablantes esperes, y AWS te permite pasar un valor MaxSpeakerLabels al iniciar un trabajo. (Documentación de Google Cloud · Documentación de AWS Transcribe)
Cómo obtener etiquetas de hablante precisas en Subanana
El modo transcripción de Subanana ejecuta la diarización de forma automática y te da control sobre las entradas que más importan. El flujo de trabajo:
| Paso | Acción |
|---|---|
| 1. Sube | Añade tu archivo de audio o vídeo, o pega una URL pública de YouTube, Instagram o Facebook para importarlo sin descargarlo localmente |
| 2. Define el idioma de origen | Elige el idioma hablado en la grabación para que el sistema enrute al modelo mejor evaluado para él |
| 3. Indica el número de hablantes | Elige la detección automática, o fija el número de hablantes manualmente si ya lo conoces: la pista manual suele producir una separación más limpia |
| 4. Transcribe | Subanana ejecuta varias capas de calidad: el modelo mejor evaluado por idioma, detección de alucinaciones con sustitución automática de modelo, y marcado de CPS en el editor |
| 5. Renombra y edita | Cambia las etiquetas «Hablante 1 / Hablante 2» por nombres reales en el editor, corrige cualquier turno mal atribuido y aplica la puntuación y la división en párrafos automáticas |
| 6. Exporta | Descarga en TXT, DOCX, XLSX, SRT, VTT o Markdown |
Un par de cosas que conviene saber mientras trabajas:
- Puedes hacer preguntas sobre la transcripción directamente en el editor —por ejemplo, «resume lo que propuso el Hablante 2»— mediante el chat con IA integrado y anclado a tu reunión.
- La revisión asistida por LLM marca las palabras que probablemente se oyeron mal y los caracteres erróneos que suenan igual para que los apruebes, de modo que el texto que revisas ya viene depurado.
Si tus reuniones ocurren en Google Meet o Microsoft Teams, el bot de reuniones activado por el calendario puede grabarlas y transcribirlas una vez terminada la llamada, y luego ejecutar el mismo proceso de diarización y resumen sobre la grabación.
La diarización es una de esas funciones que solo notas cuando falla. La receta práctica es sencilla: dale al motor el audio más limpio que puedas, dile cuántos hablantes debe esperar y usa una herramienta que enrute al modelo más fuerte para tu idioma en lugar de una atada a un único proveedor. Puedes empezar a transcribir gratis y ver las etiquetas de hablante en tu propio audio, o comparar planes en la página de precios.
Preguntas frecuentes
¿Es lo mismo la diarización de hablantes que la identificación de hablantes? No. La diarización separa las voces y asigna etiquetas anónimas (Hablante 1, Hablante 2). La identificación asocia un nombre conocido a una voz y suele necesitar una muestra de referencia. La mayoría de los flujos de transcripción usan la diarización y te dejan renombrar las etiquetas manualmente.
¿Necesito un micrófono separado por persona? No: la diarización funciona sobre una única pista mezclada, que es el caso habitual. Si sí tienes una pista por persona (canales separados), eso es separación por canales, un enfoque distinto y más sencillo, como señala AWS en su documentación. (Documentación de AWS Transcribe)
¿Por qué la transcripción fundió a dos personas en un solo hablante? Normalmente porque sus voces son acústicamente parecidas, el audio era ruidoso o no se le indicó al motor cuántos hablantes esperar. Proporcionar un número de hablantes y usar un audio más limpio son las dos soluciones más eficaces.
¿Todos los modelos de voz a texto admiten etiquetas de hablante? No. Algunos modelos base de transcripción no diarizan de forma nativa y necesitan un modelo aparte con capacidad de diarización, como muestra la documentación de OpenAI. (Guía de Speech-to-Text de OpenAI) Una herramienta que evalúa y enruta entre modelos evita esa limitación de un solo modelo.