Un subtítulo automático generado con buen audio y un solo hablante suele acertar la inmensa mayoría de las palabras. Pero los errores que quedan casi nunca se distribuyen al azar: se concentran en nombres propios, jerga del sector, dos personas hablando a la vez y tramos con ruido de fondo. Repaso abajo esos fallos previsibles, cómo detectarlos en minutos en vez de ver el vídeo entero, y qué hace falta para que un subtítulo automático sea publicable sin retoques.
Dirijo Subanana, una herramienta de subtítulos y transcripción con IA, y más abajo enseño cómo la uso.

¿Cuándo basta un subtítulo automático tal cual?
Tres condiciones juntas suelen dar un resultado publicable sin apenas tocar nada:
- Un solo hablante, sin solaparse con nadie. El reconocimiento de voz separa mal el audio cuando dos personas hablan a la vez: la transcripción intenta meter ambas voces en una sola línea y el resultado es prosa mezclada, no un error de ortografía puntual.
- Audio limpio, sin música de fondo ni eco de sala. Cuanto más se acerque la grabación a una voz grabada con micrófono de solapa o USB en una habitación tratada acústicamente, menos margen de error tiene el motor de voz-a-texto.
- Vocabulario general, sin nombres propios raros ni jerga técnica. Un modelo de voz-a-texto acierta "reunión" o "presupuesto" casi siempre; con un apellido poco común, un acrónimo interno o el nombre de un producto, la tasa de acierto baja notablemente porque el modelo no tiene ese término en su vocabulario de entrenamiento.
Si tu vídeo cumple las tres, un vistazo rápido de 30 segundos por si el software se ha comido alguna palabra suele bastar antes de publicar.
¿Qué fallos hay que revisar siempre?
Cuando falta alguna de esas tres condiciones, el error no es aleatorio: se concentra en zonas predecibles:
- Varios hablantes a la vez o entrevistas rápidas. El motor puede fusionar dos frases en una, atribuir mal quién dijo qué, o simplemente perder palabras en el solape.
- Nombres propios, marcas y jerga. Nombres de empresas, apellidos poco comunes, siglas internas: el motor sustituye por la palabra que más se parece fonéticamente, que casi nunca es la correcta.
- Ruido de fondo o audio de sala con eco. Tráfico, aire acondicionado, un evento en directo con público: cualquier ruido de fondo constante hace que el motor "oiga" palabras que no están.
- Homófonos según el contexto. Palabras que suenan igual pero se escriben distinto según lo que se quiere decir: el motor elige la más frecuente estadísticamente, no necesariamente la correcta para esa frase.
- Legibilidad del subtítulo, no solo el texto. Aunque cada palabra esté bien transcrita, un subtítulo con demasiados caracteres para el tiempo que está en pantalla obliga al espectador a leer más rápido de lo cómodo. Esto es un problema de formato, no de precisión, y las herramientas que solo revisan "¿está bien escrita la palabra?" no lo detectan.

Cómo se generan los subtítulos automáticos en Subanana, y qué hace con estos fallos
Genero el subtítulo eligiendo el idioma de origen (y, si quiero, uno o más idiomas de traducción en la misma tanda) y subo el archivo, vídeo o solo audio. A partir de ahí, el sistema aplica varias capas y me deja revisar el resultado antes de darlo por bueno:
- Asignación a distintos motores de voz-a-texto según el idioma. Subanana evalúa continuamente varios motores y dirige cada transcripción al que mejor rinde para ese idioma de origen: no hay un único motor fijo para todos los casos.
- Detección de alucinación con reintento automático. Si la salida de un tramo concreto parece inconsistente, el sistema lo vuelve a procesar con otro motor evaluado antes de entregármelo, y ese reintento interno no se cobra aparte.
- Corrección con IA sobre el texto ya transcrito, que me propone arreglos de palabras mal oídas u homófonos y yo acepto o descarto uno por uno. No reformula la prosa por claridad: eso solo existe en transcripción y reuniones, nunca en subtítulos, porque un subtítulo debe seguir el ritmo del habla, no reescribirse. Lo que esta capa no hace es detectar palabras que el motor se saltó por completo: si el reconocimiento de voz no oyó una palabra, ninguna capa de corrección de texto puede adivinar que falta, porque solo trabaja sobre lo que ya está transcrito.
- Aviso de legibilidad (CPS) para cada línea. Esta es una regla determinista: cuenta caracteres por segundo y marca la línea si sobra o falta tiempo para leerla cómodamente. No es una IA "adivinando" cuán segura está de una palabra. Me señala exactamente qué líneas revisar por ritmo de lectura, en vez de tener que repasar el vídeo entero para encontrarlas.
Con esto, la revisión manual se reduce a las líneas marcadas por el aviso de legibilidad más los tramos con nombres propios o solape de voces, no todo el vídeo palabra por palabra.
Exportar el resultado
Una vez revisado, el archivo se exporta en SRT, VTT, TXT, DOCX, XLSX o Markdown, o como vídeo con el subtítulo ya incrustado (con o sin una segunda pista de traducción en el mismo archivo). El plan gratuito transcribe los primeros 15 minutos de cada archivo (hasta 3 archivos al mes) para que veas el resultado, pero su única exportación es un vídeo con marca de agua (máximo 5 minutos, 720p): para sacar el SRT limpio o el vídeo sin marca de agua hace falta un plan de pago.
Si vas a añadir el subtítulo en un editor concreto en vez de generar un archivo SRT suelto, ya tenemos guías paso a paso para TikTok y CapCut; y si la duda es qué camino tomar entre el subtitulado nativo del editor y generar el archivo aparte, esa decisión la cubrimos en cómo poner subtítulos a un vídeo.
Preguntas frecuentes
¿Cómo activo los subtítulos automáticos? Depende de dónde publiques: TikTok e Instagram los generan en el propio editor antes de publicar el vídeo; YouTube los genera solo automáticamente después de subir el vídeo, y se gestionan desde YouTube Studio. Si prefieres generar el archivo de subtítulos aparte, para revisarlo antes, traducirlo o quemarlo en el vídeo, sube el archivo a una herramienta de subtítulos con IA como Subanana.
¿Cómo consigo subtítulos automáticos gratis? Los subtítulos nativos de TikTok, Instagram y YouTube son gratuitos y suficientes para contenido casual de un solo hablante. Para un archivo SRT separado, revisable o traducible, la mayoría de herramientas, incluida Subanana, dejan generar y previsualizar el resultado gratis; exportar el archivo limpio sin marca de agua suele requerir un plan de pago.
¿Cómo desactivo los subtítulos automáticos? En TikTok e Instagram, el subtítulo automático se activa o desactiva como una capa más al editar el vídeo antes de publicarlo, igual que un sticker de texto. En un archivo SRT generado aparte, basta con no incrustarlo en el vídeo o con no incluir esa pista al exportar.
¿Existe un generador de subtítulos automáticos gratuito? Sí, la mayoría de plataformas de vídeo corto lo traen integrado, y las herramientas de subtítulos dedicadas suelen dejar generar y previsualizar gratis, aunque limiten la exportación del archivo final a un plan de pago.
Antes de publicar
Si tu vídeo tiene un solo hablante y audio limpio, un repaso de 30 segundos suele bastar. Si tiene nombres propios, jerga o más de una voz a la vez, dedica esa revisión a esos tramos concretos: es donde se concentra el error, no en el resto del vídeo. Y si quieres que el aviso de legibilidad y la detección de alucinación hagan ese primer filtro por ti, así es como genero los subtítulos en Subanana.