En julio de 2025, procesar la grabación de una reunión de una hora llevaba 26.8 minutos.
Este mes, el mismo trabajo lleva 4.9 minutos.
No es un benchmark diseñado para quedar bien. Es la mediana de nuestros tiempos de procesamiento para reuniones de una hora en cada uno de esos julios — no un archivo de demo escogido a dedo — con los trabajos fallidos excluidos en ambos lados. Mismo mes del año, mismas duraciones de archivo, misma medición. Unas cinco veces y media más rápido — y los archivos largos ganaron aún más.
Nadie lanzó una versión de «ahora todo va rápido». Esto es un año de trabajo discreto en las partes del pipeline sobre las que nadie escribe posts, y se fue acumulando.
Qué cambió realmente
Mediana del tiempo de procesamiento, julio de 2025 contra julio de 2026. El segundo número de cada celda es el décimo más lento — el trabajo de cada diez que más tarda. Las medianas favorecen; las colas te dicen cómo es un mal día.

| Trabajo | Julio 2025 | Julio 2026 | Mejora |
|---|---|---|---|
| Reunión de 30 min | 13.6 min (p90 26.4) | 3.1 min (p90 5.9) | 4.4x |
| Reunión de 1 h | 26.8 min (p90 61.9) | 4.9 min (p90 6.8) | 5.5x |
| Reunión de 2 h | 54.1 min (p90 120.9) | 7.5 min (p90 13.4) | 7.2x |
| Vídeo de 30 min | 16.8 min (p90 35.6) | 5.2 min (p90 12.1) | 3.2x |
| Vídeo de 1 h | 32.4 min (p90 136.4) | 7.4 min (p90 21.0) | 4.4x |
| Vídeo de 2 h | 66.4 min (p90 147.3) | 11.4 min (p90 28.9) | 5.8x |
Las colas mejoraron aún más que la mediana, y eso importa más. Hace un año, una de cada diez reuniones de una hora tardaba más de una hora en volver. Hoy el décimo más lento empieza en siete minutos — un trabajo malo de hoy es varias veces más rápido que uno típico de entonces. El peor caso de un vídeo de una hora pasó de más de dos horas a 21 minutos. Si venías dejando margen a escondidas en tu agenda por Subanana, ya puedes dejar de hacerlo.
Los archivos largos son los que más ganaron — el 7x está en la fila «Reunión de 2 h». Es lo contrario de lo que suele pasar cuando un pipeline se ajusta con clips cortos de demo, y esa diferencia cambia el comportamiento: esperar una hora y media es un trabajo de «vuelvo después de comer»; siete minutos es un trabajo de «me quedo en la silla».
Y la tendencia no se aplana: la última semana de julio fue la más rápida de la historia de Subanana, con una mediana de 5.5 minutos para vídeos de una hora.
La parte que me sorprendió
Así se reparte hoy la espera de un vídeo de una hora. Las etapas se solapan, así que léelas como proporciones aproximadas, no como una secuencia estricta.
| Etapa | Parte de la espera |
|---|---|
| Cola | ~7% |
| Llevar el archivo al pipeline | ~2% |
| Preparar los medios (audio, forma de onda) | ~25% |
| Transcripción | ~20% |
| Crear y verificar los subtítulos | ~16% |
| Renderizar la vista previa — la que luego recorres a tu ritmo | ~29% |
La transcripción — la parte de la IA — es aproximadamente una quinta parte de la espera.
La IA nunca fue el cuello de botella. Todo el mundo asume que el reconocimiento de voz es la parte lenta, porque es la parte que lleva el modelo. No lo es, y hace tiempo que no. Unas cuatro quintas partes de tu espera son logística: decodificar el archivo, extraer una pista de audio limpia, generar la forma de onda, renderizar la vista previa que el editor necesita para que luego puedas recorrer el resultado.
Exactamente por eso las mejoras vinieron de donde vinieron. Solo llevar el archivo al pipeline es más de un 90% más rápido desde junio, y la preparación de medios se redujo más o menos a la mitad. En la transcripción apenas quedaba nada que ganar. En todo lo demás, muchísimo.
De la tabla salen tres cosas útiles:
Las reuniones vuelven antes. Un trabajo de reunión se salta por completo el renderizado de la vista previa de vídeo — gran parte de la razón por la que las filas de reunión siempre van por delante de las de vídeo a igual duración.
Añadir una traducción no retrasa tus resultados. La traducción se ejecuta de forma asíncrona — la transcripción y los subtítulos en el idioma original llegan igual de rápido, y la pista traducida aparece sola después. Si venías quitando el idioma de destino para no perder tiempo, no hace falta. En modo subtítulos puedes añadir varios idiomas de destino a un mismo trabajo.
Tu subida no está en estas cifras. El reloj arranca cuando empieza el procesamiento, después de que llegue tu archivo. Con una conexión lenta, la subida puede ser la mitad más larga de tu espera. Si el vídeo ya es público, pega un enlace de YouTube, Instagram o Facebook y sáltate la subida — Subanana lo obtiene directamente.
La parte que no tiene atajo
Cualquiera puede alquilar un buen modelo de reconocimiento de voz. Es el secreto a voces de esta categoría — la IA, la parte con mística, está al alcance de quien pida una clave de API. Por eso cada semana aparece una nueva app de transcripción.
Pero el modelo es una quinta parte de tu espera. Las otras cuatro quintas partes son la maquinaria que lo rodea: ingesta, decodificación, extracción de audio, creación de subtítulos, renderizado de la vista previa, gestión de colas. Nada de eso se alquila. Hay que construirlo, medirlo con cargas reales y volver a construirlo — y la única forma de que sea más rápido es dedicar tiempo de ingeniería a problemas que ninguna demo saca a la luz.
Eso es exactamente lo que fue este año. Ni una gran versión ni un cambio de modelo afortunado: la aceleración se ha ido acumulando casi cada mes durante un año y medio. Una app-envoltorio montada en un fin de semana puede usar la misma transcripción que nosotros. Las cuatro quintas partes no puede replicarlas — y eso es justo lo que notas cada vez que subes algo largo.
Lo que no cambia
Los reintentos siguen siendo gratis. Cuando una transcripción parece defectuosa, el sistema reenvía automáticamente los segmentos afectados a otro modelo, por debajo, sin avisarte. La segunda pasada no se cobra — pagas el archivo una vez, dé igual cuántos intentos internos hicieran falta. Era así hace un año y es así ahora; solo que ocurre más rápido.
Los límites por archivo han subido desde entonces a 8 horas y 30 GB, y ahora son los mismos en todos los planes, incluido el gratuito; en el plan gratuito solo se transcriben los primeros 15 minutos de cada archivo.
Pruébalo con algo largo
Si venías aplazando una grabación de dos horas por no perder una hora con ella, la cuenta ya cambió. Ahora son unos once minutos.
Transcripción de reuniones con IA y subtitulado con IA funcionan sobre el mismo pipeline del que salen estas cifras.
Todas las cifras son medianas de tiempo de procesamiento — julio de 2025 (mes completo) contra el 1–27 de julio de 2026 — agrupadas por duración de origen, con trabajos fallidos excluidos y medidas desde el inicio del procesamiento. Las filas de «2 h» cubren archivos de 90 minutos a 3 horas. Tus tiempos variarán según el tamaño del archivo, el códec y la carga.