← Volver al Blog

El umbral de 300ms en IA de voz: los 3 límites de Nielsen aplicados al audio

Vas a montar un asistente de voz. Todo funciona: reconoce lo que dices, entiende la intención, responde con voz natural. Y aun así, cuando lo usas, se siente raro. Como si estuvieras hablando con alguien por teléfono internacional, o con un colega que siempre está en modo pensativo antes de responder.

La razón no está en la calidad del modelo. Está en el tiempo.

En 1993, Jakob Nielsen publicó tres números que se volvieron el fundamento de la UX moderna: 0,1 segundos, 1 segundo, 10 segundos. Treinta años después, esos mismos números explican por qué tu asistente de voz se siente raro. Con una vuelta de tuerca: en audio, los tres límites se encogen.

Este es un post educativo sobre por qué. Al final tienes una tabla de tres líneas que puedes pegar en tu documento de diseño.

Los 3 límites de Nielsen aplicados a la voz: 100ms para el acuse, 300-500ms para el flujo, 4s para el abandono. Los cuadrantes GUI vs voz muestran cómo cada uno se encoge

Los 3 límites clásicos, en 30 segundos

Nielsen no inventó estos números. Los tomó de trabajos anteriores (Miller 1968, Card 1991) y los aplicó al diseño de interfaces. Los tres son:

LímiteQué se sienteCómo se experimenta
0,1 s (100 ms)InstantáneoEl usuario percibe que la interfaz reacciona a su acción
1 sRetraso, pero el flujo se mantieneEl usuario nota el retraso pero no pierde el hilo mental
10 sEl límite de la atenciónMás allá de esto, el usuario abandona la tarea o cambia de contexto

Estos números no son sobre computadoras. Son sobre la cabeza humana. Por eso llevan tres décadas sin cambiar, aunque los procesadores se hayan vuelto mil veces más rápidos.

Por qué en voz los límites se encogen

En una interfaz gráfica, cuando una acción tarda 1 segundo, el usuario tiene con qué acompañar la espera. Un indicador de carga, un cambio de color en el botón, el cursor que se convierte en reloj de arena. La pantalla habla mientras espera.

En voz no hay pantalla. El audio no se puede rebobinar, y el silencio no da pistas. Un segundo de silencio en una conversación humana es larguísimo: pruébalo con un colega, cuenta hasta 21, y verás cómo se pone raro rápido.

Por eso los tres límites de Nielsen se encogen así al pasar a audio:

Nielsen (GUI)VozMotivo
0,1 sSe mantieneEl límite cognitivo humano es el mismo
1 s300-500 msSin retroalimentación visual, el silencio pesa más
10 s4 sEn audio no hay nada que “mirar” mientras esperas

Los 4 segundos vienen de investigación reciente presentada en ACM CUI, donde experimentos con IVAs conversacionales muestran degradación clara de la experiencia pasada esa marca. Los 300-500 ms vienen de la práctica: es lo que aguantan los usuarios reales antes de empezar a repetir lo que dijeron o a interrumpir a la IA.

Los 3 acantilados en voz

Dentro del rango encogido, hay tres puntos donde la experiencia se cae en escalón. No gradualmente, sino de golpe:

Acantilado 1: 300 ms — el límite de la conversación natural

Por debajo de 300 ms, el usuario ni siquiera piensa “estoy hablando con una máquina”. La conversación fluye. AssemblyAI lo formula así: “un sistema con 95% de precisión que responde en 300 ms suele ganarle a uno con 98% que tarda dos segundos”. En 2026 sigue siendo el objetivo de diseño para agentes de voz en producción.

Acantilado 2: 500 ms — cuando el usuario te interrumpe

Pasados los 500 ms de silencio, el usuario empieza a hablar encima de la IA. Es un reflejo humano: si el otro no responde en medio segundo, el turno vuelve a ti. Esto es cierto en conversaciones entre personas también, pero con humanos hay pistas visuales (mirada, respiración) que la voz sola no tiene.

Cuando el usuario habla encima, el STT recibe nuevo input, el proceso se reinicia, y la latencia efectiva empeora. Es un círculo vicioso que empieza en los 500 ms.

Acantilado 3: 800 ms — la conversación se rompe

Superados los 800 ms, la interacción se siente como “teléfono internacional”. El usuario repite la pregunta, dice “¿me escuchas?”, o cuelga. Retell AI documenta este umbral en su comparativa de latencia 2025: más allá de 800 ms end-to-end, la experiencia se rompe.

Qué hacen los frameworks en 2026

Números concretos de los benchmarks públicos más recientes:

FrameworkLatencia mediana por turnoNotas
ElevenLabs1,73 sMediana rápida, cola larga (P95 3,19 s)
LiveKit Agents2,46 sWarm workers, arranque rápido
Vapi2,34 s (P5-P95: 1,66-2,95 s)El más consistente
Pipecat~3,15 sPipelines dinámicos, ~200 ms extra en el primer turno
OpenAI RealtimeVariable según regiónMenor si te acercas al POP correcto

Fuente: Voice Orchestration Benchmarks de Cekura, medidos sobre ~1.100-1.570 turnos por plataforma.

Fíjate en algo importante: ninguno cumple con los 300 ms en el promedio del turno completo. Todos están por encima. Eso no quiere decir que sean malos productos. Quiere decir que hoy, en 2026, estar por debajo de 300 ms end-to-end requiere una pila ultra optimizada (Groq + Deepgram Nova-3 + Cartesia, típicamente), y muchos casos de uso no lo justifican.

La estrategia real: rellenar el vacío

Como llegar a los 300 ms es difícil, la pregunta útil no es “¿cómo bajo la latencia total?”, sino:

¿Qué le doy al usuario en cada uno de los umbrales para que la espera no se sienta vacía?

UmbralQué debe pasar en ese instante
100 msConfirmación acústica de que te escuchó (beep o cambio de tono)
400 msPrimer fonema, o un filler breve (“mmm…”, “veamos”)
800 msYa debería estar hablando de la respuesta real
1,5 sExplicación explícita si aún no hay respuesta (“estoy buscando eso”)
4 sPunto de no retorno, hay que evitarlo por diseño

Este es el corazón del asunto: rellena los huecos. Un usuario que oye “mmm…” a los 400 ms se sienta a esperar. Un usuario que oye silencio hasta el segundo 1,5 ya está mirando el celular, repitiéndose la pregunta, o colgando.

Es lo mismo que hacen los humanos entre nosotros. Cuando alguien te pregunta algo que requiere pensar, dices “eh…”, “buena pregunta”, “déjame ver”. Esos ruidos no son basura conversacional: son señales de que el turno sigue siendo tuyo, y de que el otro debe esperar. Un agente de voz que no los usa suena raro exactamente por esa ausencia.

El diseño se llama “diseño de tiempo”

Cuando alguien te dice “mi agente de voz se siente raro”, casi nunca es la calidad de la voz. Es el diseño de tiempo. Es no haber decidido, umbral por umbral, qué llenar el vacío con qué.

Tres cosas para llevarte:

  1. Los 3 números de Nielsen sirven, pero encogen en audio: 0,1 s se mantiene, 1 s pasa a 300-500 ms, 10 s pasa a 4 s.
  2. Hay 3 acantilados en voz: 300 ms (conversación natural), 500 ms (interrupción), 800 ms (rotura). Cada uno cambia el comportamiento del usuario cualitativamente.
  3. Si no puedes bajar la latencia, rellena los huecos: fillers, confirmaciones acústicas, actualizaciones explícitas. El silencio es lo que rompe la experiencia, no el tiempo.

Si quieres ver con más detalle cómo aplicar estos umbrales a un stack real, escribí sobre cinco stacks de voz AI y por qué solo dos bajan de 300 ms, con benchmarks por componente.

Los 300 ms no son un objetivo religioso. Son la frontera donde una conversación se siente humana. Diseñar sabiendo dónde está esa frontera cambia el resultado.


ken imoto · WebRTC & Voice AI engineer · kenimoto.dev