El umbral de 300ms en IA de voz: los 3 límites de Nielsen aplicados al audio
Vas a montar un asistente de voz. Todo funciona: reconoce lo que dices, entiende la intención, responde con voz natural. Y aun así, cuando lo usas, se siente raro. Como si estuvieras hablando con alguien por teléfono internacional, o con un colega que siempre está en modo pensativo antes de responder.
La razón no está en la calidad del modelo. Está en el tiempo.
En 1993, Jakob Nielsen publicó tres números que se volvieron el fundamento de la UX moderna: 0,1 segundos, 1 segundo, 10 segundos. Treinta años después, esos mismos números explican por qué tu asistente de voz se siente raro. Con una vuelta de tuerca: en audio, los tres límites se encogen.
Este es un post educativo sobre por qué. Al final tienes una tabla de tres líneas que puedes pegar en tu documento de diseño.

Los 3 límites clásicos, en 30 segundos
Nielsen no inventó estos números. Los tomó de trabajos anteriores (Miller 1968, Card 1991) y los aplicó al diseño de interfaces. Los tres son:
| Límite | Qué se siente | Cómo se experimenta |
|---|---|---|
| 0,1 s (100 ms) | Instantáneo | El usuario percibe que la interfaz reacciona a su acción |
| 1 s | Retraso, pero el flujo se mantiene | El usuario nota el retraso pero no pierde el hilo mental |
| 10 s | El límite de la atención | Más allá de esto, el usuario abandona la tarea o cambia de contexto |
Estos números no son sobre computadoras. Son sobre la cabeza humana. Por eso llevan tres décadas sin cambiar, aunque los procesadores se hayan vuelto mil veces más rápidos.
Por qué en voz los límites se encogen
En una interfaz gráfica, cuando una acción tarda 1 segundo, el usuario tiene con qué acompañar la espera. Un indicador de carga, un cambio de color en el botón, el cursor que se convierte en reloj de arena. La pantalla habla mientras espera.
En voz no hay pantalla. El audio no se puede rebobinar, y el silencio no da pistas. Un segundo de silencio en una conversación humana es larguísimo: pruébalo con un colega, cuenta hasta 21, y verás cómo se pone raro rápido.
Por eso los tres límites de Nielsen se encogen así al pasar a audio:
| Nielsen (GUI) | Voz | Motivo |
|---|---|---|
| 0,1 s | Se mantiene | El límite cognitivo humano es el mismo |
| 1 s | 300-500 ms | Sin retroalimentación visual, el silencio pesa más |
| 10 s | 4 s | En audio no hay nada que “mirar” mientras esperas |
Los 4 segundos vienen de investigación reciente presentada en ACM CUI, donde experimentos con IVAs conversacionales muestran degradación clara de la experiencia pasada esa marca. Los 300-500 ms vienen de la práctica: es lo que aguantan los usuarios reales antes de empezar a repetir lo que dijeron o a interrumpir a la IA.
Los 3 acantilados en voz
Dentro del rango encogido, hay tres puntos donde la experiencia se cae en escalón. No gradualmente, sino de golpe:
Acantilado 1: 300 ms — el límite de la conversación natural
Por debajo de 300 ms, el usuario ni siquiera piensa “estoy hablando con una máquina”. La conversación fluye. AssemblyAI lo formula así: “un sistema con 95% de precisión que responde en 300 ms suele ganarle a uno con 98% que tarda dos segundos”. En 2026 sigue siendo el objetivo de diseño para agentes de voz en producción.
Acantilado 2: 500 ms — cuando el usuario te interrumpe
Pasados los 500 ms de silencio, el usuario empieza a hablar encima de la IA. Es un reflejo humano: si el otro no responde en medio segundo, el turno vuelve a ti. Esto es cierto en conversaciones entre personas también, pero con humanos hay pistas visuales (mirada, respiración) que la voz sola no tiene.
Cuando el usuario habla encima, el STT recibe nuevo input, el proceso se reinicia, y la latencia efectiva empeora. Es un círculo vicioso que empieza en los 500 ms.
Acantilado 3: 800 ms — la conversación se rompe
Superados los 800 ms, la interacción se siente como “teléfono internacional”. El usuario repite la pregunta, dice “¿me escuchas?”, o cuelga. Retell AI documenta este umbral en su comparativa de latencia 2025: más allá de 800 ms end-to-end, la experiencia se rompe.
Qué hacen los frameworks en 2026
Números concretos de los benchmarks públicos más recientes:
| Framework | Latencia mediana por turno | Notas |
|---|---|---|
| ElevenLabs | 1,73 s | Mediana rápida, cola larga (P95 3,19 s) |
| LiveKit Agents | 2,46 s | Warm workers, arranque rápido |
| Vapi | 2,34 s (P5-P95: 1,66-2,95 s) | El más consistente |
| Pipecat | ~3,15 s | Pipelines dinámicos, ~200 ms extra en el primer turno |
| OpenAI Realtime | Variable según región | Menor si te acercas al POP correcto |
Fuente: Voice Orchestration Benchmarks de Cekura, medidos sobre ~1.100-1.570 turnos por plataforma.
Fíjate en algo importante: ninguno cumple con los 300 ms en el promedio del turno completo. Todos están por encima. Eso no quiere decir que sean malos productos. Quiere decir que hoy, en 2026, estar por debajo de 300 ms end-to-end requiere una pila ultra optimizada (Groq + Deepgram Nova-3 + Cartesia, típicamente), y muchos casos de uso no lo justifican.
La estrategia real: rellenar el vacío
Como llegar a los 300 ms es difícil, la pregunta útil no es “¿cómo bajo la latencia total?”, sino:
¿Qué le doy al usuario en cada uno de los umbrales para que la espera no se sienta vacía?
| Umbral | Qué debe pasar en ese instante |
|---|---|
| 100 ms | Confirmación acústica de que te escuchó (beep o cambio de tono) |
| 400 ms | Primer fonema, o un filler breve (“mmm…”, “veamos”) |
| 800 ms | Ya debería estar hablando de la respuesta real |
| 1,5 s | Explicación explícita si aún no hay respuesta (“estoy buscando eso”) |
| 4 s | Punto de no retorno, hay que evitarlo por diseño |
Este es el corazón del asunto: rellena los huecos. Un usuario que oye “mmm…” a los 400 ms se sienta a esperar. Un usuario que oye silencio hasta el segundo 1,5 ya está mirando el celular, repitiéndose la pregunta, o colgando.
Es lo mismo que hacen los humanos entre nosotros. Cuando alguien te pregunta algo que requiere pensar, dices “eh…”, “buena pregunta”, “déjame ver”. Esos ruidos no son basura conversacional: son señales de que el turno sigue siendo tuyo, y de que el otro debe esperar. Un agente de voz que no los usa suena raro exactamente por esa ausencia.
El diseño se llama “diseño de tiempo”
Cuando alguien te dice “mi agente de voz se siente raro”, casi nunca es la calidad de la voz. Es el diseño de tiempo. Es no haber decidido, umbral por umbral, qué llenar el vacío con qué.
Tres cosas para llevarte:
- Los 3 números de Nielsen sirven, pero encogen en audio: 0,1 s se mantiene, 1 s pasa a 300-500 ms, 10 s pasa a 4 s.
- Hay 3 acantilados en voz: 300 ms (conversación natural), 500 ms (interrupción), 800 ms (rotura). Cada uno cambia el comportamiento del usuario cualitativamente.
- Si no puedes bajar la latencia, rellena los huecos: fillers, confirmaciones acústicas, actualizaciones explícitas. El silencio es lo que rompe la experiencia, no el tiempo.
Si quieres ver con más detalle cómo aplicar estos umbrales a un stack real, escribí sobre cinco stacks de voz AI y por qué solo dos bajan de 300 ms, con benchmarks por componente.
Los 300 ms no son un objetivo religioso. Son la frontera donde una conversación se siente humana. Diseñar sabiendo dónde está esa frontera cambia el resultado.
ken imoto · WebRTC & Voice AI engineer · kenimoto.dev
¿Te resultó útil este artículo?