Vectara 2026: Haiku 4.5 alucinó menos que Sonnet
La intuición que traía era simple: pagar más compra menos mentira. Sonnet es más grande que Haiku, entonces Sonnet debería alucinar menos. Los benchmarks públicos de 2026 dicen otra cosa, y en dos mediciones separadas, apuntan al mismo dedo.
En el HHEM de Vectara (snapshot del 11 de mayo de 2026, resúmenes de documentos con temperatura 0), la fila de Claude sale así:
| Modelo | Tasa de alucinación | Tasa de respuesta |
|---|---|---|
| Claude Haiku 4.5 | 9.8% | 99.5% |
| Claude Sonnet 4.6 | 10.6% | 99.9% |
| Claude Opus 4.7 | 12.0% | 98.0% |
Haiku 4.5 gana. El modelo pequeño del catálogo alucina menos que el mediano y menos que el grande. La diferencia con Sonnet 4.6 es pequeña (0.8 puntos); con Opus 4.7 sube a 2.2 puntos.
Y ese es el benchmark benévolo, el de tareas cortas. Cuando cambias a preguntas fácticas duras, la brecha se abre.
AA-Omniscience: 28% vs 48%
Artificial Analysis publicó AA-Omniscience en noviembre de 2025, un benchmark que evalúa conocimiento y alucinación con 6.000 preguntas en 42 temas dentro de 6 dominios. Los tres primeros lugares por menor tasa de alucinación son los tres modelos de Anthropic. Y quien lidera la lista es Haiku, por delante de Sonnet y Opus.
- Claude 4.5 Haiku: 28% de alucinación (el más bajo de todos los modelos evaluados)
- Claude 4.5 Sonnet: 48%
- Claude 4.1 Opus: 48%
Haiku alucina 20 puntos menos que Sonnet, con la misma familia de modelos y el mismo laboratorio. Sonnet 4.6 y Opus 4.7 no están en el estudio original de noviembre 2025 (son posteriores), pero la tendencia dentro de Anthropic ya estaba: cuando el modelo se ve empujado a decir “no sé”, el pequeño lo dice con más frecuencia.
El truco del Omniscience Index: penaliza el chute
Lo interesante de este benchmark es cómo cuenta los puntos. El Omniscience Index suma:
- +1 por respuesta correcta
- −1 por respuesta incorrecta cuando el modelo respondió
- 0 por abstenerse (“no sé”)
Bajo esa regla, GPT-5 y Gemini 2.5 Pro tienen precisión alta pero no lideran el índice, porque arriesgan una respuesta cuando no saben. Anthropic sube al podio por otra razón: cuando no sabe, se calla más. Haiku 4.5 lleva esa política al extremo dentro del catálogo.
Traducido a lo que tú y yo hacemos con el modelo un miércoles cualquiera: Sonnet te va a contestar casi siempre. Haiku te va a decir “no sé” con más frecuencia. Y “no sé” es la respuesta correcta cuando el modelo no tiene el dato. Ese silencio es parte del diseño del modelo.
Por qué el modelo grande no miente menos: miente con más soltura
La mecánica de esto me costó tragarla. Un LLM predice el siguiente token a partir de patrones que vio en el entrenamiento. Si le preguntas por un dato específico que no está en el entrenamiento, no hay una alarma interna que diga “aquí falta información”. Hay solamente distribuciones de probabilidad sobre qué palabra viene después. Y ese proceso es el mismo tanto si el modelo sabe la respuesta como si la está armando desde cero.
Lo que cambia con el tamaño es la fluidez. Un modelo grande predice tokens más plausibles, arma frases mejor conectadas, usa vocabulario técnico en el lugar correcto. Esa misma capacidad que hace útil al modelo cuando sí sabe la respuesta, es la que hace peligrosa a la mentira cuando no la sabe. Los benchmarks lo miden en frío: más parámetros no traen más humildad. Traen más elocuencia, y la elocuencia se aplica también a lo inventado.
Que Haiku 4.5 (liberado por Anthropic el 15 de octubre de 2025) marque el número más bajo del catálogo apunta a que la calibración de “cuándo callarse” no depende del tamaño del modelo. Depende del post-training. Un modelo pequeño con la política de abstención bien afinada saca ventaja al modelo grande sin esa política encima.
Lo que hago con esta información
Tres ajustes concretos, sin fuegos artificiales, todos aburridos.
Uno: la línea de “no sé” va en el system prompt.
Una frase corta que le diga al modelo “cuando no tengas el dato, di ‘no sé’ en vez de inventar” cambia la calibración por defecto. No hace magia, pero baja la tasa de respuestas confiadas y falsas. La misma capacidad que hace a Sonnet un buen mentiroso lo hace también un buen seguidor de instrucciones: cuando le pides abstenerse, se abstiene mejor que Haiku sin instrucción.
Dos: pregunta fáctica solo con el hecho en la mano.
Si necesitas la respuesta a “cómo funciona la API de X en su versión Y”, no le preguntes al modelo desnudo. Ponle la documentación en el contexto antes. Un LLM con RAG que trae la especificación real deja de tener que adivinar el detalle: lo lee. Ese es el pivote entero del context engineering: la respuesta detallada y correcta sale de un modelo que ya lee el dato en el contexto; subir de tier ayuda menos que eso.
Tres: enrutar por tarea, no por prestigio.
No todo pide el modelo más caro. Preguntas de conocimiento fáctico que pueden tener respuesta “no sé” están mejor con Haiku bajo la métrica de AA-Omniscience. Razonamiento largo con muchos pasos intermedios sí gana con Sonnet. Pagar por Sonnet para preguntar cosas que Haiku no habría inventado es gastar dinero para comprar el error.
Lo que no dice el benchmark
Los dos benchmarks miden lo que miden, y no más. HHEM evalúa consistencia en resúmenes de documentos con temperatura 0. AA-Omniscience evalúa conocimiento y abstención con 6.000 preguntas en 42 temas dentro de 6 dominios. Ninguno mide qué pasa en una sesión larga de agente, con herramientas, con tool calls encadenadas, con memoria persistente. Ahí el patrón puede cambiar. Sonnet y Opus siguen siendo más fuertes en razonamiento largo y en uso de herramientas, y ese fuerte puede compensar la calibración peor cuando la tarea pide razonar más que recuperar un dato puntual.
Y hay otra advertencia: los rankings públicos cambian versión a versión. HHEM se actualizó por última vez el 11 de mayo de 2026. Cualquier modelo posterior a esa fecha no está en la foto. La regla operativa vale para lo publicado; el número exacto habrá que releerlo cuando salga el siguiente modelo.
Cierre
- Vectara HHEM 2026: Haiku 4.5 alucina 9.8%, Sonnet 4.6 10.6%, Opus 4.7 12.0%.
- AA-Omniscience noviembre 2025: Haiku 4.5 alucina 28%, Sonnet 4.5 y Opus 4.1 alucinan 48%.
- Los tres primeros lugares por menor alucinación son los tres modelos de Anthropic, porque el índice premia abstenerse.
- Pagar por el modelo grande no compra menos mentira. Compra más elocuencia, aplicada también a lo inventado.
- La línea de “cuando no sepas, di no sé” en el system prompt y el RAG antes de la pregunta fáctica son las dos palancas simples que hacen más que subir de tier.
Si quieres ver con más detalle cómo alimentar contexto para que el modelo tenga con qué trabajar en vez de adivinar, dejé el material largo en Ingeniería de Contexto en la Práctica.
ken imoto · WebRTC & Voice AI engineer · kenimoto.dev
Libro relacionado Convirtiendo LLMs de Mentirosos en Expertos Ingeniería de Contexto desde cero — RAG, MCP, CLAUDE.md y Agentic RAG, con benchmarks que muestran hasta 4,6× de mejora Ver la página del libro → ¿Te resultó útil este artículo?