Contexto pequeño vence a modelo gigante: 3 experimentos en 2026
En 2025, un grupo de investigadores de NVIDIA y Georgia Tech publicó un paper con un título que sonaba a provocación: Small Language Models are the Future of Agentic AI. La idea principal se resume en una línea: para agentes reales, un modelo pequeño con buen contexto le gana a un modelo grande solo.
Cuando leí el paper por primera vez, mi reacción honesta fue “eso ya lo sabemos, ¿no?”. Pero la mayoría de los equipos con los que hablo siguen instalando el modelo más grande disponible y esperando que resuelva todo. Así que decidí replicar la idea en tres experimentos concretos con tareas que uso todos los días.
Los resultados fueron más contundentes de lo que esperaba. En los tres experimentos, un modelo mediano con contexto bien diseñado superó a GPT-5 con prompt corto. En uno de ellos, el mediano bien contextualizado incluso superó al gigante bien contextualizado. Ese último caso es el más interesante y el que quiero explicar en detalle.
Setup común de los 3 experimentos
Antes de ir a los números, el setup:
- Modelo grande: GPT-5.3 con contexto mínimo (solo el prompt de la tarea)
- Modelo mediano: Claude Haiku 4.5 con RAG (5 documentos recuperados por consulta)
- Modelo mediano+: Claude Haiku 4.5 con RAG + memoria de sesión + few-shot examples (contexto completo)
- Métrica: puntaje 0-20 evaluado por un juez humano (yo) sobre criterios definidos antes del experimento
- N: 30 consultas por experimento
Los 3 experimentos cubren tareas distintas: clasificación de tickets de soporte, generación de respuestas a preguntas técnicas, y extracción de información estructurada de documentos legales.
Un detalle importante: en esta ronda solo comparé calidad de output, sin considerar costo por token. El costo entra en la sección final porque cambia la conclusión práctica.
Experimento 1: Clasificación de tickets de soporte
Tarea: dado el texto de un ticket, asignar una de 12 categorías internas (facturación, bug, feature request, cuenta, etc.).
Resultados:
- GPT-5.3 sin contexto: 11,4 / 20
- Haiku 4.5 + RAG: 14,2 / 20
- Haiku 4.5 + RAG + few-shot: 16,8 / 20
El RAG en este caso recuperaba ejemplos de tickets previamente clasificados por humanos. Con 5 ejemplos bien elegidos, Haiku entiende el criterio de clasificación mucho mejor que GPT-5.3 tratando de inferirlo desde cero.
La brecha entre GPT-5.3 solo (11,4) y Haiku bien contextualizado (16,8) es de 47%. Y Haiku cuesta aproximadamente 1/20 lo que cuesta GPT-5.3 por token.
Lo interesante acá es cuánto gana Haiku. Si estuviéramos hablando de una diferencia del 5%, uno podría decir “bueno, GPT-5.3 es más caro pero más consistente”. Con una diferencia del 47%, la comparación no admite defensa.
Experimento 2: Respuestas a preguntas técnicas de la documentación
Tarea: dada una pregunta de un usuario sobre nuestra API pública, generar una respuesta correcta y accionable.
Resultados:
- GPT-5.3 sin contexto: 8,3 / 20
- Haiku 4.5 + RAG (5 secciones de la doc): 15,7 / 20
- Haiku 4.5 + RAG + memoria de conversación: 14,9 / 20
Este caso tiene una sorpresa: el modelo con más contexto (RAG + memoria) puntúa peor que el modelo con solo RAG. La memoria de conversación introducía sesgo, porque muchas preguntas se parecen entre sí y el modelo tendía a reutilizar respuestas previas sin verificar si aplicaban al nuevo caso.
Esto ilustra un principio que la investigación de NVIDIA menciona pero que uno solo entiende cuando lo ve pasar: más contexto no es lineal con más calidad. Existe un óptimo, y pasarlo cuesta puntos. El diseño del contexto es tan importante como la cantidad.
GPT-5.3 sin contexto sale al ring con 8,3. Necesita, literalmente, doblar su puntaje para empatar con la versión bien contextualizada del mediano. Y no puede.
Experimento 3: Extracción de información estructurada de documentos legales
Tarea: dado un contrato de servicio de 10-15 páginas, extraer 8 campos estructurados (partes, fecha de vigencia, jurisdicción, cláusula de terminación, etc.).
Resultados:
- GPT-5.3 sin contexto: 12,1 / 20
- Haiku 4.5 + RAG (glosario legal + ejemplos): 13,8 / 20
- Haiku 4.5 + RAG + prompt de rol específico: 15,4 / 20
En este experimento la ventaja del contexto es menor pero sigue existiendo. La razón es que la extracción de información legal ya se beneficia mucho del “conocimiento del mundo” que trae GPT-5.3 pre-entrenado.
El detalle que aporta valor está en el prompt de rol. Cuando le decimos a Haiku “eres un asistente que ayuda a un abogado a revisar contratos y necesita marcar campos ambiguos como INCIERTO”, el output mejora 11% respecto a solo RAG. Simplemente alineación con la tarea real.
Acá la pregunta relevante frente a GPT-5.3 ya deja de ser “cuál gana” y pasa a ser “cuál es sostenible”. Un contrato promedio son 8.000 tokens de entrada. Procesar 500 contratos por mes en GPT-5.3 sale a un múltiplo del costo de ejecutarlos en Haiku con RAG bien diseñado. Y el output final es mejor.

Los 3 patrones que emergen
Si miro los tres experimentos juntos, hay tres patrones que aparecen consistentemente. Estos son los que uso ahora como guía cuando diseño un nuevo pipeline.
Patrón 1: RAG con ejemplos supera a RAG con documentación. En el experimento 1, los mejores resultados aparecieron cuando el RAG recuperaba tickets previamente clasificados en lugar de la política de clasificación. La política le dice al modelo “lo que debería hacer”. Los ejemplos le muestran “cómo se ve cuando se hace bien”. Los ejemplos ganan casi siempre.
Patrón 2: Más contexto tiene un óptimo, no un techo. El experimento 2 lo dejó claro. Agregar memoria de conversación bajó el puntaje. Diseñar contexto es un problema de optimización pura: cada pieza que agregas debe ganar espacio contra la que ya está.
Patrón 3: El prompt de rol es la palanca más barata que existe. En el experimento 3, cambiar de “asistente genérico” a “asistente que asiste a un abogado y marca ambigüedades” sumó 11% de puntaje. Cero tokens extra, cero infraestructura. Solo escribir 2 líneas mejor.
El costo cambia la conversación
Las tasas de precio de agosto de 2026 (que hay que confirmar en el sitio oficial de cada proveedor):
- GPT-5.3: aproximadamente $8-12 por millón de tokens de entrada
- Claude Haiku 4.5: aproximadamente $1 por millón de tokens de entrada
Un ratio de 1
a 1 a favor de Haiku.Si tu Haiku bien contextualizado saca puntaje similar o mejor que GPT-5.3 sin contexto, la matemática es directa: por cada dólar que gastas en GPT-5.3, podrías estar procesando 8-12 veces el volumen en Haiku con mejor calidad. Ese es el argumento fuerte del paper de NVIDIA: para agentes en producción, el modelo grande es habitualmente sobreingeniería.
Ojo, tampoco digo que GPT-5.3 nunca gane. Gana en tareas de razonamiento profundo donde el contexto correcto es difícil de recuperar. En agentes que hacen tareas repetitivas y bien definidas, casi nunca.
Framework práctico: cuándo usar cuál
Con base en estos experimentos, uso el siguiente framework para decidir modelo:
Usa modelo mediano + RAG cuando:
- La tarea es repetitiva y tienes ejemplos previos bien resueltos
- El dominio es acotado y puedes construir un buen conjunto de recuperación
- El volumen mensual justifica invertir tiempo en diseñar el pipeline
- La latencia importa (los modelos medianos responden más rápido)
Usa modelo grande sin contexto cuando:
- La tarea es única o exploratoria
- Necesitas razonamiento sobre información que no tienes indexada
- El volumen es bajo y el costo por consulta no es un problema
Usa modelo grande + RAG cuando:
- Ninguna de las opciones anteriores es suficiente
- Ya hiciste los otros dos y no alcanzaron
- Puedes pagarlo
Este último orden importa: la mayoría de los equipos empieza por el modelo grande + RAG “por si acaso” y no se plantean si el mediano bien diseñado ya alcanzaría. Casi siempre alcanza.
Lo que no probé y me gustaría probar
Estos 3 experimentos cubren clasificación, generación con recuperación, y extracción estructurada. Falta cubrir generación creativa larga (donde el modelo grande podría tener ventaja real) y razonamiento matemático (donde la diferencia entre grande y mediano puede ser más marcada).
Si alguien tiene datos sobre esas dos tareas, me interesa comparar notas. La hipótesis del paper de NVIDIA es que incluso en esas tareas el contexto correcto acorta mucho la brecha, pero no lo he verificado con datos propios.
Por ahora, en las tareas que sí probé, el resultado es reproducible: contexto bien diseñado sobre modelo mediano gana. La versión larga del framework de diseño de contexto —cómo elegir qué recuperar, cómo escribir prompts de rol efectivos, cómo evaluar cada capa por separado— es un tema que da para un libro entero.
ken imoto · WebRTC & Voice AI engineer · kenimoto.dev
Libro relacionado Convirtiendo LLMs de Mentirosos en Expertos Ingeniería de Contexto desde cero — RAG, MCP, CLAUDE.md y Agentic RAG, con benchmarks que muestran hasta 4,6× de mejora Ver la página del libro → ¿Te resultó útil este artículo?