Decidir qué información se queda en el contexto de un agente y qué se descarta es la parte difícil, y para eso existen cuatro principios que puedes aplicar hoy mismo: relevance, recency, retrieval y ranking. Si trabajas construyendo o auditando agentes de IA, cada uno arregla un tipo distinto de falla y viene respaldado por evidencia dura.
La idea central es sencilla: con estos cuatro criterios puedes auditar cualquier agente y saber exactamente dónde está fallando. Vamos uno por uno.
¿Qué es la relevancia en el contexto de un agente?
La relevancia es el principio raíz de todo. En palabras de Anthropic, se trata de encontrar el conjunto más pequeño posible de tokens de alta señal que maximiza la probabilidad del resultado que quieres [00:31].
Y ojo con la palabra clave: el más pequeño posible no significa el más completo. Aquí está el dato que incomoda: en un benchmark de llamadas a funciones, un modelo falló con 46 herramientas y solo funcionó con 19 [01:00]. Le quitaron capacidades y mejoró.
Damos por hecho que más opciones lo hacen más capaz, cuando en realidad lo vuelven indeciso.
¿Cómo sé si una línea sobra en mi prompt? Pregúntate: si quito esta línea, ¿cambia alguna respuesta? Si no cambia nada, simplemente sobra y puedes eliminarla.
¿Por qué la recencia evita que los errores se arrastren?
La recencia o recency significa que lo nuevo tiene que poder ganarle a lo viejo. Un estudio de Microsoft y Salesforce encontró que, en conversaciones de varios turnos, cuando hay una respuesta incorrecta temprana el desempeño cae 39% en promedio [01:41].
¿La razón? Los modelos hacen suposiciones en los primeros turnos e intentan cerrar la solución antes de tiempo.
Llévalo a un sistema de soporte. El agente se equivoca en el turno tres, lo corriges en el cuatro y sigue arrastrando el error hasta el final. ¿Por qué? Porque tu corrección no borró nada, solo agregó. Ahora el dato equivocado y el correcto conviven en el mismo contexto [02:16].
La pregunta de auditoría aquí es directa: ¿lo viejo se puede morir o solo se acumula?
¿Qué significa recuperar información just in time?
El retrieval nos dice algo simple: en lugar de cargar, busca. En vez de precargar todo por si acaso, los agentes modernos mantienen referencias ligeras, como una ruta de archivo o un link, y traen la información solo en el momento en que la necesitan. Anthropic la llama estrategia just in time [02:45].
Es lo que hace una persona competente: no se memoriza el manual, sabe dónde está y lo abre cuando alguien pregunta.
¿Cuál es el trade off de buscar en lugar de precargar?
Buscar es más lento. Por eso muchos sistemas son híbridos: traen lo crítico por adelantado y el resto bajo demanda [03:11].
¿Qué debo precargar y qué dejar para búsqueda? Pregúntate por cada dato: ¿esto tiene que estar aquí siempre o solo cuando alguien lo pida? Lo crítico va por adelantado, el resto bajo demanda.
¿Por qué el orden del contexto cambia la exactitud?
El ranking significa que el orden pesa tanto como el contenido, y es el principio que menos gente conoce. La misma información con el mismo texto rinde distinto según dónde caiga.
Los números lo dejan claro:
- Al inicio o al final del contexto: entre 70 y 75% de exactitud.
- A la mitad: apenas entre 55 y 60%.
- La diferencia: de 15 a 20 puntos solo por la posición [03:35].
Si el SLA, es decir el acuerdo de nivel de servicio, está enterrado en el párrafo 40 de un documento de 60, el modelo lo verá peor que si estuviera en la primera línea, aunque el texto sea idéntico [03:53].
La pregunta de auditoría: ¿lo más importante está donde más se ve?
¿Cómo trabajan juntos los cuatro principios?
Cada principio cubre una decisión distinta, y juntos forman un sistema completo [04:07]:
- Relevance decide qué entra.
- Recency decide qué sale.
- Retrieval decide cuándo entra.
- Ranking decide dónde se coloca.
Si solo aplicas uno, arreglas la cuarta parte del problema. Por eso conviene pensarlos como un conjunto.
¿Qué es un SLA en un agente de soporte? Es el acuerdo de nivel de servicio, el dato que define tiempos y condiciones de respuesta. Si queda enterrado a la mitad del contexto, el modelo lo aplica peor.
¿Cómo auditar un agente de soporte con estos principios?
El reto práctico es auditar un agente de soporte en su versión más ingenua, que tiene los cuatro defectos, uno por principio [04:26]:
- En relevance: le pegaron el manual de políticas completo en el system prompt.
- En recency: nunca borra nada del historial.
- En retrieval: no tiene herramientas, todo está precargado.
- En ranking: el dato del SLA está a la mitad del bloque más largo.
El ejercicio va en cuatro pasos, y los dos últimos son los que más valen [04:45]:
- Empareja cada defecto con el principio que viola.
- Escribe la corrección concreta para cada uno en una frase.
- Construye el agente con los cuatro defectos, hazle cinco preguntas de cliente y guarda las respuestas.
- Aplica un solo principio, repite las mismas cinco preguntas y compara.
Ese cuarto paso separa a quien entendió de quien memorizó. Vas a ver la mejora directamente.
Anota cuál principio te dio más ganancia por menos esfuerzo y déjamelo en los comentarios.