Búsqueda, caché y compactación de contexto

Platzi DayPlatzi Day

Todos los cursos GRATIS

Se acaba en:
:::

Resumen

La búsqueda de información en agentes de IA no es un solo paso, sino tres. Si trabajas construyendo o dando instrucciones a asistentes de IA, entender cómo traer datos sin llenar el contexto de basura es lo que separa un agente eficiente de uno costoso y lento.

La parte operativa consiste en saber cómo recuperar un dato justo cuando lo necesitas. Y para eso existen tres herramientas que casi nadie domina completo: búsqueda, caché y compactación.

¿Cómo funciona realmente la búsqueda de información en un agente?

La mayoría cree que buscar es un solo movimiento. En realidad, traer información tiene tres pasos y casi todo el mundo solo piensa en uno.

  • La búsqueda encuentra candidatos por palabras o por semántica.
  • El ranking los ordena por relevancia, no solo por similitud.
  • La selección decide cuántos entran, y esa es una decisión de presupuesto, no de calidad [01:04].

Y aquí viene lo interesante. Un hallazgo de Chrome mostró que los modelos son casi perfectos buscando coincidencias literales, pero se degradan feo cuando la relación entre pregunta y respuesta es semántica [01:26].

¿Qué significa eso en la vida real? Si buscas la palabra devolución sin acento, el sistema también encuentra devolución con acento. Pero si buscas "me llegó roto", no siempre encuentra cuando el cliente escribió "producto con daño en tránsito". Y esa suele ser justo la consulta real de tu cliente.

¿Qué son búsqueda, ranking y selección en recuperación de información? Son los tres pasos para traer un dato: la búsqueda encuentra candidatos, el ranking los ordena por relevancia y la selección decide cuántos entran según tu presupuesto de contexto.

¿Qué es el caché y cuánto dinero te ahorra?

El caché se refiere a recuperar en vez de repetir. Vale la pena que lo consideres aunque no programes, porque tiene números concretos detrás.

El caché guarda los prefijos de tu petición. En el siguiente mensaje, el sistema reutiliza eso y solo procesa lo nuevo. Pero con una condición estricta: el prefijo se construye siempre en un orden fijo [02:00].

  1. Primero las herramientas.
  2. Luego el system prompt.
  3. Luego los mensajes.

Un cambio en cualquiera de estos niveles invalida ese nivel y todos los siguientes. Y ojo, este orden no es el mismo que usas para una solicitud común, así que conviene que compares cómo estructuras instrucciones, herramientas y memoria en cada caso [02:36].

¿Por qué poner una fecha en el system prompt rompe todo?

Aquí está el error más repetido. A veces ponemos un timestamp en el system prompt, algo como "considera que la fecha de hoy es tal" [03:20]. Como eso cambia en cada petición, termina destruyendo el caché de toda la conversación.

¿Cuánto ahorra leer del caché? La lectura del caché cuesta la décima parte que procesar el mismo texto de nuevo, y además es más rápido. Pero el contenido cacheado sigue ocupando la ventana de contexto: el caché cambia lo que pagas, no el espacio que usas.

¿Qué es la compactación y cómo escribir un buen resumen?

Compactar es tomar una conversación cerca del límite, resumirla y arrancar una ventana nueva con ese resumen. Y aquí hay una confusión frecuente: existen dos compactaciones [04:15].

  • La automática, que hace la herramienta sola cuando te acercas al límite.
  • La intencional, que haces tú con un prompt.

Trabajarás la segunda, porque la automática te deja seguir chateando, pero no te deja elegir qué se salva ni ver qué se perdió. Y controlar eso es justo lo que necesitas aprender.

Anthropic recomienda un orden explícito para escribir ese resumen. Primero maximiza el recall, es decir, captura todo lo relevante aunque quede largo. Después itera hacia la precisión y quita lo superficial [04:52]. El orden importa: si empiezas optimizando brevedad, tiras cosas que ya no vas a poder recuperar. En un resumen no hay vuelta atrás.

Existe una versión más ligera: borrar los resultados crudos de herramientas viejas. Si tu agente consultó el inventario hace 20 turnos, la tabla completa ya no sirve, pero el número que importaba sí [05:18]. Esta parte casi nunca aparece en cursos y es la que más ahorra.

¿Cuándo no debes traer información al contexto?

Hay reglas claras para no traer datos de más. No traigas información cuando:

  • El modelo ya lo sabe.
  • El dato no cambia la decisión.
  • Lo que traes es más largo que lo que aporta.
  • Ya lo trajiste hace unos turnos y sigue intacto en el contexto.

Ese último punto es el más común en agentes que ya operan con clientes, porque buscan lo mismo una y otra vez, ya que nadie les dijo que ya lo tenían [06:04].

¿Cómo se ve una auditoría de recuperación con un caso real?

Recuerda el caso de Volta Electrónica. La idea es revisar la conversación con tu agente y evaluar cada elemento que recuperó o pegaste tú [06:32].

Por ejemplo, en la conversación aparece el ticket original completo. La pregunta clave es: ¿poner el ticket cambia la respuesta? Si la cambia, va a una tabla y se valida contra si ya estaba en el contexto. Lo mismo aplica al historial de cliente, el manual de garantías o la captura del estatus de envío.

Algunos ejemplos concretos ayudan a ver el criterio:

  • El ticket original completo no vale la pena en el contexto porque no hace sentido.
  • La política de garantía extendida quizás no cambia la respuesta porque ya viene en el system prompt.
  • El correo del proveedor sobre el lote sí cambia la respuesta, pero no hay que tenerlo en el contexto.

Se trata de evaluar cada elemento para decidir si va en el contexto, en las instrucciones de las herramientas o en el caché [07:40].

¿En qué consiste el reto de auditoría de recuperación?

El reto es hacer una auditoría de recuperación en tu asistente de trabajo. El proceso es directo [08:16].

  1. Revisa una conversación larga de esta semana y cuenta cuántas veces trajo información.
  2. Marca cuáles cambiaron tu respuesta final. Vas a encontrar que muchas no cambiaron nada.
  3. Encuentra la repetición: algo que buscó dos veces en la misma sesión.

Como bonus, escribe tu prompt de compactación para ese caso en el orden correcto: primero completo y luego corto. Guárdalo, te va a servir.

¿Ya detectaste cuántas veces tu agente busca lo mismo sin necesidad? Cuéntame qué encontraste en tu auditoría.