Los límites de contexto en herramientas de IA son ese costo invisible que nadie te explica hasta que te quedas sin cuota un jueves a las 4 de la tarde. Aquí aprenderás a diferenciar el mundo del chat del mundo de la API, cómo se consumen tus tokens y cómo calcular tu propio presupuesto de contexto. Es una lección clave si trabajas a diario con modelos como Claude y no quieres quedarte sin herramienta cuando más la necesitas.
Hay un mito que conviene desmentir de una vez: como pagas suscripción, crees que el contexto sale gratis. No sale gratis, sale caro, solo que a veces lo pagas en otra moneda. Y si no entiendes eso, un día te quedas sin acceso justo cuando lo necesitas.
Qué diferencia hay entre el chat y la API
Existen dos mundos que tendemos a mezclar y funcionan con lógicas completamente distintas [00:36].
En el chat no pagas por token, pagas una mensualidad. Pero esa mensualidad tiene reglas internas:
- Una ventana rodante de varias horas que arranca con tu primer mensaje, donde todo sale de la misma bolsa.
- Un tope semanal adicional al de la ventana.
- Una bolsa compartida entre las superficies del producto, donde consumir de una te quita de la otra.
Cuando se te acaba, el sistema te manda a esperar y no hay forma de pagar más en ese momento [01:20]. Así que la corrección no llega abriendo la cartera, llega con paciencia.
¿Por qué se me acaba tan rápido la cuota del chat? Porque las conversaciones larguísimas, los archivos pesados, los proyectos con bases de conocimiento enormes y las sesiones donde el modelo usa herramientas sin parar queman tu cuota mucho más rápido.
El mundo dos es la API, donde sí pagas por uso: por token de entrada y token de salida [01:44]. Aquí también viven los parámetros que se afinan de verdad, como el caché, el retrieval y la latencia. Es el terreno de quien construye productos.
Cuánto cuestan realmente los tokens en la API
Al momento de grabar esta lección, los precios de referencia para Claude Opus 5 sirven para dimensionar cada ajuste que hagas [02:12]. Recuerda que puedes consultar valores actualizados en el enlace de la caja de recursos.
- 5 USD por millón de tokens de entrada.
- 25 USD por millón de tokens de salida.
- 50 centavos por la lectura de caché.
Con estos números entiendes por qué pasar cierto umbral de tokens de entrada suele activar tarifas más altas [02:36]. Si le pides al modelo que pegue el documento completo, no solo baja la calidad, también te sale más caro. Dos golpes en una sola decisión.
¿Qué es un token de entrada frente a uno de salida? El token de entrada es lo que tú le mandas al modelo y el de salida es lo que el modelo te responde. En la API pagas por ambos por separado, y el de salida cuesta más.
Cuáles son los costos que no aparecen en la factura
Aquí viene lo interesante: hay tres costos que duelen y que nunca llegan en un correo de facturación [02:56].
- La latencia: más tokens de entrada significan más tiempo de procesamiento. Por eso el chat se siente lento después de un rato trabajando.
- El ruido: la precisión cae del 95% a cerca del 60% solo por la longitud del input.
- La confusión: más herramientas disponibles dan peor desempeño, como en el caso de las 46 herramientas contra las 19 que el modelo terminaba ocupando.
Ninguno de estos tres te llega en una factura, pero los tres te están costando en tiempo, calidad y dinero.
Dónde reviso mis límites de uso
Para revisar todo lo anterior, ve a la parte inferior izquierda y da clic en uso [03:44]. Ahí aparecen tus estadísticas reales.
- La sesión actual, que se restablece cada cinco horas.
- Los límites semanales para todos los modelos, donde los de Fable pueden ocupar hasta el 50% de tu cuota semanal.
- Los créditos de uso de la API, con tu presupuesto disponible y lo que ya gastaste.
En el ejemplo, la sesión iba en 3%, el límite semanal en 15% con restablecimiento el viernes a las 12, y de la API se había gastado 4.56, apenas el 23% del presupuesto [04:20]. Un detalle importante: aunque le metas más dinero a los créditos, no lo puedes ocupar hasta la fecha de restablecimiento [04:52].
Cómo calculo mi presupuesto de contexto
Ese es el reto para los próximos tres días. La idea es sencilla y medible [05:04].
- Anota a qué hora te quedaste sin cuota y qué estabas haciendo.
- Identifica al culpable: casi siempre es una sesión eterna sin cerrar, un archivo enorme pegado en el chat o un proyecto con demasiada base de conocimiento.
- Aplica una corrección y vuelve a medir la semana siguiente.
La corrección más efectiva suele ser la más simple: cierra el chat y empieza uno nuevo. Suena tonto, pero funciona.
Y si trabajas con la API, da un paso más: revisa si tu system prompt tiene algo que cambie en cada petición [05:40]. Ahí se te está yendo el caché por completo, y con él, tu dinero.
¿Ya identificaste a qué hora sueles quedarte sin cuota y quién es el culpable? Cuéntame en los comentarios cuál fue tu corrección más efectiva.