Contenido del curso
Interfaces de la API y streaming
Function calling y salidas estructuradas
Reducción de costos con caching y batch
Ingeniería de producción y control de calidad
Proyecto final de consultas sobre documentos
Modelos, tokens y costo por request
Resumen
Cuando desarrollas con IA, cada llamada a la API tiene un costo real, y aquí aprenderás a calcular el costo de tokens usando el objeto usage de la Responses API de OpenAI. Esto le sirve a cualquier desarrollador que quiera pasar de un prototipo a una aplicación en producción sin sorpresas en la factura.
Un prototipo puede ignorar ese costo, pero una aplicación real no. Y ahí está la diferencia entre jugar y construir algo serio.
Por qué debo medir el costo de cada llamada a la API
Cada vez que envías un prompt a un modelo, consumes tokens de entrada y generas tokens de salida. Ambos se pagan. Ignorarlos funciona mientras pruebas, pero en cuanto tu aplicación recibe usuarios reales, esos centavos se multiplican rápido.
Por eso el primer paso es limpiar el código. Como vamos a trabajar solo con la Responses API, puedes eliminar todo lo que se refiere a la Chat Completions API [00:20]. Menos ruido, más claridad.
¿Qué es el objeto usage en la Responses API? Es el objeto que devuelve cada llamada con la cantidad exacta de tokens consumidos: los de entrada y los de salida. Con esos dos números puedes calcular cuánto te costó esa petición.
Para leer todas sus variables, defines usage = result.usage justo debajo de donde declaras tu result [01:07]. El orden importa: usage depende de que result ya exista.
Cómo crear una función para estimar el costo de tokens
La idea es sencilla: multiplicar el valor de cada token (que sacas de la documentación de OpenAI) por la cantidad de tokens que realmente usaste [01:40]. Nada de magia, pura aritmética.
Dentro de la carpeta app creas un archivo nuevo llamado cost.py [01:52]. Ahí vive la función estimate_cost, que recibe dos parámetros numéricos:
input_tokens: la cantidad de tokens de entrada.output_tokens: la cantidad de tokens de salida.- El costo por millón de cada uno, tomado de la documentación oficial.
La fórmula divide tus tokens entre un millón y los multiplica por el costo de ese millón [02:24]. Luego suma el costo de entrada más el costo de salida y devuelve un valor aproximado.
Por qué debo actualizar los precios en mi fórmula
Este punto es fácil de olvidar y caro de ignorar. La fórmula usa los precios actuales de cada modelo [02:47]. Cada vez que OpenAI lanza un modelo nuevo o actualiza tarifas, tienes que ajustar esos dos valores.
¿Por qué mi cálculo de costo puede quedar desactualizado? Porque los precios por millón de tokens cambian con cada nuevo modelo. Si no actualizas el costo de entrada y de salida en tu fórmula, tu estimación dejará de ser real.
En el ejemplo, el modelo GPT usado tiene sus propios costos de entrada y salida por cada millón de tokens [02:58]. Cambia el modelo y cambian los números.
Cómo integrar el cálculo de costo en la función main
Con el archivo listo, lo guardas y vuelves a main.py para importarlo. El editor sugiere importar desde el propio paquete app, porque cost.py está en la misma carpeta [03:29]. Traes la función estimate_cost.
Después defines una variable cost que llama a esa función y le pasa los valores que ya recibes de usage [03:50]. Encapsular la lógica en una variable mantiene todo ordenado y legible.
Luego muestras el resultado con dos casas decimales [04:20]. Para este ejercicio es más que suficiente.
Al ejecutar main.py desde la terminal, se hace la llamada a la API y recibes dos cosas: la respuesta del modelo y el costo aproximado de esa petición [04:36]. Y aquí viene lo interesante.
Qué números aparecen en el resultado final
La respuesta del ejemplo devolvió un texto de 12 pasos, pero lo valioso está al final [04:50]:
- 31 tokens de entrada consumidos.
- 519 tokens de salida generados.
- Un costo aproximado de 0.02 dólares por esa llamada.
Ese valor es aproximado y variará según el modelo que uses y la dimensión del razonamiento que active [05:20]. Un modelo más potente o un prompt más complejo mueven la aguja.
¿Cómo sé cuánto me costó una llamada a OpenAI? Multiplica tus tokens de entrada y salida por el precio por millón de tu modelo, súmalos y tendrás el costo estimado. En el ejemplo fueron 31 y 519 tokens, para un total aproximado de 0.02 dólares.
Tu integración ya dejó de ser un misterio: sabes interpretar los tokens y estimar los costos de ejecución. El siguiente paso será transformar este código en una aplicación web funcional con FastAPI [05:35].
¿Ya calculaste cuánto te cuesta tu propio prompt? Cuéntame en los comentarios qué modelo estás usando y cómo te fue con la fórmula.