JEV contra GPT 6 Luna: ¿qué funciona mejor?

Resumen

Si quieres construir un clasificador de mensajes rápido y barato, aquí comparamos Jeff contra GPT 6 Luna, el modelo más veloz de OpenAI, usando 100 mensajes reales de una zapatería. El experimento es útil para quien programa chatbots de soporte o sistemas que deciden a alta velocidad.

La tarea fue sencilla de pedir pero reveladora en resultados: crear una página web que clasifique mensajes en tres categorías. Primero, los que probablemente son una estafa. Segundo, los que son prioridad y necesitan atención inmediata. Tercero, el resto. El sistema debía mostrar nombre y mensaje de forma diferenciada, usar Jeff y recordar cuánto costó en tokens y en tiempo [00:11].

Cómo se construye un clasificador de mensajes con Jeff

El flujo empieza con una instrucción en lenguaje natural. Le pides al sistema que lea los mensajes de la carpeta, los clasifique y arme la interfaz. A partir de ese texto, el proyecto lee todo, entiende la tarea y construye el primer experimento [00:48].

Para que GPT 6 Luna participe, necesitas una llave de API de OpenAI. El proceso es directo: entras a platform.openai.com, vas a API keys, creas una nueva llave secreta y la nombras, en este caso Jeff Course. Puedes ponerle expiración de siete días por seguridad y asignarle todos los permisos [01:08].

¿Qué es una API key y para qué sirve? Es una llave secreta que autoriza a tu programa a usar un modelo de IA externo. Sin ella, el sistema no puede conectarse ni generar tokens.

El resultado con Jeff se entrega en un artefacto de Claude llamado Show Inbox Triage, con el archivo de Python, los resultados en .json y la vista de triage [01:48].

Cuánto cuesta clasificar 100 mensajes y cuánto tarda

Aquí viene lo interesante. Jeff clasificó los 100 mensajes de zapatería con cifras mínimas:

  • Costo total de 0.0036 dólares.
  • Tiempo total de 1.58 segundos.
  • 152 milisegundos por mensaje.
  • 98,000 tokens gastados [02:08].

De esos 100 mensajes, encontró cinco estafas. Por ejemplo, el que dice que la tienda será suspendida en 30 minutos, o el premio internacional al mejor comercio, o el supuesto cheque por 3,000 euros por encima del valor del pedido. Todos con cara de scam [02:42]. Luego marcó 20 mensajes como prioritarios, cada uno con un indicador de probabilidad de estafa y otro de prioridad, por ejemplo 3% y 92% [03:28].

¿Por qué importa el costo por mensaje si es tan bajo? Porque la diferencia se multiplica. Clasificar 100 mensajes casi no cuesta, pero clasificar 100,000 convierte unos centavos en cifras reales.

Jeff vs GPT 6 Luna: qué modelo conviene

La comparación directa muestra la brecha. Luna necesita una tarjeta de crédito porque OpenAI no da crédito de cortesía, mientras Jeff ofrece cinco dólares al suscribirse [05:13]. Y los tokens de tu suscripción de ChatGPT o Codex no sirven aquí: esos 20, 100 o 200 dólares corren por otro lado [05:48].

Los números del experimento hablan solos:

  • Jeff costó 0.0036 dólares en total.
  • Luna con razonamiento cero costó 0.0080 dólares.
  • Luna con razonamiento medio costó 0.0116 dólares.
  • Jeff tardó 150 milisegundos por mensaje.
  • Luna tardó 1,121 milisegundos por mensaje, entre 10 y 12 veces más [07:35].

En tiempo total, Luna se demoró 11.5 segundos sin razonamiento y 19 segundos con razonamiento, frente a los 1.58 segundos de Jeff [07:52]. Esta velocidad pesa cuando programas chatbots de decisión para soporte o ventas, o cuando necesitas decidir a ultra alta velocidad a partir de un estado inicial, que aquí es solo el nombre y el mensaje. Jeff permite agregar tantos metadatos como quieras [08:28].

En qué coinciden y en qué difieren los modelos

Lo revelador es que ambos llegaron al mismo lugar en estafas: detectaron los mismos cinco scams [09:08]. Las diferencias aparecen en la prioridad. Raúl Domínguez recibió 47% con Jeff y 83% con Luna por un reclamo de devolución de dinero de 19 días. Florencia Peralta, que no sabía si su pago se duplicó, recibió 72% de Jeff y casi nada de prioridad con Luna [09:28].

Sobre acceso a modelos, en laboratorios grandes como Anthropic, OpenAI y Google conviene usar el laboratorio directo en vez de Open Router. Para modelos chinos, Open Router sí tiene sentido [06:08].

El veredicto queda claro: Luna cuesta de dos a tres veces más y es mucho más lento por mensaje, aunque coincide en detectar estafas. ¿Qué caso de uso priorizarías tú, velocidad o profundidad de razonamiento? Cuéntame en los comentarios.