El jueves me llegó un correo de OpenAI con una cifra difícil de ignorar: GPT‑5.6 Luna cuesta ahora un 80% menos.

Podría parecer una simple rebaja. Pero, cuando trabajas con agentes que leen archivos, usan herramientas, escriben código y ejecutan pruebas durante horas, el precio cambia también la forma de organizar el trabajo.

La conclusión que me interesa no es «la IA es más barata». Es esta: el mejor modelo ya no debería hacerlo todo.

LA IDEA PRINCIPAL

No elijas un modelo favorito: diseña el trabajo

Una tarea no tiene por qué usar el mismo nivel de inteligencia en cada paso.

OpenAI ha dejado la familia GPT‑5.6 con tres posiciones bastante claras:

  • Luna: 0,20 dólares por millón de tokens de entrada y 1,20 por millón de salida. Está pensado para trabajo rápido, repetible y de mucho volumen.

  • Terra: 2 dólares de entrada y 12 de salida. Es el punto intermedio para trabajo cotidiano donde importan tanto la calidad como el coste.

  • Sol: mantiene el precio. En la API, Fast mode ofrece hasta 2,5 veces más velocidad por el doble de coste, sin cambiar la inteligencia del modelo.

En las suscripciones de Codex y ChatGPT Work no baja la cuota mensual ni aumenta el presupuesto incluido. Lo que cambia es que usar Terra y Luna consume menos créditos.

Hasta ahora elegíamos un modelo al empezar una tarea y lo dejábamos conducir hasta el final. Pero una tarea real no mantiene el mismo nivel de dificultad durante todo el recorrido.

Imagina que tienes que arreglar un bug en producción. Entender el fallo, medir el impacto y decidir qué no tocar requiere criterio. Después, aplicar un cambio ya definido, escribir pruebas y actualizar documentación es trabajo mucho más verificable.

Sol puede despejar la incertidumbre. Terra o Luna pueden ejecutar las partes bien especificadas. Y las pruebas deciden si el resultado sirve.

No se trata de ahorrar tokens a cualquier precio. Se trata de pagar inteligencia justo donde cambia el resultado.

Mi punto dulce: Luna en Extra High

Y aquí va mi opinión, basada en cómo trabajo: para la mayoría de las cosas, el punto dulce para mí es Luna en Extra High (xhigh).

No es la que gana la tabla de inteligencia. Precisamente por eso me parece interesante: en la comparación de Artificial Analysis queda cerca de Terra y Sol, pero cuesta muchísimo menos. Para leer contexto, proponer un cambio, ejecutar trabajo repetible y revisar una primera versión, esa combinación me da el mejor equilibrio entre calidad, velocidad y créditos.

Misma configuración, tres precios

Modelo (xhigh)

AA Index*

API (USD / M tokens)
entrada / salida

58

5 / 30

52

2 / 12

49

0,20 / 1,20

* Artificial Analysis Intelligence Index, misma configuración xhigh; más alto es mejor. Los precios son los actuales de la API. No equivalen directamente a los créditos de Codex o ChatGPT.

Mi regla práctica: empiezo en Luna, subo a Terra si aparece ambigüedad y reservo Sol para decisiones difíciles o una revisión final.

PRUÉBALO ESTA SEMANA

Haz una prueba A/B con una tarea pequeña

Elige una tarea que pueda pasar o fallar: añadir un test, actualizar un README o hacer un refactor pequeño. No uses una decisión de arquitectura ni un bug de producción para la primera prueba.

1. Define la tarea y el criterio de éxito

Objetivo: [una tarea concreta]

Criterios de aceptación:
- [qué tiene que funcionar]
- [qué prueba tiene que pasar]

Primero, propón un plan breve.
Después, implementa y ejecuta las pruebas.
Resume cambios, tiempo y créditos.

2. Ejecuta la misma tarea dos veces

  1. En una copia limpia del proyecto, ejecútala con Luna Extra High.

  2. En otra copia limpia, usa Sol con exactamente el mismo objetivo.

  3. Ejecuta las mismas pruebas y guarda el diff de cada resultado.

3. Decide con datos

  • ¿Pasaron las pruebas?

  • ¿Cuántas correcciones manuales necesitó cada resultado?

  • ¿Cuánto tiempo y cuántos créditos consumió?

Si Luna pasa los mismos criterios sin correcciones extra, se convierte en tu opción por defecto para esa clase de trabajo. Si la tarea exige interpretar requisitos, elegir arquitectura o asumir riesgo, sube a Terra o Sol.

UNA NOVEDAD MÁS

Cursor ya está convirtiendo esta idea en producto

Cursor Router analiza cada solicitud y la envía a un modelo distinto según quieras optimizar inteligencia, equilibrio o coste. No significa que su elección sea siempre la correcta, pero sí confirma una dirección: cada vez decidiremos menos «qué modelo uso» y más «qué resultado necesito».

Además, en sus experimentos con enjambres, los agentes que ejecutaban el trabajo consumieron al menos el 69% de los tokens y, en la mayoría de configuraciones, más del 90%. Ahí es donde elegir un modelo eficiente puede transformar el coste total.

Y PARA ACABAR…

¿Qué parte de tu trabajo delegarías antes a un modelo más barato?

Quiero usar las respuestas para preparar la siguiente guía práctica.

Login or Subscribe to participate

¿Te reenviaron este correo? Regístrate aquí para recibir cada lunes una idea importante, una aplicación concreta y solo las novedades que merecen atención.

Reply

Avatar

or to participate

Seguir leyendo