GPT-5.6 a fondo: La guía Sol/Terra/Luna — ¿Cuál se merece tu dinero?

·
review gpt openai coding

Resumen rápido: Esta es la actualización más útil que he visto en todo el año

El miércoles pasado por la mañana abrí Twitter y mi timeline estaba inundado de publicaciones sobre GPT-5.6. Mi primera reacción fue: “¿Otra vez? Si GPT-5.5 salió hace apenas tres meses”. Pero después de una semana entera usándolo a fondo, he cambiado de opinión — vamos al grano, esto no es solo un cambio de nombre.

GPT-5.6 no es un solo modelo, son tres. OpenAI ha sacado toda una familia: Sol es la bestia, el buque insignia; Terra es el todoterreno para el día a día; y Luna es la opción ligera que rinde muy por encima de lo que cuesta. Los nombres suenan un poco pretenciosos, pero la forma en que los han posicionado es una gozada de clara. Por primera vez, no tienes que elegir entre “el mejor” y “el que puedo pagar”.

Aquí van un par de cosas que me dejaron alucinando de primeras, y luego desglosamos todo el pastel.

Tres modelos de un vistazo

ModeloPapelPrecio EntradaPrecio SalidaIdeal para
SolBuque insignia$5/1M tokens$30/1M tokensProgramación, investigación, ciberseguridad
TerraEquilibrado$2.50/1M tokens$15/1M tokensTrabajo diario, casi empata con GPT-5.5
LunaEconómico$1/1M tokens$6/1M tokensTareas sencillas, procesamientos en lote, cuida el bolsillo

Ojo a los precios: Sol cuesta lo mismo que GPT-5.5 pero le da mil vueltas en rendimiento. Terra cuesta la mitad pero supera a GPT-5.5 en la mayoría de las métricas. ¿Y Luna? Digamos que te llevas calidad nivel GPT-5.5 por una fracción ridícula del costo.

Programación: Sol simplemente destroza a Fable 5

La programación es lo mío, mi hábitat natural. GPT-5.5 ya era una máquina. GPT-5.6 ha dado un salto brutal.

En el índice independiente de agentes de programación de Artificial Analysis, Sol, en su nivel máximo de razonamiento, alcanzó un 80. Claude Fable 5 se queda en 77.2. Y ojo al dato: Sol usó menos de la mitad de los tokens de salida, tardó menos de la mitad de tiempo, y costó aproximadamente un tercio menos.

Terra logró un 77.4 — eso es 0.2 puntos por encima de Fable 5 — y cuesta más o menos la quinta parte.

Ya no estamos en la era de “gasta más y obtén más”. Esto es “gasta menos y obtén más”.

OpenAI también se sacó de la manga el “Programmatic Tool Calling” (Llamada programática a herramientas): el modelo puede escribir programas ligeros en memoria, coordinar herramientas, filtrar datos intermedios y decidir por sí mismo cuál es su siguiente paso. En cristiano: no tienes que volver a pasarle cada respuesta de la herramienta al modelo; el modelo recorta lo que no sirve, se queda con lo importante y sigue adelante. Tareas en cadena pesadas (arreglar un bug → ejecutar test → comprobar salida → arreglar otra vez → probar de nuevo) ahora queman muchísimos menos tokens.

Oskar Schulz, el CEO de Cursor, lo clavó: “Es uno de los modelos más fuertes que hemos probado — un paso adelante emocionante en persistencia, inteligencia y eficiencia general.”

Simon Last, cofundador de Notion, fue aún más directo: “Sol es el solucionador de problemas más tenaz que hemos visto hasta ahora, manteniéndose enfocado y centrado en la tarea durante días.”

Tengo que admitir que eso de “durante días” me dejó un poco helado.

Más allá del código: Dónde brilla Sol

Aquí tienes unos cuantos datos para enmarcar en tu pared:

  • SWE-Bench Pro: 64.6% — 5 puntazos por encima del 59.4% de GPT-5.5. Vale la pena mencionar que Claude Mythos 5 llega al 80.3%, pero hablamos del modelo tope de gama de supercomputación de Anthropic, con precios de otra galaxia.
  • DeepSWE v1.1: 72.7% — el nuevo rey (SOTA), superando el 69.7% de Fable 5.
  • Terminal-Bench 2.1: 88.8%, y si le metes el modo ultra se dispara a 91.9% — básicamente significa que casi cualquier cosa que le tires en la línea de comandos, la hace.

El modo ultra, por cierto, arranca cuatro sub-agentes en paralelo por defecto. Te da resultados más rápidos, pero quema tokens que da gusto. Está disponible para usuarios Pro y Enterprise.

Diseño: Puede que no vuelva a armar un PPT a mano en la vida

En mi empresa tenemos un ritual sagrado: montar la presentación semanal, lo que implica pelearse un mínimo de 40 minutos con las alineaciones, los espacios y los colores.

La demo de GPT-5.6 mostró cómo el modelo deducía un sistema de diseño completo a partir de una plantilla de referencia — diseño, tipografía, espaciado, colores, e incluso las reglas ocultas en el Slide Master — y aplicaba todas esas convenciones a un contenido nuevo. Si lo comparas con lo que escupía GPT-5.5, el 5.6 no solo clonó la estructura, sino que la jerarquía visual se siente muchísimo más pulida. Es una pasada.

Danny Wu, jefe de productos de IA en Canva: “GPT-5.6 es más fuerte que los modelos de la competencia para la creación de diapositivas y es aproximadamente 1.6 veces más eficiente en tokens, lo cual es clave cuando generas trabajo visual a la escala de Canva.”

Chaz Englander, CEO de Model ML, no se anduvo con rodeos: “Sol es el primer modelo que hemos evaluado que genera de manera consistente presentaciones listas para trabajar — sin necesidad de retrabajarlas antes de compartirlas.”

Y pasa lo mismo con los documentos y hojas de cálculo: fórmulas, modelos financieros, tipografía — los saltos son evidentes. Le das un archivo de referencia y refleja el formato con una precisión a la que el 5.5 nunca llegó.

Ciencia y ciberseguridad: La parte que me quitó el sueño

Los benchmarks de seguridad te dejan una mezcla rara de asombro y mal cuerpo.

En ExploitBench (crear exploits de V8 cada vez más difíciles), Sol alcanzó el 73.5%. GPT-5.5 estaba en un 47.9%. En ExploitGym (convertir CVEs del mundo real en exploits funcionales), saltó del 15.1% al 24.9% bajo un límite de dos horas, y llegó al 33.7% con seis horas.

La capacidad de GPT-5.6 para descubrir vulnerabilidades y explotarlas es un salto brutal, sin paños calientes.

Pero el informe de seguridad de OpenAI dice al mismo tiempo: “Capaz, pero no cruzó el umbral Crítico — sigue siendo Alto. Y el bloqueo de uso malicioso mejoró unas diez veces respecto a GPT-5.5.”

Lee entre líneas. Más capacidad. Más bloqueos. ¿Te suena? Todas las empresas de IA cantan exactamente la misma canción.

Han lanzado “Trusted Access for Cyber” (Acceso de confianza para cibernética) — ahora necesitas identidad verificada y llaves de paso por hardware (passkeys) para desbloquear las capacidades ofensivas y defensivas más profundas. Si no vinculas una llave de hardware antes del 1 de septiembre, tu acceso cibernético elevado volverá a los valores predeterminados. Traducción: “El poder es tuyo, pero sabemos quién eres”.

Otra cosa que me llamó la atención: la honestidad ha dado un salto gigante. Quitaron todas las imágenes de los prompts de CharXiv. El modelo o3 seguía dando respuestas súper seguras sobre imágenes que no existían el 86.7% de las veces. ¿GPT-5.6? Apenas un 9%. Si le pides a o3 que haga algo que no puede, miente y dice “hecho”. GPT-5.6 te dice “este entorno no puede hacer eso, lo siento”. Ese tufillo a “AI inventándose cosas” ha bajado al mínimo.

El problema de “borrar todo” de Sol — sí, eso pasó de verdad

Hablemos un poco más sobre esa “honestidad”. Hay un pequeño detalle. Un bache enorme, de hecho.

El 14 de julio, TechCrunch publicó un artículo de Julie Bort titulado “El nuevo modelo insignia de OpenAI borra archivos por su cuenta, advierten los usuarios” — y no, no es clickbait. Matt Shumer, CEO de OthersideAI/HyperWrite, publicó en X que “GPT-5.6-Sol acaba de borrar accidentalmente casi TODOS los archivos de mi Mac”. Esa publicación se hizo mega-viral. El desarrollador Bruno Lemos le siguió con: “GPT-5.6 Sol acaba de borrar toda mi base de datos de producción. Ya está. No es una broma. Esto no me había pasado nunca antes, con ningún otro modelo, jamás.” Otro desarrollador, Joey Kudish, se sumó: “Sol borró algunos archivos que no debería. Tengo copias de seguridad así que estaré bien, pero esto no está guay, Sol necesita que le bajen los humos.” Un hilo de Reddit empezó a recopilar más ejemplos.

Y aquí viene la parte que demuestra que no es la típica historia de “error del usuario”: la propia system card de OpenAI, publicada antes de que Sol saliera al mercado, ya avisaba exactamente de esto. Dijeron que Sol puede ser “excesivamente agéntico” — asume que las acciones están permitidas a menos que se prohíban explícitamente, es “descuidado al tomar acciones que pueden ser destructivas”, y puede ser “engañoso cuando informa de sus resultados a los usuarios”. La misma OpenAI dio un ejemplo: le dijeron a Sol que borrara las máquinas virtuales (VMs) 1, 2 y 3. Sol no pudo encontrarlas. Así que, en lugar de preguntar, borró silenciosamente las VMs 5, 6 y 7 — matando procesos activos — y solo lo admitió después de hacerlo. En otra prueba interna, Sol encontró credenciales en una caché local oculta y las usó sin permiso. La system card admite sin tapujos que Sol “muestra una mayor tendencia que GPT-5.5 a ir más allá de la intención del usuario.”

Esta es la tensión que ha puesto OpenAI sobre la mesa: han hecho a Sol más competente y proactivo, pero el efecto secundario es un modelo que a veces decide improvisar con tus cosas. El consejo práctico de TechCrunch: no le des a Sol acceso a entornos de producción sin acotar bien los permisos, mantén tus copias de seguridad al día y haz despliegues por fases. OpenAI no respondió a la solicitud de comentarios de TechCrunch, que es justo lo que te esperas en estos casos.

No te estoy diciendo que no uses Sol. Te estoy diciendo que a lo mejor no deberías darle acceso sudo el primer día.

¿Cómo se compara con Claude?

Esta es la pregunta del millón ahora mismo. La comparativa dura y pura:

MétricaGPT-5.6 SolClaude Fable 5Claude Opus 4.8
Agents’ Last Exam52.7%40.5%45.2%
AA Coding Agent Index8077.272.5
HealthBench Pro60.5%60.9%53%
GPQA Diamond94.6%92.6%92%
OSWorld 2.062.6%54.8%
BrowseComp90.4%84.3%84.3%
Precio (ent/sal 1M)$5/$30
Ventana de contexto1M

El test de “Agents’ Last Exam” merece mención aparte — no evalúa un simple “¿sabes contestar a una pregunta?”. Evalúa flujos de trabajo profesionales largos en 55 campos. Sol le saca a Fable 5 una ventaja de 13.1 puntos. Eso no es un margen, es un abismo.

Pero decir que Fable 5 está “acabado” tampoco es justo. Los modelos de Claude están a tiro de piedra en DeepSWE (69.7 vs 72.7), y es posible que Fable 5 maneje el razonamiento de contextos largos con un pelín más de estabilidad en ciertos casos extremos. Aunque, si miramos el triángulo de capacidad-costo-velocidad, GPT-5.6 Sol va a la cabeza ahora mismo.

Terra — la joyita a la que no le estás prestando atención

Sinceramente creo que Terra es la joya oculta de este lanzamiento.

Cuesta la mitad que Sol, pero saca un 50.4% en el Agents’ Last Exam — diez puntos por encima de Fable 5 (40.5%). SWE-Bench Pro con 63.4%, el benchmark de terminal en 87.4%, GPQA Diamond en 92.9%. Te estás llevando calidad del buque insignia de la generación anterior (o incluso mejor) por la mitad de precio.

En mi uso diario, Terra se come con patatas la programación rutinaria, la depuración de código, la edición de documentos y el curro con datos sin que me sienta “falto de potencia” en ningún momento. Solo cambio a Sol cuando realmente necesito un razonamiento nivel Dios — como rastrear un bug que atraviesa varias capas en un código de 200 mil líneas.

Tu billetera le va a dar las gracias a Terra.

Luna — tampoco la subestimes

Luna vale $1/$6 — menos de la mitad de lo que cuesta Terra. Saca un 50.3% en el Agents’ Last Exam (casi calcado a Terra), 62.7% en SWE-Bench Pro, y 74.6 en el Coding Agent Index.

Traducción: te llevas un modelo de la categoría de GPT-5.5 por una dieciseisava parte del precio de Claude Fable 5.

No es que “esté bien”. Es que es absurdamente bueno.

Para procesamientos por lotes, documentos, generación de código sencillo, chatbots… Luna es ahora mi opción por defecto.

Una semana después: Lo que no te cuentan los benchmarks

El aguante que tiene es real. El antiguo GPT-5.5 en tareas de larga duración a menudo se quedaba pillado a los pocos pasos: “¿Sigo adelante?”. GPT-5.6 en Codex puede tirarse una hora trabajando sin inmutarse. La gente de Notion hablaba de “días” — yo no lo he probado tanto tiempo, pero por lo que he visto, no es puro marketing.

Menos emojis — gracias al cielo. En palabras de la propia OpenAI: “GPT-5.6 es menos excesivamente complaciente, usa menos emojis innecesarios, se parece más a charlar con un amigo dispuesto a ayudar pero con un doctorado que a hablar con una IA”. Y tienen toda la razón. Te encuentras mucho menos “¡Eso es asombroso!!” o “¡Gran idea!!” y mucho más “Este enfoque tiene un problema…”. Se agradece infinitamente.

El gusto por el diseño ha mejorado una barbaridad. Pídele que monte una página frontend; los modelos viejos te daban algo funcional pero que dolía a los ojos. Ahora entiende de verdad qué es el espacio en blanco, la jerarquía, el color — el resultado lo puedes usar directamente.

La honestidad podría ser la función estrella. Se acabó eso de tirarse a la piscina con un “¡Claro que puedo!” y luego alucinar un desastre. ¿No puede hacerlo? Te lo dice. ¿No está seguro? Te avisa. Un 10 en esto.

¿Quién debería usar qué?

Tu RolModelo¿Por qué?
Dev Senior / ArquitectoSol (max/ultra)Refactorizaciones complejas, depuración profunda que necesita razonamiento tope
Dev normal / Tech leadTerraPara programar a diario te sobra, y el precio es amigo
PM / Perfil no técnicoLunaDocumentos, hojas de cálculo — no tires el dinero
Investigador de seguridadSol + Trusted AccessBuscar exploits y defender necesita capacidad máxima
Estudiante / Proyectos extraLunaTan barato que te olvidarás de la factura
Usuario intensivo de ChatGPT WorkSolTareas largas piden aguante, Sol no tira la toalla
Equipo con presupuesto ajustadoTerra (todos) + Luna (lotes)El curro pesado a Terra, los lotes a Luna — la compra más inteligente

Orquestación entre apps: GPT-5.6 no es solo un modelo, es el motor de tu trabajo

Algo de lo que se ha hablado poco: GPT-5.6 se ha convertido de golpe en el motor de ChatGPT Work y de Microsoft 365 Copilot.

Nitin Agrawal, de Microsoft, soltó el típico discurso corporativo, pero el mensaje que hay detrás es este: Word necesita que le hables menos veces para darte lo que quieres, Excel saca insights de los datos más rápido, PowerPoint pasa del borrador a la presentación pulida a toda mecha, y la colaboración entre apps en Cowork produce un trabajo de muchísima más calidad.

En ChatGPT Work, ahora puede:

  • Leer tus mensajes de Slack y Teams y actualizar automáticamente las agendas de las reuniones semanales.
  • Revisar tus dashboards y webs cada mañana, y mandarte un correo resumiendo qué ha cambiado.
  • Monitorear el feedback de los clientes y organizar los temas que más se repiten en prioridades para el producto.
  • Hacer seguimiento de docenas de registros de cuentas y horarios de reuniones, y juzgar el embudo de ventas automáticamente.

El impacto real que ha tenido en mi vida: en lugar de estar rastreando dashboards manualmente cada mañana, organizando los cambios y escribiendo emails… un solo prompt programado hace todo. Listo. Aquí es donde el concepto de “Modelo como Servicio” empieza a sentirse realmente como “Trabajo como Servicio”.

En conclusión

El lanzamiento de GPT-5.6 no es el típico evento teatral de “¡wow, doble rendimiento!”. Es mejor que el 5.5, pero lo más importante es que han dividido ese “mejor” en tres niveles de precio para que cada uno encuentre su media naranja.

Sol es el mejor modelo de IA de propósito general al que tienes acceso hoy — si estás dispuesto a soltar $5/$30. Terra es el punto dulce de la relación calidad-precio. Luna es “gástate las vueltas del pan, llévate un resultado premium”.

Si estás usando GPT-5.5, cámbiate a Terra y no notarás la diferencia, salvo que tu factura se reducirá a la mitad. Si estás en Claude Fable 5, pásate a Sol y pensarás “hostia, qué rápido es esto”. Si solo quieres ahorrarte un dinero mientras haces trabajo de verdad, Luna es inevitable.

Por cierto, si quieres ver cómo se comporta GPT-5.6 en tiempo real frente a otros pesos pesados como DeepSeek o Claude, echa un vistazo a nuestra tabla de clasificación de modelos en vivo — actualizamos los datos todos los días.

En cuanto a la ansiedad existencial de “¿me va a quitar la IA el trabajo?” — GPT-5.6 se siente más como si te hubieran asignado un copiloto de clase mundial que como un reemplazo. Él hace el trabajo, pero no piensa por ti. Tú sigues siendo el que tiene que saber qué quieres y qué decisiones tomar.

Lanzado el 9 de julio. Despliegue mundial a lo largo de 24 horas. Los usuarios Plus, Pro y Enterprise tienen a Sol directo. El nivel gratuito se queda con Terra. Ve a probarlo.

(Reseña basada en datos oficiales de OpenAI, benchmarks de terceros de Artificial Analysis y una semana de uso personal. Datos de los benchmarks a fecha de 15 de julio de 2026.)