Opus 5.5, GPT-6 Sol y Luna, Grok 4.7 y MiMo V2.6: ¿cuál usar para programar?
Entre el 21 y el 22 de septiembre de 2026 salieron casi al mismo tiempo cuatro lanzamientos importantes de modelos de IA: Claude Opus 5.5 de Anthropic, GPT-6 Sol y GPT-6 Luna de OpenAI, Grok 4.7 de SpaceXAI y MiMo V2.6 de Xiaomi.
Cada laboratorio asegura tener "el mejor modelo", así que en este artículo te dejo un resumen rápido y al grano: qué ofrece cada uno, cuánto cuesta y cuál tiene sentido si te dedicas a escribir código.
📺 Este artículo acompaña al video: [ENLACE AL VIDEO]
Tabla de contenidos
- Resumen rápido
- Claude Opus 5.5: el nuevo modelo de referencia
- GPT-6 Sol y GPT-6 Luna: OpenAI apuesta por el precio
- Grok 4.7: decepcionante
- Xiaomi MiMo V2.6: ¿el nuevo DeepSeek?
- ¿Cuál usar para programar?
- Preguntas frecuentes
Resumen rápido
| Modelo | Empresa | Lanzamiento | Precio API (entrada / salida por 1M tokens) | Veredicto corto |
|---|---|---|---|---|
| Claude Opus 5.5 | Anthropic | 22 sep 2026 | $4 / $20 | Nivel Fable 5.1 a menor precio |
| GPT-6 Sol | OpenAI | 22 sep 2026 | $2 / $10 | Más barato, pero sin un salto de capacidad |
| GPT-6 Luna | OpenAI | 22 sep 2026 | $0.10 / $0.50 | Muy barato para tareas sencillas |
| Grok 4.7 | SpaceXAI | 21 sep 2026 | $2 / $6 | Decepcionante |
| MiMo V2.6 Pro | Xiaomi | 21–22 sep 2026 | $0.435 / $0.87 | Modelo abierto muy barato, alternativa a DeepSeek |
Los precios son los publicados en el lanzamiento y pueden cambiar. Los benchmarks mencionados son, en su mayoría, reportados por cada empresa, así que tómalos como referencia y no como verdad absoluta.
Claude Opus 5.5: el nuevo modelo de referencia
Claude Opus 5.5 es el primer modelo de la familia Claude 5.5 y el sucesor de Claude Opus 5. Lo interesante es que, según Anthropic, rinde al nivel de Claude Fable 5.1 (el modelo superior de la compañía) en la mayoría de tareas, pero cuesta bastante menos. En la práctica, es básicamente un Fable 5.1 más barato.
🎥 Video relacionado: Claude Opus 5.5
Precio
| Por 1M de tokens | Opus 5.5 | Opus 5 | Cambio |
|---|---|---|---|
| Entrada | $4 | $5 | -20% |
| Salida | $20 | $25 | -20% |
| Lectura de caché | $0.20 | $0.50 | -60% |
| Escritura de caché | $5 | $6.25 | -20% |
Anthropic estima que el costo total en tareas típicas baja alrededor de un 40% frente a Opus 5, porque además del recorte de precio el modelo usa menos tokens para terminar las tareas. Esa cifra es una estimación de la propia empresa, así que puede variar según tu caso de uso.
Si lo comparas con Fable 5.1 ($10 / $50), Opus 5.5 es un 60% más barato en precio base.
Benchmarks
En la tabla publicada por Anthropic, Opus 5.5 supera a Fable 5.1 y a Opus 5 en casi todo, y le gana a GPT-6 Astra en la mayoría de pruebas:
| Benchmark | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra |
|---|---|---|---|---|
| Terminal-Bench 4.0 (código agéntico) | 66.4% | 55.8% | 52.3% | 57.9% |
| FrontierCode v1.1 | 54.4% | 50.3% | 48.0% | 53.3% |
| CursorBench 4.0 | 57.8% | 51.8% | 46.6% | — |
| OSWorld 2.0 (computer use) | 81.8% | 80.7% | 74.0% | — |
| AutomationBench (flujos de negocio) | 40.0% | 31.4% | 26.9% | 41.4% |
| Terminal-Bench-Science 0.1 | 58.7% | 52.6% | 29.0% | 64.6% |
Las dos únicas áreas donde GPT-6 Astra queda por delante son automatización de flujos de negocio e investigación científica con agentes. Para escribir código, ejecutar agentes, razonamiento, uso de computadora y análisis visual, Opus 5.5 lidera.
Otras mejoras
- Más rápido: genera la salida más de un 30% más rápido que Opus 5. También hay un fast mode hasta 2.5 veces más veloz, a $8 / $40.
- Respuestas menos verbosas: en mi experiencia escribiendo artículos, las respuestas se sienten más naturales, con menos sobreexplicación y menos de esos guiones largos que delataban que un texto lo había escrito Claude.
- Más uso de tu suscripción: como resuelve las tareas con menos tokens que Opus 5, en teoría deberías poder sacarle más provecho a los límites de tu plan de Claude antes de agotarlos.
- Contexto de 1M de tokens y thinking siempre activo, con niveles de esfuerzo (low, medium, high, xhigh, max).
Opus 5.5 está disponible en las apps de Claude, en la Claude Platform y en AWS, Google Cloud y Microsoft Azure.
GPT-6 Sol y GPT-6 Luna: OpenAI apuesta por el precio
El mismo día que Anthropic presentó Opus 5.5, OpenAI lanzó GPT-6 Sol y GPT-6 Luna. No son modelos más grandes: el tope de la familia sigue siendo GPT-6 Astra, lanzado a inicios de septiembre. Sol y Luna son tamaños más baratos de GPT-6, pensados para quienes se quejaban de que Astra consume demasiados tokens.
| GPT-6 Sol | GPT-6 Luna | |
|---|---|---|
| Precio (entrada / salida por 1M) | $2 / $10 | $0.10 / $0.50 |
| Contexto | ~1.05M tokens | ~1.05M tokens |
| Salida máxima | 128K tokens | 128K tokens |
Algunos datos a tener en cuenta:
- Sol cuesta la mitad que Opus 5.5 por token. Si tu prioridad es el costo y no necesitas el máximo rendimiento, es una opción a considerar.
- Luna es el que más llama la atención. Está entre los modelos más baratos de OpenAI y sirve para tareas del día a día que no requieren mucho esfuerzo: responder preguntas, convertir archivos de un formato a otro o procesar texto dentro de una aplicación.
- Ojo con Luna: pruebas independientes de Artificial Analysis muestran que GPT-6 Luna retrocedió ligeramente en algunas evaluaciones de código frente a GPT-5.6 Luna, aunque su costo por tarea bajó bastante.
- No existe GPT-6 Terra. En GPT-5.6 había un tamaño intermedio llamado Terra, pero OpenAI no lanzó una versión GPT-6 de ese modelo.
Mi veredicto: nada impresionante. Sol y Luna son, sobre todo, un recorte de precios; no traen un salto real de capacidad frente a lo que ya existía.
En la comparación directa, OpenAI vuelve a quedar por detrás de Anthropic en el modelo tope: Astra pierde frente a Opus 5.5 en la mayoría de benchmarks de código.
Grok 4.7: decepcionante
Grok 4.7 es el nuevo modelo de SpaceXAI (la división de IA que resultó de la compra de xAI por SpaceX). Salió el 21 de septiembre, después de varios retrasos, y está disponible en Cursor, Grok Build y la API de Grok.
- Precio: mantiene los $2 / $6 por millón de tokens de Grok 4.6 (hasta 200K tokens de contexto).
- Contexto: 500K tokens.
- Mejoras reportadas: según la tabla de SpaceXAI, supera a Grok 4.6 en todas las pruebas; por ejemplo, CursorBench 4.0 sube de 40.4% a 46.3% y Terminal-Bench 4.0 de 20.3% a 38.0%.
Pero hay varios puntos que generan dudas:
- La comparación no es justa. La tabla oficial compara Grok 4.7 en esfuerzo xHigh contra Grok 4.6 en esfuerzo High, así que parte de la mejora puede venir solo de "pensar más".
- Consume más tokens. Artificial Analysis midió unas 2.5 veces más tokens de salida, lo que encarece el costo real aunque el precio por token sea el mismo.
- Diferencias con mediciones independientes. En Terminal-Bench 4.0, SpaceXAI reporta 38%, pero Artificial Analysis lo mide en 26%.
- Sigue detrás de los líderes. Fable 5.1 lo supera en la mayoría de pruebas de su propia tabla, y la comparación contra GPT-6 Astra casi no aparece.
Mi veredicto: decepcionante. Muchos usuarios reportan que se siente más lento que Grok 4.6 para las mismas tareas, y por ahora da la impresión de ser un modelo optimizado para los benchmarks más que para el uso real, algo que contrasta con Grok 4.6, que sí fue bien recibido.
Xiaomi MiMo V2.6: ¿el nuevo DeepSeek?
La sorpresa de la semana fue MiMo V2.6, de Xiaomi. No es un modelo frontier como Opus o Astra, pero se acerca bastante a costos muchísimo menores.
- Modelo abierto: los pesos están disponibles bajo licencia MIT en Hugging Face.
- Arquitectura: mixture of experts de ~1 billón de parámetros (unos 42B activos) y contexto de 1M de tokens.
- Rendimiento: MiMo V2.6 Pro obtiene 46 en el índice de inteligencia de Artificial Analysis, el mejor puntaje entre modelos de pesos abiertos y al mismo nivel que Grok 4.7.
- Código: en DeepSWE v1.1 marca 71.9, cerca de GPT-5.6 Sol (73.0) y Claude Opus 5 (74.0).
Precios
| Modelo | Entrada / 1M | Salida / 1M |
|---|---|---|
| MiMo V2.6 Flash | $0.14 | $0.28 |
| MiMo V2.6 Pro | $0.435 | $0.87 |
| DeepSeek V4.1 Flash (referencia) | $0.30 | $1.20 |
Durante mucho tiempo, cuando alguien necesitaba un modelo barato para integrar en una aplicación, la respuesta era DeepSeek. Ahora MiMo aparece como una alternativa real, con benchmarks similares y un precio de salida aún menor. Puedes probarlo por API en OpenRouter.
¿Cuál usar para programar?
Con lo que tenemos hasta ahora (y sabiendo que los benchmarks van a cambiar en las próximas semanas):
- Para programar en serio y trabajar con agentes: Claude Opus 5.5. Es el modelo de referencia actual y además más barato que Opus 5.
- Si el costo pesa más que el máximo rendimiento: GPT-6 Sol, a la mitad del precio de Opus 5.5.
- Para tareas simples o procesamiento de texto dentro de tu app: GPT-6 Luna o MiMo V2.6 Flash, ambos muy baratos.
- Si quieres un modelo abierto para autohospedar o integrar a bajo costo: MiMo V2.6 Pro.
- Grok 4.7: por ahora no lo recomendaría; incluso si ya usas Cursor, no hay evidencia clara de que sea mejor que su predecesor en el uso real.
Una nota personal: sé que muchos están usando Muse Spark de Meta a través de OpenRouter. Lo he probado en varios harness y, honestamente, no lo usaría para un proyecto serio; sigo creyendo que está demasiado optimizado para los benchmarks.
Preguntas frecuentes
¿Cuánto cuesta Claude Opus 5.5?
$4 por millón de tokens de entrada y $20 por millón de salida, un 20% menos que Opus 5. La lectura de caché bajó a $0.20 por millón.
¿Opus 5.5 es mejor que GPT-6 Astra?
Según los benchmarks de Anthropic, sí en la mayoría de pruebas de código, agentes y trabajo de conocimiento. Astra solo gana en automatización de flujos de negocio e investigación científica con agentes.
¿Existe GPT-6 Terra?
No. La familia GPT-6 está formada por Astra, Sol y Luna. Terra existía en GPT-5.6, pero no tiene versión GPT-6.
¿Grok 4.7 es mejor que Grok 4.6?
En los benchmarks oficiales sí, pero la comparación usa distintos niveles de esfuerzo, consume más tokens y las mediciones independientes muestran resultados más bajos que los reportados.
¿MiMo V2.6 es de código abierto?
Sí. Xiaomi publicó los pesos bajo licencia MIT, y también puedes usarlo por API en su plataforma o en OpenRouter.
Conclusión
Esta semana dejó claro que la competencia ya no es solo por quién tiene el modelo más inteligente, sino por cuánto trabajo útil obtienes por cada dólar. Anthropic vuelve a la cabeza con Opus 5.5, OpenAI responde con modelos más baratos, Grok 4.7 no termina de convencer y Xiaomi se consolida como la alternativa abierta y económica.
Si quieres ver un ejemplo práctico con alguno de estos modelos, déjalo en los comentarios del video.
¿Necesitas ayuda para elegir o integrar un modelo de IA en tu proyecto? En fazt.dev puedes reservar asesorías personalizadas.