Gemini 3.8 Flash y Muse Spark 1.3: ¿todavía vale la pena pagar Opus o Claude?
En menos de 48 horas salieron tres modelos: Claude Fable 5.1 (Anthropic, 1 de septiembre), Gemini 3.8 Flash (anuncio de Google, 2 de septiembre) y Muse Spark 1.3 (anuncio de Mark Zuckerberg, el mismo 2 de septiembre, apenas unas horas después). Los benchmarks se reordenaron dos veces en un solo día.
Si pagas una suscripción de IA para programar, la pregunta práctica es simple: ¿te conviene cambiar de modelo? Aquí está lo que realmente cambió, con las cifras contrastadas contra las fuentes oficiales y contra los rankings independientes.
Resumen rápido
| Dato | |
|---|---|
| Modelo más inteligente hoy | Claude Fable 5.1 (66 en el Artificial Analysis Intelligence Index) |
| Mejor puntaje en DeepSWE | Gemini 3.8 Flash, empatado con Opus 5 en 74% — a un quinto del costo |
| Sorpresa del día | Muse Spark 1.3 de Meta, tercero del índice de inteligencia con 62 |
| Modelo más rápido | Gemini 3.8 Flash, ~305 tokens por segundo |
| Tendencia de fondo | La brecha de inteligencia se cierra; la competencia se mueve a costo por tarea |
Los tres lanzamientos, en orden
1 de septiembre: Claude Fable 5.1 y Mythos 5.1
Anthropic lanzó Claude Fable 5.1 junto a Claude Mythos 5.1. Una aclaración que suele confundirse: no son dos modelos distintos con propósitos distintos. Son el mismo modelo subyacente con niveles de salvaguarda diferentes. Fable 5.1 está disponible de forma general; Mythos 5.1 vive detrás de programas de acceso restringido para organizaciones verificadas de ciberdefensa y ciencias de la vida.
El precio se mantuvo en $10 de entrada y $50 de salida por millón de tokens, pero las lecturas de caché bajaron de $1 a $0.25 por millón, un recorte del 75%.
2 de septiembre: Gemini 3.8 Flash
Google lanzó Gemini 3.8 Flash y Gemini 3.8 Flash Cyber. Es su tercer modelo Flash en seis semanas. Flash Cyber sí es una variante afinada específicamente para ciberseguridad, disponible solo para "defensores de confianza" mediante el nuevo Fairwind Program.
2 de septiembre, unas horas después: Muse Spark 1.3
Meta respondió con Muse Spark 1.3, su cuarto modelo Muse Spark en cinco meses. Y este es el que descolocó las tablas de inteligencia general.
DeepSWE: el dato más importante del día
Antes de mirar índices compuestos, conviene mirar DeepSWE, el benchmark de Datacurve que mide agentes de código en tareas de ingeniería reales y de largo horizonte. Es el más limpio del momento por tres razones:
- Libre de contaminación: las 113 tareas están escritas desde cero, no adaptadas de commits o PRs existentes, así que ningún modelo vio la solución durante el preentrenamiento
- Diversidad real: 91 repositorios en 5 lenguajes
- Un solo harness: todos los modelos corren sobre mini-swe-agent, no cada uno con el suyo
Ese último punto es el que hace la diferencia. Los números que publican Google y Meta en sus anuncios vienen de corridas propias, con configuraciones distintas. DeepSWE los corre a todos igual.
Leaderboard DeepSWE v1.1 — actualizado el 2 de septiembre de 2026
| Modelo | Pass@1 | Costo promedio | Tokens salida | Pasos |
|---|---|---|---|---|
| gemini-3.8-flash [high] | 74% ±1% | $2.36 | 143k | 166 |
| claude-opus-5 [max] | 74% ±4% | $11.84 | 118k | 99 |
| gpt-5.6-sol [max] | 73% ±3% | $6.46 | 60k | 61 |
| claude-fable-5 [max] | 70% ±4% | $21.63 | 119k | 88 |
| glm-5.3 [max] | 69% ±3% | $3.99 | 80k | 124 |
| kimi-k3 [max] | 69% ±5% | $4.65 | 81k | 98 |
| gpt-5.6-luna [max] | 67% ±4% | $0.61 | 73k | 102 |
| grok-4.6 [xhigh] | 67% ±2% | $5.50 | 71k | 87 |
| gemini-3.7-flash [high] | 65% ±2% | $2.18 | 107k | 125 |
| glm-5.3-flash [max] | 63% ±4% | $0.24 | 73k | 123 |
| claude-opus-4.8 [max] | 59% ±2% | $13.22 | 135k | 120 |
| muse-spark-1.2 [xhigh] | 55% ±2% | $3.70 | 99k | 101 |
| claude-sonnet-5 [max] | 54% ±4% | $26.40 | 214k | 268 |
Qué dice esta tabla
Gemini 3.8 Flash encabeza el leaderboard, empatado con Opus 5 dentro del margen de error, y cuesta cinco veces menos. Esa es la noticia real del lanzamiento de Google, y es más significativa que cualquier índice compuesto.
Pero hay un matiz que la columna de puntaje esconde: Gemini necesita 166 pasos y 143k tokens de salida para llegar al mismo 74% que Opus 5 logra en 99 pasos con 118k tokens. Llega al mismo destino dando un 67% más de vueltas. Si tu carga de trabajo tiene límites de tiempo o de llamadas, ese costo no aparece en el precio por token.
Dos ausencias importantes: ni Claude Fable 5.1 ni Muse Spark 1.3 estaban en el leaderboard al momento de escribir esto. El único Muse Spark medido es la versión 1.2, con 55%. Meta reporta 75.4 para su 1.3 en "DeepSWE v1.1", pero ese número sale de una corrida propia de Meta, no del leaderboard oficial. Hasta que Datacurve lo publique, es una cifra del fabricante.
Gemini 3.8 Flash: rápido y barato, con letra pequeña
Lo que Google ofrece
Según la documentación oficial de la API:
- Contexto: 1,048,576 tokens de entrada, 65,536 de salida
- Entradas: texto, imagen, video, audio y PDF
- Precio: $0.75 entrada / $3.75 salida por millón de tokens
- Niveles de esfuerzo: low, medium, high
- Disponible en: app de Gemini (Pro y Ultra), AI Mode, Google Sheets, Antigravity, AI Studio y la API
Está construido sobre Gemini 3.7 Flash, no sobre una base nueva. Google lo dice explícitamente en su model card.
Las tres letras pequeñas que importan
1. El precio es introductorio. Los $0.75 / $3.75 rigen hasta el 31 de diciembre de 2026. Después sube a $1.50 / $7.50, exactamente el doble. Si estás calculando el presupuesto anual de un producto, ese es el número que debes usar.
2. Consume más tokens que su predecesor. Google recomienda quedarse en 3.7 Flash para cargas donde la eficiencia sea la prioridad. Artificial Analysis lo midió: 48k tokens de salida promedio por tarea, un 30% más que 3.7 Flash, lo que eleva el costo real por tarea a $0.58 — unos 40% más caro que su predecesor pese a tener la misma tarifa.
3. Es rapidísimo produciendo, pero lento en arrancar. Genera a ~305 tokens por segundo, lo más rápido que Artificial Analysis mide hoy. Pero tarda 13.3 segundos en soltar el primer token, contra una mediana de 2.99 segundos, porque piensa antes de responder. Para una experiencia de chat interactiva, esa diferencia se siente.
Muse Spark 1.3: Meta se mete al top 3
Artificial Analysis colocó a Muse Spark 1.3 (max) en 62 puntos del Intelligence Index, tercero de todos los modelos medidos, superado solo por Claude Fable 5.1 y Claude Opus 5.
Lo que Meta cambió:
- Menos derroche: ~20% menos llamadas a herramientas y ~25% menos tokens que Muse Spark 1.2, según comparaciones internas de Meta
- Más colaborativo: entrenado para hacer preguntas cuando el prompt es ambiguo, pedir ayuda cuando se atasca y confirmar antes de acciones con consecuencias
- Mejor calibrado: en lugar de alucinar un resultado, reconoce sus límites
- Contexto: 1M de tokens
En Tau3-Bench Banking, la variante max saca 52% y es la número uno de esa evaluación.
El asterisco que hay que decir en voz alta
El 62 corresponde a la variante max, que está en preview limitado solo para socios de Meta. La versión que puedes usar hoy es xhigh, y marca 61. Meta confirmó que el modo max llega después de terminar pruebas de seguridad adicionales.
Es una distinción que se pierde en casi toda la cobertura, pero cambia la conclusión práctica: el modelo del gráfico no es el que puedes contratar.
Precio: aquí está el golpe real
Según OpenRouter, Muse Spark 1.3 cuesta $1.25 entrada / $4.25 salida por millón de tokens. Frente a Fable 5.1 a $10 / $50, hablamos de 8 veces más barato en entrada y casi 12 veces más barato en salida, con un puntaje de inteligencia a 4 puntos de distancia.
Hay además un tier Contributor a $0.10 / $0.20, con una condición que conviene leer: los prompts y las salidas pueden usarse para mejorar los productos de Meta. Es datos a cambio de descuento.
Puedes usar el modelo desde Muse Code, el agente de código propio de Meta, equivalente a Claude Code o Codex.
La tabla de inteligencia general
Artificial Analysis Intelligence Index — 2 de septiembre de 2026
| Puesto | Modelo | Índice | Precio (entrada / salida por 1M) |
|---|---|---|---|
| 1 | Claude Fable 5.1 (max) | 66 | $10 / $50 |
| 2 | Claude Opus 5 (max) | 63 | $5 / $25 |
| 3 | Claude Fable 5 (max) | 62 | $10 / $50 |
| 3 | Muse Spark 1.3 (max)* | 62 | $1.25 / $4.25 |
| 5 | Muse Spark 1.3 (xhigh) | 61 | $1.25 / $4.25 |
| 5 | GPT-5.6 Sol (max) | 61 | $4 / $20 |
| 5 | Grok 4.6 (high) | 61 | — |
| 8 | Kimi K3 (max) | 60 | $3 / $15 |
| 8 | GLM-5.3 (max) | 60 | $1.40 / $4.40 |
| 10 | Gemini 3.8 Flash (high) | 59 | $0.75 / $3.75* |
*Muse Spark 1.3 max: preview limitado. Gemini 3.8 Flash: precio introductorio hasta el 31/12/2026.
Diez modelos dentro de una banda de 7 puntos. Ese es el dato que resume el momento.
Fíjate en algo: Gemini 3.8 Flash es último en este índice y primero en DeepSWE. No es contradicción, es especialización. El Intelligence Index promedia conocimiento general; DeepSWE mide trabajo de ingeniería sostenido. Elegir modelo por el índice equivocado es el error más caro de esta semana.
Benchmaxxing: por qué el gráfico bonito no significa nada
El término describe optimizar para el benchmark en vez de para la capacidad que el benchmark pretende medir. Es la ley de Goodhart aplicada a modelos de lenguaje.
Hay tres razones concretas para tomárselo en serio esta semana:
1. Los números no coinciden entre fuentes
Terminal-Bench 2.1 para Gemini 3.8 Flash aparece publicado como 90.8%, 89.4% y 87.6% según dónde mires. Tres cifras distintas, el mismo modelo, el mismo test. La diferencia está en el harness, el número de intentos y la configuración de razonamiento, y casi nunca se documenta al lado del gráfico.
2. Los fabricantes se comparan contra quien les conviene
Ni Google ni Meta compararon su modelo contra Claude Fable 5.1, que había salido el día anterior y encabezaba el índice. Meta comparó contra su propio 1.2, GPT-5.6 Sol y Opus 5. Es una decisión editorial, no técnica.
3. Las corridas independientes encuentran huecos que los benchmarks no ven
Una prueba independiente de 232 llamadas entre Gemini 3.8 Flash y Muse Spark 1.3 dio un resultado que ningún benchmark de lanzamiento anticipaba: Muse pasó 112 de 112 llamadas evaluadas, Gemini 91 de 112. La separación se concentró casi por completo en contexto largo — Muse pasó las 16 llamadas de 128K y 512K tokens, Gemini no pasó ninguna.
Pero el mismo test apunta al revés en otra dimensión: Gemini salió más barato por resultado aceptado y más rápido en la mediana, mientras Muse promedió 86.7 segundos por tarea en modo high contra 27.3 de Gemini. Ninguno gana en todo.
La defensa práctica es preferir benchmarks que corran todos los modelos bajo el mismo harness y publiquen sus tareas, como DeepSWE, por encima de los scorecards de lanzamiento.
¿Se está alcanzando un techo?
Sí, y no es solo una percepción. Los propios autores de DeepSWE construyeron el benchmark porque los públicos actuales están empezando a saturarse en la frontera: los modelos de arriba se agrupan en una banda estrecha donde las configuraciones adyacentes se solapan en sus intervalos de confianza.
Míralo en la tabla de DeepSWE: entre el primero (74%) y el sexto (69%) hay cinco puntos, y varios de esos intervalos de error se cruzan. Estadísticamente, media docena de modelos empatan.
Pero el techo no es parejo. En tareas agénticas el margen todavía es grande: Fable 5.1 sacó 1,853 Elo en GDPval-AA v2, +130 sobre Fable 5, y Gemini 3.8 Flash marcó 1,545 en la misma evaluación. Trescientos puntos de Elo no son un empate. El techo aparece en conocimiento general y en tareas de código acotadas, no en trabajo autónomo de largo horizonte.
La consecuencia práctica es que la competencia se está mudando a costo por tarea. Cuando seis modelos empatan en capacidad, la columna que decide es la de dólares.
Qué modelo usar según el caso
| Situación | Recomendación | Por qué |
|---|---|---|
| Ingeniería de software real, tareas largas | Gemini 3.8 Flash (high) | 74% en DeepSWE al mismo nivel que Opus 5, a un quinto del costo |
| Proyecto complejo con presupuesto holgado | Claude Fable 5.1 u Opus 5 | Mejor en contexto largo y decisiones autónomas; menos pasos por tarea |
| Vibe coding, sitios web, componentes | Gemini 3.8 Flash o Muse Spark 1.3 | Calidad suficiente a una fracción del costo |
| Agentes con muchas llamadas | Muse Spark 1.3 | Menos tool calls y menos tokens por tarea |
| Latencia crítica | Gemini 3.8 Flash (low/medium) | ~305 t/s; usa low para bajar el time-to-first-token |
| Presupuesto mínimo | GLM-5.3-Flash | 63% en DeepSWE por $0.24 promedio por tarea |
No te cases con un proveedor
En un panorama que se reordena cada tres semanas, la decisión inteligente no es elegir el mejor modelo — es elegir un harness que te deje cambiarlos sin reescribir tu flujo:
- OpenCode — agente open source con 195K estrellas en GitHub. Su plan Go, a $10/mes, ya incluye Muse Spark 1.3 Contributor, Hy4 preview, Kimi K3, Grok 4.6, GLM-5.3-Flash, MiniMax M3 y GPT-5.6 Luna. Ojo: Muse Spark 1.3 Contributor está limitado a ciertas regiones, así que verifica disponibilidad si estás en LATAM.
- Command Code — agente de terminal que aprende tus preferencias de código y las convierte en skills reutilizables del proyecto. Plan Go desde $1/mes y plan GOAT a $10/mes con más de 50 modelos, con foco explícito en hacer funcionar bien los modelos abiertos.
Ambos te permiten probar los lanzamientos nuevos el mismo día sin cambiar de suscripción.
El resto del pelotón: Tencent Hy4
No todo pasa entre Google, Meta y Anthropic. El 28 de agosto Tencent liberó Hy4 preview:
- 770B parámetros totales, 49B activos (arquitectura MoE)
- Contexto de más de 1M de tokens
- Pesos abiertos bajo Apache 2.0, sin cláusulas de usuarios activos ni licencia comunitaria personalizada
- $0.834 entrada / $2.501 salida por millón vía API
Tencent afirma que rinde comparable a Kimi K3 con aproximadamente un tercio del tamaño. Ya está incluido en el plan Go de OpenCode, lo que da una señal clara de qué tan rápido se está normalizando el acceso a modelos de esta escala.
Si la tendencia continúa, en algunos años es plausible tener un modelo preinstalado en tu equipo generando código sin necesidad de contratar un servicio.
Conclusión
Tres modelos en 48 horas, y ninguno cambia radicalmente el panorama por sí solo. Lo que cambia es la forma de la competencia.
Lo que puedes concluir con confianza:
- Gemini 3.8 Flash empata con Opus 5 en el benchmark de ingeniería más limpio que hay, a un quinto del costo — el mejor trato del mercado ahora mismo para trabajo de código
- Claude Fable 5.1 sigue siendo el modelo más capaz medido, y por un margen claro en tareas agénticas de largo horizonte
- Meta entró al top 3 del índice de inteligencia y ya no es un actor secundario
- Media docena de modelos empatan estadísticamente en DeepSWE, y eso convierte al precio en el criterio de desempate
Lo que no puedes concluir todavía: que cualquiera de estos modelos reemplace a Fable u Opus para trabajo complejo de largo horizonte. Empatan en puntaje pero necesitan bastantes más pasos para llegar, y en evaluaciones agénticas la brecha sigue siendo de cientos de puntos de Elo.
Lo sensato es no casarse con un proveedor y probar con tu propio código. El ranking de hoy no es el de dentro de tres semanas.
Preguntas frecuentes
¿Gemini 3.8 Flash es mejor que Claude Opus 5? Para tareas de ingeniería de software, empatan: ambos marcan 74% en DeepSWE v1.1, pero Gemini cuesta $2.36 por tarea contra $11.84 de Opus 5. En conocimiento general Opus 5 sigue por delante (63 contra 59 en el Intelligence Index).
¿Cuánto cuesta Gemini 3.8 Flash? $0.75 por millón de tokens de entrada y $3.75 de salida, pero solo hasta el 31 de diciembre de 2026. Después pasa a $1.50 / $7.50.
¿Muse Spark 1.3 es el mejor modelo de código? No hay evidencia independiente que lo respalde todavía. Meta reporta 75.4 en DeepSWE, pero es una corrida propia; el leaderboard oficial de DeepSWE aún no lo incluye, y la versión 1.2 medida allí saca 55%.
¿Qué es el benchmaxxing? Optimizar un modelo para obtener buenos puntajes en un benchmark concreto en vez de mejorar la capacidad que ese benchmark pretende medir. El síntoma típico es un salto grande en la puntuación sin mejora perceptible en el uso diario.
¿Vale la pena cancelar mi suscripción a Claude? Depende del tipo de trabajo. Para tareas de código acotadas, las alternativas baratas ya rinden igual y cuestan una fracción. Para proyectos donde delegas gran parte del desarrollo, la diferencia sigue siendo visible en contexto largo y en toma de decisiones autónoma.
¿Dónde puedo consultar los benchmarks yo mismo? DeepSWE para tareas de ingeniería de software con un harness consistente, y Artificial Analysis para inteligencia general, velocidad y costo por tarea de casi 200 modelos.
¿Tienes dudas sobre qué stack de IA conviene para tu proyecto? Puedes reservar asesorías personalizadas en fazt.dev.