Qwen3.8-Max: el nuevo modelo de Alibaba que quiere competir directamente con Claude
Alibaba acaba de lanzar Qwen3.8-Max, el modelo más potente de toda su familia Qwen hasta la fecha. Y esta vez no es solo otro release incremental: estamos hablando de un modelo de 2.4 billones (trillions) de parámetros totales que, según los propios benchmarks de Alibaba, se compara de tú a tú con Claude Opus 4.8 y en algunos casos con Claude Fable 5. Además, viene con una promesa importante: los pesos abiertos se liberan la próxima semana, siendo la primera vez que Alibaba abre un modelo de esta escala.
Lo probé en varias tareas de generación de código y en este artículo te cuento qué hay de real, qué es marketing y qué tan usable es en la práctica.
¿Qué es exactamente Qwen3.8-Max?
Es un modelo Mixture-of-Experts (MoE) con estas características:
- 2.4 billones de parámetros totales, con solo 95 mil millones activos por token. Es decir, no ejecuta toda la red en cada consulta, sino que divide el trabajo entre "expertos" especializados.
- Ventana de contexto de 1 millón de tokens, aproximadamente 750,000 palabras de entrada por consulta.
- Multimodal nativo: acepta texto, imagen y video como entrada, y devuelve texto. Alibaba dice que puede procesar documentos de cientos de páginas, series de TV completas o transmisiones de hasta 100 horas y convertirlas en bases de conocimiento consultables.
- Está construido sobre la arquitectura de Qwen 3.5 y sucede a Qwen3.7-Max, que salió en mayo.
En tamaño queda muy cerca de Kimi K3 de Moonshot AI (2.8 billones de parámetros), que salió apenas semanas antes. La carrera entre los laboratorios chinos está claramente acelerada, y el timing de ambos lanzamientos no parece casualidad.
El modelo ya está disponible vía API en Alibaba Cloud Model Studio (compatible con el formato de OpenAI, así que integrarlo es cambiar la base URL y el ID del modelo), y también puedes probarlo gratis a nivel de usuario desde Qwen Studio.
Los benchmarks: lo bueno y las pinzas
Alibaba publicó una tabla completa de benchmarks con este lanzamiento (a diferencia del preview de julio, que llegó sin datos de respaldo). Los números más relevantes:
| Benchmark | Qwen3.8-Max | Claude Fable 5 | Notas |
|---|---|---|---|
| Terminal-Bench 2.1 | 86.6 | 84.6 | Por encima de Opus 4.8 y Fable 5, detrás de GPT-5.6 Sol (88.8) |
| SWE-bench Pro | 67.7 | 80.0 | Aquí la distancia es clara |
| FrontierSWE | 73.5 | 88.8 | Idem |
| GPQA Diamond | 92.6 | — | Casi igual que su predecesor (92.4) |
La lectura honesta es esta: las mejoras grandes no están en razonamiento puro, sino en lo agéntico y multimodal. Contra su propia versión anterior el salto es enorme (FrontierSWE pasa de 40.7 a 73.5, por ejemplo), y en visión lidera la mayoría de las tablas. Pero en ingeniería de software de nivel frontier, Fable 5 sigue estando en otra liga.
Y ojo con un detalle que casi nadie menciona: la tabla multimodal de Alibaba compara contra Qwen3.7-Plus, no contra Qwen3.7-Max, lo cual infla artificialmente el salto generacional. Este tipo de cosas es exactamente por lo que siempre digo que los benchmarks del propio fabricante hay que verlos con pinzas hasta que salgan evaluaciones independientes.
Como referencia externa temprana: en Arena.AI (comparación crowdsourced), Qwen3.8-Max se convirtió inmediatamente en el modelo chino mejor rankeado en tareas de texto, aunque todavía por debajo de varios modelos de Anthropic incluyendo Fable 5. En visión quedó segundo a nivel global, solo detrás de una variante de Fable 5. Eso ya es un dato más creíble que la tabla propia.
El "desarrollo autoevolutivo": la apuesta central
Lo que más está marcando este lanzamiento es el enfoque en operación autónoma de largo plazo. Alibaba muestra varios experimentos internos:
- El modelo pasó más de 10 días programando de forma autónoma un harness de código autoevolutivo desde una carpeta vacía: escribiendo código, corriendo sus propios tests, incorporando feedback, creando pull requests, revisándolos e iterando hasta llegar a una versión 1. El repositorio resultante es un CLI tipo agente, básicamente su propio "Claude Code" generado por el propio modelo.
- Reprodujo un paper de machine learning desde cero: 33 rondas de entrenamiento en GPU durante unas 125 horas, 7,600 líneas de código, y luego propuso 18 ideas de mejora que terminaron superando al método del paper original.
- En una competencia online real contra 526 equipos humanos, superó al 87% del campo.
Suena impresionante, y probablemente algo de eso es real. Pero de nuevo: son experimentos internos, sin verificación externa todavía. Habría que revisar el código de ese repositorio para ver qué tan bueno es realmente. Lo que sí es innegable es la dirección: Alibaba no está vendiendo un chatbot, está vendiendo un agente que trabaja semanas sin supervisión. Es exactamente el mismo territorio donde Anthropic ha estado empujando con Claude en los últimos meses, y por eso lo veo como su competidor abierto más directo.
Precios
Aquí está uno de los argumentos más fuertes. La API cuesta:
- $2 por millón de tokens de entrada
- $6 por millón de tokens de salida
- $0.25 por millón en cache reads implícito, y sin recargo por contexto largo
Es más caro que su predecesor Qwen3.7-Max ($1.25/$3.75), pero sigue siendo considerablemente más barato que los modelos frontier de Anthropic y OpenAI. Para cargas agénticas que consumen millones de tokens, la diferencia de costo es un argumento real. Eso sí: los modelos Qwen tienden a generar más tokens de salida por tarea que sus competidores, así que el costo real por tarea puede ser mayor de lo que sugiere el precio por token.
Sobre los pesos abiertos: un matiz importante
Que sea "open weight" no significa que lo vayas a correr en tu PC. Un checkpoint de 2.4 billones de parámetros es un artefacto de datacenter multi-nodo: ni con un DGX Spark te acercas. Lo que sí es relevante para quienes trabajamos con modelos locales es que Alibaba también va a liberar Qwen3.8-27B, un checkpoint que sí entra en hardware on-premise normal. Ese es el que vale la pena esperar si tu interés es la ejecución local.
El valor real de abrir el modelo grande está en otro lado: proveedores de inferencia terceros podrán servirlo y competir en precio, y la comunidad podrá auditarlo, destilarlo y hacer fine-tuning sobre él.
Lo probé: mis impresiones
Para la prueba usé Command Code como harness (me permite escoger entre múltiples modelos abiertos) con el nivel de esfuerzo en extra high. Dos pruebas con prompts deliberadamente vagos:
Prueba 1 — Juego 3D estilo Mario Kart. La primera versión generada no arrancaba: no sirvió el proyecto y los assets no cargaban hasta que le pedí explícitamente que lo sirviera en un puerto. Es un desliz que la mayoría de modelos actuales ya no comete. Pero una vez corriendo, el resultado fue bastante decente: el juego funciona bien, y le atinó al primer prompt sin pedirle nada más que un párrafo. Comparado con generaciones de modelos abiertos anteriores, se nota el salto.
Prueba 2 — ERP en monorepo con backend. Le tomó unos 30 minutos y algo más, pero el resultado fue sólido: monorepo con Turbo bien configurado, API y aplicación web separadas como dos proyectos grandes, base de datos real funcionando, estructura correcta. La creación de productos y datos funcionó sin problemas. La interfaz es la típica genérica de modelos abiertos (eso se mejora con un skill), pero a nivel de lógica es bastante usable.
Mi sensación general: me recuerda bastante a Opus 4.8. No está al nivel de Fable 5 en las tareas más exigentes de ingeniería de software (y sus propios benchmarks lo confirman), pero es un competidor mucho más serio de lo que fue, por ejemplo, DeepSeek V4 Flash, que genera código rápido pero no juega en esta liga.
Conclusión
Qwen3.8-Max es un modelo genuinamente usable y el competidor abierto más directo que tiene Anthropic ahora mismo. Los datos verificables: 2.4T de parámetros MoE, 1M de contexto, $2/$6 por millón de tokens, número uno entre modelos chinos en Arena.AI, y pesos abiertos confirmados para la próxima semana. Las afirmaciones a tomar con pinzas: la paridad con Fable 5 (sus propios números muestran brechas de 12-15 puntos en SWE-bench Pro y FrontierSWE) y los experimentos de desarrollo autónomo de 10+ días, que aún nadie ha verificado externamente.
Como siempre pasa con estos lanzamientos, en unos días los benchmarks independientes tipo Artificial Analysis van a poner las cosas en su lugar. Mientras tanto, si trabajas con agentes de código y el costo te importa, este modelo ya merece un lugar en tus pruebas.
¿Ya lo probaste? Cuéntame en los comentarios qué resultados obtuviste o qué ejemplo te gustaría ver.