GLM-5.3: qué es, precio, benchmarks y cómo rinde en proyectos reales
GLM-5.3 es el nuevo modelo de la empresa china Z.ai (antes Zhipu), lanzado el 14 de agosto de 2026 y orientado a código, agentes y tareas largas de ingeniería de software. Se presenta como alternativa a modelos frontier como GPT-5.6 u Opus 5, pero a una fracción del precio.
En este artículo te cuento qué es GLM-5.3, cuánto cuesta, qué dicen los benchmarks independientes y, sobre todo, qué pasó cuando lo probé con tres proyectos reales desde la terminal.
Qué es GLM-5.3 y por qué no es un modelo nuevo
Lo primero que hay que entender es que GLM-5.3 no es una arquitectura nueva. Según el anuncio oficial de Z.ai, usa exactamente el mismo modelo base que GLM-5.2 (un MoE de 743B de parámetros). Todas las mejoras vienen de escalar el post-entrenamiento: más entornos de tareas, más diversidad y más cómputo de reinforcement learning. La propia empresa resume el lanzamiento diciendo que escalar el post-entrenamiento fue lo único que hicieron.
Es un dato interesante por sí solo: demuestra cuánto margen queda en un modelo base ya entrenado sin pasar por otro ciclo caro de pre-entrenamiento.
Características principales de GLM-5.3
- Contexto de 1M de tokens y hasta 128K tokens de salida (igual que GLM-5.2).
- Solo texto: no es multimodal. No acepta imágenes ni audio, a diferencia de GPT o Claude.
- Tres niveles de razonamiento:
low,highymax. El predeterminado esmaxy es el que Z.ai recomienda para código. - El razonamiento ya no se puede desactivar. Es un cambio que rompe compatibilidad si tenías apps con GLM-5.2 y thinking apagado.
- API compatible con OpenAI y Anthropic: en VS Code, Cursor, Claude Code, OpenCode o tu propio agente basta con cambiar la URL base.
- Pesos abiertos, pero todavía no: Z.ai prometió liberarlos unas dos semanas después del lanzamiento (alrededor del 28 de agosto) tras la evaluación de seguridad. Al escribir esto, el botón de Hugging Face sigue en "Coming Soon".
Benchmarks de GLM-5.3: realista, no exagerado
Algo que valoro de este lanzamiento es que Z.ai no se está vendiendo al nivel de Opus 5, como hacen otros labs. Sus propias tablas muestran dónde gana y dónde pierde.
Según Artificial Analysis, GLM-5.3 (max) obtiene 60 puntos en el Intelligence Index, empatando con Kimi K3. Es decir, su competencia real no es Opus 5, GPT-5.6 ni Grok (que están por delante y muy cerca entre sí), sino el grupo de modelos chinos: Kimi K3, GLM-5.3 y Qwen 3.8. Si quieres una referencia mental rápida, piensa en GLM-5.3 como un Kimi K3 más barato.
GLM-5.3 vs GLM-5.2 (benchmarks oficiales de Z.ai)
| Benchmark | GLM-5.2 | GLM-5.3 |
|---|---|---|
| Terminal-Bench 3.0 | 4.6% | 28.3% |
| DeepSWE v1.1 | 46.2% | 66.9% |
| AutomationBench | 26.2% | 48.2% |
| CyberGym | 77.2% | 84.5% |
| ExploitBench | 24.4% | 54.4% |
Frente a los modelos cerrados el panorama es más mixto: en Terminal-Bench 3.0 sigue detrás de Claude Fable 5 (33.7) y GPT-5.6 Sol (34.6), y lo mismo en DeepSWE. Donde sí lidera es en AutomationBench y en CyberGym.
Importante: salvo los datos de Artificial Analysis, estos números los reporta el propio Z.ai y aún no tienen replicación independiente completa.
Ciberseguridad: el punto más comentado
Z.ai añadió datos de descubrimiento de vulnerabilidades al post-entrenamiento y, según ellos, la capacidad ofensiva creció más rápido de lo esperado: el modelo empezó a encadenar etapas de un ataque por sí solo. Ese es el motivo por el que retrasaron los pesos abiertos, como cubrieron Axios y VentureBeat. En CyberGym supera a Fable 5 y GPT-5.6 Sol; en ExploitBench queda justo detrás. Es uno de los pocos modelos chinos que realmente ha mejorado en esta área.
Precio de GLM-5.3: aquí está la ventaja real
GLM-5.3 cuesta $1.40 por millón de tokens de entrada y $4.40 por millón de salida, con lectura de caché a $0.26/M, según OpenRouter. En contexto:
- Es el mismo precio por token que GLM-5.2.
- Es más barato que Grok 4.6, que esta misma semana también sorprendió por su relación precio/rendimiento.
- Está al nivel o por debajo de Kimi K3, que ya era la opción económica frente a Opus 5 (cerca de un tercio del precio).
- Frente a Claude Opus 5 hablamos de unas 5 veces menos por token.
Un matiz que hay que considerar: Artificial Analysis encontró que GLM-5.3 es bastante más verboso que su antecesor. Generó 170M de tokens al correr el Intelligence Index frente a una mediana de 72M, por lo que el costo por tarea completada sube a unos $0.68 frente a $0.44 en GLM-5.2, aunque el precio por token sea idéntico. El precio de lista no cuenta toda la historia.
Si prefieres suscripción, el GLM Coding Plan empieza en $18/mes con un sistema de puntos que cobra la mitad fuera de horas pico (en horario de China, así que los fines de semana siempre son off-peak).
Mi prueba: tres proyectos con GLM-5.3 desde la terminal
No usé ZCode, la herramienta oficial de Z.ai, sino Command Code, un harness de terminal similar a Claude Code u OpenCode que se actualiza muy rápido con los modelos open-weight chinos (Qwen, DeepSeek, GLM, Kimi). Lo ejecuté con cmdc --yolo, seleccioné GLM-5.3 con /model y lo puse en esfuerzo max.
1. Juego 3D en el navegador (estilo la cabaña de Resident Evil 4)
Pedí algo con lógica real, no solo "un personaje en un ambiente 3D": sobrevivir a oleadas de enemigos en una cabaña, renderizado y jugable en el navegador.
Aquí pasó lo primero raro: el modelo (o el harness, no estoy seguro) entró en un loop. Generaba la planificación, se detenía, volvía a planificar, se detenía. Esperé más de una hora en el primer intento y 22 minutos en el segundo sin resultado. Es la primera vez que me pasa con un modelo; los otros modelos actualizados que he probado responden sin problema.
Lo que funcionó fue limpiar la sesión y simplificar el prompt: "demo 3D jugable, shooter, sobrevive a enemigos". Con eso sí generó algo funcional. El resultado no está mal, aunque los controles no quedaron del todo bien y no es exactamente la misión de RE4. La idea la captó.
2. E-commerce con Next.js + Stripe
Algo más típico: tienda con pagos Stripe, dashboard, inventario, roles de usuario e historial de compras. Después de unos 20 minutos terminó, generando un TODO con subtareas por el camino.
Lo primero que obtuve fue un error con la variable de entorno de Node. Además usó Next.js 14, una versión antigua. Tardó otros 10 minutos en corregirlo. Al final el proyecto funciona: registro, sesiones, carrito, productos. Pero la estructura es muy común y no es nada sorprendente. Lo he probado también con Qwen y DeepSeek e, irónicamente, esos modelos responden mejor en este tipo de tarea pese a estar por detrás en los benchmarks.
3. Landing page para una agencia de marketing
Como la UI del e-commerce no fue gran cosa, le pedí una landing con servicios, precios, portafolio y testimonios. De nuevo noté que la fase de planificación toma alrededor de 10 minutos antes de escribir la primera línea de código, igual que en el ejemplo 3D.
El resultado, honestamente, no está nada mal. Tiene un diseño único, aunque parece más la interfaz de una app de música que de una agencia de marketing. Al menos no es el típico "UI slop" genérico que generan la mayoría de modelos; es un buen punto de partida para luego ajustar la idea.
¿Es el modelo, el harness o la API saturada?
No tengo una respuesta definitiva. Hay tres posibilidades:
- La API está saturada porque el modelo acaba de salir y todos lo están probando (normal en lanzamientos populares).
- Command Code todavía no está adaptado al modelo (el loop de planificación apunta a esto).
- El modelo no es tan bueno en la práctica como en los benchmarks.
Probablemente sea una mezcla. Lo que sí puedo decir es que en los tres casos obtuve un proyecto funcional en el primer prompt, que es el objetivo mínimo, pero la experiencia fue más lenta y con más fricción de la que esperaba.
¿Vale la pena usar GLM-5.3? Cómo lo usaría yo
Mi flujo actual es delegar la planificación a un modelo frontier (GPT-5.6 u Opus 5) y el trabajo por lotes a un modelo barato: Grok 4.6, Kimi K3 o ahora GLM-5.3. Si la restricción es usar modelos puramente chinos, las tres opciones son Kimi K3, GLM-5.3 y Qwen 3.8, y están prácticamente al mismo nivel.
La realidad es que ya no hay tanta diferencia entre modelos como hace un par de años, cuando había uno malo, uno decente y los buenos. Ahora casi todos convergen. GLM-5.3 logra una ventaja pequeña sobre Kimi y Grok 4.6 en precio y velocidad, pero cuánto se note en la práctica dependerá del tipo de tarea.
Preguntas frecuentes sobre GLM-5.3
¿GLM-5.3 es open source? Todavía no. Z.ai prometió liberar los pesos unas dos semanas después del lanzamiento del 14 de agosto de 2026, tras completar la evaluación de seguridad. La licencia aún no se ha anunciado.
¿Cuánto cuesta la API de GLM-5.3? $1.40 por millón de tokens de entrada y $4.40 por millón de salida. El GLM Coding Plan empieza en $18/mes.
¿GLM-5.3 acepta imágenes? No. Es un modelo solo de texto (entrada y salida).
¿GLM-5.3 es mejor que Claude Opus 5 o GPT-5.6? No. En los benchmarks independientes está claramente por detrás; su competencia real es Kimi K3 y Qwen 3.8. Su ventaja es el precio.
¿Dónde puedo usar GLM-5.3? Vía API de Z.ai, OpenRouter, ZCode, Claude Code, OpenCode, Command Code o cualquier herramienta compatible con la API de OpenAI/Anthropic.
Enlaces útiles
- Anuncio oficial de GLM-5.3 (Z.ai)
- GLM-5.3 en Artificial Analysis
- GLM-5.3 en OpenRouter (precios y API)
- Repositorio zai-org/GLM-5 en GitHub
- VentureBeat: GLM-5.3 llega a la API a $1.4/$4.4
- Interconnects: cómo los labs chinos siguen el ritmo de la frontera
Si estás probando GLM-5.3 y has obtenido buenos resultados con algún proyecto, déjalo en los comentarios. Así todos nos enteramos.