Grok 4.6: el nuevo modelo de xAI que ya puedes usar en Cursor
Hace unos días se actualizó Grok a su versión 4.6. Durante mucho tiempo, Grok era un modelo bastante generalista, más o menos al nivel de GPT, pero con esta actualización tenemos un modelo que es muy bueno en generación de código, a tal punto que —en mi opinión— se parece bastante a lo que ofrece GPT.
Y si a eso le sumamos que lo podemos utilizar directamente desde Cursor, probablemente estemos ante una de las mejores actualizaciones recientes en el mundo de los agentes de IA. Para los que ya pagan Cursor, esto significa dos cosas: mejores respuestas dentro del editor y la posibilidad de generar mucho más código con la misma suscripción.
En este artículo te comparto por qué esto es así, junto con algunas demos de lo que puede hacer este modelo.
Los benchmarks oficiales (con pinzas)
Empecemos por lo básico: el benchmark que publicó la propia SpaceXAI. Según sus números, Grok 4.6 en su grado de esfuerzo High obtiene 61 puntos en el Artificial Analysis Intelligence Index, subiendo desde los 56 de Grok 4.5 y quedando casi al mismo nivel de Claude Fable 5 Max (62) y empatado con GPT-5.6 Sol Max.
Esto siempre hay que tomarlo con pinzas, porque cuando una empresa publica su propia tabla comparativa suele mezclar resultados públicos con mediciones propias de los competidores. No es un ranking neutral, es la vitrina del fabricante. Pero el punto importante es este: ahora tenemos un modelo mucho más barato que está a la par de los modelos frontier, y que puede encargarse de tareas bastante más complejas que su versión anterior.
De hecho, xAI está lanzando versiones a un ritmo bastante rápido, incluso más veloz que OpenAI y Anthropic en algunos ciclos.
¿Y qué dicen los benchmarks independientes?
Una mejor forma de ver qué tan bueno es un modelo es usar un benchmark ajeno, es decir, uno que no venga de la misma empresa. Ahí es donde entra Artificial Analysis.
En su índice, Grok 4.6 (High) queda casi al mismo nivel de GPT-5.6 Sol en su grado de esfuerzo máximo. Y si se fijan, los modelos más grandes ya están prácticamente a la par entre sí. Por ejemplo, Kimi K3 —uno de los modelos que más se ha estado promoviendo estas últimas semanas— tiene un puntaje de 60 en su modo max, mientras que Grok lo supera apenas por un punto.
Lo que más me llama la atención es justamente eso: los modelos frontier parecen estar llegando a un tope, y los demás empiezan a alcanzarlos. Esto quiere decir que en los siguientes meses probablemente veamos mejoras ya no tan exageradas en inteligencia bruta, y la competencia se va a mover hacia otro terreno: el precio.
Eso sí, no todo es perfecto. El análisis independiente también matiza: en pruebas de programación exigente como DeepSWE y Terminal-Bench, GPT-5.6 Sol mantiene una ventaja clara. No hay un ganador universal; cada modelo puntea más alto en distintas tareas.
El precio: aquí está lo interesante
Cuando usas un modelo que responde bien y lo vas a usar mucho —generación de código, revisión de código— necesitas tokens. Muchos tokens. Y aquí es donde Grok 4.6 realmente destaca:
- Entrada: $2 por millón de tokens
- Salida: $6 por millón de tokens
- Existe una variante rápida que cuesta el doble
Si bien no es excesivamente barato, está por debajo de Kimi K3 ($3 / $15 por millón), que era justamente una de las ventajas de ese modelo chino. Es decir: mientras estos últimos meses se hablaba de que los mejores modelos eran GPT-5.6 Sol, Fable 5 u Opus, ahora tenemos un modelo casi al mismo nivel pero mucho más barato. Artificial Analysis incluso destaca que completa tareas en aproximadamente la mitad de pasos y con una fracción de los tokens que consumen algunos rivales.
Esto eventualmente va a obligar a los demás laboratorios a reducir precios, y obviamente a lanzar modelos más grandes.
Una consideración importante: aunque en inteligencia está a la par, en velocidad de generación no es de los mejores. Los modelos más rápidos del momento siguen siendo los de la familia Flash de Google y las variantes ligeras de GPT, y Grok 4.6 queda casi al final en tokens por segundo. Aun así, comparado con K3 —que también es lento— hasta sale ganando.
El contexto: SpaceX compró Cursor
Aquí hay algo clave para entender esta jugada. SpaceX (que absorbió a xAI a inicios de año) ejerció en junio su opción de compra sobre Anysphere, la empresa detrás de Cursor, en un acuerdo totalmente en acciones valorizado en $60 mil millones — la mayor adquisición de una startup respaldada por venture capital de la historia. Se espera que la transacción cierre en el tercer trimestre de 2026.
Por eso Grok 4.6 llega como modelo destacado dentro de Cursor: ofrecen la variante por defecto y también el modo xhigh (extra high), su grado de esfuerzo máximo. Con esto, xAI gana todo un ecosistema de herramientas enfocadas en generación de código: el editor, los datos (Cursor genera alrededor de 150 millones de líneas de código al día) y un canal directo hacia los desarrolladores.
Dato curioso: Elon Musk ha dicho que este es uno de sus mejores modelos hasta la fecha, y aunque de momento se compara con los modelos de Anthropic, él mismo reconoce que Anthropic lanzará nuevos modelos y recuperará terreno. Y para los que no lo sabían: Anthropic está dentro de la nube de xAI. Hace unos meses se reveló (en el propio S-1 de SpaceX) que Anthropic le paga a xAI $1.25 mil millones al mes por capacidad de cómputo del clúster Colossus hasta 2029. Sí, le están alquilando la nube a su competencia directa.
Lo que se entiende de todo esto es que xAI está avanzando rápido y ahora es una competencia mucho más seria para OpenAI, con tres laboratorios prácticamente a la par en la cima: Anthropic, OpenAI y xAI.
Demo 1: un juego estilo Mario Kart en 3D
Vamos a lo práctico. Desde Cursor, usando Grok 4.6 en modo xhigh, le pedí lo que siempre pido cuando pruebo un modelo nuevo: "crea un juego al estilo de Mario Kart en 3D".
Con un solo prompt, el resultado no luce nada mal. La interfaz está bien generada, incluye bots que compiten contra el jugador principal, y todo esto tomó alrededor de 45 minutos de trabajo autónomo — considerando que es un juego 3D con lógica de multijugador, no está mal.
Obviamente tiene fallos: los controles salieron invertidos (algo muy típico con Three.js) y las colisiones no están del todo pulidas. Pero es su primer prompt. Yo mismo he pedido esto a Kimi K3 y otros modelos populares del momento, y aquí funciona mucho mejor.
Demo 2: un landing page para un SaaS
Segundo test: "crea un landing page de un SaaS enfocado en seguimiento de gastos". Y le agregué algo extra: "no uses ningún skill". Como en mi computador tengo varios skills enfocados en diseño web y desarrollo de interfaces, no quería que el modelo mejorara con eso — quería verlo en su formato más crudo.
El resultado tomó 3 minutos y no luce como el típico AI slop. Es simple, pero está bien logrado. Me recuerda bastante a lo que genera GPT, y lo menciono porque esa es justamente su competencia directa: xAI y OpenAI vienen básicamente de la misma idea.
Quizás esperabas que respondiera más rápido si estás acostumbrado a Composer, pero honestamente casi ni se nota.
Demo 3: un monorepo completo (web + API + CLI + MCP)
El test más ambicioso: "crea un monorepo de administración de proyectos (tareas, proyectos, equipos) conformado por frontend, backend, CLI y un MCP. Tú decide las funcionalidades, enfócalo en un estilo SaaS para un MVP".
Le tomó alrededor de una hora, pero generó prácticamente todo:
- La aplicación web con registro e inicio de sesión
- El backend / API con base de datos funcionando
- Un CLI que consume esa misma API
- Un servidor MCP conectado al sistema
Son básicamente cuatro proyectos en uno, todos conectados entre sí. En la sección de settings incluso generó la parte de API keys para autenticar tanto el CLI como el MCP.
Para probar el MCP le pedí los pasos para conectarlo a Claude Desktop: generar una llave, encontrar el archivo de configuración y pegar el bloque de código. Y como esto es un agente de código, puede hacer todo eso por ti. Una vez configurado, desde Claude Desktop le pregunté cuántos proyectos tenía registrados; llamó al conector, consultó la API y me devolvió justamente el proyecto de prueba que acababa de crear.
Lo más destacable: no falló en el desarrollo. Un solo prompt y el modelo generó todo el proyecto sin que tuviera que pedirle reescribir nada. Lo único que ajusté fue configuración externa (levantar el servidor del backend), que no tiene que ver con el desarrollo como tal.
Conclusiones
Dos puntos importantes de todo esto:
Cursor gana un modelo propio de primer nivel. Con Grok 4.6, Cursor ya compite de tú a tú con Codex de OpenAI, y esto explica en gran parte por qué SpaceX compró la empresa: ahora tienen el ecosistema completo — modelo, editor y datos.
La cima está más reñida que nunca. Grok 4.6 se ubica entre los mejores modelos del ranking, casi al nivel de GPT-5.6, con tres laboratorios prácticamente a la par. Y ojo, que los modelos chinos no se quedan quietos: probablemente esta semana escuchemos algo de MiniMax o GLM.
Si tienes alguna duda o quieres que pruebe otro tipo de tarea usando Grok y Cursor, déjamelo en los comentarios.