Tier list de modelos de IA (agosto 2026): cuál usar según tu caso y tu bolsillo
Cada semana me preguntan lo mismo: ¿qué modelo utilizar? ¿Cuándo conviene un modelo chino frente a uno americano? ¿Vale la pena pagar los modelos de Anthropic u OpenAI, o basta con algo más barato? El problema es que la mayoría se guía por las métricas que publica cada laboratorio sobre sus propios modelos, y eso es como preguntarle al panadero si su pan es bueno.
Así que en este artículo voy a categorizar los modelos más relevantes del momento y a comentarte cuándo uso uno u otro. Aclaración importante: esto no es un tier list estrictamente técnico, es mi percepción subjetiva basada en uso real, contrastada con benchmarks independientes (principalmente Artificial Analysis). Tómenlo con pinzas.
El tier alto: GPT y Claude
Empecemos por los modelos que casi todos ya han probado. GPT, en sus variantes más grandes como GPT 5.6 Sol o GPT 5.5 Extra High, es un modelo que por lo general siempre responde bien. Lo uses desde ChatGPT, desde Codex o desde harnesses propios como Hermes u OpenClaw, funciona muy bien y resulta bastante barato si lo consumes vía suscripción. Yo lo uso sobre todo para tareas cotidianas: leer correos, responder cosas en asistentes de IA, tareas relativamente sencillas.
Claude es su competencia directa, y su punto fuerte es el código. Cuando se trata de leer o generar código, personalmente prefiero Claude, sobre todo con Opus 5, que es el punto dulce entre precio y calidad de respuesta. Anthropic también tiene Fable 5, y es una de las razones por las que Claude está en el top de esta lista. Si comparamos GPT 5.6 Sol con Opus 5, ambos están muy decentes y ambos valen lo que cuestan.
MiniMax M3: el "Claude ligero" chino
Entre los modelos chinos populares está MiniMax M3, que colocaría en un nivel normal. No genera mal código, no es excesivamente caro y su plan estándar está bien de precio. Si buscas algo barato dentro de los modelos chinos, va bastante bien.
Su principal problema: tiende a ser verboso. Muchas veces genera porciones de código que no son del todo necesarias, simplemente porque el modelo se pone a responder. Yo lo describiría como una especie de Claude mucho más ligero, quizás comparable a un Claude 4.6 de versiones anteriores.
Eso sí, el ecosistema de MiniMax va más allá del código: la misma empresa ofrece MiniMax H3 para video y MiniMax Speech para audio y música, todo accesible desde el MiniMax CLI. Si pagas su suscripción y necesitas generar imágenes, videos o música además de código, la suscripción se justifica mucho más.
Grok: multimodal y muy barato
Grok podría ir tanto en alto como en normal; lo dejo en alto principalmente porque es multimodal: genera video, imágenes, código y texto, muy al estilo de ChatGPT, aunque no al mismo nivel. Un GPT 5.6 sigue siendo mejor modelo que Grok 4, tanto en texto como en código.
Para contexto: Grok es el modelo de xAI, la empresa de IA de Elon Musk que se fusionó con SpaceX a inicios de 2026. Y aquí viene un dato importante: SpaceX compró Cursor (Anysphere) por unos 60 mil millones de dólares. El modelo interno que Cursor venía desarrollando (Composer) pasó a segundo plano, y ahora el foco está en integrar Grok como motor de código del editor. En sus benchmarks lo comparan con Opus 4.8 o GPT 5.5 — no con los modelos más grandes como Fable 5, con los que todos quieren compararse.
En inteligencia pura, Grok 4.5 está por la mitad de la tabla, pero en precio se acerca a los modelos chinos como MiniMax o GLM. Es decir: un modelo que responde decentemente y es muy barato, lo que en Cursor se traduce en producir mucho código gastando poco. Yo lo uso a diario, sobre todo para creación de contenido: su búsqueda en internet y la forma en que interpreta los resultados me gusta bastante.
Nemotron 3 Ultra: la apuesta open weight de NVIDIA
Nemotron 3 Ultra es el modelo de NVIDIA y su bandera del open weight: 550 mil millones de parámetros (55B activos), pesos abiertos y pensado para agentes de larga duración. Mi lectura es estratégica: OpenAI y Anthropic viven de sus modelos; NVIDIA vive de vender el hardware donde esos modelos corren. Nemotron funciona como demostración de que su hardware (los DGX Spark, sus equipos de inferencia) ejecuta bien este tipo de cargas, más que como un intento serio de que todo el mundo lo adopte. Dicho esto, es hoy el modelo open weight más inteligente salido de un laboratorio estadounidense, aunque sigue por detrás de la frontera abierta china.
Gemini 3.6 Flash: rápido, pero caro para lo que ofrece
Sé que a muchos les gusta Gemini 3.6 Flash, sobre todo para generación de contenido. Pero si hablamos estrictamente de código, se parece mucho a los modelos chinos en calidad… con un precio que a veces es mayor. Comparado con Grok 4, yo diría que Grok produce código de más calidad: puedes soltarlo en un proyecto grande, con múltiples stacks o un monorepo, y hace un trabajo razonable. Gemini 3.6 Flash te genera una landing o un sitio pequeño sin problema — pero eso hoy lo hace cualquier modelo.
Donde sí brilla es en velocidad: generación de código rápido, lecturas, ejecución de herramientas, tareas por lotes. Y es que Google de momento no tiene una versión "Pro" más potente en esta generación (la retrasaron), así que su apuesta está en la versión rápida. La comparación justa no es contra GPT 5.6 Sol ni Opus 5, sino contra las variantes veloces: GPT 5.6 Luna o Claude Sonnet 5. Contra esos modelos americanos sí es más barato; contra los chinos (MiniMax, y ni hablar de DeepSeek), es caro para la inteligencia que entrega.
Un matiz importante: aquí hablo de costo por API. Si pagas suscripción, probablemente ni lo notes, porque las suscripciones están subsidiadas. Lo dejo en normal porque en mis últimas pruebas responde mucho mejor que antes; en versiones anteriores lo habría puesto en low.
DeepSeek V4 Flash: el rey del precio
Hace poco salió DeepSeek V4 Flash (0731), un modelo que está más o menos al nivel de Gemini 3.6 Flash pero a un precio muchísimo menor: alrededor de $0.14 por millón de tokens de entrada y $0.28 de salida — y con caché de contexto, la entrada repetida baja hasta ~$0.003 por millón. Es, en la práctica, el modelo más barato de entre todos los que realmente sirven.
No es tan potente como los grandes, pero tampoco está excesivamente lejos: queda un poco por debajo de Grok 4.5. Para integrar en herramientas — un RAG, un chatbot, cualquier funcionalidad que ejecute constantemente algo inteligente — ese precio cambia el juego. DeepSeek ya anunció un ajuste de precios en su API, pero incluso así sigue siendo de lo más barato que hay. Y además la línea V4 es open weight: los checkpoints están en Hugging Face y, para darte una idea, con un par de DGX Spark puedes ejecutarlo completo.
GLM 5.2 y Kimi K3: los chinos de tier alto
GLM 5.2 no va en low: va en high, a la par de Grok 4.5. Se le suele comparar con Opus 4.8 y llamó la atención porque saltó varios puestos en los rankings — antes ni figuraba en el top 10. El tema es que no es de los modelos baratos entre los chinos, y con la aparición de otros saltos grandes (Kimi, por ejemplo) ya no acapara tanta atención. Si tienes que elegir entre GLM y Grok, yo iría por Grok: herramientas similares, mejor respuesta y la integración con Cursor.
Kimi K3 lo coloco en alto. Sé que muchos lo ponen en top — normal, pagan la suscripción y quieren que sea lo mejor —, pero en la práctica está al nivel de estos otros modelos altos, no del top absoluto. Lo interesante es lo mismo que con DeepSeek: te da un modelo categorizado casi al lado de GPT 5.6 y Opus 5, a un precio mucho menor. Desarrollo web, ejecución de agentes, tareas en paralelo con sub-agentes: todo lo hace relativamente bien. Yo simplemente no lo siento igual de inteligente que los dos grandes, y por eso no lo subo de tier. En costos, eso sí, les gana por goleada.
Qwen y la sorpresa de Meta
Qwen 3.8 (Alibaba) aparece alto en los benchmarks y es muy bueno para código, pero no lo he usado lo suficiente como para rankearlo con justicia. La mayoría que lo usa lo corre localmente más que desplegado, y este tier list se enfoca en modelos desplegados.
La sorpresa reciente viene de Meta: Muse Spark, un modelo relativamente barato que responde mucho mejor de lo esperado. Y no vino solo: Meta lanzó Muse Code, su propio agente de código en terminal, competidor directo de Claude Code y Codex, corriendo sobre Muse Spark 1.2. No está por encima de los grandes — no es como los modelos chinos que cada lanzamiento se compara contra Fable 5 o GPT 5.6 —, pero está lo suficientemente bien como para empezar a usarse a un precio bastante menor. Ahí está su ventaja.
¿Y los benchmarks qué dicen?
Para armar este top me he apoyado bastante en Artificial Analysis, porque mide múltiples modelos y no está ligado a ningún laboratorio. Y su índice de inteligencia coincide con lo que les cuento: en los primeros puestos están Opus 5 y Fable 5 (Opus 5 incluso por encima), luego GPT 5.6, y después Kimi K3. Básicamente el mismo tier list que acabo de describir. De ahí para abajo vienen Grok, GLM, DeepSeek y compañía.
¿Realmente necesitas un modelo caro?
Esta es la pregunta que muchos no terminan de responder: si puedo generar un sitio web con DeepSeek V4 Flash, ¿para qué pagar un modelo enorme?
Depende de lo que construyas. Si trabajas en aplicaciones muy producidas — un monorepo, una base de código enorme que el modelo debe explorar, planes elaborados con mucho contexto — sí importa que el modelo sea grande, y uno de los primeros del ranking te ayuda. Si haces landing pages y aplicaciones pequeñas revisando de a pocos, hasta uno de los últimos de la tabla te sirve.
Y luego está el factor de cómo pagas:
- Suscripción: casi todos cobran lo mismo (~$20 inicial, luego planes de $50, $100, $200). Como el uso está subsidiado, aquí conviene ir directo por los mejores modelos. GPT y Claude son los que la mayoría paga y usa sin problema.
- API (pago por token): aquí cada centavo cuenta, y la tabla de precios pesa incluso más que la de inteligencia. En mi caso, cuando desarrollo para clientes un RAG, un chat o funcionalidad con tool calling, casi nunca uso Claude Opus por costos: un GPT bien configurado en su nivel de esfuerzo suele ser suficiente, y para procesar texto simple se puede bajar aún más en la tabla.
En resumen: con suscripción, usa el mejor modelo que puedas. Con API, deja que el precio mande — a menos que tengas mucho presupuesto.
¿Tienes tu propio tier list? Déjamelo en los comentarios: me interesa la percepción real de quienes usan estos modelos día a día.