Tier list de herramientas de IA para programar: mi ranking después de meses de pruebas
Llevo bastantes meses probando herramientas de IA para desarrollo, así que en este artículo voy a ordenarlas en una tier list: cuáles me parecen top, cuáles buenas, cuáles decentes y cuáles directamente no recomendaría. La idea es darte un resumen de qué hace cada una por si no las conoces todas, siempre desde mi experiencia de uso. Si tu percepción es distinta, es totalmente válido — al final cada quien trabaja diferente.
Antes de empezar, una aclaración importante: aquí estoy hablando de harness, es decir, de herramientas de IA que por lo general pueden incluir distintos modelos a la vez. Por darte una idea, en Cursor no solo están sus propios modelos, sino que también puedes usar Opus o GPT; en Open Code puedes usar múltiples modelos chinos e incluso modelos privados. No estoy rankeando modelos inteligentes — eso lo haré en una lista aparte más adelante.
Antigravity: la app de escritorio no, el CLI sí
Antigravity 2.0 (la aplicación de escritorio con administrador de agentes) es el editor favorito de muchos, pero como harness a mí no me convence. En la práctica es una especie de continuación del desarrollo que hicieron en Windsurf, y las veces que lo he usado no me ha funcionado del todo: la interfaz da muchos errores, no está completa, y si la comparas con GPT Codex o Claude Code Desktop, está muy por detrás. Además, cada vez que hablo con alguien que usa Antigravity, rara vez lo usa con los modelos de Google — casi siempre me dicen que lo usan con Opus, que viene incluido en la misma suscripción. Y si vas a usar Opus, no tiene mucho sentido quedarte ahí.
Lo contrario pasa con Antigravity CLI, que es otro producto aparte: un harness de terminal al estilo de Claude Code o Codex CLI. Y sí, funciona bastante bien — es ligero, rápido, me gusta cómo muestra los mensajes y cómo puedes manejar y editar notas. Si vas a usar las suscripciones de Gemini para escribir código, mi recomendación es clara: ve por el CLI.
¿Por qué importa tanto la diferencia entre la terminal y el escritorio? Porque probablemente son equipos de desarrollo distintos dentro de Google, y el de la terminal claramente va mejor.
Veredicto: Antigravity 2.0 → decente (siendo generoso). Antigravity CLI → bueno.
GPT Codex: la mejor app de escritorio del momento
La aplicación de escritorio de OpenAI es, en mi opinión, la que está mucho mejor que la mayoría de competidores en su categoría. No hablo del ChatGPT web o móvil, sino de la app que descargas y que te da una experiencia similar al chat, pero con acceso a archivos del sistema: puede crear y ejecutar código, generar imágenes, e incluso últimamente puedes grabar tu pantalla para que el modelo interprete lo que haces y trate de automatizarlo. También puedes controlarla desde el móvil. Es una interfaz muy puntera. El único tema es que solo funciona con modelos GPT — pero si ya pagas ChatGPT y no te interesa otro modelo, está muy bien.
Su herramienta de consola, Codex CLI, es otra historia. A muchos les gusta porque está hecho en Rust y es un proyecto abierto, pero a mí el harness no me termina de gustar: no me convence cómo muestra los mensajes, y cuando cierras una sesión e intentas volver a un historial largo, simplemente no te deja. Tiene características muy básicas para ser una de las herramientas más populares. Ojo, esto no va contra el modelo — yo uso mucho GPT y me parece muy buen modelo, barato y que responde bien. Es el harness lo que necesita mejorar.
Veredicto: GPT Codex (escritorio) → top. Codex CLI → decente.
Claude Code: mi harness de todos los días
La competencia directa de Codex CLI es Claude Code, y es muchísimo mejor. Yo lo uso todos los días. Tiene una cantidad enorme de comandos (algunos que ni sé del todo qué hacen), y para cualquier trabajo donde estás lanzando múltiples agentes o trabajando en varios proyectos a la vez, funciona perfecto: puedes controlarlo remotamente, dictarle con voz, lanzar subagentes, hacer scroll por el historial, y últimamente ha mejorado bastante el renderizado de mensajes. Para mí es uno de los mejores harness que existen. Sé que hay gente que no quiere nada de Anthropic por tema de modelos — es una posición personal válida — pero como harness, es muy bueno.
Su aplicación de escritorio, Claude Code Desktop, también es buena — puedes ejecutar instancias de Claude Code dentro de la interfaz gráfica y ha mejorado bastante — pero si la comparas con la experiencia de la app de escritorio de ChatGPT, esta última está más producida: marketplace de skills, configuración visual de MCPs, mejor organización.
Aquí hay algo curioso: en OpenAI su mejor herramienta es la aplicación de escritorio y su CLI va por detrás; en Anthropic es exactamente al revés — su mejor herramienta es Claude Code en la terminal, y el escritorio va por detrás.
Veredicto: Claude Code → top. Claude Code Desktop → bueno.
Open Code: el mejor harness abierto
A Open Code lo coloco en top. No solo porque puedes conectarle cualquier modelo — incluyendo modelos alojados en tu propia máquina — sino porque tiene características que lo hacen muy útil: manejo de sesiones múltiples y un TUI muy desarrollado con lista de tareas al costado que se va actualizando mientras trabajas. Es muy cómodo.
¿Está al nivel de Claude Code? Yo diría que no exactamente, pero está bastante cerca, y dependiendo del modelo que le conectes puedes llegar a una experiencia similar o incluso mejor según el tipo de trabajo. Si haces desarrollo web y le conectas un modelo abierto potente — un GLM, un Kimi, un Qwen en su máxima capacidad — probablemente no vas a extrañar ningún harness cerrado para la mayoría de tareas repetitivas. Ahora, siendo honestos: hay modelos que simplemente son más grandes. Fable 5, en mi opinión, es el mejor modelo que existe hoy, y un modelo abierto no te va a dar el mismo grado de calidad. Pero para el día a día, con Open Code te puede bastar perfectamente.
Yo no pago las suscripciones de este harness, pero sí uso suscripciones de modelos chinos desde Open Code — por eso te digo que es muy buen harness para manejar modelos de todo tipo.
Veredicto: Open Code → top.
Cursor: mucho mejor que hace un año
Cursor no me parece una mala herramienta — de hecho, justo ahora está muy bien, principalmente por su suscripción: tiene modelo propio, es barato y realmente puedes terminar aplicaciones. Si me preguntabas hace un año te habría dicho "no es tan bueno, usa otra cosa", porque pagabas $20 o $50 y no podías crear mucho. Hoy los modelos responden rápido, se combina bien y es un buen harness.
¿Por qué no lo pongo en top? Porque algunas partes son un poco buggy — y no hablo del editor de código, sino de su administrador de agentes (el equivalente a Antigravity 2.0). El MCP para controlar el navegador a veces no me funciona, la terminal integrada a veces tampoco. Detalles, pero suman.
Veredicto: Cursor → bueno.
Pi: para los que quieren control total
Pi es como una especie de Open Code, pero con la filosofía contraria: lo instalas y no hay nada. Ni siquiera trae soporte de MCPs de fábrica — solo soporta skills. Todo lo demás lo agregas con plugins: ¿quieres MCPs? Instala un plugin. ¿Quieres conectarle algo? Plugin. Es la idea de editores tipo Vim o Neovim, donde vas instalando a medida que necesitas. Por eso lo usan quienes quieren configurar su agente al detalle: da mucho más control. Tiene incluso una especie de panel gráfico donde puedes manejar subagentes.
Eso sí, es puramente harness: no te vende ninguna suscripción, tienes que traer tu propio modelo o API (Codex, modelos chinos que ofrecen API y suscripción, etc.). Y sí necesitas saber configurarlo. Como no viene con nada integrado, la experiencia depende mucho de tu setup.
Veredicto: Pi → bueno.
Devin (ex Windsurf): decente, pero el precio no cierra
Windsurf como tal ya no existe — lo compró Devin y ahora es parte de su stack. Devin era lo que hace un año o más te vendían como el "ingeniero de IA": lo integrabas en Slack, le pedías cosas y te generaba todo en la nube. Esa idea no les pegó muy bien, y ahora lo que tienen es un administrador de agentes muy similar al de Cursor, con sus propios modelos heredados de Windsurf.
La interfaz es usable y está bastante decente. El problema es el precio: por los $20 no obtienes mucho, la cuota se acaba rapidísimo y el siguiente salto es un plan de $200 — no hay plan intermedio, mientras que Cursor sí escala de 20 a 50, 100 y 200. Lo único distintivo es que tiene su propia nube: el código se ejecuta allá y te llega un pull request a GitHub, por ejemplo. Pero la mayoría queremos ejecutar y revisar el código en nuestra propia máquina.
Veredicto: Devin → decente.
GitHub Copilot: el gran perdedor de esta época
Justo ahora GitHub Copilot está en el nivel pésimo, uno de los peores. Y no es solo por cómo responde — aunque los modelos dentro de este harness no rinden bien: puedes usar un Opus 4.8 ahí y aun así no hace bien el trabajo comparado con Claude Code u otros harness enfocados en estos modelos. El problema principal es el precio.
Hace unos meses tenía planes accesibles de $10, $20 o $30. Eso ya no funciona así: te dan unos cuantos créditos y luego pagas por uso, a precio real de API — al punto de que ahora tienen hasta una calculadora de costos. Mucha gente hizo el cálculo y lo que antes eran $28 de suscripción ahora puede saltar a $700 o más según tu consumo. La razón es simple: Microsoft se cansó de subsidiar tokens, y como no tienen modelos propios alojados en su nube al estilo de Anthropic, les sale más caro ofrecer los precios de las APIs.
Veredicto: GitHub Copilot → pésimo.
VS Code: ya no es la herramienta por defecto
Es un poco triste decirlo, pero VS Code ya no es la herramienta por defecto. Antes lo colocaríamos como editor top sin pensarlo, pero en la época de la IA el editor ya no se usa tanto en el mismo sentido de antes. Puedes conectarle otros harness con extensiones y APIs, y ahí puede serte útil.
El detalle es que, aunque es un proyecto abierto y aceptado por la comunidad, sigue siendo de Microsoft, y obviamente quieren promover sus propios servicios. Si crees que puedes conectarle cualquier modelo chino directamente, no es tan así: tienes que pasar por una API compatible con OpenAI o Claude para "engañar" al editor. Hay extensiones que lo resuelven, pero se vuelve complicado desde el propio editor. Por eso en esta época no es del todo bueno como harness — aunque no lo voy a poner junto a Antigravity, que como editor sí es desastroso.
Veredicto: VS Code → decente.
Kiro: perdió su enfoque original
Kiro empezó como un fork de VS Code fuertemente basado en los modelos de Anthropic, y hoy tiene administrador de agentes, herramienta de consola e incluso app móvil. Hace un año tenía sentido usarlo porque era la interfaz gráfica para los modelos de Claude — Claude no tiene editor de código propio. Pero hoy la mayoría ya no usa ese tipo de interfaz como principal, así que Kiro perdió ese enfoque.
No es mala herramienta. Viene por parte de AWS, así que si tu empresa tiene partnership con AWS y te dan créditos de Bedrock, puedes aprovecharlos desde este harness. Pero básicamente son puros modelos de Claude.
Veredicto: Kiro → decente.
Zed: gran editor, harness flojo
Zed como editor de código me gusta bastante: es rapidísimo, tiene muy buena integración con Git, renderiza cantidades enormes de archivos y abre en segundos. Pero como harness de IA está bastante por detrás: cuando usas su chat o los agentes integrados, no responde del todo bien. Es un caso parecido al de VS Code — editores que nacieron como editores y que con la llegada de la IA se quedaron un poco atrás.
Veredicto: Zed → decente (por el harness; como editor es muy bueno).
Kimi Code: si te gusta Kimi, es tu harness
Kimi Code solo funciona con Kimi, obviamente, pero lo he estado usando bastante estos últimos meses, principalmente por las suscripciones y porque permite ejecutar múltiples agentes en paralelo. Si te gusta Kimi 3 — uno de los últimos modelos que ha salido y que responde muy bien — este es el harness oficial de la misma empresa que desarrolla el modelo. Soporta la mayoría de características principales de Claude Code o Codex CLI: subagentes en paralelo, planificaciones, etc. No vas a extrañar mucho.
Veredicto: Kimi Code → decente.
Grok CLI: buen harness, y un futuro incierto con Cursor
La versión de terminal de Grok permite usar los modelos de xAI, y como harness me gusta bastante: responde rápido, me gusta cómo administra las respuestas, puedes colocar notas y revisiones — similar a lo que hace Antigravity CLI, pero con modelos de Grok. No es una herramienta por la que estaría dispuesto a pagar como principal, y como el modelo no está tan producido, para la mayoría de tareas lo dejo en decente. Para tareas de sistemas web puede funcionar bastante bien.
Lo interesante aquí es el contexto: SpaceX compró Cursor hace poco, así que ahora Grok Build y Cursor conviven bajo el mismo paraguas, cada uno con sus propios modelos y herramientas compitiendo entre sí. Ya hay modelos compartidos — en Grok puedes usar Composer y en Cursor puedes usar Grok — así que es muy probable que en unos meses unifiquen todo bajo un solo nombre. Aún no se sabe.
Veredicto: Grok CLI → decente.
OpenClaw y Hermes: asistentes, no harness de código
Para cerrar los harness, dos proyectos que en realidad juegan otro juego. OpenClaw fue uno de los proyectos principales de inicio de año — todo el mundo hablaba de cómo instalarlo. Pero no es un harness preparado específicamente para código: es un asistente del día a día, para tenerlo ejecutándose todo el tiempo y delegarle tareas. Puede generar código (cualquier modelo puede), e incluso puede llamar a Pi o a Open Code para comunicarse con agentes que sí se enfocan en escribir código.
Hermes va por la misma idea, pero yo lo colocaría bastante más arriba — en bueno, cerca de top incluso. Yo tengo un VPS con Hermes instalado: clona proyectos, los corrige, arma planificaciones y crea proyectos desde el propio VPS. No te voy a mentir — no produce código al nivel de los harness top de esta lista — pero hace un trabajo muy decente modificando proyectos, se toma su tiempo, te notifica cuando termina, y trabaja con múltiples modelos. Si estás entre OpenClaw y Hermes, ve por Hermes: es mucho mejor asistente, de lejos.
Veredicto: OpenClaw → decente. Hermes → bueno (casi top).
Replit, Lovable y el vibe coding
Sé que muchos van a mencionar las plataformas de vibe coding. En el caso de Lovable y similares, son plataformas para pedir cosas y que todo lo haga la plataforma — no están enfocadas en escribir código. Replit sí te permite acceder al editor y continuar o corregir ahí, así que sí lo consideraría una herramienta enfocada en código, aunque tampoco es excesivamente buena. No destaca frente a otras herramientas, pero tampoco es mala: si quieres una suscripción barata con un entorno en la nube que ya ejecute tu aplicación, es una opción decente.
Veredicto: Replit y compañía → decente.
Warp: mejor de lo que esperaba
Para sorpresa de muchos, Warp me parece un buen proyecto, y no solo como terminal. Para quien no lo conoce, es una terminal multiplataforma muy buena para administrar múltiples sesiones, comandos y agentes — y últimamente se ha vuelto la interfaz favorita de varios que trabajan con agentes de terminal.
Antes solo te vendían la terminal, pero como no todo el mundo está dispuesto a pagar por una terminal, ahora también ofrecen créditos de agentes de IA para usar desde su propio harness. Lo he probado poco, pero de lo poco que he hecho, funciona muy bien: genera código, te hace review de diferencias de Git, renderiza documentos Markdown. El único tema es el precio — no es del todo barato, así que no lo consideraría herramienta principal. Pero si el precio no te preocupa, bajo su suscripción responde muy bien.
Veredicto: Warp → bueno (con el asterisco del precio).
Orquestadores de agentes: Conductor, Orca y Herder
Dejé para el final tres herramientas que no son harness propiamente — no abren directamente el modelo — sino administradores de otras herramientas. Algunos les llaman Agent Development Environments: programas que te permiten abrir terminales de Claude Code, Codex u Open Code dentro de su interfaz para administrarlas.
Conductor es muy buena herramienta: puedes abrir múltiples sesiones (se parece a la interfaz de GPT Codex en ese sentido), pero la interfaz principal no es un chat sino una terminal incrustada en la aplicación de escritorio, y las sesiones se pueden comunicar con otros agentes. Los peros: aún no es multiplataforma y tiene precios para funciones como aplicaciones móviles o su nube. Bueno.
Orca ofrece algo muy similar a Conductor, pero es open source y gratuito — traes tus propias suscripciones de agentes. Me ha sorprendido bastante en las últimas semanas: es muy usable, tiene extensiones para revisión de código vía Git, comentarios, planificaciones que se guardan en la misma interfaz, puedes comunicar agentes entre ellos y hasta tiene app móvil. Tiene un uso real, no es solo un agrupador de agentes. Bueno.
Herder es similar a Orca pero sin interfaz gráfica: todo desde terminal. Compite más con tmux y los multiplexores de terminal, solo que enfocado en agentes: ves cómo avanza cada uno y puedes comunicarlos. Lo que más me gusta es que tiene plugins — si te falta una característica, puedes generarla con la propia IA — y un marketplace de extensiones. Bueno.
Resumen: la tier list completa
| Tier | Herramientas |
|---|---|
| Top | Claude Code, GPT Codex (escritorio), Open Code |
| Bueno | Cursor, Pi, Antigravity CLI, Claude Code Desktop, Hermes, Warp, Conductor, Orca, Herder |
| Decente | Antigravity 2.0, Codex CLI, Devin, VS Code, Kiro, Zed, Kimi Code, Grok CLI, OpenClaw, Replit |
| Malo / Pésimo | GitHub Copilot |
¿Y esto para qué te sirve?
De forma resumida: si estás considerando pagar por alguna herramienta, échale un ojo primero a las que están en bueno o top — son las que vas a querer usar si llevas un proyecto serio.
En mi caso, hoy pago Claude Code, Codex y Cursor. Warp no lo pago. Hermes lo uso con la suscripción de GPT, y en Open Code uso las suscripciones de modelos chinos — por algo lo considero uno de los mejores harness para manejar modelos de todo tipo.
Seguramente se me quedaron fuera algunas herramientas. Si conoces alguna que valga la pena o tienes tu propia tier list, déjala en los comentarios.