Modelos, harnesses y orquestadores: la pirámide para entender cualquier herramienta de IA
Cada semana aparece un modelo nuevo, una CLI nueva y una interfaz nueva para "orquestar agentes". Si intentas probarlas todas, terminas con 40 pestañas abiertas y cero trabajo hecho.
La salida no es probar más rápido: es clasificar. Casi todo lo que sale hoy en IA cae en una de tres capas, y una vez que sabes en cuál cae, ya sabes para qué sirve antes siquiera de instalarlo.
Esas tres capas son:
| Capa | Qué es | Ejemplos |
|---|---|---|
| 1. Modelos | La inteligencia. Lo que realmente pagas al final del día | Claude Opus 5, GPT-5.6, Grok 4.6, Kimi K3, GLM-5.3 |
| 2. Harnesses | El programa que envuelve al modelo y le da herramientas | Claude Code, Codex CLI, opencode, Goose, Pi |
| 3. Orquestadores | Lo que coordina varios harnesses/agentes a la vez | Orca, herdr, cmux, Traycer, Grok Bot |
Todo lo demás son variaciones. Vamos capa por capa.
Capa 1: los modelos (la base de todo)
Lo primero que deberías conocer son los modelos, porque de ahí sale todo lo demás. El problema es que la competencia se mueve tan rápido que ningún ranking mental te dura un mes.
La forma práctica de mantenerte al día sin volverte loco es apoyarte en un benchmark independiente. El más útil hoy es Artificial Analysis, que no está ligado a ningún laboratorio y mide a todos con las mismas pruebas.
Su índice principal, el Artificial Analysis Intelligence Index, combina nueve evaluaciones distintas (razonamiento, código, conocimiento general, tareas agénticas) en un solo puntaje. Al 25 de agosto de 2026 la foto es esta:
- Claude Opus 5 lidera con 63 puntos
- Claude Fable 5 le sigue con 62
- GPT-5.6 Sol y Grok 4.6 están empatados alrededor de 61
Y en modelos abiertos (open weights), la brecha con los cerrados nunca estuvo tan corta: Kimi K3 (Moonshot) y GLM-5.3 (Z.ai) empatan en 60 puntos, con Qwen3.8-Max de Alibaba justo detrás.
No mires solo "inteligencia"
Este es el error más común. Artificial Analysis mide en tres ejes distintos, y el ranking cambia según cuál te importe:
- Inteligencia: para generar código complejo o razonar. Aquí manda Opus 5.
- Velocidad: Gemini 3.7 Flash es hoy el más rápido de todos, con unos 385 tokens por segundo.
- Costo por tarea: aquí el ganador es otro. GPT-5.6 Luna completa una tarea del índice por unos 5 centavos de dólar, después del recorte de precios del 30 de julio de 2026. En el otro extremo, Claude Fable 5 es de los más caros: $10 por millón de tokens de entrada y $50 de salida, exactamente el doble que Opus 5.
Un detalle que casi nadie considera: el precio por token no es el precio real. Un modelo barato pero verborrágico puede gastar el doble de tokens para terminar el mismo trabajo. Por eso la métrica de "costo por tarea completada" es más honesta que la tabla de precios.
Regla práctica: presta atención solo a los 10 primeros del ranking. Esos son los que vale la pena probar, integrar en una aplicación o pagar como suscripción. El resto casi nunca justifica el cambio.
Capa 2: los harnesses (el programa encima del modelo)
Aquí es donde se pone interesante, y donde la mayoría se confunde.
Un harness es cualquier programa que se monta encima del modelo. La definición que se está estandarizando en la industria es directa:
Agente = Modelo + Harness
Es decir, todo lo que hay en un agente que no es el modelo: las herramientas de consola, el acceso a archivos, la búsqueda web, la memoria, los subagentes, el loop de iteración, los permisos.
Esto ya es una disciplina con nombre propio —harness engineering— y con literatura seria detrás. Si quieres profundizar, el artículo de Birgitta Böckeler en el sitio de Martin Fowler es el mejor punto de entrada desde la perspectiva de quien usa los agentes, y O'Reilly Radar tiene un buen resumen del origen del término.
Por qué todos hablan de Claude Code si Claude también corre en otras herramientas
Esta es la pregunta que responde el concepto. Claude lo puedes usar desde opencode, desde una extensión de VS Code o desde una CLI cualquiera. Pero el resultado no es el mismo, y la diferencia es el harness: qué herramientas le entrega al modelo, cómo administra el contexto, cómo verifica el trabajo, cuándo se detiene.
Hay un sesgo predecible aquí: la empresa que desarrolla el harness lo afina para sus propios modelos. Anthropic hace Claude Code y funciona mejor con Claude. Google hace Antigravity CLI y funciona mejor con Gemini. Puedes conectar modelos ajenos casi siempre, pero no esperes paridad.
Qué harnesses existen hoy (agosto 2026)
De laboratorio (modelo + harness en la misma caja):
- Claude Code (Anthropic) — sigue siendo el estándar de facto para trabajo multiarchivo profundo
- Codex CLI (OpenAI) — sobre GPT-5.6
- Antigravity CLI (Google) — ojo con esto: Gemini CLI dejó de servir peticiones el 18 de junio de 2026 y fue reemplazado por Antigravity CLI, un binario de código cerrado. Si tienes tutoriales viejos apuntando a Gemini CLI, ya están desactualizados.
- Grok Build (xAI) — permite hasta 8 subagentes en paralelo, cada uno en su propio git worktree
Agnósticos de modelo (tú eliges qué le pones debajo):
- opencode — el más grande del ecosistema abierto, con 75+ proveedores soportados, incluyendo modelos locales. Un detalle importante: perdió el login con suscripción Claude Pro/Max tras una disputa con Anthropic, aunque la API key sigue funcionando.
- Goose — de Block, abierto y conectable a modelos abiertos y cerrados
- Pi — el minimalista del grupo; su gracia es un system prompt de menos de 1.000 tokens, lo que lo hace muy predecible
- GitHub Copilot CLI — funciona, pero rara vez es la primera opción de nadie para trabajo agéntico serio
Y algunos mueren. Continue es el caso de estudio: fue adquirido por Cursor en junio de 2026, sacó una última versión el 19 de junio y su repositorio quedó en solo lectura. El código Apache 2.0 sigue ahí para hacer fork, pero el equipo original ya no publica nada. Antes de casarte con un harness, revisa la frecuencia de commits.
Subcategoría importante: asistentes de IA ≠ CLIs de código
Dentro de los harnesses hay dos familias que la gente confunde todo el tiempo.
Las CLIs de arriba están enfocadas en generar código. Pero hay otra familia —los asistentes personales de IA— que opera un nivel más arriba: viven en un servidor, están disponibles 24/7, se conectan a tus programas y pueden llamar a Claude Code o Codex por debajo.
Los dos proyectos principales son:
- OpenClaw — asistente personal open source enfocado en alcance: se integra con 20+ plataformas de mensajería para que le escribas desde donde ya trabajas
- Hermes — de Nous Research, enfocado en continuidad: mantiene memoria persistente entre sesiones y genera automáticamente "skills" reutilizables a partir de tareas que completó con éxito
La diferencia de filosofía es clara: OpenClaw gana en amplitud, Hermes gana en que mejora mientras más lo usas. Si vas a instalar uno en un VPS, Hermes suele ser el más cómodo para empezar.
⚠️ Nota de seguridad, porque importa: en 2026 se documentaron más de 135.000 instancias de OpenClaw expuestas públicamente y cientos de skills maliciosos en su marketplace. Si vas a exponer un asistente con acceso a shell, correo y credenciales, aísla el entorno (contenedor o LXC), limita permisos y no le des tokens de producción.
Capa 3: los orquestadores (coordinar varios agentes)
Si ya pagas Claude Code, Codex y algún modelo chino, en algún momento vas a terminar combinándolos a mano: una terminal planificando, otra ejecutando, tú copiando contexto entre ventanas.
Los orquestadores existen para automatizar exactamente eso: un agente principal planifica y delega tareas a otras sesiones, que se abren solas y trabajan en paralelo.
Las opciones más sólidas hoy:
- Orca — entorno de desarrollo agéntico (ADE) con licencia MIT, de Stably AI. Interfaz gráfica estilo VS Code, git worktrees paralelos para que los agentes no se pisen, y soporte para 30+ CLIs. No proxea tu tráfico: usa tus propias cuentas.
- herdr — mi favorito si vives en la terminal. Es un runtime en Rust que "adueña" las terminales de tus agentes: las sesiones sobreviven a un reinicio, se reconectan por SSH, y los propios agentes pueden abrir paneles y esperar a que otro termine.
- cmux — terminal nativa de macOS (basada en Ghostty) con pestañas verticales y notificaciones por agente. Pensada para que ocho sesiones simultáneas sigan siendo legibles.
- Traycer — el más "producido": múltiples sesiones en paralelo, contexto compartido entre modelos y proveedores, mensajería entre agentes y sincronización entre dispositivos.
¿Esto es para todos? No. Si trabajas en un solo proyecto a la vez, un orquestador es fricción pura. La capa 3 recién paga cuando tienes varios proyectos vivos y estás perdiendo el hilo entre uno y otro.
Tres niveles de orquestación (no todos requieren un orquestador)
Vale la pena separarlos, porque se confunden:
- A nivel de orquestador — Orca, herdr, cmux abren y coordinan varios harnesses distintos: Claude Code, Codex, opencode, todos a la vez.
- A nivel de agente — dentro de un mismo harness. opencode o Pi te dejan usar un modelo como planificador y otro como ejecutor, pero solo entre los modelos que ese harness soporta. opencode no va a abrirte Claude Code.
- A nivel de modelo — con API o un router. En Claude Code,
/model opusplanplanifica con Opus y ejecuta con Sonnet para ahorrar tokens. Y el comando/advisor(experimental) hace lo inverso: un modelo barato ejecuta todo y consulta a uno más fuerte solo cuando se atasca; Anthropic midió −11,9 % de costo y +2,7 % de precisión en SWE-bench frente a usar Sonnet solo.
Un caso aparte es OpenRouter Fusion. Aquí conviene ser preciso: Fusion no intercambia entre modelos. Manda tu prompt a un panel de modelos en paralelo, un modelo juez compara las respuestas (consensos, contradicciones, puntos ciegos) y escribe una respuesta final combinada. Es orquestación a nivel de modelo, pero por síntesis, no por enrutamiento.
Cómo usar la pirámide en la práctica
Aquí está el valor real de todo esto: clasificar antes de investigar.
Dos ejemplos reales de este mes:
Grok Bot. xAI (ahora SpaceXAI, tras fusionarse con SpaceX y la compra de Cursor) lanzó Grok Bot el 11 de agosto de 2026: agentes always-on, cada uno con su propia computadora en la nube, que se loguean en tus apps, aprenden flujos por demostración y se coordinan entre ellos en chats grupales. ¿Suena a OpenClaw y Hermes? Es la misma idea con más presupuesto. Va en la capa 3, con un pie en la 2.
Claude Tag. Anthropic lanzó en junio de 2026 esta versión de Claude que vive dentro de Slack: etiquetas @Claude en un canal, y descompone y ejecuta la tarea a la vista de todo el equipo. Capa 3 otra vez, solo que integrado en la herramienta de trabajo en lugar de la terminal. (Está en beta para planes Enterprise y Team.)
Sale GLM-5.4 mañana. Capa 1. Ya sabes que lo que cambia es el ranking, no tu flujo de trabajo.
Sale otro editor tipo Cursor. Capa 2. Es un harness con GUI.
Eso es todo. No tienes que aprender algo enteramente nuevo cada semana, porque casi nunca es algo enteramente nuevo.
Preguntas frecuentes
¿Qué es un harness en IA? Es todo lo que rodea al modelo dentro de un agente: herramientas de terminal, acceso a archivos, memoria, subagentes, permisos y el loop de iteración. La fórmula corta es Agente = Modelo + Harness.
¿Cuál es el mejor modelo de IA ahora mismo? Depende del eje. En inteligencia, Claude Opus 5 lidera el índice de Artificial Analysis con 63 puntos. En velocidad, Gemini 3.7 Flash. En costo por tarea, GPT-5.6 Luna. Y en modelos abiertos, Kimi K3 y GLM-5.3 empatan en 60.
¿Vale la pena usar un orquestador de agentes? Solo si manejas varios proyectos en paralelo. Con un proyecto a la vez, agrega complejidad sin darte nada a cambio.
¿Puedo usar cualquier modelo con cualquier harness? Técnicamente muchas veces sí, pero no esperes el mismo rendimiento. Cada harness está afinado para los modelos de quien lo desarrolla, y algunos proveedores restringen el acceso por suscripción.
Conclusión
Las herramientas de IA se ven infinitas cuando las miras una por una, y bastante ordenadas cuando las miras por capas. Modelos abajo, harnesses en medio, orquestadores arriba. Lo que sale mañana va a caer en alguna de las tres.
Un último recordatorio: los números de este artículo son una foto de agosto de 2026. Los rankings se mueven cada semana. La pirámide, no.
¿Tú los categorizas distinto? Déjamelo en los comentarios: entre todos podemos afinar el modelo mental.
Si quieres revisar tu stack de IA o resolver algo puntual de tu proyecto, puedes reservar una asesoría personalizada en fazt.dev.