Kimi K3: el modelo open weight que compite con Fable 5 y GPT 5.6 (probado con Kimi Code)
🔗 Kimi API — Los nuevos usuarios obtienen un 15% extra de bono en su primera compra (válido hasta el 1 de octubre).
De todos los modelos open weight disponibles hoy, Kimi K3 es probablemente el más comentado. Y no es para menos: está compitiendo directamente con Claude Fable 5 y GPT 5.6 Sol, dos modelos propietarios enormes, pero a una fracción del costo. En este artículo te muestro qué es K3, cómo funciona su arquitectura y qué se puede lograr en la práctica usando su propio harness, Kimi Code, incluyendo subagentes en paralelo (swarm) y ejecución en bucle hasta cumplir objetivos (goals).
¿Qué es Kimi K3?
Kimi K3 es el modelo insignia de Moonshot AI, lanzado en julio de 2026 como sucesor de la familia K2. Los datos confirmados por la propia documentación oficial:
- 2.8 billones (trillions) de parámetros totales, el primer modelo abierto en la clase de los 3T.
- Arquitectura Mixture of Experts: activa solo 16 de 896 expertos por token, así que no usa todos los parámetros en cada inferencia.
- Ventana de contexto de 1 millón de tokens, casi 4 veces más que K2.6.
- Visión nativa: entiende texto, imágenes y video en el mismo modelo.
- Pesos abiertos: Moonshot liberó los pesos completos el 27 de julio de 2026, con soporte de inferencia en vLLM.
Lo interesante es cómo llegó hasta aquí. Si revisas benchmarks de generaciones anteriores, las versiones previas de Kimi ni siquiera figuraban entre los modelos punteros. Hoy K3 aparece al lado de los modelos de OpenAI y Anthropic. La propia Moonshot admite que en rendimiento general todavía queda por debajo de Fable 5 y GPT 5.6 Sol, pero supera de forma consistente al resto de modelos abiertos como GLM o MiniMax M3. En benchmarks de automatización de tareas reales quedó primero en 4 de 8 pruebas (incluyendo Automation Bench y BrowseComp) y segundo detrás de Fable 5 en la mayoría de las restantes. Para un modelo con pesos abiertos, eso es territorio nuevo.
La arquitectura: Delta Attention y Attention Residuals
Dos innovaciones hacen posible el contexto de 1M de tokens sin que el costo se dispare:
Kimi Delta Attention (KDA) es un mecanismo de atención lineal híbrida. En términos simples: el modelo no intenta releer todo el contenido constantemente, sino que va "tomando apuntes" y descartando lo irrelevante a medida que procesa. Esto reduce drásticamente el costo de sesiones largas.
Attention Residuals (AttnRes) funciona como reemplazo de las conexiones residuales tradicionales: reprocesa la salida anterior para continuar respondiendo con coherencia en tareas extensas.
El resultado es un modelo pensado para tareas de largo aliento: planificaciones enormes, sesiones de chat extendidas, repositorios completos cargados en una sola sesión, o agentes que iteran durante horas. Y con precios de API cercanos a lo que costaría un modelo de gama media, pero con respuestas que en muchos casos se acercan a lo que daría Fable 5.
Kimi Code: el harness oficial
Para probar K3 usé Kimi Code, el harness propio de Moonshot (similar en concepto a Claude Code). Se instala con un comando desde la terminal en Linux, Mac o Windows, y verificas la instalación con kimi --version. La autenticación es con /login usando tu cuenta de Kimi Code, lo que te permite usar la suscripción en lugar de pagar por token.
Puntos clave del flujo de trabajo:
/modelte muestra todas las versiones disponibles. Asegúrate de escoger K3 y, con las flechas, puedes ajustar el nivel de esfuerzo. K3 Max responde más lento pero con mucha más calidad.- Modo plan (Shift+Tab): el modelo primero analiza y arma una planificación antes de tocar código.
/yolo: ejecuta comandos sin pedir confirmación en cada paso./swarm: activa la ejecución multiagente en paralelo./goal: define un objetivo y el agente itera hasta cumplirlo.
Prueba 1: sistema de finanzas personales (monorepo full-stack)
El primer reto: "Crea un sistema de finanzas personales con dashboard, landing page, autenticación, presupuesto y más, conformado por backend y frontend en un monorepo", añadiendo que implemente la planificación para que múltiples agentes (swarm) la ejecuten.
En modo plan, K3 generó una planificación extensa dividida en 8 agentes con responsabilidades separadas: uno para backend, otro para frontend, base de datos, etc. Al aprobar el plan y activar swarm, los subagentes se lanzaron en olas paralelas: primero tres para base de datos y UI, luego una segunda ola de dos más, y así hasta terminar.
Un detalle de diseño muy bien pensado: cada subagente mantiene su propio contexto y lo libera al terminar, así que el contexto principal no se llena. Con 1M de tokens disponibles, el margen es enorme.
¿El resultado? Un proyecto completo: landing page, registro de cuenta, transacciones, presupuestos, seed de datos con credenciales de prueba, y un monorepo real con NestJS en el backend y Next.js en el frontend, base de datos con su propia sección y documentación incluida. Todo con un solo prompt, sin iterar. En versiones anteriores había que escribir prompts enormes y detallados; aquí el modelo completó solo lo que faltaba.
Prueba 2: juego estilo Mario 64 con modo goal
Para probar la generación 3D pedí un juego al estilo Mario 64, saltándome el modo plan. El primer resultado funcionaba pero tenía un bug de movimiento lateral. Aquí entra la característica más interesante del harness: /goal.
Le indiqué: "Comprueba el juego usando Playwright CLI y actualiza y corrige hasta que puedas cumplir una misión completa". Con "switch to auto and start", el agente entró en bucle: probaba el juego, detectaba fallos, corregía, y volvía a probar. Tras solo 8 iteraciones, reportó misión cumplida: un bot jugando con entrada de teclado real completó el nivel obteniendo 12 de 12 monedas con las tres vidas intactas. Al probarlo manualmente, el bug había desaparecido.
La gracia está en que tú no tienes que estar detrás del juego corrigiendo en cada iteración: el propio agente verifica y ajusta hasta llegar al objetivo.
Prueba 3: la app educativa de anatomía
Anthropic publicó hace un tiempo el prompt de una aplicación educativa interactiva del cuerpo humano. Se lo pasé a K3 con swarm activado y el HTML resultante fue prácticamente el mismo que producen los modelos grandes de Anthropic: sistema de diseño coherente, sonido al seleccionar secciones del cuerpo, todo funcional. Para una suscripción propia y un modelo abierto, es notable.
Extensión para VS Code
Además de la terminal, existe una extensión oficial de Kimi Code para VS Code (publicada por Moonshot). Agrega un panel lateral desde donde puedes pedir modificaciones al proyecto, cambiar de modelo, ajustar el esfuerzo o entrar en modo plan — lo mismo que la terminal, pero con interfaz gráfica y métricas de contexto disponible y tokens consumidos. En mi prueba le pedí crear un CLI que consumiera la API del monorepo y extendió el proyecto correctamente a la primera.
Conclusión
K3 no es excesivamente rápido — la app educativa tomó unos 10 minutos — pero la calidad compensa: el código funciona como esperas sin tener que iterar tantas veces. De todos los modelos open weight actuales (GLM 5.2, MiniMax M3), K3 es el que mejor sale en los benchmarks agregados como Artificial Analysis, y hay una comunidad creciente de desarrolladores de videojuegos usándolo por la combinación de bajo costo, lógica sólida y buen manejo de 3D.
Estamos pasando la barrera de "código barato con un modelo abierto" a un modelo que realmente cuesta mucho menos y produce código extenso y pulido al nivel de los grandes. Si trabajas con tareas largas, automatización constante o simplemente quieres una alternativa seria a los modelos propietarios, K3 con Kimi Code merece la prueba.
Si quieres probar la API de Kimi, con este enlace los nuevos usuarios obtienen un 15% extra en créditos de API en su primera compra (válido hasta el 1 de octubre).