Kimi K3: el nuevo modelo chino que compite con Claude Fable 5 y GPT 5.6
Hace unas horas salió Kimi K3, la versión más reciente del modelo de Moonshot AI. Es un modelo multimodal capaz de trabajar con texto, imágenes y código, y desde su lanzamiento ha dado bastante de qué hablar: está saltando tanto en los benchmarks que ya se lo compara directamente con Claude Fable 5 y GPT 5.6 Sol, los modelos más grandes disponibles en este momento.
En este artículo te resumo de qué trata este nuevo modelo y te muestro un par de demos que hice para probar qué tan bueno es generando código.
Qué es Kimi K3
K3 es el sucesor de K2.7, y lo que más ha llamado la atención es el salto que dio. Con K2.7 comparábamos el modelo con GPT 5.3 u Opus 4.7, así que lo esperable era que K3 compitiera con Opus 4.8 o GPT 5.5. Pero no: el salto fue tan grande que ahora se lo compara con GPT 5.6 Sol y Fable 5.
Esto dice algo importante: esa distancia de 6 meses que supuestamente llevaban los modelos chinos respecto a los modelos más populares, en realidad ya no es tanta. Un modelo que estaba fuera del top 10 de muchos benchmarks ahora compite con los dos más grandes, algo similar a lo que pasó con GLM 5.2 hace algunas semanas.
En números:
- Es un modelo de clase 3 trillones de parámetros (2.8T exactos), el modelo open-weight más grande hasta la fecha
- Ventana de contexto de 1 millón de tokens
- Implementa dos técnicas nuevas para acelerar la decodificación de tokens: Kimi Delta Attention y Attention Residuals
Ese contexto de 1 millón de tokens permite aplicarlo en tareas de larga duración: ejecución de asistentes, generación de código, razonamiento y, en general, tareas de agentes.
Los benchmarks
Una forma de medir todo esto sin depender de los números de la propia empresa es usar benchmarks independientes como Artificial Analysis, que evalúa múltiples modelos en distintas áreas.
En inteligencia general —sobre todo al momento de escribir código o hacer tareas agénticas— K3 dio un salto enorme respecto a sus predecesores y ahora está casi a la par de GPT 5.6 y Fable 5. Y esto no solo aplica a generación de código, sino también a ejecución de programas y tareas de agentes en general.
Pero lo que más se está comentando en redes es el benchmark de Frontend Code Arena: ahí Kimi K3 quedó por encima de Fable 5 y GPT 5.6 Sol. Es decir, para tareas de frontend realmente supera a esos modelos, y en mis pruebas se nota desde el primer prompt.
Precios
Algo muy importante: no es un modelo tan costoso considerando contra quién compite. Según su propia documentación:
- Entrada: ~$3 por millón de tokens
- Salida: ~$15 por millón de tokens
Es un poco más caro que GLM 5.2, pero sigue siendo más barato que Opus 4.8, mucho más barato que GPT 5.5 y obviamente muy por debajo de Fable 5 en cuanto a precios.
Velocidad
Aquí no hay tan buenas noticias. Ya se sabía que Kimi no era un modelo rápido: si llegaron a usar K2.7 saben que es decente, pero hay modelos mucho más veloces (incluso Composer 2.5, que desciende de esta familia, es notablemente más rápido en mi opinión). K3 no ha mejorado tanto en este aspecto, así que al menos por velocidad no esperen un cambio enorme.
Un detalle adicional: por ahora solo está disponible el modo de esfuerzo max. Si escriben /effort en Kimi Code van a ver que es la única opción. Esto sugiere que a medida que vayan saliendo variaciones del modelo, podríamos obtener versiones que respondan más rápido.
Probando Kimi K3
Para probarlo ya lo tienen disponible en la suscripción de Kimi.com, o pueden usarlo desde aplicaciones como Kimi Web, Kimi Code o la Kimi API. En mi caso lo probé desde Kimi Code, su harness. Para cambiar el modelo simplemente escriben /model y seleccionan K3.
Demo 1: dashboard de finanzas personales
Le pedí un dashboard de finanzas personales con manejo de distintas cuentas, objetivos financieros y registro de ingresos, retiros y demás operaciones. No era una planificación completa, pero tampoco un prompt pequeño.
Después de aproximadamente 40 minutos, generó el proyecto completo. La razón de la demora es que implementó cada uno de los módulos, tanto backend como frontend. El resultado:
- UI bastante buena, con datos demo y secciones con gráficas
- Aplicación en Next.js con API incluida
- Como no fui explícito con la base de datos, eligió SQLite
- Versiones modernas de los frameworks, con TypeScript y linting configurados, sin paquetes innecesarios
Y ojo: esto es el modelo tal cual, sin ningún skill adicional. El único punto flojo que encontré es que no generó una forma aparente de añadir datos nuevos; quedó más como un frontend para visualizar.
Demo 2: juego 3D estilo Mario Kart
El segundo prompt fue: crea un juego en 3D al estilo de Mario Kart, con métricas de velocidad y un escenario realista.
Después de unos 30 minutos (y un poco más), generó un proyecto usando Three.js. Es algo básico, pero cumplió con la idea del prompt inicial: tiempo y velocidad en la parte superior izquierda, un mapa a la derecha. Para ser un primer prompt sin modificaciones, está bastante bien — y recordemos que es un modelo mucho más barato que GPT 5.6.
Conclusión
Kimi K3 está bastante impresionante, sobre todo para tareas de frontend, donde los benchmarks y mis propias pruebas coinciden: supera incluso a los modelos más grandes. Sus puntos débiles siguen siendo la velocidad y que por ahora solo existe el modo de esfuerzo máximo.
Todavía me falta probarlo más a fondo con lógica compleja, tareas en paralelo y subagentes, así que en el transcurso de la semana traeré una actualización. Mientras tanto, ya pueden probarlo desde Kimi Code o desde cualquier otro harness compatible.
Si tienes alguna duda o sugerencia, déjala en los comentarios. Y si quieres conocer más, en fazt.dev puedes reservar asesorías personalizadas de cualquier tema.