Probé Muse Code, el agente de código de Meta: así se siente usarlo
Meta acaba de sacar su propio agente de código para la terminal: Muse Code. Es competencia directa de Claude Code, Codex, OpenCode y similares, y lo que más llamó la atención en el lanzamiento no fue la herramienta en sí, sino el precio: las suscripciones arrancan en $5 al mes, una de las más baratas del mercado ahora mismo, incluso comparada con los servicios chinos.
Zuckerberg lo estuvo promoviendo bastante en X, y con ese precio la pregunta obvia es si vale la pena pagarlo. Así que pagué el plan más barato y lo usé. Este artículo va menos sobre benchmarks y más sobre cómo es realmente sentarse a trabajar con esta herramienta: desde la instalación hasta el momento en que se te acaba la cuota a mitad de una tarea.
Qué es Muse Code y qué corre por detrás
Muse Code es el harness (la herramienta de consola) y Muse Spark 1.2 es el modelo. Meta ya venía mostrando Muse Spark desde hace unos meses como su modelo propio de razonamiento, y según los benchmarks del lanzamiento se ubica en la zona de los modelos chinos actuales: cerca de la línea de Qwen 3.8 y GLM 5.3, con algunos resultados por encima de Gemini 3.7.
Los números de lanzamiento siempre son la mejor cara del modelo, así que vamos a lo otro. Lo que trae:
- 1 millón de tokens de contexto
- Subagentes que se lanzan en paralelo para tareas complejas
- Entrada multimodal: puedes arrastrarle imágenes directamente
- Skills, con algunas preconstruidas
- Solo macOS y Linux. En Windows toca WSL, que es lo que usé yo.
Meta ya lo sacó de beta y le sumó un SDK en developer preview, además de rewind para retroceder conversación y cambios de código, Workflows para orquestar equipos de agentes, y mensajería entre sesiones.
La instalación es fácil. El login no tanto.
Instalar es un curl y listo. Reinicias la terminal y ya tienes el comando muse. Le das enter, confías la carpeta, eliges login with browser y hasta ahí todo es lo mismo que en cualquier otro agente.
Pero ahí aparece el primer detalle que te va a llamar la atención: como el modelo es de Meta, te pide una cuenta de Facebook o Instagram. Si eliges correo o número de móvil, igual termina pidiéndote que crees una cuenta. En mi caso entré con Facebook.
Suena menor, pero no lo es tanto: es tu identidad social atada a tu herramienta de trabajo, con una empresa cuyo negocio es la publicidad. Si eso te incomoda, es un punto a considerar antes de instalar.
Antes de escribir una línea, tienes que tomar una decisión
Al entrar y escribir /model no hay una lista larga de modelos. Hay dos opciones: Contributor y normal. Y la diferencia no es técnica, es de datos:
| Tier | Input / 1M | Input cacheado / 1M | Output / 1M |
|---|---|---|---|
| Standard | $1.25 | $0.15 | $4.25 |
| Contributor | $0.10 | $0.002 | $0.20 |
Contributor es baratísimo, pero el trato es explícito: Meta usa tus prompts y respuestas para entrenar sus modelos. Para código de clientes, material bajo NDA o lógica de producto sin publicar, eso te descarta el descuento de una. Mi recomendación es usar el normal y ya.
Y ojo con lo otro: ese tier Standard, que es el precio real, ya no es barato. Está a la mitad de los modelos caros y bastante por encima de opciones como GLM 5.3 Flash o GPT 5.6 Luna. Si tu plan es usarlo por API, hay mejores opciones y más actualizadas.
Las suscripciones sí son agresivas en precio:
| Plan | Precio | Uso |
|---|---|---|
| Everyday Usage | $5/mes | ~10 a 50 peticiones cada 5 horas |
| High Usage | $15/mes | 3× el plan base |
| Power Usage | $50/mes | 10× el plan base |
Comparado con Claude Code (incluido en el Pro de $20) o los planes altos de Anthropic y OpenAI en $100 y $200, el número impresiona. Guarda ese "10 a 50 peticiones cada 5 horas" en la cabeza, porque más abajo aparece otra vez.
Cómo se siente en el día a día
Aquí está lo mejor que tengo que decir de Muse Code: es rápido. Más rápido de lo que esperaba. Responde con mucha más velocidad que otros agentes, y diría que incluso más que Codex. Cuando le pides algo pequeño, el ida y vuelta es ágil y no te quedas mirando un spinner.
El resto de la experiencia es la que ya conoces de otros harness, ni mejor ni peor:
- Modo bash con
?para comandos rápidos sin salir de la sesión - Los permisos típicos por cada acción. Se hacen pesados rápido, así que puedes lanzar
muse --yoloy saltarte la aprobación de todo. /configo/settingspara ajustar la configuración desde adentro/resumepara retomar sesiones anteriores y/forkpara ramificar desde una conversación existente/compacty/clearpara manejar el contexto- Deep research para investigar en internet a partir de una duda
/goal, el clásico bucle que no para hasta cumplir un objetivo. Todo el mundo lo tiene ya, quema muchísimos tokens y no sirve para cualquier tarea.- Un grado de esfuerzo configurable con
/effort. Viene enhighpor defecto y puedes subirlo aultra.
Y trae skills: carga las típicas desde la carpeta del proyecto y viene con algunas preconstruidas, además de otras que puedes instalar. Las que trae son bastante básicas, pero la puerta está abierta para meter las tuyas.
Nada de esto es malo. Simplemente no hay nada aquí que no exista ya en los agentes que llevan meses en el mercado.
Donde la experiencia se rompe
Tres cosas me sacaron del flujo de trabajo, en orden de gravedad.
La cuota. Con el plan de $5, una sola tarea grande se lleva todo. Le pedí un proyecto multi-aplicación con esfuerzo en ultra y a los 30-40 minutos la cuota se había agotado con el trabajo a medias. Tocó parar y esperar el reset. No es que sea poco generoso para lo que cuesta: es que el modelo gasta demasiados tokens para completar una tarea, y esas dos cosas juntas te dejan mirando el reloj.
Las esperas de la API. De vez en cuando el servicio no da abasto y te mete unos segundos de espera. No es grave por sí solo, pero se suma al tiempo total.
Las sesiones que no se guardan. Al resumir una sesión hay veces que no guarda todo. Y si cierras la terminal sin salir de la sesión, directamente no la guarda. Eso sí duele cuando llevas media hora de contexto encima.
¿Y la calidad del código?
Corta versión: es rápido, pero no es preciso. Hice dos pruebas.
La primera fue un juego 3D estilo Mario Kart. Lo generó muy rápido, pero falló a la primera: errores apenas lo levanté en el servidor y los controles ni siquiera respondían.
La segunda fue un proyecto más grande, con esfuerzo en ultra y una imagen de referencia arrastrada al prompt. Ahí sí hizo algo interesante a nivel de arquitectura: lanzó cinco subagentes en paralelo para repartirse el trabajo. Pero el resultado, después de cerca de una hora, fueron templates. El dashboard se ve bien pero no funciona, y lo que debía ser una aplicación móvil terminó siendo un HTML con pestañas diseñado para parecer una app. No es React Native, no es Expo, no es una app.
Eso es lo que más molesta, porque no es un estándar imposible: modelos como DeepSeek o GLM ya resuelven ese mismo pedido entregando código Expo real dentro de un monorepo, y gastando menos tokens.
Con eso me quedó bastante clara la idea del modelo. En un agente de código lo que pagas es la inteligencia, no la velocidad de la terminal: si genera código roto en la mitad del tiempo, no ganaste nada.
Por el mismo dinero
Aquí está el problema real. Muse Code no es caro; es que lo que hay al lado por unos dólares más sí funciona.
OpenCode Go cuesta $10 al mes ($5 el primer mes) y te da acceso a un catálogo grande de modelos ya probados: GLM 5.2, Kimi K3, Qwen 3.8 Max, DeepSeek V4, GPT 5.6 Luna, Grok 4.5 y más. Los límites van por valor de uso ($12 cada 5 horas, $30 semanal, $60 mensual) y funciona con cualquier agente, no solo con OpenCode.
Command Code también juega en ese rango, con planes que arrancan muy bajo y suben según el uso, y acceso a decenas de modelos abiertos y cerrados.
Por $5 tienes algo que funciona a medias. Por $10 tienes varios modelos altamente probados en tareas de código.
Veredicto
Para lo que sí puede servirte hoy:
- Landing pages y templates visuales, que es donde mejor se defiende
- Modificaciones pequeñas y respuestas puntuales
- Alguien que quiera gastar lo mínimo posible y no le importe repasar todo
Para lo que no:
- Proyectos con lógica funcional real
- Cualquier cosa multi-aplicación
- Aplicaciones móviles de verdad
- Cualquier flujo donde una sola tarea se coma la cuota entera
Ahora, contexto: Grok también era mediocre en sus primeras versiones y hoy pelea arriba. Muse Spark es demasiado nuevo, probablemente ni terminó de entrenarse del todo, y Meta se está moviendo rápido: salió de beta en menos de un mes y ya publicó un SDK. No me extrañaría que en un par de versiones esto cambie, e incluso que lo liberen como open source.
Pero eso es a futuro. Hoy, la suscripción no la vale.
Si lo probaste y tuviste otra experiencia, déjalo en los comentarios. Y si quieres asesoría personalizada sobre agentes de código, stack o infraestructura, puedes reservarla en fazt.dev.
Enlaces
- Anuncio de Zuckerberg: x.com/finkd
- Meta for Developers: x.com/MetaforDevs
- OpenCode: opencode.ai
- Command Code: commandcode.ai