Grok Build subía tu código completo a la nube: lo que este leak nos enseña sobre privacidad e IA
Todos los días usamos modelos de IA que, de una forma u otra, terminan en la nube. Y es posible que más de uno ya se haya preguntado: ¿a dónde van exactamente esos datos?
Esta semana ocurrieron dos noticias que responden esa pregunta de la peor manera posible. La primera: se descubrió que Grok Build, el agente de terminal de xAI, subía el código completo de tus repositorios a su nube. La segunda está relacionada con OpenAI y Apple, y el motivo por el que Apple cambió de proveedor de IA.
Aunque parezcan noticias de "nubes grandes", en realidad afectan directamente a cualquiera que desarrolle proyectos propios y le preocupe su privacidad, o simplemente quiera saber hacia dónde corren sus datos cuando ejecuta un programa o modelo de IA. Si estás trabajando en un proyecto importante, esto te interesa.
El caso Grok Build: subiendo repos enteros sin permiso
Grok Build es un harness de terminal muy similar a Claude Code o a Codex CLI: un agente que lee tu código, edita archivos y ejecuta comandos desde la línea de comandos.
Lo normal en este tipo de herramientas es que solo se suba la parte del código que el modelo necesita para trabajar. El agente va llamando los archivos que sean necesarios para la tarea y nada más. Ese es el comportamiento esperado.
El problema con Grok Build es que estaba haciendo algo bastante raro: subía el repositorio entero. En las pruebas que se hicieron, llegó a subir proyectos de hasta 12 GB, con sesiones de hasta 5 GB de tamaño. Y cuando decimos el repo entero, es el repo entero: todos los archivos del proyecto, incluyendo tus variables de entorno, tus secrets, tus API keys y todo lo que tengas en esa carpeta.
La respuesta de xAI
Durante varias horas se habló bastante del tema y xAI no decía nada. Después, se vieron obligados a lanzar un comunicado donde explicaban que existe un comando llamado /privacy con el que se puede desactivar la retención de datos, es decir, evitar que tus archivos queden alojados en su nube.
Pero eso no fue suficiente para calmar las aguas. Así que unas horas después hicieron un review del código y finalmente liberaron el proyecto como open source. Al momento de escribir esto, Grok Build es un harness abierto, al estilo de opencode, disponible en GitHub y escrito 100% en Rust. Esto significa que cualquiera puede ver cómo está desarrollado y que, con el tiempo, eventualmente se podrían añadir más modelos que no sean solo los de Grok.
Algo bueno salió de todo esto, al menos.
Las pruebas independientes: ignora tus instrucciones
Aquí viene la parte más interesante. Investigadores independientes hicieron sus propios tests, y uno de los más reveladores viene de cereblab. La prueba fue simple: le enviaron un prompt del estilo "responde con okay y no abras ningún archivo".
¿El resultado? A pesar de la instrucción explícita, Grok Build ejecutaba por debajo una especie de clon del repositorio y empezaba a subir todo el proyecto. Ignoraba completamente lo que le habías dicho y alojaba el código en su nube.
Y hay más: incluso después de aplicar el fix rápido que lanzó xAI, se comprobó que se seguían haciendo las mismas peticiones, subiendo al menos la información de la sesión más algunos archivos.
Aquí hay un detalle importante que muchos pasan por alto: la política habla de retención de datos, no de transmisión. Es decir, tus datos igual se suben. Lo que cambia con /privacy es que no los retienen: cuando terminas tu sesión, eso se limpia y ya no queda rastro. Pero la transmisión ocurre de todas formas.
¿Y las demás herramientas? En el mismo test se probó Claude Code, Codex y Gemini CLI, y ninguno tuvo este problema: no suben archivos innecesarios. Este comportamiento era específico de Grok Build. Por cierto, si te preguntas cómo se detecta esto: básicamente con un proxy interceptando el tráfico de la herramienta.
El caso Apple: por qué cambiaron OpenAI por Gemini
Esto me recuerda otro caso bastante interesante y que se le parece en algo.
Quizás recuerden que Apple hace algunos años integró GPT dentro de su sistema operativo bajo el nombre de Apple Intelligence. Apple no tiene un modelo propio competitivo, así que básicamente le pagaba a OpenAI por usar sus modelos.
Pero este último año cambiaron de proveedor: dejaron los modelos de OpenAI y ahora usan Gemini de Google. ¿Por qué?
La razón, según Apple, es que OpenAI básicamente les ha estado robando ingenieros y diseños. Internamente es como si se hubieran llevado una enorme cantidad de diseños de dispositivos desarrollados dentro de Apple. Incluso se rumorea que OpenAI está por lanzar su propio asistente con hardware —algo al estilo de un Alexa, pero con sus modelos— desarrollado, cómo no, por varias personas que antes trabajaban en Apple.
¿Por qué debería importarte todo esto?
A la gran mayoría quizás no nos interese el drama de quién le roba datos a quién entre gigantes tech. Pero sí debe importarnos cuando desarrollamos aplicaciones en entornos donde los datos no se pueden filtrar, sobre todo a nivel empresarial.
Piensa en empresas farmacéuticas, petroleras, o cualquier organización que no quiere que su información termine procesándose en un data center ajeno. Empresas que llevan 20, 30 o 60 años acumulando información que puede ser vital: si se filtra, puede terminar en manos de la competencia o usarse para entrenar otros modelos.
Y aquí está el tradeoff de siempre: los modelos más potentes viven en la nube. Hace poco salió GPT 5.6 y obviamente quieres usar el modelo más capaz, pero el precio de tener una IA con una enorme cantidad de parámetros generalmente se paga con tu privacidad.
Y no es solo el tema de los agentes. ¿Recuerdan que alrededor del 20 de abril GitHub anunció que usaría los repositorios de la plataforma para entrenar sus propios modelos? Sí, se puede desactivar, igual que con Grok. Pero el patrón es el mismo: la información que alojas en plataformas de terceros —que al final son nubes de otras empresas— termina entrenando modelos, alimentando prototipos o siendo analizada de forma genérica.
Las dos soluciones
Si trabajas con información sensible, la solución pasa por dos frentes:
1. Aloja tu código en tu propia infraestructura. Existen alternativas a GitHub donde puedes tener el control total. GitLab, por ejemplo, además de funcionar como alternativa en la nube, tiene su versión self-hosted: la instalas en un servidor propio y ahí es donde vive tu código, con todo el historial incluido. El único tema es que requiere desplegarlo tú mismo, pero es un paso que vale la pena si te preocupa dónde se aloja tu código.
2. Invierte en tu propia infraestructura de IA. Si usas herramientas o agentes, vas a necesitar un modelo. Y si el proyecto es importante, la información es vital, no quieres depender de que una plataforma te banee, o simplemente te preocupa hacia dónde van tus datos, la respuesta son los modelos abiertos corriendo en tu propio hardware.
Ahora, seamos honestos: no todo el mundo puede permitirse desplegar un modelo abierto con una enorme cantidad de parámetros. La mayoría de gente que habla de modelos locales en internet lo hace con una tarjeta gráfica, un par de GPUs o equipos especializados pero pequeños. No es lo mismo un modelo de data center que uno que corre en casa. Pero cuando hablamos de una empresa, la inversión sí se justifica, principalmente por una razón: saber exactamente dónde terminan los datos.
Hardware para IA local: DGX Spark
Hablando de infraestructura propia, si quieres conocer equipos especializados de IA —cómputo, laptops, servidores y estaciones de trabajo— debes conocer a Vastec, una empresa con más de 20 años fabricando y vendiendo equipos de cómputo bajo estándares ISO 9001.
Ahora también traen la NVIDIA DGX Spark: una supercomputadora de IA personal con el superchip GB10 Grace Blackwell, 128 GB de memoria unificada y hasta un petaflop de rendimiento. En la práctica, esto significa que puedes correr modelos de hasta 200 mil millones de parámetros localmente, hacer fine-tuning y desplegar agentes de IA sin depender de la nube y sin enviar tus datos afuera. Todo desde tu escritorio.
Y lo mejor: la consigues con respaldo, garantía y soporte técnico local, sin importar algo desde afuera rezando que llegue. El enlace para cotizar la DGX Spark o cualquier otro equipo de Vastec está en la descripción.
Conclusión
De esto se trataban los leaks de esta semana: cuando usas un modelo de IA o una nube de terceros, tus datos siempre terminan por allí. Para proyectos comunes del día a día, quizás no sea un problema. Pero si el código que estás desarrollando es importante, es probable que quieras tomar esto en cuenta.
Si tienes alguna duda o comentario sobre estas noticias, déjalo en los comentarios. Y si quieres asesorías personalizadas sobre cualquier tema, puedes reservarlas en fazt.dev.