Gemini 3.6 Flash: lo probé a fondo y esto es lo que nadie te cuenta
Esta semana Google lanzó Gemini 3.6 Flash, y como siempre pasa con estos anuncios, los titulares hablan de benchmarks y porcentajes. Pero yo quería ir más allá: pagué la suscripción de Gemini AI Pro, lo puse a generar proyectos reales —desde un landing page hasta un monorepo completo con backend, frontend, CLI, app de escritorio y app móvil— y lo desplegué en producción. Aquí te cuento qué hace bien, dónde falla y si vale la pena pagar por él.
No es un modelo, son tres
Lo primero que hay que aclarar es que Google no lanzó un solo modelo. El 21 de julio de 2026 anunció tres variantes de la familia Flash:
- Gemini 3.6 Flash: el nuevo modelo "caballo de batalla", multimodal, orientado a producción y agentes.
- Gemini 3.5 Flash-Lite: la versión más rápida y barata, pensada para tareas de alto volumen y baja latencia (hasta 350 tokens/segundo según Artificial Analysis).
- Gemini 3.5 Flash Cyber: un modelo especializado en ciberseguridad que, curiosamente, no está disponible para el público general — solo para gobiernos y socios de confianza a través de CodeMender, en un programa piloto de acceso limitado.
Y ojo con un detalle importante: Gemini 3.5 Pro no formó parte de este lanzamiento. El modelo insignia de Google sigue en pruebas con socios y venía arrastrando retrasos (medios como Reuters reportaban que estaba planificado para junio). Mientras tanto, Google ya confirmó que empezó el preentrenamiento de Gemini 4, que describen como su proyecto más ambicioso hasta la fecha. En otras palabras: los números de versión avanzan rápido, pero el modelo grande todavía no llega.
Lo que dicen los benchmarks (y lo que no)
El discurso de venta de Google no es "este es el modelo más inteligente", sino "este es el modelo más eficiente". Y los números oficiales van por ahí:
- Consume 17% menos tokens de salida que Gemini 3.5 Flash (según el índice de Artificial Analysis).
- Cuesta $1.50 por millón de tokens de entrada y $7.50 por millón de salida, frente a los $9/1M de salida de su antecesor.
- Mejora en benchmarks de código como DeepSWE, con "mayor precisión y menos ediciones de código no deseadas".
Hasta ahí el marketing. Ahora, si revisamos el gráfico de Artificial Analysis que la propia Google cita —donde se cruza inteligencia, velocidad y costo— la foto es menos amable:
- En velocidad, sí: 3.6 Flash es de los más rápidos de su categoría, comparable o superior a modelos como Sonnet en tiempo de respuesta.
- En inteligencia, deja mucho que desear. No está entre las primeras opciones; queda apenas por encima de modelos como M3 de MiniMax o DeepSeek, y muy por detrás de los modelos de los que todo el mundo habla estos días, como GLM 5.2.
- En precio, tampoco es el más barato. Es más económico que los frontier grandes (Fable, Kimi, GPT 5.5), pero para el nivel de inteligencia que ofrece, debería costar bastante menos. De hecho, es más caro que M3, con el que empata en inteligencia.
Entonces, la narrativa de "modelo barato" en API cruda no se sostiene del todo. Donde sí cambia la ecuación es en las suscripciones, y de eso hablo más abajo.
Probándolo en la práctica: Antigravity 2.0
Para usar estos modelos gratis solo necesitas una cuenta de Gmail. Google tiene su propio set de herramientas: Antigravity 2.0 (la app de escritorio para trabajar con múltiples agentes), el Antigravity IDE (un editor tipo VS Code) y el CLI. Gemini 3.6 Flash ya es el modelo por defecto del agente de Antigravity.
Test 1: Landing page
Le pedí un landing para un SaaS ficticio de gestión de proyectos ("TaskPilot"), con hero, grid de funcionalidades y paleta índigo. Importante: le indiqué explícitamente no usar skills, para medir el modelo pelado, sin ayudas.
El resultado no estuvo nada mal. Y hubo algo interesante: como es un modelo multimodal, generó los assets gráficos por sí mismo — imágenes para la página creadas con Gemini en la misma sesión. Eso sí es una ventaja real frente a otros modelos que te dejan placeholders. Ahora, seamos honestos: a estas alturas hasta los modelos abiertos generan landings decentes, así que esto ya no es una buena métrica de nada.
Test 2: Juego 3D estilo Mario 64
Aquí la cosa flojeó. Generó el juego, sí, pero los controles salieron raros (e invertidos), el personaje no se veía bien y había elementos rotos. Otros modelos hacen esto mejor al primer prompt.
Test 3: Monorepo completo (backend + frontend + base de datos)
Este era el test serio: un sistema con backend, frontend, base de datos y estructura de monorepo. Y aquí es donde la velocidad del modelo impresiona de verdad: generó el plan de implementación en unos 10 segundos y el proyecto completo en poco más de un minuto. Para que te hagas una idea, una tarea equivalente con Claude Fable puede tomar entre 40 minutos y una hora de ejecución.
¿Y la calidad? Abrí el proyecto en el Antigravity IDE, levanté Prisma Studio desde la terminal y comprobé que los datos que ingresaba desde la interfaz sí llegaban a la base de datos. Funciona. Pero cuando revisas la lógica interna, se nota que el modelo prioriza "que se vea y que funcione" por encima de hacerlo bien: falta sistema de permisos, la autenticación es básica, y en general no genera esa lógica más compleja y escalable que sí producen los modelos grandes. El frontend de Astro, de hecho, salió con problemas de diseño que hubo que reparar aparte.
Mi lectura: es usable, más de lo que esperaba, pero no lo confiaría para proyectos reales con usuarios de verdad.
Test 4: CLI + app de escritorio (Tauri) + app móvil (Expo/React Native)
Solo por retarlo, le pedí que extendiera el proyecto con un CLI que consuma la API, una app de escritorio con Tauri y una app móvil con React Native. Lo generó todo en unos 5 minutos — un tiempo excesivamente corto como para confiar a ciegas, pero la app de Tauri compiló, me dio el instalador y funcionó. Nada mal para la velocidad a la que trabaja.
El despliegue: aquí es donde se cae
Para subir el monorepo usé Railway (si es tu primera vez, tienes $20 gratis con el enlace de la descripción). La gracia de Railway es que tiene CLI y un skill instalable, así que el agente puede crear el proyecto, configurar servicios y desplegar solo, sin que tú toques el dashboard.
Y aquí apareció el patrón que ya he visto en otros modelos de esta categoría: le dije "despliega el proyecto"... y solo desplegó el backend. Le tuve que decir explícitamente "despliega también el frontend". ¿Y qué hizo? Volvió a desplegar el backend. Lo intenté con 3.6 Flash, lo cambié a Sonnet dentro del mismo harness, y tras más de 30 minutos de intentos no lo logró. Al final terminé desplegando con Claude Code.
Esta es exactamente la diferencia entre estos modelos y un Opus, un Fable 5 o un GPT 5.6: no es que no generen código, es que fallan en la planificación y en las tareas donde hay que indagar, entender servicios y tomar decisiones. Ejecutan rápido, pero tú tienes que saber qué pasó cuando se atascan.
Donde sí brilla: testing y tareas por lotes
Hay un tipo de tarea donde un modelo rápido, barato en suscripción y decente en cosas comunes encaja perfecto: testing y QA. Aquí lo combiné con TestSprite, que es una mezcla de framework de testing + IA + QA con historial de pruebas en la nube (tiene cuenta gratuita, enlace en la descripción).
El flujo fue: instalar el CLI de TestSprite desde la terminal de Antigravity, configurar la API key, y pedirle al agente "testea el entorno de producción de este proyecto en Railway usando TestSprite CLI". El modelo ejecutó los comandos, generó pruebas de backend (health checks) y frontend (login), y tras pasarle credenciales creó unos nueve tests adicionales, de los cuales solo falló uno — un bug real en el módulo de facturación que quedó registrado con grabación paso a paso en el panel.
Para este tipo de tareas delegables, largas y en lotes, el modelo funciona muy bien. Y aquí entra el matiz de precios que casi nadie menciona: los benchmarks comparan costo en API cruda, pero en suscripción la ecuación cambia. La suscripción de Google cuesta $20/mes (igual que Cursor y similares) y, como estos modelos tienen relativamente poca demanda, te dan muchísimo uso. Además incluye NotebookLM con más funciones, Google AI Studio, acceso desde Android Studio, los modelos de generación de video e imagen de Google (que sí son de los mejores) e incluso YouTube Premium. Curiosamente, la suscripción también te da acceso a un Claude Opus 4.6 — un modelo ya desfasado, así que si pagas ese plan, aprovéchalo por todo lo demás.
Veredicto
Gemini 3.6 Flash es el modelo más rápido que he visto generar código. Más rápido incluso que Sonnet o Composer. Pero velocidad no es calidad, y en planificación y tareas críticas sigue muy por detrás de los frontier.
¿Para quién sí?
- Si sabes programar, sabes hacer code review y quieres un modelo que avance rápido mientras tú iteras y corriges, cumple bien.
- Para tareas por lotes: testing, QA, modificaciones puntuales de interfaz, agentes pequeños (leer correos, tareas junto a OpenClaw, Hermes o similares).
- Si vas a usar el resto del ecosistema de Google (video, imagen, NotebookLM), la suscripción de $20 se justifica sola.
¿Para quién no?
- Si quieres delegar planificaciones grandes y confiar en que el modelo haga la mayor parte del trabajo sin supervisión, este no es tu modelo. Ahí sigo usando un Fable 5, un Opus o un GPT 5.6, y delego lo pequeño a modelos tipo Kimi — y ahora los Gemini entran en esa misma línea.
En resumen: Google no lanzó un modelo para competir en inteligencia, lanzó uno para competir en volumen. Y en ese nicho, con suscripción, no está nada mal. Solo no le pidas que piense por ti.
¿Lo has probado? Cuéntame en los comentarios cómo lo usas en la práctica. Y si quieres una asesoría personalizada, puedes reservarla en fazt.dev.