DeepSeek V4 Flash: rendimiento cercano a Opus 4.8 por centavos
Cuando hablamos de modelos inteligentes y baratos, DeepSeek es el nombre que aparece casi siempre. Es uno de los laboratorios con los precios más agresivos entre los modelos abiertos, aunque históricamente sus modelos económicos no siempre estaban a la altura al momento de generar código. Eso acaba de cambiar: el 31 de julio de 2026, DeepSeek lanzó la versión oficial de DeepSeek-V4-Flash (build 0731), y los números que trae merecen una mirada con lupa.
No es un modelo nuevo: es un reentrenamiento
Lo primero que hay que entender es que V4-Flash-0731 no es una arquitectura nueva ni un modelo más grande. DeepSeek fue explícito: la arquitectura y el tamaño son idénticos al preview que muchos ya probaron desde abril. Lo que hicieron fue repetir todo el proceso de post-training, y el salto que lograron solo con eso es enorme.
Para ubicarnos, V4-Flash es un modelo MoE (Mixture-of-Experts) de 284B parámetros totales con solo 13B activos, ventana de contexto de 1 millón de tokens y hasta 384K tokens de salida. Soporta modo thinking y non-thinking, y la API se mantiene igual: sigues llamando a deepseek-v4-flash, pero por detrás ya responde la versión 0731.
Un detalle importante: esta actualización aplica solo a la API de Flash. La API de V4-Pro y las versiones de la app y web siguen con sus builds anteriores; el V4-Pro oficial vendrá después.
Los benchmarks: el salto es real, pero leamos la letra pequeña
El salto respecto al preview es de los más grandes que hemos visto en un solo checkpoint:
En Terminal Bench 2.1 pasa de 61.8 (preview) a 82.7. En DeepSWE, de 7.3 a 54.4 — sí, leíste bien, un salto de 47 puntos con el mismo modelo. En NL2Repo, de 39.4 a 54.2. Y en su set interno de full-stack (DSBench-FullStack), de 37.0 a 68.7.
Con esos números, V4-Flash-0731 supera a V4-Pro-Preview en los nueve benchmarks de agentes que DeepSeek publicó, a pesar de activar muchísimos menos parámetros. También queda por encima de GLM-5.2 en prácticamente todas las filas (en Terminal Bench 2.1: 82.7 vs 81.0).
Ahora, la comparación que todos están haciendo es contra Claude Opus 4.8, y aquí toca ser honestos: en la propia tabla de DeepSeek, Opus 4.8 gana en las nueve filas. En Terminal Bench 2.1 marca 85.0 vs 82.7, en NL2Repo 69.7 vs 54.2, en Cybergym 83.1 vs 76.7. La claim correcta no es "iguala a Opus 4.8", sino "se acerca a Opus 4.8 a una fracción del precio", que ya de por sí es una locura para un modelo de 13B parámetros activos.
También hay que decir que todos estos números son auto-reportados: DeepSeek evaluando a DeepSeek, con un harness propio que todavía no han liberado, y dos de los nueve benchmarks son sets internos de la empresa. La medición independiente de Artificial Analysis da 79% en Terminal-Bench 2.1, no el 82.7 oficial. No significa que el salto sea falso — la propia AA había medido el preview en 61.8, exactamente lo que DeepSeek reportaba — pero sí que conviene esperar verificación externa antes de repetir las cifras como verdad absoluta.
Y sobre lo que circula en redes de que "supera a Fable 5 en terminal bench": en ese benchmark puntual sí queda por encima de Fable 5 y Sonnet 5, aunque unos 3 puntos por debajo de GPT-5.6 Sol. Como siempre, un benchmark aislado no hace a un modelo mejor en general — pero a este precio, es un argumento fuerte.
El precio: aquí está la verdadera noticia
Los precios de la API oficial se mantienen:
- $0.14 por millón de tokens de entrada (cache miss)
- $0.0028 por millón con cache hit (el caché es automático)
- $0.28 por millón de tokens de salida
Para dimensionarlo: modelos frontier como GPT-5.6 Sol o Claude Fable 5 cuestan entre $5-$10 por millón de entrada y $30-$50 por millón de salida. Estamos hablando de una diferencia de 35x a 100x. Incluso después de que OpenAI recortara el precio de GPT-5.6 Luna en 80% (movida que llegó literalmente un día antes de este lanzamiento, y que muchos leen como respuesta directa a la presión de los modelos chinos), DeepSeek sigue muy por debajo.
Esto redibuja la famosa frontera de Pareto de costo vs. inteligencia: un modelo que puntúa alto y a la vez cuesta centavos deja obsoletos a todos los que quedan debajo de esa línea — modelos que o son muy caros para lo que ofrecen, o simplemente no son suficientemente capaces.
Compatible con las herramientas que ya usas
Otro punto interesante: la API soporta tanto la interfaz de OpenAI ChatCompletions como la interfaz de Anthropic. En la práctica, eso significa que puedes apuntar herramientas como Codex o Claude Code hacia DeepSeek cambiando el base_url, y el harness ni se entera de que por detrás está respondiendo otro modelo. Para automatizaciones y tareas por lotes, el ahorro es directo.
Además, los pesos están abiertos en Hugging Face bajo licencia MIT (deepseek-ai/DeepSeek-V4-Flash-0731), con soporte en vLLM y SGLang, incluyendo su módulo de speculative decoding (DSpark) y una variante NVFP4 para GPUs Blackwell. Si consigues una versión cuantizada, es el tipo de modelo que podrías correr en hardware local serio — un par de DGX Sparks, por ejemplo.
Lo probé: tres ejemplos reales
Para ponerlo a prueba usé un harness con acceso al modelo y le lancé tres tareas de distinta complejidad, midiendo el costo real de cada una.
Un Mario Kart 3D: en modo máximo, generó el juego en unos 7 minutos al primer intento, con animaciones y personajes razonablemente trabajados. Costo total: alrededor de $0.04. Las llamadas individuales de 44,000 tokens ni siquiera llegaban a la centésima de centavo.
Una landing page de boletería para conciertos: la resolvió en un par de minutos al primer intento. El resultado es un sitio bastante estándar, nada espectacular visualmente, pero funcional. Costo marginal: aproximadamente un centavo.
Un finance tracker completo: multi-usuario, con gastos, dashboard, gráficos, presupuestos, y backend + frontend en un monorepo con pnpm. Esto le tomó unos 24 minutos, incluyendo el testeo de la aplicación. Generó la API, el frontend y los paquetes compartidos, y el registro/login funcionaba de una. Todo el proyecto: alrededor de $0.15.
¿Está al nivel de un GPT-5.6 Sol o un Opus en calidad de detalle? No. Si comparas los resultados lado a lado, vas a notar la diferencia en pulido. Pero ese no es el punto de un modelo "flash": la idea no es usarlo para planificar la arquitectura de un proyecto grande, sino para delegar tareas por lotes donde el volumen importa más que el acabado fino. Y ahí, generar un proyecto full-stack funcional con un solo prompt por 15 centavos cambia completamente la ecuación de costos.
Vale recordar el contraste con generaciones anteriores de modelos chinos: antes te generaban un inicio decente y tenías que iterar varias veces para llegar a algo usable. Esta generación entrega proyectos que funcionan al primer intento con mucha más frecuencia.
Conclusión
DeepSeek V4 Flash 0731 no destrona a los modelos frontier, y las cifras oficiales todavía necesitan verificación independiente completa. Pero como opción para generar código a bajo costo, es probablemente la mejor relación calidad-precio del mercado ahora mismo: rendimiento en tareas de agentes que se acerca a Opus 4.8, precio de centavos, pesos abiertos bajo MIT, y compatibilidad directa con los harnesses que ya usas.
Si estás automatizando generación de código, corriendo agentes en volumen, o simplemente quieres experimentar sin quemar presupuesto, este es el modelo a probar esta semana. Y si tienes hardware local con memoria suficiente, el hecho de que sea open-weight lo hace doblemente interesante.
¿Ya lo probaste? ¿Viste métricas distintas? Déjamelo en los comentarios.