Un modelo con 284.000 millones de parámetros que activa solo 13.000 millones por pasada y cobra céntimos por millón de tokens. DeepSeek V4 Flash es el LLM chino que obliga a replantear cuánto estás pagando por inferencia en tus pipelines de producción. Y no es solo un modelo barato. Es un modelo barato que funciona.
TL;DR: El resumen sin rodeos
- Arquitectura MoE: 284.000 millones de parámetros, solo 13.000 millones activos por pasada. Capacidad grande, coste pequeño.
- Precio ridículo: 0,14 $/M tokens entrada, 0,28 $/M salida. Con caché, un 98% menos. Hasta 7,6 veces más barato que Gemini Flash.
- Producción real: 79% en SWE-bench, 91,6% en LiveCodeBench, 2.500 solicitudes concurrentes y soporte nativo para Codex.
- El límite: cadenas agénticas de más de 8 llamadas acumulan errores. Olvídate de usarlo como agente autónomo: es tu caballo de batalla para volumen.
¿Qué es DeepSeek V4 Flash?
DeepSeek V4 Flash es un modelo de lenguaje de arquitectura Mixture-of-Experts (MoE) lanzado oficialmente el 31 de julio de 2026 (build 0731). Tiene 284.000 millones de parámetros totales, pero solo activa 13.000 millones en cada inferencia. Toda la capacidad del grande, pagando solo por el pequeño.

Las cifras clave: ventana de contexto de 1 millón de tokens (8 veces más que su predecesor V3.2), salida máxima de 384.000 tokens y un sistema de atención híbrida (CSA/HCA) que mejora la eficiencia en contextos largos (en V4 Pro, esta arquitectura reduce los FLOPs de inferencia al 27% y el caché KV al 10% respecto a V3.2). Los pesos están en Hugging Face bajo licencia MIT. Cualquiera puede descargarlo.
Todo eso queda muy bonito en papel. En producción lo que importa es el soporte nativo para la API de Respuestas de Codex (el único modelo que lo tiene), la compatibilidad con los formatos de API de OpenAI y Anthropic, y un límite de concurrencia de 2.500 solicitudes simultáneas. En Hacker News ya se discute la versión experimental con visión que DeepSeek soltó el 21 de agosto, acercándose al rendimiento de Opus 4.8 en tareas multimodales.
Tres modos de razonamiento: rápido (sin cadena de pensamiento), análisis lógico y máximo esfuerzo. Los tokens de razonamiento se facturan como salida.
Precio de DeepSeek V4 Flash: la comparativa que escuece
DeepSeek V4 Flash cuesta 0,14 dólares por millón de tokens de entrada y 0,28 dólares por millón de tokens de salida. Si usas caché de entradas, los aciertos bajan a 0,0028 dólares por millón. Un descuento del 98%.
Las comparaciones duelen:
- Aproximadamente 7,6 veces más barato que Gemini 2.5 Flash en coste combinado (ratio 3:1 entrada/salida).
- Unas 90 veces más barato que Claude Opus 4.6 en tareas donde la calidad Flash cubre el requisito.
- Un 99% más económico que GPT-5.5, que cobra 5 y 30 dólares por millón de tokens de entrada y salida respectivamente.
Desde el 16 de agosto, DeepSeek metió tarifas pico/valle. En YouTube, Nichonauta ya lo analizaba con más de 1.700 visualizaciones: "Actualmente, tanto el V4 Flash como el V4 Pro cuestan apenas centavos de dólar por millón de tokens de salida... a partir del día 16 van a cambiar". Aun con la subida en horas pico, sigue siendo ridículamente barato frente a cualquier competidor.
Rendimiento bruto: entre 83 y 150 tokens por segundo, tiempo de primer token entre 300 y 500 milisegundos, 79% en SWE-bench Verified y 91,6% en LiveCodeBench.
El coste por rendimiento es obsceno. No hay otra forma de decirlo.
DeepSeek V4 Flash en tu stack de producción: dónde encaja y dónde no
Flash encaja como caballo de batalla en un stack de orquestación cross-model: el modelo que procesa volumen mientras Claude o GPT se reservan para razonamiento pesado. Si ya trabajas con pipelines automatizados de contenido con IA, Flash puede absorber las pasadas de clasificación, extracción y transformación que hoy te cuestan diez veces más.

La integración es directa. Soporta los formatos de API de OpenAI y Anthropic, así que migrar una llamada en tu orquestador es cambiar el endpoint y la clave. Si usas algo como OpenRouter, ni eso.
¿Dónde se rompe? En cadenas agénticas largas. Los datos indican que Flash maneja limpiamente de 4 a 6 llamadas a herramientas por cadena, pero a partir de 8 empieza a acumular errores. Me juego algo a que este es el patrón más peligroso que puedes ignorar: un modelo que te ahorra un 90% funciona de maravilla en tareas delimitadas, pero si le pides que sea tu agente autónomo durante 15 pasos seguidos, la calidad se degrada y acabas repitiendo la cadena entera. El ahorro se evapora.
Y aquí va lo que nadie dice en voz alta: la dependencia estratégica. Construir tu pipeline sobre el modelo más barato del mercado suena genial hasta que el proveedor cambia las reglas. DeepSeek ya reestructuró precios el 16 de agosto con tarifas pico/valle. ¿El próximo cambio? Nadie lo sabe. La jugada inteligente: diseña tu stack para que Flash sea intercambiable. Un hueco de "modelo económico" que hoy ocupa DeepSeek y mañana puede ocupar otro.
Eso sí: mientras el precio se mantenga, no conozco nada que ofrezca mejor relación coste/rendimiento para cargas de trabajo de volumen.
DeepSeek V4 Flash hace una cosa muy bien: absorber volumen. Si tu stack depende de cientos o miles de llamadas diarias y la calidad Flash cubre el requisito, ignorar un modelo que cuesta céntimos por millón de tokens es tirar el dinero. Y si me equivoco, al menos habré tirado muy poco.
Copia esto y pégalo en Claude Code, Cursor o tu asistente de código favorito:
Instala el paquete openai de Python y haz una llamada de prueba a DeepSeek V4 Flash usando el endpoint https://api.deepseek.com. Envía un prompt que resuma un texto de 2.000 palabras y calcula el coste real de la llamada en dólares. Necesito una clave de API de https://platform.deepseek.com.
No necesitas saber programar. El asistente se encarga de la instalación, la configuración y las pruebas.
Preguntas frecuentes sobre DeepSeek V4 Flash
¿Qué es la arquitectura Mixture-of-Experts (MoE)?
MoE es un diseño de red neuronal que divide el modelo en "expertos" especializados y activa solo un subconjunto en cada inferencia. En DeepSeek V4 Flash, de sus 284.000 millones de parámetros solo trabajan 13.000 millones por pasada, lo que reduce el coste computacional sin sacrificar la capacidad total del modelo.
¿Se puede ejecutar DeepSeek V4 Flash en local?
Sí. Los pesos están en Hugging Face bajo licencia MIT y existen versiones cuantizadas que publicó Unsloth el mismo día del lanzamiento. Eso sí: incluso cuantizado necesitas una GPU con memoria suficiente para los 13.000 millones de parámetros activos, y el rendimiento en local no se acerca a los 83-150 tokens por segundo de la API.

