IA Aplicada24/08/20266 min lectura

DeepSeek V4 Flash como subagente: ahorro real y humo viral

Un post de Instagram con 74 comentarios lo tiene claro: cancela tu suscripción de 200 dólares al mes a Claude, instala un repo y cambia Opus 5 por DeepSeek V4 Flash en 3 minutos. La promesa huele a clickbait puro, pero la herramienta que hay debajo merece cinco minutos reales de tu tiempo.

Mascota Marketing Ultra

TL;DR: El resumen sin rodeos

  • Codex-router: proxy open source que mete modelos externos (DeepSeek, Kimi, Grok) en el selector de Codex como subagentes.
  • Ahorro bruto: DeepSeek V4 Flash cuesta ~0,22 $/M tokens de entrada frente a los 5 $ de Opus 5. Unas 23 veces menos.
  • Configuración: instalación vía Homebrew o script, en minutos. No es magia: necesitas claves API y criterio.
  • Riesgo real: proyecto comunitario, no producto oficial. Tus credenciales pasan por él.
Veredicto: el enrutamiento de modelos es una estrategia real y el ahorro es brutal, pero "cancelar tu suscripción a Claude" es vender humo. Pruébalo con datos, no con fe.

Qué es codex-router y qué problema resuelve

Codex-router es un proxy de código abierto que permite usar DeepSeek V4 Flash y otros modelos externos como subagentes dentro de Codex, la plataforma de agentes de ingeniería de OpenAI.

Codex incorporó subagentes en marzo de 2026: un agente principal que delega subtareas a agentes secundarios en paralelo, cada uno en su sesión aislada. Va muy bien para explorar bases de código grandes o implementar funcionalidades por fases. El problema: de forma nativa solo acepta modelos de OpenAI.

Codex-router lo resuelve actuando como proxy local. Intercepta las peticiones de Codex y las enruta al proveedor que elijas. DeepSeek, Kimi, Grok o incluso Claude aparecen en el selector como si fueran nativos. La instalación va por Homebrew o con un script guiado, y LiteLLM se encarga de traducir cada petición al protocolo del proveedor correspondiente. Tres minutos es optimista, pero tampoco vas a estar una tarde.

DeepSeek V4 Flash frente a Opus 5: las cifras que duelen

DeepSeek V4 Flash cuesta unas 23 veces menos que Claude Opus 5 en tokens de entrada y 38 veces menos en salida. Veintitrés veces. Esas son las cifras que importan.

Clasificadora industrial: 86 % de tareas al canal barato (DeepSeek V4 Flash, 0,22 $/M) y 14 % al caro (Opus 5, 5 $/M); ahorro de −85 %

Los precios a agosto de 2026, según OpenRouter:

  • DeepSeek V4 Flash: 0,22 $ por millón de tokens de entrada, 0,66 $ por millón de salida (horas valle).
  • Claude Opus 5: 5 $ por millón de entrada, 25 $ por millón de salida.

DeepSeek V4 Flash es un modelo Mixture-of-Experts (MoE) con 284.000 millones de parámetros totales, pero solo activa 13.000 millones por inferencia. Ventana de contexto de un millón de tokens. En rendimiento puro no alcanza a Opus 5 en la mayoría de referencias, pero la diferencia de precio es tan bestia que la pregunta se da la vuelta: ¿qué tareas necesitan REALMENTE el modelo más caro?

En TikTok, un vídeo de @jceronch con más de 50.000 visualizaciones sobre cómo usar DeepSeek V4 Flash gratis con OpenCode lo clava en un comentario: "deepseek v4 flash está chetado, modelo infravalorado".

Enrutamiento de modelos: la idea que importa de verdad

La idea es sencilla: clasificas cada tarea por complejidad y la mandas al modelo que mejor te sale en calidad-precio para ese trabajo. No es "sustituir" el modelo caro: es dejar de usarlo donde no hace falta.

Un estudio presentado en ICLR 2025 (RouteLLM) demostró que esta estrategia puede recortar un 85% los costes de inferencia manteniendo el 95% de la calidad de GPT-4. Solo el 14% de las consultas necesitaba el modelo de frontera. El resto se resolvía con modelos ligeros.

Llevo tiempo defendiendo esto mismo cuando hablo de cómo automatizar flujos con IA de forma inteligente: el modelo más potente te da igual si no tienes un sistema que decida cuándo usar cada pieza. La misma historia que cuando decides cuándo usar ChatGPT y cuándo Claude. Clasificar intención, formatear, confirmar acciones cortas: modelo barato. ¿Razonamiento complejo y código arquitectónico? Ahí sí pones la artillería.

Lo que el post de Instagram no te cuenta

Ahora viene lo que me interesa: lo que se queda fuera del carrusel.

Primero: no estás "cancelando" nada. Codex es de OpenAI. Para usarlo necesitas su acceso o su API. Codex-router no sustituye Codex: le añade modelos externos. Si tu flujo sigue en Codex, sigues pagando a OpenAI.

Segundo: codex-router es un proyecto comunitario, no un producto con soporte oficial ni garantías de continuidad. Tus claves API de DeepSeek (o del proveedor que uses) pasan por ese proxy. El repo dice que las credenciales se manejan de forma aislada. Tú decides cuánto te fías de un README.

Y tercero, lo que apostaría a que nadie explica en un carrusel de Instagram: los flujos con subagentes consumen MÁS tokens en total que una ejecución de agente único. Cada subagente lanza su propio ciclo de herramientas. Ahorras por token, sí, pero gastas más tokens. El ahorro neto depende de la proporción de tareas que puedas migrar a modelos más baratos sin que baje la calidad del resultado final. Y eso requiere medir. No asumir.

¿Quieres probarlo tú mismo?

Copia esto y pégalo en Claude Code, Cursor o tu asistente de código favorito:

Instala codex-router desde https://github.com/duolahypercho/codex-router, configura DeepSeek V4 Flash como subagente con mi clave API de DeepSeek, y lanza una tarea de prueba que clasifique 10 issues de un repo por prioridad para verificar que el enrutamiento funciona.

No necesitas saber programar. El asistente se encarga de la instalación, la configuración y las pruebas.

Equipos de modelos, no modelos solitarios

El titular de Instagram da igual. Lo relevante es la tendencia que hay debajo: estamos dejando de buscar "el modelo que lo hace todo" para montar equipos de modelos donde cada uno hace lo suyo al precio justo. La misma lógica que un equipo humano: no pones al director creativo a hacer informes de tráfico.

La mascota desvía el flujo de un tubo caro a seis canales baratos en paralelo, pero el volumen total combinado es mayor que el original

Codex-router es una herramienta joven, con las limitaciones de un proyecto comunitario. Pero la idea que hay detrás va a más. Si gestionas flujos de IA con volumen (y si estás leyendo esto, probablemente sí), pruébalo en un entorno controlado y mide el ahorro real antes de decidir nada.

La pregunta ya no es si puedes usar modelos baratos como subagentes. Claro que puedes. La pregunta es si lo vas a hacer con criterio o con fe ciega en un post de Instagram.


Preguntas frecuentes sobre DeepSeek V4 Flash como subagente en Codex

¿Qué es Mixture-of-Experts y por qué abarata la inferencia?

Mixture-of-Experts (MoE) es una arquitectura de red neuronal que divide el modelo en "expertos" especializados y solo activa un subconjunto por inferencia. DeepSeek V4 Flash tiene 284.000 millones de parámetros totales pero activa solo 13.000 millones por consulta, lo que reduce el coste computacional sin sacrificar la capacidad del modelo.

¿Codex-router funciona solo con DeepSeek?

No. Soporta múltiples proveedores: DeepSeek, Kimi, GLM, Grok, Claude y GitHub Copilot. LiteLLM traduce cada petición al protocolo nativo del proveedor que elijas, lo que permite mezclar modelos según la tarea dentro del mismo flujo de Codex.

Deja un comentario

Tu correo no se publicará. Revisamos los comentarios antes de mostrarlos.