Alibaba acaba de publicar un modelo de IA de 27.800 millones de parámetros, con licencia Apache 2.0, que en varias pruebas de rendimiento supera a Claude Opus 4.6 Max en tareas de código. Qwen 3.8 27B es el primer modelo local que merece que te lo mires en serio como alternativa a las APIs de pago. Pero antes de cancelar tu suscripción, vamos a mirar los números con lupa.
TL;DR: El resumen sin rodeos
- Qwen 3.8 27B: modelo denso de Alibaba con 27B parámetros, licencia Apache 2.0, resultados que superan a Claude Opus 4.6 Max en código.
- Hardware mínimo: 17 GB en versión cuantizada (4 bits). En la práctica, portátil de 4.000-5.000 € o GPU de 24+ GB.
- Punto fuerte: código, agentes de IA y cargas de alto volumen donde el coste por token de las APIs se dispara.
- Punto débil: velocidad (15-30 tokens/s en local, varias veces menos que en la nube) y configuración manual obligatoria.
¿Qué es Qwen 3.8 27B?
Qwen 3.8 27B es un modelo de IA denso de 27.800 millones de parámetros, desarrollado por Alibaba y publicado el 14 de agosto de 2026. Su licencia Apache 2.0 permite uso comercial, modificación y redistribución sin restricciones ni tarifas. Es multimodal (texto, imagen, video), con una ventana de contexto de 262.144 tokens ampliable a un millón, y está optimizado para código, razonamiento y flujos agénticos.

Los resultados son los que han montado el revuelo. En SWE-bench Pro (ingeniería de software) marca un 61.7, por encima del 53.4 de Claude Opus 4.6 Max. En LiveCodeBench v6, un 90.3 contra 88.8. Son cifras de Alibaba, así que toca cogerlas con pinzas. Pero la comunidad las está validando: en Hacker News el hilo de lanzamiento acumuló 1.436 puntos y casi 800 comentarios.
En LinkedIn, un post con 109 likes lo resume bien: "100x smaller than frontier models, but performance more or less in line with the frontier models of a few months ago". Que un modelo que cabe en un portátil se acerque a lo que hacen modelos cien veces más grandes ya es para sentarse a mirarlo en serio.
Qué hardware necesitas para ejecutar Qwen 3.8 27B en local
El modelo completo en 16 bits pesa 56 GB de memoria GPU. Eso descarta cualquier equipo de consumo. La clave es la cuantización (reducir la precisión numérica de los pesos del modelo): en 4 bits baja a unos 17 GB, algo que un equipo potente puede gestionar.
Simon Willison lo probó en un MacBook Pro M5 Max con 128 GB de RAM usando LM Studio. Resultado: entre 15 y 30 tokens por segundo. Funciona. Pero con un asterisco gordo.
Ojo: esos 17 GB son solo el modelo. Si usas la ventana de contexto completa en 4 bits, el caché de claves y valores puede añadir otros 16 GB. El "corre en un portátil" exige un portátil de 4.000-5.000 euros o una GPU dedicada con 24-32 GB de VRAM. En TikTok, un comentario con 41 likes lo pone en perspectiva: "No consumer computer can run this. Mac Studio is like $7,000". Exagera, pero el fondo es válido.
AMD ha anunciado soporte de día cero para sus Ryzen AI Max+ y Radeon AI PRO R9700 de 32 GB. NVIDIA con una RTX 4090 de 24 GB también sirve. El software está resuelto. Lo que duele es el cheque.
Dónde rinde Qwen 3.8 27B y dónde se atraganta
Código y agentes: ese es su terreno. Los resultados en SWE-bench Pro y LiveCodeBench son los de un modelo mucho más grande, y está afinado para tareas de múltiples pasos donde otros modelos abandonan a mitad de camino. Si tu día a día pasa por automatizar flujos con agentes de IA, aquí hay chicha. En GitHub, un usuario del repositorio club-3090 que lo puso a prueba con doble RTX 3090 resume su veredicto con un meme: "Mamá, ¿puedo tener una suscripción a Claude?" / "Tenemos Claude en casa".
También rinde en análisis de documentos e imágenes (visión integrada) y en cargas de alto volumen predecibles. Si procesas miles de peticiones similares al día, el coste marginal por token es CERO.
¿Y dónde flojea?
Velocidad. Willison midió 15-30 tokens por segundo en local. En la nube, cualquier modelo puntero multiplica eso por 3 o por 6. Para respuestas en tiempo real, la nube gana por goleada.
Configuración por defecto. Willison contó que generar un SVG simple le llevó 21 minutos porque el modelo viene con el razonamiento al máximo ("xhigh"). Bajarlo a "low" soluciona el problema. Pero si nadie te avisa, el primer rato es desesperante.
Y lo que nadie pone en el titular: no es algo que enchufas y funciona. Configurar y mantener todo eso corre de tu cuenta. Cada hora peleándote con parámetros es una hora que no facturas.
¿Cuándo merece la pena dejar la API por un modelo de IA local?
Si pagas 50 euros al mes en APIs y tu uso es esporádico, Qwen 3.8 27B no te compensa. Entre lo que cuesta el hardware y el tiempo de configuración, la suscripción sale mejor. Punto.

La ecuación cambia cuando tu factura supera los 200-300 euros mensuales en tokens y tu caso de uso es repetitivo. Procesamiento masivo de documentos, agentes de código corriendo en bucle, datos confidenciales que no quieres subir a la nube. Ahí la inversión en hardware (que ya tienes o que amortizas en menos de un año, si eres optimista) empieza a ganar.
Y luego está la privacidad. Tus datos no salen de tu máquina. Para quien trabaja con información sensible de clientes, eso ya no es negociable. Con Apache 2.0 y ejecución local, cumples GDPR sin depender de las políticas de retención de un tercero. Eso sí: como analiza Wired sobre los riesgos de los modelos abiertos, la misma licencia que te libera, libera a todo el mundo.
Apostaría a que el modelo de uso que más va a crecer es el híbrido: IA local para el volumen bruto y lo predecible, API de un modelo puntero para lo que exige máxima calidad o respuesta instantánea. La gracia está en saber cuándo usar cada una. Y si ya usas IA local para tareas como transcripción, Qwen 3.8 27B es el salto natural.
Qwen 3.8 27B no mata a las APIs. Es la primera alternativa local que merece que te sientes a hacer las cuentas. Si el hardware ya lo tienes y tu factura en tokens te duele, los números hablan SOLOS. Si tu uso es puntual, sigue con tu suscripción y a correr. Lo que sí ha cambiado es que, por primera vez, "tenemos Claude en casa" no es solo un meme.
Preguntas frecuentes sobre Qwen 3.8 27B
¿Qué es la cuantización de un modelo de IA?
La cuantización reduce la precisión numérica de los pesos del modelo (de 16 bits a 4 u 8 bits) para que ocupe menos memoria. Un Qwen 3.8 27B cuantizado a 4 bits pasa de 56 GB a unos 17 GB, con una pérdida de calidad mínima en la mayoría de tareas.
¿Qué diferencia hay entre Apache 2.0 y otras licencias de modelos de IA?
Apache 2.0 permite uso comercial, modificación y redistribución sin restricciones. Otros modelos "abiertos" como Llama usan licencias con límites de usuarios activos o cláusulas jurisdiccionales. En la práctica, Apache 2.0 es la licencia más permisiva del ecosistema de IA: sin letra pequeña ni sorpresas.

