Alibaba libera los pesos de su modelo más potente, 2,4 billones de parámetros, y viene sin ojos y sin la memoria larga


Alibaba ha publicado en Hugging Face los pesos de Qwen3.8, su modelo de lenguaje más capaz: 2,4 billones de parámetros en total, de los que se activan unos 95.000 millones en cada consulta. Es la primera vez que la compañía abre un modelo de su gama alta, la que hasta ahora se quedaba siempre en la nube de pago, y sobre el papel juega en la liga de los modelos punteros occidentales.
Ahora la parte que cuentan bastante menos los titulares, y que cambia por completo para qué sirve esto. La versión que puedes descargar no es la misma que la que Alibaba vende como servicio. Le han quitado la visión —es solo texto—, le han recortado el contexto nativo y no deja desactivar el modo de razonamiento. Y la licencia, pese a lo de "pesos abiertos", no es una licencia de código abierto al uso.
Merece la pena desmontarlo por partes, porque es un caso de manual de algo que vamos a ver mucho: modelos que se anuncian como abiertos y que son, más bien, abiertos con recortes.
Qué se ha publicado exactamente
El repositorio se llama Qwen/Qwen3.8-2.4T-A95B y está acompañado de una versión cuantizada en FP8. Los números que da la propia ficha del modelo:
| Dato | Versión abierta (2.4T-A95B) | Versión de nube (Qwen3.8-Max) |
|---|---|---|
| Parámetros | 2,4 billones (95.000 M activos) | Los mismos |
| Entrada de imagen | No | Sí |
| Contexto nativo | 262.144 tokens | 1 millón |
| Modo sin razonamiento | No, siempre "piensa" | Sí |
| Herramientas integradas | No | Sí |
El contexto se puede estirar hasta cerca del millón de tokens con técnicas de interpolación de posiciones, pero eso es una extensión que aplicas tú y que degrada la calidad, no una capacidad nativa. Por dentro es una arquitectura de mezcla de expertos con 92 capas y 512 expertos, y funciona con los servidores de inferencia habituales del mundo abierto: vLLM y SGLang, entre otros.
La reacción en el propio repositorio ha sido inmediata. El hilo más votado en la sección de discusiones se titula, literalmente, "Huge disappointment", y el argumento es difícil de rebatir: cuando un modelo es fuerte en tareas de visión y lenguaje y le arrancas la visión, tiras la mitad de su valor. En el momento de escribir esto, nadie del equipo de Qwen ha respondido en ese hilo.
Hay otro cabo suelto. Al anunciar la apertura, Alibaba habló también de un Qwen3.8 de 27.000 millones de parámetros, un tamaño mucho más manejable y, para el 99% de la gente, mucho más útil. En el perfil oficial de Qwen en Hugging Face solo están, hoy, el modelo de 2,4 billones y su versión FP8. El pequeño no ha llegado.
La licencia: abierta hasta que factures
Esto es lo que casi nadie mira y lo que decide si puedes usarlo en tu empresa. No es Apache 2.0 ni MIT: es una licencia propia, la "Qwen3.8-Max License", con tres condiciones que conviene conocer.
- Uso interno, sin problema. Si lo despliegas para tu propia organización y no se lo ofreces a terceros, no hay restricciones adicionales.
- Umbral de ingresos. Si montas encima un negocio de modelo como servicio o un asistente de trabajo con IA y facturas más de 50 millones de dólares en doce meses consecutivos, necesitas una licencia aparte con Alibaba.
- Obligación de citar la marca. Los productos con más de 100 millones de usuarios activos mensuales o más de 20 millones de dólares de ingresos al mes tienen que mostrar el nombre del modelo de forma destacada en su interfaz.
En la práctica, para una pyme española o para un desarrollador esto es libre. Para una startup que crezca de verdad, es una bomba de relojería contractual. Y desde el punto de vista de las definiciones, no es software libre: es una licencia de fuente disponible con condiciones comerciales. La diferencia importa y la he explicado con calma en modelos de IA de código abierto.
El detalle práctico: no lo vas a ejecutar tú
Vamos a poner números sobre la mesa, porque "puedes descargarlo gratis" suena a que puedes usarlo, y no es el caso.
Un modelo de 2,4 billones de parámetros ocupa, en la versión FP8 —un byte por parámetro—, del orden de 2,4 terabytes solo de pesos. Una tarjeta de centro de datos de gama alta tiene 80 gigabytes de memoria. Haz la división: hacen falta unas treinta de esas tarjetas solo para que el modelo quepa, antes de reservar memoria para las conversaciones. Eso es un armario de servidores, no un ordenador.
Que se activen "solo" 95.000 millones de parámetros por consulta abarata el cálculo, no la memoria: los expertos que no se usan en un turno se usan en el siguiente, así que tienen que estar cargados igualmente.
Traducido: esta apertura no es para ti ni para mí. Es para proveedores de nube, para laboratorios y para grandes empresas que quieran servir el modelo en su propia infraestructura sin pasar por Alibaba. Si lo que buscas es IA que corra en tu equipo, el sitio donde mirar sigue siendo el de los modelos de 4.000, 8.000 o 30.000 millones de parámetros, que es de lo que hablo en IA sin censura en local.
Por qué lo hace Alibaba
Publicar los pesos de un modelo de gama alta cuesta dinero y regala trabajo. Se hace por tres razones, y ninguna es filantropía.
La primera es el reparto del mercado. Cada empresa que despliega Qwen en su propio centro de datos es una empresa que no despliega un modelo estadounidense, y que se queda en un ecosistema chino de herramientas, formatos y adaptaciones. La segunda es reputacional: en la competición por ser el estándar abierto, quien publica marca la agenda. Y la tercera, la más pegada al suelo, es que los recortes que le han hecho —sin visión, sin el millón de contexto, sin herramientas— son exactamente lo que sigue vendiendo en la nube. Abres el motor y te guardas el coche.
Es la misma jugada que llevan meses haciendo otros laboratorios chinos, y por la que el catálogo abierto se ha vuelto un terreno bastante más competitivo de lo que era hace un año. Lo tengo repasado en las mejores IA chinas.
Qué te cambia esto a ti
Poco, hoy, si eres un usuario normal. Bastante, a medio plazo, y en esta dirección:
- Va a aparecer barato en las APIs. Cuando terceros sirvan estos pesos, el precio por millón de tokens de un modelo de este nivel va a caer. Ese es el efecto real y llega en semanas, no en años.
- Sube el suelo de lo que se puede tener en casa. No este modelo, pero sí sus destilados: ya hay versiones pequeñas entrenadas a partir de la familia circulando en Hugging Face.
- Y conviene leer las licencias. "Open weights" se ha convertido en una etiqueta de marketing. Antes de construir un producto encima de un modelo abierto, mira el umbral de facturación. Está siempre ahí.
Mi valoración, sin humo: que un laboratorio publique su modelo de gama alta es una buena noticia y no hay que restarle mérito. Pero llamarlo "abierto" a secas, cuando le faltan capacidades frente a la versión de pago y la licencia tiene un techo de ingresos, es contar la mitad. La mitad que se cuenta suele ser la que conviene.
Fuentes: la ficha del modelo en Hugging Face, su texto de licencia, la discusión abierta sobre las capacidades retiradas y la cobertura del lanzamiento de Qwen3.8-Max en MarkTechPost.
Inteligencia Artificial aplicada a negocio
Sin humo. Solo experimentos reales, prompts que funcionan y estrategias de escalabilidad.
Escribo sobre inteligencia artificial intentando que se entienda y sin vender humo. Ver todas las noticias.


