Alibaba publica Qwen3.8-27B con licencia Apache: el modelo abierto que sí te cabe en un ordenador


Hace unos días conté aquí que Alibaba había soltado unos pesos abiertos de 2,4 billones de parámetros y avisé de lo obvio: es una noticia enorme y a la vez es un modelo que no vas a poder ejecutar en tu vida, porque no cabe ni en un armario de servidores razonable.
Pues bien, el mismo lanzamiento traía un hermano pequeño, y ese sí importa para el mundo real. Qwen3.8-27B: 27.000 millones de parámetros, licencia Apache 2.0 desde el primer día, entiende texto, imágenes y vídeo, y admite 262.144 tokens de contexto de forma nativa —ampliables hasta un millón con una técnica llamada YaRN—. Está publicado en Hugging Face y te lo puedes descargar ahora mismo.
Este es el tamaño con el que la gente trabaja de verdad fuera de los titulares. Y la licencia Apache 2.0 significa que puedes usarlo comercialmente, modificarlo y desplegarlo en tu servidor sin pedir permiso ni pagar por uso.
Las cifras, con la advertencia por delante
Antes de la tabla, el aviso que toca: estos números los publica Alibaba comparándose con quien le interesa. No son de un evaluador independiente. Yo los doy porque son la única referencia que hay hoy y porque el modelo es descargable —cualquiera puede desmentirlos—, pero léelos con la ceja levantada.
| Prueba | Qué mide | Qwen3.8-27B | Muse Glimmer-30B |
|---|---|---|---|
| Terminal-Bench 2.1 | Tareas en terminal de principio a fin | 73,0% | 51,7% |
| GPQA Diamond | Preguntas de ciencia de nivel doctorado | 89,2% | 83,5% |
| IFBench | Seguir instrucciones al pie de la letra | 79,5% | 77,0% |
Y la comparación que se ha llevado los titulares, contra un modelo propietario de gama alta:
| Prueba | Qwen3.8-27B | Opus 4.6 Max |
|---|---|---|
| SWE-bench Pro | 61,7% | 53,4% |
| LiveCodeBench v6 | 90,3% | 88,8% |
| CoWorkBench | 70,7% | 68,2% |
Que un modelo de 27.000 millones de parámetros que te descargas gratis se ponga a la altura de uno propietario de gama alta en pruebas de programación es, si se sostiene, la noticia. Pero cuidado con la lectura fácil: una prueba de programación mide programar. No mide redactar en español correcto, ni entender el contexto fiscal español, ni aguantar una conversación larga con un cliente sin desbarrar. Ahí las comparativas siguen siendo otra cosa, y lo comprobé en su día en ChatGPT vs Claude vs Gemini.
El hardware, sin adornos
Esta es la parte que casi nadie pone y es la única que decide si esto te sirve. Los pesos ocupan lo siguiente según la precisión con la que lo ejecutes:
| Precisión | Ocupan | Tarjeta gráfica que pide |
|---|---|---|
| BF16 (calidad máxima) | ~56 GB | Clase 80 GB (H100, H200) |
| FP8 (equilibrio para servir) | ~28 GB | Clase 48 GB (L40S, RTX Pro 6000) |
| 4 bits (GGUF/AWQ) | ~14–17 GB | Clase 24 GB (RTX 4090, RTX 5090) |
La fila que te interesa si esto es para ti es la última: con una gráfica de 24 GB lo ejecutas en casa. Es una tarjeta cara, sí, pero es una tarjeta que existe y que se compra, no un centro de datos.
Y un matiz que se omite siempre y luego da disgustos: los pesos son el suelo, no el total. Encima hay que sumar la memoria de contexto, que crece con la longitud de la conversación y con el número de usuarios simultáneos. Si presumes de 262.000 tokens de contexto y los usas de verdad, la cuenta de memoria se dispara. Con documentos largos o varios usuarios a la vez, la fila de 24 GB se queda corta rápido.
Para quién es esto de verdad
Voy a ser concreto, porque "modelo abierto potente" no significa nada por sí solo.
Sí te interesa si manejas información que no puede salir de tu equipo. Un despacho con expedientes de clientes, una clínica con historiales, una asesoría con documentación fiscal. Ahí un modelo que corre en tu servidor no es una preferencia técnica: es la diferencia entre poder usar IA y no poder. Y con visión incluida, además, puedes meterle facturas escaneadas y documentos fotografiados, que es justo el formato en el que llega el papeleo real.
Sí te interesa si tienes volumen. Cuando procesas miles de documentos al mes, pagar por token deja de ser trivial y un modelo propio en un servidor alquilado empieza a salir a cuenta. Ojo: empieza. Hay que echar la cuenta completa, con el coste del servidor y el tiempo de alguien manteniéndolo.
No te interesa si eres una empresa pequeña sin nadie técnico. Montar esto, mantenerlo, actualizarlo y responder cuando falle un martes a las nueve de la mañana es un trabajo. Para el 90% de los casos, pagar 20 euros al mes por una herramienta que funciona es la decisión correcta, y no pasa nada por reconocerlo.
Si quieres entender el ecosistema del que sale todo esto, está en IA de código abierto: modelos abiertos, y el camino práctico para ejecutar uno en tu equipo lo tengo paso a paso en IA sin censura en local. Si lo que quieres es adaptarlo a tu forma de escribir, el concepto es el fine-tuning.
Lo que esto dice del año
Llevo meses repitiendo lo mismo y cada semana lo confirma: la distancia entre lo que puedes descargarte y lo que puedes alquilar se sigue estrechando. Hace un año, un modelo abierto que rozara a uno propietario de gama alta en programación era una noticia de portada. Hoy pasa cada pocas semanas y con licencia Apache 2.0.
Para quien vende IA a peso, es una mala noticia lenta. Para quien la usa, es la mejor de todas: cada modelo abierto que aparece es una carta de negociación frente al proveedor que tengas contratado. No hace falta que lo despliegues para que te sirva. Basta con que exista y con que tú sepas que existe.
Fuentes: los pesos publicados en Hugging Face bajo licencia Apache 2.0, el resumen de benchmarks de OfficeChai y el desglose de requisitos de hardware de Yotta Labs.
Inteligencia Artificial aplicada a negocio
Sin humo. Solo experimentos reales, prompts que funcionan y estrategias de escalabilidad.
Escribo sobre inteligencia artificial intentando que se entienda y sin vender humo. Ver todas las noticias.


