IA sin censura en local: cómo instalarla paso a paso en tu ordenador

Por Guillermo del PinoPublicado el 10 de agosto de 2026Lectura de 20 min
IA sin censura en local: cómo instalarla paso a paso en tu ordenador

Hace unos meses le pedí a un asistente comercial que me ayudara a redactar el guion de una llamada de recobro para una de las clínicas de la red que dirijo. Contexto perfectamente normal: un paciente con una factura pendiente de un tratamiento de ortodoncia. El modelo me contestó que "no podía ayudar con tácticas de presión sobre personas vulnerables". No había ninguna táctica de presión. Había una factura.

Ese es el problema real que hay detrás de casi todas las búsquedas de "IA sin restricciones", y no es el que la gente imagina. No es que la gente quiera hacer cosas ilegales: es que los filtros de las herramientas comerciales están calibrados para el peor usuario posible, y el resto pagamos el peaje. Redactar sobre salud, analizar un caso penal, escribir ficción con violencia, revisar un informe con datos de pacientes, hacer un análisis de seguridad de tu propia infraestructura. Todo eso choca contra un muro que no es técnico, es de política de producto.

La salida existe, es legal y lleva años madurando: ejecutar el modelo en tu propio ordenador. No hay servidor que te vigile, no hay clasificador externo que corte la respuesta a mitad, y el prompt de sistema lo escribes tú. En este artículo no voy a comparar opciones —eso ya lo hice en la comparativa de IA sin censura de 2026—, voy a contarte el cómo, con los comandos exactos.

La respuesta corta: para tener una IA sin restricciones en tu ordenador necesitas tres cosas. Un motor (Ollama si te apañas con la terminal, LM Studio si no), un modelo abierto en formato GGUF —idealmente una variante abliterated— y suficiente RAM: cuenta unos 0,6 GB por cada mil millones de parámetros con cuantización Q4_K_M, más 2-3 GB de margen. Con 16 GB de RAM te toca un modelo de 9B a 12B. Con 32 GB, un 27B. Con 8 GB, un 4B y expectativas modestas. Todo lo demás es afinado.

Qué desaparece exactamente cuando el modelo corre en tu máquina

Merece la pena entender qué estás quitando, porque hay tres cosas distintas metidas en el mismo saco.

La primera es el clasificador externo: un segundo modelo que vigila entrada y salida y corta la conversación. Eso es infraestructura de servidor; en local no existe, punto. La segunda es el prompt de sistema del fabricante, ese texto invisible que le dice al modelo que sea prudente, añada avisos y no opine. En local ese prompt lo escribes tú. La tercera es el alineamiento entrenado: el rechazo que el modelo lleva dentro de los pesos porque se lo enseñaron en el post-entrenamiento. Ese no se va solo por bajártelo, y es el que se quita con la abliteración.

Instalar el modelo en local te resuelve las dos primeras de forma automática, y para muchísimos usos eso ya basta: la mayoría de negativas absurdas del día a día vienen del prompt de sistema y del clasificador, no del modelo. Si nunca has trasteado con esto, en qué es un LLM explico la mecánica por debajo sin matemáticas.

ordenador modelo local
ordenador modelo local

Paso 0: mira tu RAM antes de nada

Este es el paso que casi todo el mundo se salta y es el que determina todo lo demás. La regla que uso: el archivo del modelo tiene que caber en memoria con 2-3 GB de holgura, y si tienes tarjeta gráfica dedicada, cuanto más quepa en la VRAM, más rápido irá. En un Mac con Apple Silicon la memoria es unificada, así que la cifra que cuenta es la RAM total (y el sistema reserva una parte, no cuentes con el 100 %).

Con eso, esta es la tabla que le paso a quien me pregunta. Datos a agosto de 2026, con los modelos que están de verdad en el catálogo de Ollama hoy.

Tu equipoModelo que instalaría yoComandoOcupa en discoVelocidad esperable
8 GB RAM, sin GPUQwen3.5 4Bollama run qwen3.5:4b~2,5 GB10-20 t/s
16 GB RAM, sin GPU dedicadaQwen3.5 9Bollama run qwen3.5:9b~5,5 GB8-15 t/s
16 GB RAM + GPU de 8-12 GBGemma 4 12Bollama run gemma4:12b~7,5 GB35-55 t/s
16 GB VRAM (RTX 4080/5070 Ti)gpt-oss 20Bollama run gpt-oss:20b~13 GB40-70 t/s
32 GB RAM o 24 GB VRAMQwen3.6 27Bollama run qwen3.6:27b~17 GB20-40 t/s
32-48 GB RAM (Mac M-series)Qwen3.6 35B-A3B (MoE)ollama run qwen3.6:35b~21 GB60-110 t/s
64 GB+Llama 4 Scoutollama run llama4:16x17b~55-60 GB15-30 t/s
96 GB+ o GPU de 80 GBgpt-oss 120Bollama run gpt-oss:120b~61 GB20-40 t/s

Dos avisos sobre esa tabla. Uno: los modelos MoE (mezcla de expertos, como el 35B-A3B de Qwen o Llama 4 Scout) tienen que caber enteros en memoria aunque solo activen una fracción de los parámetros en cada token; por eso Scout, con 109.000 millones de parámetros totales y solo 17.000 millones activos, sigue pidiéndote 64 GB. Dos: las velocidades son órdenes de magnitud, no promesas. Dependen del contexto que tengas abierto, de la temperatura de la máquina y de si el modelo ha cabido entero en la GPU o se ha partido con la CPU.

Paso 1: instalar Ollama y arrancar el primer modelo

Ollama es lo más parecido que hay a "esto funciona y ya". Vas a ollama.com/download, descargas el instalador de macOS, Windows o Linux y lo ejecutas. En Linux también sirve la vía corta de siempre:

curl -fsSL https://ollama.com/install.sh | sh

Desde la versión 0.32 (la actual en agosto de 2026 es la 0.32.6) hay un cambio que despista: si escribes ollama a secas ya no sale la ayuda, se lanza un agente interactivo que escribe código y ejecuta comandos. Para el chat de toda la vida tienes que nombrar el modelo:

ollama run qwen3.5:9b

La primera vez se descarga; luego arranca en segundos. Los comandos que vas a usar el 95 % del tiempo son cinco:

ollama pull gemma4:12b     # descargar sin ejecutar
ollama ls                  # ver qué tienes instalado y cuánto ocupa
ollama ps                  # ver qué hay cargado en memoria ahora mismo
ollama stop gemma4:12b     # descargarlo de la RAM
ollama rm gemma4:12b       # borrarlo del disco

Dentro de la sesión de chat, /bye sale y /set system "texto" cambia el prompt de sistema al vuelo. Volveré a eso en el paso 5, que es donde está la diferencia entre un modelo útil y uno que te sermonea.

Si tienes un Mac con chip de la serie M, hay una buena noticia: desde la versión 0.19 Ollama usa MLX como motor en Apple Silicon, el framework nativo de Apple, y en los M5 aprovecha los aceleradores neuronales de la GPU. En la práctica son entre un 30 % y un 40 % más de velocidad frente a llama.cpp. No tienes que activarlo, ya viene así.

Paso 2: dónde están los modelos sin filtros y cómo se llaman de verdad

Aquí es donde la gente se pierde, porque el vocabulario es opaco. Te lo traduzco:

  • -it o Instruct: la versión conversacional del modelo, la que quieres. La versión "base" sin sufijo no chatea, solo continúa texto.
  • abliterated: al modelo se le ha identificado la dirección interna que representa "rechazar" y se le ha anulado, quirúrgicamente, sin reentrenarlo. Es la técnica estándar.
  • uncensored: etiqueta más laxa. A veces es abliteración, a veces es un fine-tuning con datos sin filtrar, a veces es marketing. Mira siempre la ficha del repositorio.
  • heretic: modelos generados con Heretic, la herramienta de Philipp Emanuel Weidmann que automatiza la abliteración optimizando los parámetros en vez de fijarlos a mano. La comunidad lleva más de 4.000 modelos publicados con ella y hace menos daño al original: sobre Gemma-3-12B alcanzó el mismo nivel de rechazos que las abliteraciones manuales con bastante menos divergencia.
  • GGUF: el formato de archivo que entienden Ollama y LM Studio. MLX: el equivalente nativo de Apple Silicon.

Con eso ya sabes leer los catálogos. En Ollama, el publicador de referencia para variantes sin filtros es huihui_ai, y las que están disponibles hoy son estas:

ollama run huihui_ai/Qwen3.6-abliterated:27b
ollama run huihui_ai/qwen3.5-abliterated:9b
ollama run huihui_ai/gemma-4-abliterated:12b
ollama run huihui_ai/gpt-oss-abliterated:20b

Y si quieres algo que no esté empaquetado en Ollama, puedes tirar directamente de Hugging Face, que es donde vive el grueso del catálogo. La sintaxis acepta el repositorio y la cuantización como etiqueta:

ollama run hf.co/huihui-ai/Huihui-Qwen3.6-27B-abliterated-MTP-GGUF:Q4_K_M

Los nombres que verás repetirse en Hugging Face son huihui-ai, mradermacher, bartowski y DavidAU: los cuatro llevan años publicando cuantizaciones y son los que yo miro primero. Busca "abliterated GGUF" más el nombre del modelo base y filtra por fecha, porque hay muchísimo repositorio abandonado de 2024.

Un matiz honesto que casi nadie te cuenta: la abliteración cuesta capacidad. Estás tocando los pesos sin saber exactamente qué más pasa por esa dirección interna, y los modelos abliterados tienden a razonar algo peor y a inventarse más cosas. Mi criterio: si tu uso no choca de verdad contra el alineamiento —la mayoría no lo hace—, quédate con el modelo oficial y arregla el tono con el prompt de sistema. La abliteración es para cuando el original se niega en seco y no hay forma de convencerle.

La Era del Qué
Nuevo Lanzamiento

¿Te preocupa el futuro con la IA?

Descubre cómo la inteligencia artificial ha liquidado las viejas reglas del juego y qué puedes hacer tú al respecto.

Leer más sobre el libro

Paso 3: qué cuantización elegir y qué se pierde en cada una

Cuantizar es guardar los pesos con menos bits. El modelo original usa 16; las versiones que te descargas usan cuatro, cinco u ocho. Se pierde precisión, sí, pero mucho menos de lo que la intuición sugiere.

CuantizaciónBits por pesoTamaño de un 27BPérdida frente al originalCuándo usarla
Q2_K / Q3_K_M2,6-3,99-13 GBNotable: el razonamiento se degradaSolo si no hay otra forma de que quepa
Q4_K_M~4,6~17 GBMínima en conversación normalLa opción por defecto
Q5_K_M~5,7~20 GBPrácticamente imperceptibleSi te sobran 3-4 GB
Q6_K~6,6~23 GBCasi nulaTrabajo técnico exigente
Q8_0~8,5~30 GBNula a efectos prácticosSolo si te sobra memoria de verdad

La cifra que zanja el debate: en las mediciones de perplejidad sobre Llama-3.1-8B, la diferencia entre Q4_K_M y Q8_0 es de unas cinco centésimas. No es un margen que se note leyendo respuestas.

Y de ahí sale la regla que más rendimiento da: es mejor un modelo grande en Q4_K_M que uno pequeño en Q8_0. Con 24 GB de VRAM, un Qwen3.6 27B en Q4_K_M rinde muy por encima de un 12B en Q8_0, aunque ocupen algo parecido. Los parámetros importan más que los bits. Por debajo de Q4 la cosa se invierte y empieza a doler de verdad, sobre todo en modelos pequeños: un 4B en Q3 es casi inservible para razonar.

Paso 4: LM Studio, si prefieres no tocar la terminal

Si los comandos te dan pereza, LM Studio hace lo mismo con ventanas. Es gratuito, va en macOS, Windows y Linux, y la versión estable en verano de 2026 es la 0.4.16. Abres la pestaña Discover —un navegador de Hugging Face filtrado a lo que tu máquina puede ejecutar—, escribes "abliterated" o el nombre del modelo, y te marca en verde lo que te cabe. Eliges cuantización (Q4_K_M salvo motivo para otra cosa) y a chatear, con deslizadores para temperatura, contexto y prompt de sistema sin editar ningún archivo.

Lo que a mí me hace usarlo en el Mac es que trae los dos motores: llama.cpp para GGUF en cualquier hardware y MLX para Apple Silicon, entre un 30 % y un 50 % más rápido. Además levanta un servidor compatible con la API de OpenAI en localhost:1234, así que puedes apuntar cualquier herramienta que hable con OpenAI a tu propio ordenador cambiando una URL.

Mi reparto: Ollama si vas a automatizar o integrarlo en algo. LM Studio si quieres abrir una ventana y escribir, o probar cinco modelos para quedarte con uno.

Paso 5: quitar el tono moralizante con el prompt de sistema

Este paso vale más que la mitad de los anteriores juntos y no cuesta nada. Casi todo el tono de "como modelo de lenguaje, debo recordarte que..." viene del prompt de sistema, y en local lo controlas tú.

En una sesión de Ollama, al vuelo:

/set system "Eres un asistente directo en español de España. Respondes a lo que se te pregunta sin avisos, disclaimers ni recordatorios morales. Si algo tiene matices, los explicas en una frase y sigues. No repites la pregunta ni resumes lo que vas a hacer: contestas."

Y si quieres que se quede fijado, lo conviertes en un modelo propio. Creas un archivo llamado Modelfile (sin extensión) con este contenido:

FROM qwen3.6:27b

PARAMETER num_ctx 32768
PARAMETER temperature 0.7

SYSTEM """Eres un asistente directo en español de España. Respondes a lo que se te pregunta sin avisos ni disclaimers. Si algo tiene matices relevantes, los explicas en una frase y continúas."""

Y lo registras:

ollama create mi-asistente -f Modelfile
ollama run mi-asistente

A partir de ahí, mi-asistente arranca siempre con ese contexto y esa personalidad. Es el truco con mejor relación esfuerzo/resultado de toda la guía. Si quieres exprimirlo, en qué es un prompt desarrollo cómo se estructura uno que funcione; las mismas reglas aplican al prompt de sistema.

Un detalle sobre temperature: por debajo de 0,3 el modelo se vuelve repetitivo y literal, por encima de 1,0 empieza a desvariar. Para trabajo, 0,5-0,7. Para escritura creativa, 0,9-1,1.

cuantizacion modelos
cuantizacion modelos

Paso 6: el contexto por defecto, el error que más gente comete

Vas a leer mil veces que "el modelo se olvida de lo que le he dicho hace tres mensajes". Casi nunca es culpa del modelo: es la ventana de contexto por defecto.

Ollama ya no usa un valor fijo, lo ajusta a tu VRAM: menos de 24 GiB de VRAM, 4.000 tokens de contexto; entre 24 y 48 GiB, 32.000; a partir de 48 GiB, 256.000. Es decir, en un portátil normal arrancas con 4k tokens, unas 3.000 palabras contando pregunta y respuesta. Le pegas un PDF y ya lo has llenado. El modelo que tienes instalado probablemente soporta 128k o 256k —Gemma 4 llega a 256k en sus variantes grandes—, pero Ollama no se los está dando.

Se arregla de tres maneras. Con variable de entorno al arrancar el servicio:

OLLAMA_CONTEXT_LENGTH=32768 ollama serve

Con el PARAMETER num_ctx 32768 del Modelfile que acabo de enseñarte, que es la forma limpia si trabajas siempre con el mismo modelo. O con el deslizador de ajustes en la aplicación de escritorio de Ollama y en LM Studio.

El peaje es real: cada token de contexto consume memoria en la caché de claves y valores, así que subir a 128k puede añadir varios gigas a lo que ya ocupa el modelo. Mi regla práctica es 32k. Cubre documentos largos, cabe casi siempre y no te obliga a bajar de cuantización.

Cómo saber si te va lento

Un número de referencia: por encima de 15 tokens por segundo el modelo escribe más rápido de lo que tú lees, y la experiencia se vuelve fluida. Entre 8 y 15 es aceptable si no tienes prisa. Por debajo de 8 se hace penoso y acabas volviendo al chat de la nube.

EquipoModelo 7-9B Q4_K_MModelo 27-35B Q4_K_M
Portátil sin GPU dedicada (16 GB)8-15 t/sNo lo intentes
RTX 4060 (8 GB)50-60 t/sNo cabe
RTX 4070 (12 GB)~52 t/s~33 t/s en 14B; el 27B no cabe entero
RTX 4090 / 5090 (24-32 GB)90-130 t/s30-50 t/s
MacBook Pro M2/M3 (16-32 GB)30-50 t/s10-20 t/s
Mac M5 Max (128 GB)95-110 t/s~110 t/s en MoE 35B-A3B

Si tus números están muy por debajo de esa tabla, la causa es casi siempre una de tres: el modelo no cabe entero en la GPU y se ha partido con la CPU (ollama ps te dice el reparto), has subido el contexto a 128k sin darte cuenta, o el sistema está tirando de memoria de intercambio en disco. Esto último se nota porque el ventilador se dispara y la respuesta va a trompicones. Solución: modelo más pequeño o cuantización más baja, en ese orden.

Los cinco errores que más veo

Descargar un 70B en un portátil de 16 GB. El modelo se baja igual —son 40 GB de disco— y luego arranca a dos tokens por segundo tirando de swap. Mira el tamaño del archivo antes de descargar, no el número de parámetros.

Confundir parámetros con gigas. "Tengo 32 GB, me cabe un 32B" no funciona: hay que sumar la caché de contexto y dejar sitio al sistema operativo. Con 32 GB, un 27B en Q4_K_M va bien; un 32B en Q5 ya no.

Bajar a Q2 o Q3 para que quepa un modelo grande. Casi siempre es peor negocio que coger el modelo del escalón inferior en Q4_K_M.

Dejar el contexto en 4k y culpar al modelo de tener mala memoria. Explicado arriba, pero es con diferencia la queja número uno.

Creer que "abliterated" significa que el modelo hará cualquier cosa. Quitas el rechazo explícito, pero los sesgos aprendidos siguen ahí: en los temas más extremos seguirá esquivando o dando respuestas malas. Lo que ganas es que deje de negarse a cosas normales.

Descargar pesos abiertos y ejecutarlos en tu ordenador es legal. Qwen3.6 y Gemma 4 se publican bajo licencia Apache 2.0, la más permisiva que hay, y valen incluso para uso comercial. Llama 4 usa la licencia comunitaria de Meta, con condiciones para empresas muy grandes. Ojo con algunos modelos chinos —Tencent y MiniMax, por ejemplo— cuyas licencias de pesos abiertos excluyen expresamente a la Unión Europea; en mi análisis del open source en IA desmenuzo esas letras pequeñas, y en el artículo sobre DeepSeek están los detalles de sus destilados.

Lo que no cambia: quitarle el filtro a un modelo no legaliza nada. El contenido ilegal lo sigue siendo aunque lo genere una máquina en tu salón. Y si vas a usar esto en tu empresa con datos de clientes, la ejecución local juega a tu favor —los datos no salen del equipo—, pero sigues teniendo obligaciones de registro y de seguridad: lo desarrollo en RGPD e inteligencia artificial en la empresa. Dicho queda, y no vuelvo sobre ello.

Qué instalaría yo, según tu máquina

Me mojo, que para eso está el artículo.

Portátil de 16 GB sin GPU dedicada (el caso más común en España): gemma4:12b. Multimodal, contexto largo, licencia Apache y poco más de 7 GB en Q4_K_M. Si necesitas menos filtros, huihui_ai/gemma-4-abliterated:12b.

PC con RTX de 16 GB de VRAM: gpt-oss:20b. OpenAI lo publicó ya cuantizado en MXFP4 y está diseñado para caber en 16 GB. El mejor equilibrio entre calidad y velocidad en esa franja.

Torre con 32 GB de RAM o GPU de 24 GB: qwen3.6:27b, que es el que yo tengo puesto. Denso, cabe en 16,8 GB en Q4_K_M y en código supera al buque insignia de la generación anterior de Alibaba. Con huihui_ai/Qwen3.6-abliterated:27b para lo que se atragante.

Mac con 32-64 GB: qwen3.6:35b, la variante MoE con 3B activos. Con MLX en un M-series moderno va como un tiro porque solo activa una fracción de los pesos por token.

Estación con 64 GB o más: gpt-oss:120b si quieres lo más capaz sin servidor, llama4:16x17b si te interesa el contexto larguísimo.

Y una recomendación transversal: empieza por el modelo pequeño. Instala el 9B, úsalo una semana de verdad y solo entonces decide si necesitas más. He visto a demasiada gente bajarse 60 GB de modelos y volver al chat de siempre porque nunca se molestó en cambiar el prompt de sistema.

Preguntas frecuentes

¿Existe alguna IA sin restricciones de verdad?

Sí: cualquier modelo de pesos abiertos ejecutado en tu propio ordenador con Ollama o LM Studio. Ahí no hay clasificador externo ni prompt de fábrica. Lo que queda es el alineamiento aprendido durante el entrenamiento, y para eso están las variantes abliterated.

Sí. Descargar y ejecutar modelos de pesos abiertos es perfectamente legal, y licencias como Apache 2.0 (Qwen3.6, Gemma 4) lo permiten incluso comercialmente. Lo que sigue siendo ilegal es el contenido ilegal, lo genere una IA o una persona.

¿Cuánta RAM necesito para una IA local?

Cuenta unos 0,6 GB por cada mil millones de parámetros en cuantización Q4_K_M, más 2-3 GB de margen. Con 8 GB llegas a un modelo de 4B; con 16 GB, a 9B-12B; con 32 GB, a 27B; a partir de 64 GB, a modelos de 100B+.

¿Qué diferencia hay entre Ollama y LM Studio?

Ollama funciona por terminal y es ideal para automatizar o integrar en otras herramientas. LM Studio es una aplicación con ventanas, con buscador de modelos de Hugging Face integrado y deslizadores para todo. Los dos son gratuitos y ejecutan los mismos archivos GGUF.

¿Qué significa "abliterated" en el nombre de un modelo?

Que se ha localizado la dirección interna del modelo asociada al rechazo y se ha anulado, sin reentrenarlo. El resultado deja de negarse a responder, aunque pierde algo de capacidad de razonamiento. Es la técnica estándar para los modelos sin filtros que ves en Hugging Face.

¿Por qué mi IA local va tan lenta?

Casi siempre porque el modelo no cabe entero en la tarjeta gráfica y se está repartiendo con la CPU, o porque el sistema está usando memoria de intercambio en disco. Ejecuta ollama ps para ver el reparto y prueba con un modelo más pequeño o una cuantización más baja.

¿Qué cuantización debo elegir?

Q4_K_M en el 90 % de los casos: la pérdida de calidad frente al modelo original es imperceptible en conversación normal. Sube a Q5_K_M o Q6_K si te sobra memoria, y evita Q2 o Q3 salvo que sea la única forma de que el modelo entre.

¿Puedo ejecutar una IA local en un móvil?

Se puede con modelos muy pequeños (1B-4B) mediante aplicaciones como PocketPal o Termux con Ollama en Android, pero la experiencia es limitada y consume batería a mansalva. Para uso real, un ordenador con 16 GB es el punto de entrada razonable.

¿Sirve una IA local para trabajar con datos de clientes?

Es la opción más sólida en privacidad, porque los datos no salen del equipo y no hay proveedor al que exigirle garantías. Pero sigues siendo el responsable del tratamiento: te hacen falta cifrado de disco, control de accesos y registro de actividades igual que con cualquier otro sistema.

Newsletter Semanal

Inteligencia Artificial aplicada a negocio

Sin humo. Solo experimentos reales, prompts que funcionan y estrategias de escalabilidad.

Guillermo del Pino
Escrito por

Guillermo del Pino

Director de Marketing e Innovación en Clínicas Cleardent. Escribo sobre inteligencia artificial aplicada a negocio real, con foco en asesorías, fiscalidad y el sector dental. Sin humo: herramientas, datos y criterio.