
El fine-tuning es el proceso de coger un modelo de IA ya entrenado y reentrenarlo con tus propios ejemplos para que se especialice en una tarea concreta: tu tono de voz, tu forma de clasificar, tu formato de salida.
Y ahora la parte que casi nadie te dice antes de venderte el proyecto: la mayoría de los casos en los que alguien cree que necesita fine-tuning se resuelven mejor, antes y más barato con un buen prompt o con RAG. Esta guía sirve tanto para hacerlo bien como para decidir que no toca.
Qué es el fine-tuning (explicación directa)
El fine-tuning es coger un modelo ya entrenado y reentrenarlo con tus propios datos.
Publiqué 172 artículos en marzo y fue mi peor mes
Tenía esta web parada y la estoy rehaciendo con IA. Cambié la forma de hacerlo y en once días de agosto ha tenido más visitas desde Google que en todo julio. Te cuento por correo qué cambié.
- · Por qué la oportunidad es mayor ahora, y no menor
- · Lo único que la IA no te puede copiar: tu criterio
- · Cómo hacer que Google te vea en días, no en seis meses
Imagina que contratas a un médico generalista (el modelo base) y le das una formación intensiva de seis meses en cardiología (el fine-tuning). Sigue siendo médico, pero ahora es especialmente bueno en corazones.
El modelo base —una familia GPT-5.x, Claude, Gemini, Llama o Qwen— ya sabe muchísimo sobre lenguaje, razonamiento y conocimiento general. Con fine-tuning le enseñas a hacer algo específico mucho mejor:
- Escribir en el tono de voz de tu marca
- Clasificar tickets de soporte según tus categorías
- Extraer datos de facturas con tu formato concreto
- Devolver siempre una estructura exacta sin que se lo tengas que recordar
El fine-tuning no crea un modelo nuevo. Ajusta un modelo existente para que sea mejor en lo que tú necesitas.

Fine-tuning, RAG, contexto largo y prompt engineering
Esta es la decisión que de verdad importa, y la que más dinero hace perder cuando se toma mal. Son cuatro estrategias que resuelven problemas distintos.
| Prompt engineering | Contexto largo | RAG | Fine-tuning | |
|---|---|---|---|---|
| Qué hace | Le explicas la tarea con ejemplos | Le metes los documentos enteros en cada petición | Buscas el fragmento relevante y se lo pasas | Modificas el modelo con tus ejemplos |
| Para qué sirve | Formato, tono básico, instrucciones | Colecciones pequeñas y estables | Conocimiento propio, actualizable | Estilo, clasificación, formato muy rígido |
| Datos que actualizas | Al instante | Al instante | Al instante | Hay que reentrenar |
| Coste de puesta en marcha | Nulo | Nulo | Medio | Medio-alto |
| Coste por petición | Bajo | Alto: pagas todos esos tokens | Bajo | Bajo (y a veces el más bajo de todos) |
| Se puede citar la fuente | No | Sí | Sí | No |
| Riesgo de alucinación | Alto | Bajo | Bajo | Alto si le pides datos |
La regla que aplico siempre, en este orden:
- Prompt engineering primero. Es gratis, tarda cinco minutos y resuelve más casos de los que la gente cree. La guía completa está en cómo escribir prompts efectivos.
- Contexto largo si tu documentación es pequeña. Con ventanas de un millón de tokens, meter treinta PDF en el prompt es hoy una opción real y no necesita infraestructura.
- RAG si el conocimiento es mucho, cambia o hay que citar la fuente. Lo tengo desarrollado, con la comparación entre las tres estrategias, en qué es RAG.
- Fine-tuning solo cuando lo anterior no basta, o cuando el objetivo es abaratar y acelerar una tarea que ya funciona.
La confusión más cara del sector: el fine-tuning no sirve para meter conocimiento. Sirve para cambiar comportamiento. Si lo que quieres es que el modelo sepa cosas de tu empresa, es RAG, no fine-tuning. Un modelo ajustado con tus documentos no los memoriza de forma fiable: aprende a sonar como ellos, que es exactamente la receta para una alucinación con acento corporativo.
Cómo funciona el fine-tuning (paso a paso)
1. Preparar los datos de entrenamiento
Esta es la parte más importante y la que más tiempo lleva. Necesitas pares de entrada y salida que representen exactamente lo que quieres que el modelo aprenda.
Por ejemplo, si quieres que el modelo clasifique correos de soporte:
{"input": "No puedo acceder a mi cuenta desde ayer", "output": "Categoría: Acceso - Prioridad: Alta"}
{"input": "¿Cuánto cuesta el plan premium?", "output": "Categoría: Ventas - Prioridad: Baja"}
{"input": "La app se cierra cuando subo una foto", "output": "Categoría: Bug - Prioridad: Media"}
Con unas 50-100 muestras de calidad ya se ven efectos en tareas sencillas. Para resultados sólidos, cuenta con varios cientos o miles. Y "de calidad" quiere decir revisadas por una persona: cien ejemplos buenos rinden más que mil regulares.
2. Configurar el entrenamiento
Especificas los hiperparámetros: cuántas veces el modelo repasa los datos (epochs), con cuánta agresividad ajusta los pesos (learning rate) y el tamaño de los lotes. La mayoría de plataformas ofrecen valores por defecto que funcionan bien para empezar, y salvo que sepas lo que haces, empieza por ahí.
3. Entrenar
El proceso puede durar desde minutos hasta horas, según el tamaño del modelo y la cantidad de datos. No necesitas GPU propias: los proveedores de API ofrecen fine-tuning como servicio.
4. Evaluar
Prueba el modelo ajustado con datos que no usaste para entrenar y compáralo con el modelo base. Este paso se salta muchísima gente, y es el que te dice si has mejorado algo o has empeorado el modelo en todo lo demás.

Nota Importante
Presta atención a este detalle.
Cuándo SÍ tiene sentido el fine-tuning
Reducir costes a escala. Es hoy el motivo número uno, y con diferencia. Si haces miles de peticiones al día con un prompt larguísimo lleno de instrucciones y ejemplos, estás pagando esos tokens en cada llamada. Ajustar un modelo pequeño que ya "sabe" lo que quieres sustituye ese prompt entero. La cuenta sale sola a partir de cierto volumen.
Baja latencia. Un modelo pequeño ajustado responde más rápido que uno grande con un prompt de tres mil tokens. Si tienes un chatbot en tiempo real o una API de alto tráfico, la diferencia se nota.
Tono de marca consistente. Cuando necesitas que todas las respuestas suenen exactamente igual, el fine-tuning es más fiable que las instrucciones: el modelo internaliza el estilo en vez de imitarlo cada vez.
Tareas de clasificación muy específicas. Clasificar tickets, etiquetar contenido según tus categorías, decidir prioridades con tus criterios. Aquí brilla, sobre todo si tus categorías no son intuitivas para alguien de fuera.
Formatos de salida estrictos. Cuando necesitas que el modelo devuelva siempre exactamente la misma estructura y no admites variaciones.

Cuándo NO tiene sentido
Para añadir conocimiento nuevo. Ya lo he dicho arriba y lo repito porque es el error más caro: para eso está RAG.
Si tienes pocos datos. Con menos de cincuenta ejemplos buenos no vas a mejorar nada. Y con datos malos, empeorarás el modelo.
Si el prompt ya funciona. No gastes dinero ni tiempo si un prompt bien escrito resuelve el problema. Es contratar a un cirujano para poner una tirita.
Si buscas un modelo bueno en todo. El fine-tuning especializa; no generaliza. Casi siempre pierdes algo de rendimiento en tareas fuera de la que has entrenado.
Si los datos cambian a menudo. Cada cambio implica reentrenar. Si tu catálogo cambia cada semana, RAG.
Si estás en la UE y el uso es sensible. El Reglamento Europeo de IA impone obligaciones a quien modifica sustancialmente un sistema de IA, y en usos de alto riesgo —selección de personal, crédito, educación— hacer fine-tuning puede convertirte en proveedor a efectos legales, con la documentación que eso implica. Merece una conversación con tu asesoría antes de empezar, y el marco lo explico en el Reglamento Europeo de IA.
Inteligencia Artificial aplicada a negocio
Sin humo. Solo experimentos reales, prompts que funcionan y estrategias de escalabilidad.
Cómo hacer fine-tuning: las opciones hoy
Fine-tuning con API (la opción fácil)
OpenAI ofrece varios tipos de ajuste sobre sus modelos: supervisado con pares de entrada y salida, por preferencias entre dos respuestas y por refuerzo con una función de recompensa. Subes los datos en formato JSONL y lanzas el entrenamiento desde la API o el panel. Qué familias de modelos admiten cada modalidad cambia con cada lanzamiento, así que compruébalo en su documentación antes de planificar nada.
Google ofrece ajuste de Gemini en Vertex AI, orientado sobre todo a empresas ya instaladas en Google Cloud.
Los proveedores de modelos abiertos (Together, Fireworks, Replicate y similares) ofrecen fine-tuning gestionado sobre Llama, Qwen o Mistral, y te dejan descargar los pesos resultantes.
Sobre el coste: se paga por tokens de entrenamiento y luego un precio de inferencia algo mayor que el del modelo base. Los rangos varían tanto entre proveedores y tamaños de modelo que cualquier cifra que te dé aquí estaría desfasada en un mes; mira la tabla de precios oficial y multiplica por tu volumen real antes de decidir.
Fine-tuning de modelos abiertos (más control)
Si quieres control total y que tus datos no salgan de tu infraestructura:
- Llama, Qwen, Mistral o Gemma: descargas el modelo y lo ajustas con tus GPU o alquilándolas por horas
- LoRA y QLoRA: técnicas que permiten ajustar con poca memoria, hasta en una GPU de consumo
- Hugging Face + PEFT: el stack estándar para hacerlo
- Unsloth o Axolotl: herramientas que aceleran el proceso y reducen el consumo de memoria
Esta ruta exige conocimientos técnicos, pero te deja el modelo resultante sin depender de nadie. Y hay una advertencia legal que se ha vuelto muy real: "pesos abiertos" no significa "puedes usarlo". Algunas licencias recientes excluyen expresamente a la Unión Europea del territorio autorizado o exigen permiso escrito por encima de cierta facturación. Abre el fichero de licencia antes que el README. El panorama completo, en IA open source y modelos abiertos.

Los errores más comunes en fine-tuning
Datos de baja calidad. Es el error número uno. Si tus ejemplos tienen errores, inconsistencias o ruido, el modelo aprende esos errores y los amplifica.
Sobreajuste. Si entrenas demasiado con pocos datos, el modelo memoriza los ejemplos en vez de aprender el patrón. Perfecto con los datos de entrenamiento, desastroso con datos nuevos.
No evaluar contra el modelo base. A veces el modelo ajustado es peor que el original en tareas generales. Compara siempre antes y después con un conjunto de prueba que no haya visto.
Olvidar el coste total. No solo pagas el entrenamiento: pagas cada uso del modelo ajustado y pagas otra vez si necesitas reentrenar. Presupuesta los tres.
Quedarte anclado a un modelo. Este es el error nuevo y el que más he visto este año. Ajustas un modelo, funciona, y seis meses después sale una generación que lo supera sin ajustar. Si tu proceso de fine-tuning no está automatizado y documentado, migrar cuesta tanto que acabas quedándote con un modelo viejo por inercia.
No documentar los datos de entrenamiento. Si dentro de tres meses necesitas reentrenar o depurar, tendrás que saber exactamente qué datos usaste. Documenta siempre.
Fine-tuning completo, LoRA y QLoRA
Si investigas sobre el tema, te encontrarás estos tres términos:
Fine-tuning completo: se ajustan todos los parámetros del modelo. El más potente, pero requiere muchos recursos.
LoRA (Low-Rank Adaptation): solo ajusta una pequeña fracción de parámetros añadiendo unas matrices pequeñas al modelo original. Mucho más eficiente y casi tan bueno. Es el estándar actual, y tiene una ventaja práctica enorme: los adaptadores pesan poco y puedes tener varios para tareas distintas sobre el mismo modelo base.
QLoRA (Quantized LoRA): LoRA sobre un modelo cuantizado, es decir, comprimido para ocupar menos memoria. Permite ajustar modelos grandes en una GPU de consumo.
Para la inmensa mayoría de los casos, LoRA o QLoRA es todo lo que necesitas. El ajuste completo solo se justifica cuando quieres cambiar el comportamiento del modelo de raíz.

¿Te preocupa el futuro con la IA?
Descubre cómo la inteligencia artificial ha liquidado las viejas reglas del juego y qué puedes hacer tú al respecto.
Leer más sobre el libroMi recomendación
Si has llegado hasta aquí pensando "¿necesito fine-tuning?", la respuesta probablemente es todavía no.
El camino correcto es:
-
Empieza con prompt engineering. Buenos ejemplos y restricciones claras resuelven la mayor parte de los casos.
-
Prueba a meter la documentación en el contexto si es poca y estable. Cero infraestructura.
-
Añade RAG si el conocimiento es grande, cambia o necesitas citar fuentes. Es lo que uso en casi todos los proyectos reales.
-
Solo entonces plantéate fine-tuning, y normalmente por una de estas dos razones: bajar el coste por petición a escala, o conseguir un comportamiento que las otras técnicas no dan de forma consistente.
Fine-tuning es una herramienta potente. Como toda herramienta potente, usarla cuando no toca genera más problemas de los que resuelve.
Preguntas frecuentes
¿Qué es el fine-tuning de un modelo de IA?
Es reentrenar un modelo ya existente con tus propios ejemplos para que se especialice en una tarea. No se construye un modelo desde cero: se parte de uno que ya sabe lenguaje y razonamiento general y se le ajustan los pesos con unos cientos o miles de casos tuyos. El resultado es un modelo que hace mejor esa tarea concreta y, normalmente, algo peor todo lo demás.
¿Cuál es la diferencia entre fine-tuning y RAG?
El fine-tuning cambia cómo se comporta el modelo; RAG cambia qué información tiene delante al responder. Si quieres que suene como tu marca o que clasifique con tus criterios, fine-tuning. Si quieres que responda con tus documentos, tus precios o tu normativa —y que puedas actualizarlos sin reentrenar nada—, RAG. Están comparados con detalle en qué es RAG.
¿Cuánto cuesta hacer fine-tuning?
Tiene tres partidas: preparar los datos (donde va el 80 % del esfuerzo real y suele ser trabajo humano), el entrenamiento (se paga por tokens y para un caso pequeño puede ser de decenas de euros) y el uso posterior, que se factura algo más caro que el modelo base. Los precios cambian cada pocos meses, así que consúltalos en la web del proveedor y calcula con tu volumen real.
¿Cuántos ejemplos necesito para hacer fine-tuning?
El mínimo práctico ronda los 50-100 ejemplos bien hechos para tareas simples como clasificar. Para resultados sólidos, varios cientos o miles. Importa mucho más la calidad y la consistencia que la cantidad: si dos ejemplos parecidos tienen respuestas distintas, el modelo aprende a dudar.
¿Puedo hacer fine-tuning gratis?
Sí, con modelos abiertos y tu propio hardware. Con QLoRA se ajusta un modelo mediano en una GPU de consumo, y hay cuadernos gratuitos en Google Colab que sirven para aprender. Gratis no significa sin coste: pagas en tiempo, en electricidad y en la curva de aprendizaje. Las APIs comerciales no ofrecen fine-tuning gratuito.
¿El fine-tuning sirve para que la IA aprenda los datos de mi empresa?
No, y es el malentendido que más dinero cuesta. El modelo ajustado no memoriza tus documentos de forma fiable: aprende su estilo. Si le preguntas un dato concreto, te lo dirá con el tono de tu empresa y puede ser falso. Para conocimiento propio, RAG o contexto largo; para comportamiento, fine-tuning.
¿Qué es LoRA y en qué se diferencia del fine-tuning normal?
LoRA ajusta solo unas matrices pequeñas añadidas al modelo en lugar de tocar todos sus parámetros. Consume una fracción de memoria y tiempo, da resultados muy cercanos al ajuste completo y produce adaptadores ligeros que puedes intercambiar según la tarea. QLoRA es lo mismo sobre un modelo comprimido, para que quepa en una GPU normal. Para la mayoría de proyectos, LoRA es la respuesta.
¿Se puede hacer fine-tuning de ChatGPT o de Claude?
De los modelos de OpenAI, sí: la API ofrece varias modalidades de ajuste, aunque no todas las familias de modelos las admiten en todo momento. Con Claude no se hace fine-tuning por la vía habitual de consumidor, y las opciones de personalización se articulan por otros caminos empresariales. En ambos casos, comprueba la documentación oficial vigente antes de diseñar el proyecto.
¿Cuánto tarda un fine-tuning?
El entrenamiento en sí va de minutos a unas horas según el tamaño del modelo y el volumen de datos. Lo que de verdad ocupa tiempo es lo de antes y lo de después: preparar y revisar los ejemplos puede llevar semanas, y montar una evaluación decente, unos días. Si alguien te vende un fine-tuning "en una tarde", te está vendiendo el paso más corto.
¿Es seguro subir mis datos para hacer fine-tuning?
Depende del proveedor y del plan. Los contratos empresariales de los grandes proveedores no usan tus datos de entrenamiento para mejorar sus modelos y ofrecen retención cero o acotada, pero eso hay que verificarlo por escrito, no darlo por hecho. Si trabajas con datos personales, además necesitas base legal y contrato de encargado del tratamiento. Y si el dato es especialmente sensible, la respuesta limpia es un modelo abierto ajustado en tu propia infraestructura.






