
Cuando OpenAI presentó los resultados de o3 en el benchmark ARC-AGI a finales de 2024, el campo de la IA se detuvo un momento. No porque o3 fuera simplemente "mejor" que los modelos anteriores — eso pasa constantemente. Se detuvo porque o3 consiguió una puntuación que los investigadores habían considerado inalcanzable para los modelos de lenguaje de entonces.
Este artículo es el análisis de ese modelo: qué es o3, por qué supuso un cambio de enfoque y qué queda de él hoy.
Antes de nada: dónde queda o3 en agosto de 2026
Actualizo esto porque cambia por completo la utilidad práctica del artículo.
o3 desaparece de ChatGPT el 26 de agosto de 2026. OpenAI lo retiró junto con el resto de modelos de la generación anterior tras un periodo de aviso de 90 días, dentro de su decisión de dejar en el producto de consumo únicamente la familia GPT-5.x. Es decir: si entras hoy en ChatGPT, el selector de modelos ya no te va a ofrecer o3, o lo dejará de hacer en cuestión de días.
Publiqué 172 artículos en marzo y fue mi peor mes
Tenía esta web parada y la estoy rehaciendo con IA. Cambié la forma de hacerlo y en once días de agosto ha tenido más visitas desde Google que en todo julio. Te cuento por correo qué cambié.
- · Por qué la oportunidad es mayor ahora, y no menor
- · Lo único que la IA no te puede copiar: tu criterio
- · Cómo hacer que Google te vea en días, no en seis meses
En la API sigue disponible. OpenAI ha separado explícitamente las dos estrategias: retira modelos de ChatGPT para simplificar el producto, pero mantiene el catálogo amplio en la API para no romper las integraciones de las empresas. Si tienes código en producción llamando a o3 u o3-mini, sigue funcionando, aunque conviene planificar la migración: la política de OpenAI es avisar antes de retirar nada de la API, no mantenerlo indefinidamente.
Qué usar en su lugar. Las capacidades de razonamiento de o3 están hoy integradas de serie en los modelos de la familia GPT-5, que ya no separan "modelo rápido" y "modelo que razona" en dos productos distintos, sino que ajustan el esfuerzo de razonamiento según la dificultad de la pregunta. Si buscas el modelo actual de OpenAI, empieza por GPT-5. Y si lo que necesitas es elegir proveedor, la comparativa está en ChatGPT vs Claude vs Gemini.
Entonces, ¿para qué sirve seguir leyendo? Porque o3 fue el modelo que demostró que escalar el cómputo en el momento de responder funciona, y esa idea es la que está detrás de todo lo que usas hoy. Entender o3 es entender por qué los modelos de 2026 se comportan como se comportan.

Qué es o3: el modelo que piensa antes de responder
Para entender o3, primero tienes que entender qué problema resolvía.
Los modelos de lenguaje de la generación anterior generaban texto de forma "autorregresiva": predecían el siguiente token basándose en todo lo anterior. Es un proceso muy rápido pero poco deliberativo — el modelo no "piensa" en el sentido de explorar diferentes posibilidades y seleccionar la mejor.
o3 (y su predecesor o1) pertenece a la familia de modelos que incorporan un proceso de razonamiento extendido antes de dar la respuesta final. El modelo dedica tiempo de cómputo — a veces segundos, a veces minutos — a razonar internamente, explorando caminos de solución, verificando su propio razonamiento y descartando enfoques incorrectos.
Este proceso se llama informalmente "chain of thought" (cadena de pensamiento), aunque o3 iba más allá del chain of thought básico: usaba búsqueda y verificación activa durante el razonamiento, algo parecido a cómo un matemático explora varias demostraciones posibles antes de decidir cuál seguir.
El resultado fue un modelo que cometía muchos menos errores en problemas de múltiples pasos y que mantenía la coherencia lógica en cadenas largas de razonamiento, justo donde los modelos rápidos fallaban.
La diferencia fundamental: velocidad frente a calidad de razonamiento
El ecosistema de OpenAI en aquel momento se organizaba alrededor de este compromiso:
- GPT-4o y GPT-4.5: modelos rápidos y versátiles, respuesta en segundos, coste por token bajo. Los caballos de trabajo del día a día. Ambos fueron retirados de ChatGPT durante 2026.
- o3 y o3-mini: modelos de razonamiento. Más lentos, mucho mejores en problemas profundos, bastante más caros.
La analogía que usaba el propio OpenAI: la diferencia entre la respuesta rápida e intuitiva (Sistema 1 en psicología cognitiva) y el razonamiento deliberativo lento (Sistema 2).
Lo interesante es que esa separación ya no existe como tal. Los modelos actuales de OpenAI, Anthropic y Google han integrado el razonamiento dentro del propio modelo y deciden solos cuánto "pensar" según la dificultad de la pregunta. La familia o fue el laboratorio donde se probó esa idea, y el hecho de que hoy no necesites elegir entre dos modelos es precisamente la señal de que funcionó.
Los benchmarks que importan
Aquí es donde o3 impresionó, pero también donde conviene poner los números en contexto.
ARC-AGI: el benchmark más llamativo
ARC-AGI es una colección de problemas de razonamiento visual-abstracto diseñados por François Chollet (autor de Keras) como test de inteligencia general, no de conocimiento memorizado. Los problemas son del tipo: "mira esta cuadrícula de colores, identifica el patrón y aplícalo para completar la de la derecha".
Los humanos lo resuelven con alrededor de un 85% de precisión sin entrenamiento específico. GPT-4 se quedaba cerca del 33%. o3, en su configuración de alto cómputo, superó el 85%.
Era significativo porque ARC-AGI fue diseñado específicamente para ser difícil para LLMs que memorizan patrones. El matiz importante: esa configuración de alto cómputo tenía un coste computacional enorme por problema, del orden de miles de dólares en la variante más cara. No era el modo que ibas a usar tú en el día a día. En configuraciones eficientes los resultados eran mejores que los de los modelos anteriores, pero no tan extremos.
Matemáticas y olimpiadas
o3 logró resultados de nivel experto en competiciones como el AIME, donde los modelos anteriores fallaban con regularidad en los últimos problemas. En el benchmark MATH superó el 96% frente al entorno del 90% de GPT-4o. La diferencia parece pequeña en porcentaje, pero en la práctica es enorme: lo que separa el 90 del 96 son los problemas más difíciles.
Programación competitiva
En Codeforces, o3 alcanzó un rating equivalente al percentil 99,9 de programadores humanos en ese benchmark: resolvía problemas de programación competitiva al nivel de los mejores del mundo.
El benchmark que no debes ignorar: los errores
Los números de o3 eran impresionantes, pero seguía cometiendo errores que un experto humano no cometería. En problemas parecidos a los que resolvía bien pero con un giro sutil, fallaba de formas inesperadas. Y la confianza excesiva era un problema observado: presentaba respuestas incorrectas con una seguridad que no estaba justificada.
Esto no se ha resuelto con los modelos actuales. Sigue siendo cierto en 2026: más razonamiento reduce los errores, no los elimina, y no arregla la confianza mal calibrada.
o3 frente a o3-mini: qué diferenciaba a cada uno
| o3-mini | o3 | |
|---|---|---|
| Velocidad | Segundos | De segundos a varios minutos |
| Coste relativo | Moderado | Muy alto |
| Fuerte en | Razonamiento matemático y lógico habitual | Olimpiadas, investigación, código competitivo |
| Recomendación de entonces | Punto de partida por defecto | Solo cuando o3-mini no bastaba |
| Estado hoy | Retirado de ChatGPT, disponible en API | Retirado de ChatGPT el 26/08/2026, disponible en API |
La recomendación práctica de la época sigue siendo válida como principio general: empieza por el modelo más barato que resuelva tu problema y sube solo cuando el resultado no te sirva. Con los modelos actuales el razonamiento es automático, pero el coste sigue escalando con el esfuerzo, y en la API puedes controlarlo.
Precios: la realidad del coste
El coste fue uno de los talones de Aquiles de o3. Los precios cambiaron varias veces a lo largo de su vida comercial —OpenAI llegó a recortarlos de forma agresiva—, así que cualquier cifra concreta que leas en un artículo antiguo, incluido este, hay que tomarla como histórica. La tarifa vigente está siempre en la página de precios de OpenAI, y tengo un repaso de las alternativas en APIs de IA en 2026.
El patrón que sí se mantiene: un modelo de razonamiento consume muchos más tokens de los que ves, porque los tokens de pensamiento se facturan aunque no se muestren. Una respuesta que parece corta puede haber costado diez veces más que la misma pregunta a un modelo rápido. Si integras razonamiento en producción, mide el consumo real antes de estimar el presupuesto.

Cuándo tiene sentido un modelo de razonamiento
Aunque o3 como producto de consumo desaparezca, la pregunta de fondo sigue siendo la misma y hoy se aplica a los modos de razonamiento de cualquier proveedor.
Merece la pena cuando...
- El problema es genuinamente difícil: matemáticas de competición, demostraciones, análisis científico
- Hay muchos pasos interdependientes y un error temprano invalida todo lo demás
- Estás depurando lógica compleja, concurrencia o condiciones de carrera
- El valor de acertar justifica esperar (y pagar) más
No merece la pena cuando...
- Escribes emails, resúmenes o contenido general
- La conversación es de ida y vuelta y la latencia importa
- El problema es de conocimiento, no de razonamiento
- El coste por consulta es una restricción seria
Ejemplos concretos donde el razonamiento marcaba la diferencia
Demostración matemática: un teorema con cinco pasos intermedios donde cada uno depende del anterior. Un modelo rápido puede fallar en el paso 3 de 5; uno de razonamiento mantiene la coherencia completa mucho más a menudo.
Depuración compleja: "este código tiene un fallo de concurrencia que solo aparece bajo cierta carga; analízalo y explica exactamente qué ocurre". Seguir varios hilos de ejecución simultáneos es justo el tipo de tarea donde el razonamiento extendido gana.
Planificación con muchas variables: "analiza estas 15 variables de negocio interdependientes y recomienda la secuencia óptima de acciones". Problemas donde las decisiones tempranas cierran opciones posteriores.
Análisis crítico de un paper: identificar supuestos implícitos, limitaciones metodológicas e implicaciones que el propio texto no menciona.
o3 frente a Claude Opus: la comparativa que importaba
En su momento, la comparativa más relevante para usuarios avanzados era entre o3 y el Claude Opus de Anthropic. Ambos representaban el techo de capacidades de sus respectivas empresas, y las diferencias observadas fueron:
- Matemáticas puras: ventaja para o3 en los benchmarks más extremos.
- Seguir instrucciones complejas: ventaja para Claude Opus, con fama de respetar mejor restricciones detalladas y prompts de sistema elaborados.
- Razonamiento sobre código: empate técnico, con diferencias que dependían del lenguaje y del tipo de problema.
- Coste y velocidad: ambos caros; o3 tendía a ser más lento en configuraciones de alto esfuerzo.
Esa foto ya no describe el presente: ambas familias han tenido varias generaciones desde entonces. Pero la conclusión metodológica se mantiene intacta y es lo más útil del apartado: prueba los modelos en tu caso de uso real en vez de fiarte de benchmarks genéricos. Las diferencias entre modelos punteros son pequeñas en abstracto y grandes en tu tarea concreta.
Las implicaciones para el desarrollo de la IA
o3 importa más allá de sus capacidades prácticas. Representó un cambio en cómo pensamos el progreso de la IA.
El escalado del cómputo de inferencia
La tendencia dominante hasta entonces era escalar el entrenamiento: más datos, más parámetros, más cómputo en la fase de entrenar. o3 demostró un enfoque complementario: escalar el cómputo en el momento de la inferencia, es decir, dedicar más potencia a razonar sobre cada problema concreto.
Es una forma distinta de conseguir más inteligencia: no necesariamente modelos más grandes, sino modelos que piensan más sobre cada problema. Y tiene implicaciones económicas diferentes, porque el gasto se traslada de un coste fijo enorme (entrenar) a un coste variable por consulta. Esa es exactamente la arquitectura de todos los modelos punteros de 2026.
¿Qué significó el ARC-AGI para la AGI?
El rendimiento de o3 en ARC-AGI generó mucho debate sobre si estábamos más cerca de la inteligencia artificial general. La posición equilibrada: o3 mostró capacidades de razonamiento abstracto notables, pero ARC-AGI, por bien diseñado que esté, mide una capacidad concreta, no inteligencia general.
Estos sistemas no tienen comprensión del mundo físico, no aprenden de la experiencia de forma continua y no hacen la mayoría de cosas que un adulto resuelve sin pensar. Dicho lo cual, la tendencia es clara: se están alcanzando capacidades que hace dos años se consideraban lejanas.
Inteligencia Artificial aplicada a negocio
Sin humo. Solo experimentos reales, prompts que funcionan y estrategias de escalabilidad.
Preguntas frecuentes
¿Sigue existiendo o3 de OpenAI en 2026?
En ChatGPT, no: OpenAI lo retiró el 26 de agosto de 2026 tras un periodo de aviso de 90 días, dentro de su decisión de dejar solo la familia GPT-5.x en el producto de consumo. En la API sí sigue disponible para desarrolladores, porque OpenAI mantiene un catálogo más amplio ahí para no romper integraciones. Si eras usuario de o3 en ChatGPT, tu sustituto natural es el modo de razonamiento de GPT-5.
¿Qué modelo ha sustituido a o3?
La familia GPT-5 y sus versiones posteriores. La diferencia de fondo es que ya no hay que elegir entre "modelo rápido" y "modelo que razona": el propio modelo decide cuánto esfuerzo de razonamiento dedica según la dificultad de la pregunta, y en la API puedes fijar ese nivel de esfuerzo tú.
¿Qué era exactamente o3?
o3 fue el modelo de razonamiento de OpenAI presentado a finales de 2024 y lanzado en 2025. En lugar de responder de inmediato, dedicaba tiempo de cómputo a explorar caminos de solución, verificar su propio razonamiento y descartar los que no funcionaban antes de contestar. Ese enfoque le permitía resolver problemas de muchos pasos donde los modelos rápidos se perdían.
¿Por qué fue tan importante el resultado de o3 en ARC-AGI?
Porque ARC-AGI está diseñado para castigar a los modelos que memorizan patrones y premiar el razonamiento abstracto sobre problemas nuevos. GPT-4 se quedaba en torno al 33% y los humanos rondan el 85%; o3, en su configuración de más cómputo, superó ese 85%. El matiz que se citó menos: esa configuración costaba una fortuna por problema y no era la que usaría ningún usuario real.
¿Cuánto costaba usar o3?
Bastante más que un modelo rápido, y el precio cambió varias veces durante su vida comercial, con recortes agresivos incluidos. Cualquier cifra concreta de un artículo antiguo está desfasada. Lo que no cambia es el mecanismo: los modelos de razonamiento facturan también los tokens de pensamiento que no ves, así que una respuesta corta puede haber costado diez veces más que la misma pregunta a un modelo normal.
¿Cuál era la diferencia entre o3 y o3-mini?
o3-mini era la versión rápida y económica: mantenía la mayor parte de la capacidad de razonamiento con mucho menos cómputo, y era la opción sensata para el día a día. o3 completo estaba pensado para lo verdaderamente difícil —olimpiadas matemáticas, investigación, programación competitiva— y solo compensaba cuando o3-mini se quedaba corto.
¿Los modelos de razonamiento se equivocan menos?
Se equivocan bastante menos en problemas de varios pasos, pero no dejan de equivocarse. El patrón observado con o3 sigue vigente hoy: fallan en variantes sutiles de problemas que resuelven bien, y a veces presentan respuestas erróneas con una seguridad que no está justificada. Para cualquier decisión con consecuencias, la verificación humana no es opcional.
¿Merece la pena usar un modelo de razonamiento para tareas normales?
No. Para escribir correos, resumir textos o mantener una conversación, un modelo de razonamiento es más lento y más caro sin darte mejor resultado. Guárdalo para matemáticas, lógica compleja, depuración difícil, análisis técnico y problemas con muchas variables interdependientes. Esa es la regla que valía con o3 y sigue valiendo con lo que hay ahora.
¿Qué significa "escalar el cómputo de inferencia"?
Es dedicar más potencia de cálculo al momento de responder en lugar de al momento de entrenar. En vez de construir un modelo más grande, dejas que el modelo piense más rato sobre cada problema concreto. o3 fue la demostración de que este camino funciona, y hoy es la arquitectura por defecto de todos los modelos punteros.
¿o3 significaba que estábamos cerca de la AGI?
No. o3 demostró un salto real en razonamiento abstracto sobre un test concreto, pero ARC-AGI mide una capacidad específica, no inteligencia general. Estos sistemas siguen sin comprensión del mundo físico y sin aprendizaje continuo por experiencia. Lo que sí demostró es que el ritmo de progreso es más rápido de lo que casi nadie estimaba en 2024.
Qué queda de o3
o3 no es el modelo que vas a usar mañana: para cuando leas esto, probablemente ya no esté en ChatGPT. Pero fue el que demostró que dejar pensar a un modelo antes de responder cambia cualitativamente lo que puede resolver, y esa idea está hoy dentro de todos los modelos que usas.
Si quieres entender mejor la tecnología detrás de todo esto, el artículo sobre qué es un LLM y la guía de prompt engineering te dan el contexto para sacarle partido a los modelos actuales — que, en el fondo, son o3 con el razonamiento integrado y sin tener que elegirlo en un menú.






