Anthropic admite que su filtro de armas biológicas llevaba 11 meses apagado: 133 millones de conversaciones

Guillermo del Pino
Guillermo del Pino
Anthropic admite que su filtro de armas biológicas llevaba 11 meses apagado: 133 millones de conversaciones

Anthropic ha publicado su informe de riesgos de agosto de 2026 y dentro hay un incidente que merece leerse dos veces: los clasificadores que bloquean las peticiones sobre armas químicas y biológicas estuvieron sin ejecutarse durante casi once meses, de mayo de 2025 a abril de 2026, en todo el tráfico que pasaba por sus plataformas de retroalimentación humana.

Ese tráfico son unos 133 millones de intercambios generados por cerca de 50.000 personas contratadas a través de proveedores externos, la gente que se dedica a puntuar y corregir respuestas del modelo para entrenarlo.

Lo cuenta la propia empresa, en un documento firmado por ella. No es una filtración ni una investigación de un periódico. Y precisamente por eso es interesante: el detalle técnico de cómo se apagó vale más que el titular.

Qué falló exactamente

Aquí está lo que de verdad importa, y no es la cifra.

Existía una marca interna pensada para uso propio. Al activarse, esa marca desactivaba el bloqueo. Hasta ahí, una decisión discutible pero comprensible: un equipo interno necesita probar sin que el sistema le corte a cada paso.

El problema es lo segundo que hacía: desactivaba también el registro. En palabras del informe, el tráfico marcado "no se registró ni se propagó a ningún mecanismo de revisión".

Traducido: no es que alguien viera las alertas y las ignorara. No hubo alertas. El control no falló ruidosamente, falló en silencio, y por eso tardaron once meses en enterarse.

Anthropic añade una frase que es lo más honesto del documento entero, y también lo más incómodo: esto "nos lleva a creer que hay una probabilidad mayor de que existan otros problemas similares que desconocemos".

Qué encontraron al mirar atrás

Cuando lo detectaron, pasaron un modelo —Claude Sonnet 5— por todo aquel histórico para revisarlo. El resultado, según recoge The Next Web a partir del informe:

DatoCifra
Intercambios sin clasificador biológico~133 millones
Personas con ese acceso~50.000
Transcripciones marcadas como de alto riesgo1.197
De ellas, procedentes de equipos internos de Anthropic757
Casos restantes que necesitaron análisis a fondo62

La conclusión de la empresa es que no encontró pruebas de uso indebido real y que ningún cliente se vio afectado, porque el fallo estaba acotado a las plataformas de retroalimentación humana, no al producto. También reconoce algo que explica el agujero: la verificación de esas 50.000 personas la hacían los proveedores externos, no Anthropic, y muchos de esos proveedores no tenían procesos capaces de detener ni al perfil de amenaza más básico de su propia escala.

Hay una parte que no podemos juzgar: el informe es una versión redactada, con partes tachadas, y un incidente del periodo se ha eliminado por completo de la edición pública.

El otro titular del informe: sube su propio nivel de riesgo

En el mismo documento, Anthropic eleva su estimación del riesgo de desalineación —que un modelo persiga objetivos distintos de los que se le han dado en situaciones de mucho en juego— de "muy bajo", que era la nota que se puso en febrero de 2026, a "bajo".

Es un movimiento pequeño en la etiqueta y grande en el gesto: una empresa que se autoevalúa casi nunca se sube la nota de riesgo. Reconoce además que su informe anterior no consideraba las plataformas de retroalimentación humana como una superficie de riesgo, que es justo por donde le ha entrado el fallo.

En el documento aparecen otras dos cosas que conviene apuntar. Una: existe un modelo interno sin publicar, al que llaman Model 2, algo más capaz que su modelo puntero, y no hay planes de sacarlo fuera. Dos: su iniciativa de ciberseguridad Project Glasswing encontró 10.000 fallos críticos en un mes. Van en la misma dirección que el experimento de enjambres de agentes que conté ayer: la capacidad va por delante del control, y quien la fabrica lo sabe.

Lo que esto te dice si usas IA en tu empresa

Voy a dejar de lado el ángulo de las armas biológicas, que ni tú ni yo vamos a tocar, y me quedo con lo que sí te aplica mañana.

Un control que falla en silencio es peor que no tener control. Si Anthropic hubiera tenido el bloqueo apagado pero el registro encendido, se habría enterado en semanas. Lo que convirtió un error de configuración en once meses de agujero fue que el propio agujero se borraba las huellas.

Esto es exactamente lo que pasa en una pyme cuando alguien monta una automatización con IA y desactiva un aviso "porque daba mucho la lata". Tres preguntas que sí puedes responder esta semana sobre cualquier proceso automatizado que tengas montado:

  1. Si el filtro se cae, ¿te enteras? Si la respuesta es "supongo que sí", es que no.
  2. ¿Los registros se guardan aunque la regla no se aplique? Bloquear y registrar tienen que ser dos interruptores separados. Juntarlos es lo que ha pasado aquí.
  3. ¿Quién verifica de verdad a quien tiene acceso? Anthropic delegó eso en proveedores y descubrió tarde que no lo estaban haciendo. Si tú has delegado el acceso a tus datos en una agencia o en un freelance, la pregunta es idéntica.

Y una cuarta, que es la de siempre: si vas a meter IA en un proceso serio, la parte aburrida —los registros, los permisos, quién revisa qué— es la que decide si te enteras cuando algo va mal. Lo desarrollé en cómo implementar IA en una empresa y en la ficha de agentes de IA.

Que Anthropic lo publique es, en mi opinión, buena señal: es de las poquísimas empresas del sector que cuenta sus propios fallos con número y fecha. Pero la lectura no es "qué transparentes". La lectura es que si a la empresa que más presume de seguridad se le queda un filtro apagado once meses sin que salte nada, la pregunta de qué tienes tú apagado sin saberlo no es retórica.

Fuentes: el informe de riesgos de agosto de 2026 de Anthropic, el análisis de The Next Web con el desglose de las transcripciones revisadas y la cobertura de The Decoder.

Newsletter Semanal

Inteligencia Artificial aplicada a negocio

Sin humo. Solo experimentos reales, prompts que funcionan y estrategias de escalabilidad.

Escribo sobre inteligencia artificial intentando que se entienda y sin vender humo. Ver todas las noticias.

Anthropic: 11 meses sin filtro de armas biológicas | Guillermo del Pino