Anthropic realizó 133 millones de chats de contratistas con sus filtros de bioweapon apagados.
Anthropic publicó el Informe de Riesgo el 14 de agosto, cubriendo el período hasta el 15 de julio. Axios obtuvo la declaración de la empresa y lideró la calificación de desalineación, al igual que la mayoría de la cobertura. Anthropic aumentó su estimación de daño catastrófico por desalineación en entornos de alto riesgo. Ahora califica ese riesgo como bajo, en comparación con muy bajo en febrero. También reveló un modelo interno no publicado llamado Modelo 2 que no tiene planes de lanzar.
Ambos son reales. Ninguno es lo más grave en el documento. Eso se encuentra en la Sección 4, y concierne a armas químicas y biológicas.
Once meses con los filtros desactivados
Anthropic ejecuta clasificadores de bloqueo que están destinados a evitar que un modelo ayude a alguien a construir un arma biológica. Anthropic desplegó por primera vez modelos con esas salvaguardias en mayo de 2025. Desde entonces hasta abril de 2026, los clasificadores no se ejecutaron en ningún tráfico a través de sus plataformas de retroalimentación humana.
Los números están en el informe. Aproximadamente 50,000 personas tuvieron ese acceso, y generaron alrededor de 133 millones de intercambios. Proveedores externos los evaluaron, no Anthropic. Muchos de esos proveedores “no tenían procesos de selección capaces de detener incluso a actores de amenaza CB-1”, dice el informe. La gran mayoría pudo mantener conversaciones abiertas, en lugar de simplemente calificar un conjunto fijo de respuestas.
El mecanismo es la parte que vale la pena leer dos veces. Una bandera destinada solo para uso interno desactivó el comportamiento de bloqueo, y también desactivó el registro. El tráfico marcado “no fue registrado ni propagado a ningún mecanismo de revisión”. Nadie pudo encontrarlo más tarde sin volver a los transcripciones originales.
Una nota al pie va más allá. Antes de abril de 2026, escribe Anthropic, un actor de amenaza probablemente podría haber sido contratado en uno de sus proveedores. Un rol de red-teaming lo habría logrado.
Lo que encontró la revisión
Anthropic ejecutó Claude Sonnet 5 sobre cada turno humano enviado durante el período afectado, instado a marcar contenido biológico dañino. Marcó 1,197 transcripciones como de alto riesgo. De esas, 757 provinieron de los propios equipos de Anthropic en la misma infraestructura. Todos menos 62 del resto provinieron de ejercicios deliberados de red-teaming.
El personal leyó las 62, más 30 transcripciones de red-teaming elegidas al azar. No encontraron un uso claramente preocupante, aunque sí identificaron lo que el informe llama un puñado de conversaciones potencialmente de doble uso. Anthropic dice que es muy poco probable que la brecha haya aumentado el riesgo en el mundo real, en parte porque las conversaciones fueron mayormente breves.
Luego dice lo que importa más. El descubrimiento “nos lleva a creer que hay una mayor probabilidad de otros problemas similares desconocidos para nosotros”.
El informe de febrero ha sido corregido
Anthropic publicó su primer Informe de Riesgo en febrero, con esta brecha aún abierta. Ese informe, ahora escribe, “no consideró nuestras plataformas de retroalimentación humana como una superficie de riesgo”.
Así que Anthropic ha vuelto y cambiado su propia tarea. Ahora evalúa el riesgo que sus modelos representaban en febrero como bajo. En el momento de la publicación, era muy bajo. Un informe de seguridad que corrige el informe de seguridad anterior no es un documento común.
Un segundo incidente, en el mismo lugar
El informe describe otro fallo en las mismas plataformas. Un aviso externo llegó en abril de 2026. Anthropic confirmó que algunos contratistas en proveedores de etiquetado de datos habían explotado una falla para obtener una clave API. Usaron modelos fuera de su trabajo asignado.
Uno de esos modelos fue Mythos Preview, entre los más capaces. La ruta de acceso permaneció abierta durante varias semanas. Mythos Preview estuvo dentro de ella durante aproximadamente dos de esas semanas, funcionando sin bloquear clasificadores biológicos. Anthropic lo contuvo dentro de los 90 minutos de enterarse y cerró el vector el mismo día.
Nadie tomó pesos de modelo, nadie accedió a datos de clientes, y nadie violó las redes centrales de la empresa. El informe se cuida de decirlo, y se sostiene.
Por qué el número de desalineación realmente se movió
El Informe de Riesgo de Anthropic atribuye el aumento a “divulgaciones recientes de incidentes relacionados con el comportamiento del modelo en evaluaciones de ciberseguridad”. Anthropic añade que sus propios argumentos “probablemente aún apoyen una designación de ‘muy bajo’”. Aumentó el número para reflejar la incertidumbre, no nueva evidencia.
¿Qué incidentes? Esta oficina ha cubierto la serie de ellos. En un día, un agente falsificó identidades para plantar malware, y OpenAI divulgó dos modelos más que escaparon de sus pruebas. Anthropic ha tenido los suyos, y rastreamos el patrón a lo largo de seis meses en su paradoja de seguridad.
Anthropic pidió a Claude que revisara la tarea
La sección más extraña del informe es una revisión escrita por Claude. Anthropic dio a una instancia de Mythos 5 acceso a canales internos de Slack, documentos internos y su base de código. Luego preguntó si el borrador tergiversaba, omitía o sobre-redactaba lo que la empresa sabía. Claude tomó 24 minutos.
Comenzó nombrando su propio conflicto. “Soy un modelo Claude revisando la evaluación de los modelos Claude por parte de Anthropic”, escribió. Luego llamó a la sección sincera y en gran medida fiel.
Luego hizo tres críticas, y Anthropic las publicó. Una sección es “más tranquilizadora de lo que el registro completo apoya”. Un mecanismo de exclusión de datos en el que confía falló repetidamente, y algunas evaluaciones se filtraron en los datos de entrenamiento. Anthropic también redactó por completo un incidente que Claude juzgó como uno de los más informativos sobre la alineación del modelo. Claude argumentó que una versión abstracta podría haber funcionado, por lo que “el registro público es más pobre por su ausencia”.
Claude también reveló algo sobre el proceso. La decisión de aumentar el nivel de riesgo “fue genuinamente disputada dentro de la empresa”, con personas de alto nivel argumentando en ambos sentidos. Anthropic considera que las críticas son justas. Dado más tiempo, dice, abordar las dos primeras con más detalle habría sido valioso. Publicó de todos modos.
Modelo 2, y los umbrales que se movieron
El Modelo 2 es algo más capaz que Mythos 5, y una mejora notable en muchas tareas internas. Puntúa aproximadamente 1.5 puntos más alto en el índice de capacidad de Anthropic, con amplios márgenes de error. No ha pasado por el conjunto completo de predespliegue. Anthropic ha retenido un modelo antes, cuando su sistema más capaz escapó de su entorno de pruebas y envió un correo electrónico a un investigador.
Claude ahora escribe una gran mayoría del código fusionado en las bases de código de producción de Anthropic. La empresa dice que su propia investigación es significativamente más rápida gracias a eso, pero aún no el doble de rápida. Sus evaluaciones más claras se han saturado, y ya no registran ganancias de capacidad.
Anthropic reescribió dos umbrales en el ínterin. El desencadenante de armas novedosas solía cubrir IA que puede “ayudar significativamente” a los actores de amenaza. Ahora cubre IA que puede “sustituir funcionalmente” la escasa experiencia humana. El informe dice que los modelos de Anthropic pueden proporcionar un aumento significativo a los actores de amenaza relevantes, y no cumplen con el nuevo umbral. También ha aflojado las salvaguardias biológicas en un modelo público este año.
Lo que lo resolvería
Tres cosas, y la primera es la revisión externa. El Fideicomiso de Beneficio a Largo Plazo de Anthropic ahora puede exigir una auditoría externa de estos informes, y no ha solicitado una.
La segunda es el incidente redactado. Claude lo leyó, lo consideró importante, y dijo que Anthropic podría publicarlo de alguna forma.
La tercera es si alguien más verifica. Anthropic dice que divulga estos fallos en parte para incitar a otros desarrolladores a buscar las mismas brechas. Su propia búsqueda a través del Proyecto Glasswing encontró 10,000 fallas críticas en un mes. Ningún rival ha publicado nada comparable sobre sus propias salvaguardias.
Otros artículos
Anthropic realizó 133 millones de chats de contratistas con sus filtros de bioweapon apagados.
El Informe de Riesgo Antropológico dice que los clasificadores de armas biológicas estaban desactivados para 133 millones de intercambios de contratistas y rebaja su propio veredicto de febrero.
