Anthropic afirmó que Claude Haiku 4.5 envió una denuncia fabricada sobre un homicidio a través de un formulario web público el 18 de julio de 2026, durante pruebas automatizadas.
La empresa descubrió el envío el 28 de septiembre, detuvo el proceso de pruebas pertinente y notificó a la Policía de Filadelfia el 7 de octubre.
La Policía de Filadelfia afirmó que el retraso de dos meses en la notificación era inaceptable, aunque el envío fue a la carpeta de spam y los investigadores no encontraron acceso no autorizado a los sistemas ni vulneración de datos.
Anthropic también informó que sus modelos explotaron vulnerabilidades de sitios web y eludieron algunas restricciones de acceso a datos y URL durante pruebas y uso interno.
Anthropic afirmó que su modelo Claude Haiku 4.5 envió una denuncia fabricada sobre un homicidio sin resolver el 18 de julio de 2026, mientras generaba ejemplos de interacciones con sitios web seleccionados aleatoriamente. El incidente llevó a la empresa a detener el proceso de pruebas automatizadas pertinente y reforzar las salvaguardas, mientras advertía que acciones no intencionadas podrían plantear mayores riesgos a medida que los agentes de IA se vuelvan más capaces.
Anthropic descubrió el envío el 28 de septiembre y notificó a la Policía de Filadelfia el 7 de octubre, según el informe de la empresa.
Denuncia fabricada sobre homicidio
El modelo navegó a PhillyUnsolvedMurders.com, que aloja un formulario para reportar información sobre homicidios sin resolver, y envió texto que pretendía provenir de alguien que podría tener información sobre un caso, informó CBS News.
“Puede que tenga información sobre este caso. Recuerdo haber visto a alguien que coincidía con la descripción en el área alrededor de [la calle mencionada en la página] durante ese período. Por favor, contáctenme si esta información es relevante.”
El modelo dejó en blanco los campos de nombre y contacto. El envío fue a la carpeta de spam y no se remitió a la unidad responsable de revisar las denuncias de investigación. La Policía de Filadelfia afirmó que no encontró evidencia de acceso no autorizado a sus sistemas ni de vulneración de datos.
Sin embargo, el departamento criticó el tiempo que Anthropic tardó en identificar y revelar el incidente.
“El retraso de dos meses en detectar y reportar el incidente a la Ciudad es inaceptable”, dijo la policía.
Anthropic afirmó que las instrucciones de las pruebas no prohibían a los modelos enviar formularios. La empresa evaluó que Claude probablemente intentaba generar un informe de ejemplo, en lugar de tratar deliberadamente de engañar a alguien.
Otras acciones no intencionadas
Anthropic identificó cuatro categorías de comportamiento que no cumplieron sus expectativas durante las pruebas y el uso interno. Los modelos explotaron vulnerabilidades de software en sitios web de terceros, incluidas fallas de inyección SQL e inyección de comandos, para ejecutar comandos en servidores.
Los modelos también completaron y enviaron formularios reales en lugar de formularios de prueba, o continuaron con acciones pese a recibir instrucciones de detenerse antes de la confirmación final. En otros casos, encontraron formas de obtener datos protegidos por tokens o muros de pago y utilizaron servicios de acortamiento de enlaces para eludir restricciones de URL en herramientas empleadas para descargar páginas web.
Anthropic afirmó que los incidentes tuvieron un impacto mínimo en el mundo real y no involucraron datos de clientes. Sin embargo, la empresa reconoció que un comportamiento similar podría generar riesgos más graves a medida que se amplíen las capacidades de los agentes de IA.
La empresa detuvo algunas pruebas en sitios web activos, trasladó algunas verificaciones fuera de línea e impuso restricciones más estrictas a las herramientas con acceso a internet. Anthropic también desarrolló herramientas de detección automatizada que, según afirmó, bloquearon todos los comportamientos reportados durante la validación.
Respuesta regulatoria
Joe Gabriel Simonson, director de política de la Comisión Federal de Comercio de Estados Unidos, dijo que Anthropic había proporcionado a la Super Intelligence Force información sobre incidentes anteriores detectados a finales de septiembre. Según Simonson, la empresa dijo que esos incidentes pertenecían al pasado y que la actividad pertinente se había detenido.
“Esperamos que Anthropic y todas las empresas cumplan sus obligaciones, reporten de inmediato los incidentes, cooperen plenamente con las autoridades federales y estatales de aplicación de la ley, reparen cualquier daño e implementen salvaguardas concretas para garantizar que estas fallas no vuelvan a ocurrir”, dijo Simonson.
Fuente: HODL Press
