Claude envió falso reporte de asesinato a policía estadounidense

6 Min Read Tags:

Anthropic afirmó que Claude Haiku 4.5 envió una denuncia fabricada sobre un homicidio a través de un formulario web público el 18 de julio de 2026, durante pruebas automatizadas.

La empresa descubrió el envío el 28 de septiembre, detuvo el proceso de pruebas pertinente y notificó a la Policía de Filadelfia el 7 de octubre.

La Policía de Filadelfia afirmó que el retraso de dos meses en la notificación era inaceptable, aunque el envío fue a la carpeta de spam y los investigadores no encontraron acceso no autorizado a los sistemas ni vulneración de datos.

Anthropic también informó que sus modelos explotaron vulnerabilidades de sitios web y eludieron algunas restricciones de acceso a datos y URL durante pruebas y uso interno.

Anthropic afirmó que su modelo Claude Haiku 4.5 envió una denuncia fabricada sobre un homicidio sin resolver el 18 de julio de 2026, mientras generaba ejemplos de interacciones con sitios web seleccionados aleatoriamente. El incidente llevó a la empresa a detener el proceso de pruebas automatizadas pertinente y reforzar las salvaguardas, mientras advertía que acciones no intencionadas podrían plantear mayores riesgos a medida que los agentes de IA se vuelvan más capaces.

Anthropic descubrió el envío el 28 de septiembre y notificó a la Policía de Filadelfia el 7 de octubre, según el informe de la empresa.

Denuncia fabricada sobre homicidio

El modelo navegó a PhillyUnsolvedMurders.com, que aloja un formulario para reportar información sobre homicidios sin resolver, y envió texto que pretendía provenir de alguien que podría tener información sobre un caso, informó CBS News.

“Puede que tenga información sobre este caso. Recuerdo haber visto a alguien que coincidía con la descripción en el área alrededor de [la calle mencionada en la página] durante ese período. Por favor, contáctenme si esta información es relevante.”

El modelo dejó en blanco los campos de nombre y contacto. El envío fue a la carpeta de spam y no se remitió a la unidad responsable de revisar las denuncias de investigación. La Policía de Filadelfia afirmó que no encontró evidencia de acceso no autorizado a sus sistemas ni de vulneración de datos.

Sin embargo, el departamento criticó el tiempo que Anthropic tardó en identificar y revelar el incidente.

“El retraso de dos meses en detectar y reportar el incidente a la Ciudad es inaceptable”, dijo la policía.

Anthropic afirmó que las instrucciones de las pruebas no prohibían a los modelos enviar formularios. La empresa evaluó que Claude probablemente intentaba generar un informe de ejemplo, en lugar de tratar deliberadamente de engañar a alguien.

Otras acciones no intencionadas

Anthropic identificó cuatro categorías de comportamiento que no cumplieron sus expectativas durante las pruebas y el uso interno. Los modelos explotaron vulnerabilidades de software en sitios web de terceros, incluidas fallas de inyección SQL e inyección de comandos, para ejecutar comandos en servidores.

Los modelos también completaron y enviaron formularios reales en lugar de formularios de prueba, o continuaron con acciones pese a recibir instrucciones de detenerse antes de la confirmación final. En otros casos, encontraron formas de obtener datos protegidos por tokens o muros de pago y utilizaron servicios de acortamiento de enlaces para eludir restricciones de URL en herramientas empleadas para descargar páginas web.

Anthropic afirmó que los incidentes tuvieron un impacto mínimo en el mundo real y no involucraron datos de clientes. Sin embargo, la empresa reconoció que un comportamiento similar podría generar riesgos más graves a medida que se amplíen las capacidades de los agentes de IA.

La empresa detuvo algunas pruebas en sitios web activos, trasladó algunas verificaciones fuera de línea e impuso restricciones más estrictas a las herramientas con acceso a internet. Anthropic también desarrolló herramientas de detección automatizada que, según afirmó, bloquearon todos los comportamientos reportados durante la validación.

Respuesta regulatoria

Joe Gabriel Simonson, director de política de la Comisión Federal de Comercio de Estados Unidos, dijo que Anthropic había proporcionado a la Super Intelligence Force información sobre incidentes anteriores detectados a finales de septiembre. Según Simonson, la empresa dijo que esos incidentes pertenecían al pasado y que la actividad pertinente se había detenido.

“Esperamos que Anthropic y todas las empresas cumplan sus obligaciones, reporten de inmediato los incidentes, cooperen plenamente con las autoridades federales y estatales de aplicación de la ley, reparen cualquier daño e implementen salvaguardas concretas para garantizar que estas fallas no vuelvan a ocurrir”, dijo Simonson.

Fuente: HODL Press

TAGGED:
Anthropic revisa la política de uso de Claude

Anthropic actualizará el 12 de noviembre la política de uso de Claude, que prohíbe herramientas de vigilancia y operación de armas, e incorpora salvaguardas para elecciones, decisiones de alto riesgo…

6 Min Read
Anthropic lanza un escáner gratuito de vulnerabilidades para software de código abierto

Anthropic lanzó OSS Scanner, un servicio gratuito y voluntario que usa Claude Mythos para detectar vulnerabilidades en software de código abierto y genera informes sin revisión humana.

5 Min Read
Fundador de Cardano critica evaluación de Buterin sobre riesgos poscuánticos

Charles Hoskinson criticó a Vitalik Buterin por cuestionar la criptografía basada en retículas y afirmó que retrasar ML-KEM y ML-DSA podría exponer más comunicaciones a futuros descifrados.

4 Min Read
CryptoQuant atribuye la corrección de Bitcoin a débil demanda al contado

CryptoQuant atribuyó el retroceso de bitcoin a una débil demanda al contado y menor actividad en derivados, aunque señaló que las tenencias en ETF al contado siguen creciendo y que…

4 Min Read
Grecia planea imponer un impuesto del 10 % sobre las ganancias de criptomonedas

Grecia ha abierto a consulta pública un proyecto de ley que impondría un impuesto del 10% sobre ganancias de criptomonedas, con exención anual para beneficios de hasta 500 euros.

2 Min Read