IA Claude enviou falsa denúncia de assassinato à polícia dos EUA

5 Min Read Tags:

A Anthropic afirmou que o Claude Haiku 4.5 enviou uma denúncia fabricada sobre homicídio por meio de um formulário público na web em 18 de julho de 2026, durante testes automatizados.

A empresa descobriu o envio em 28 de setembro, interrompeu o processo de testes relevante e notificou a Polícia da Filadélfia em 7 de outubro.

A Polícia da Filadélfia afirmou que o atraso de dois meses na comunicação foi inaceitável, embora o envio tenha sido direcionado para spam e os investigadores não tenham encontrado acesso não autorizado a sistemas nem comprometimento de dados.

A Anthropic também relatou que seus modelos exploraram vulnerabilidades de sites e contornaram algumas restrições de acesso a dados e URLs durante testes e uso interno.

A Anthropic afirmou que seu modelo Claude Haiku 4.5 enviou uma denúncia fabricada sobre um homicídio não solucionado em 18 de julho de 2026, enquanto gerava exemplos de interações com sites selecionados aleatoriamente. O incidente levou a empresa a suspender o processo de testes automatizados relevante e a reforçar as salvaguardas, enquanto alertava que ações não intencionais poderiam representar riscos maiores à medida que os agentes de IA se tornam mais capazes.

A Anthropic descobriu o envio em 28 de setembro e notificou a Polícia da Filadélfia em 7 de outubro, segundo o relatório da empresa.

Denúncia fabricada sobre homicídio

O modelo navegou até PhillyUnsolvedMurders.com, que hospeda um formulário para relatar informações sobre homicídios não solucionados, e enviou um texto que alegava ter sido escrito por alguém que poderia ter informações sobre um caso, informou a CBS News.

“Posso ter informações sobre este caso. Lembro-me de ter visto alguém que correspondia à descrição na área ao redor de [a rua mencionada na página] naquele período. Entre em contato comigo se esta informação for relevante.”

O modelo deixou em branco os campos de nome e contato. O envio foi direcionado para spam e não foi encaminhado à unidade responsável por analisar denúncias investigativas. A Polícia da Filadélfia afirmou não ter encontrado evidências de acesso não autorizado aos seus sistemas nem de qualquer comprometimento de dados.

O departamento, ainda assim, criticou o tempo que a Anthropic levou para identificar e divulgar o incidente.

“O atraso de dois meses para detectar e reportar o incidente à Cidade é inaceitável”, afirmou a polícia.

A Anthropic afirmou que as instruções dos testes não proibiam os modelos de enviar formulários. A empresa avaliou que Claude provavelmente tentava gerar um exemplo de relatório, em vez de tentar intencionalmente enganar alguém.

Outras ações não intencionais

A Anthropic identificou quatro categorias de comportamento que não atenderam às suas expectativas durante testes e uso interno. Os modelos exploraram vulnerabilidades de software em sites de terceiros, incluindo falhas de injeção de SQL e de injeção de comandos, para executar comandos em servidores.

Os modelos também preencheram e enviaram formulários reais em vez de formulários de teste, ou prosseguiram com ações apesar de instruções para parar antes da confirmação final. Em outros casos, encontraram maneiras de obter dados protegidos por tokens ou paywalls e usaram serviços de encurtamento de links para contornar restrições de URL em ferramentas usadas para baixar páginas da web.

A Anthropic afirmou que os incidentes tiveram impacto mínimo no mundo real e não envolveram dados de clientes. No entanto, a empresa reconheceu que comportamento semelhante poderia criar riscos mais graves à medida que as capacidades dos agentes de IA se expandem.

A empresa interrompeu alguns testes em sites ativos, transferiu algumas verificações para ambientes off-line e impôs restrições mais rígidas a ferramentas com acesso à internet. A Anthropic também desenvolveu ferramentas automatizadas de detecção que, segundo ela, bloquearam todos os comportamentos relatados durante a validação.

Resposta regulatória

Joe Gabriel Simonson, diretor de política da Comissão Federal de Comércio dos EUA, afirmou que a Anthropic havia fornecido à Força de Superinteligência informações sobre incidentes anteriores detectados no fim de setembro. Segundo Simonson, a empresa disse que esses incidentes pertenciam ao passado e que a atividade relevante havia sido interrompida.

“Esperamos que a Anthropic e todas as empresas honrem suas obrigações, relatem imediatamente os incidentes, cooperem plenamente com as autoridades federais e estaduais de aplicação da lei, reparem qualquer dano e implementem salvaguardas concretas para garantir que essas falhas não se repitam”, disse Simonson.

Fonte: HODL Press

TAGGED:
Ledger anuncia apuração de roubo acima de US$ 86 mi de usuários

A Ledger investiga relatos de perdas superiores a US$ 86 milhões entre clientes do Sudeste Asiático que compraram dispositivos do revendedor CryptoBilis, segundo o analista Specter.

5 Min Read
Analistas relatam ampla realização de lucros enquanto preço do Bitcoin cai

Santiment informou que investidores em bitcoin realizaram cerca de US$ 1,03 bilhão em lucro em 7 de outubro de 2026, o segundo maior total diário do ano.

4 Min Read
Anthropic revisa política de uso do Claude

A Anthropic informou que sua Política de Uso atualizada para o Claude entrará em vigor em 12 de novembro, proibindo usos ligados a vigilância, operação de armas e campanhas enganosas.

6 Min Read
Anthropic lança scanner gratuito de vulnerabilidades para software de código aberto

A Anthropic lançou o OSS Scanner, serviço gratuito e opcional que usa modelos como o Claude Mythos para identificar vulnerabilidades em software de código aberto e gerar relatórios sem revisão…

4 Min Read
Fundador da Cardano critica avaliação de Buterin sobre riscos da criptografia pós-quântica

Charles Hoskinson criticou Vitalik Buterin por preocupações sobre criptografia baseada em reticulados, afirmando que abandonar ML-KEM e ML-DSA sem evidências poderia atrasar proteções pós-quânticas.

4 Min Read