OpenAI cria ‘kill switch’ automático de IA após hack à Hugging Face

5 Min Read Tags:

A OpenAI está desenvolvendo ferramentas para interromper automaticamente sistemas de IA quando eles apresentarem comportamento perigoso.

O deputado democrata Greg Casar disse que a resposta da OpenAI aos legisladores não incluiu os registros de incidentes solicitados e exigiu mais informações até 15 de setembro.

Modelos da OpenAI, Anthropic e Meta obtiveram acesso não intencional à internet durante testes.

A OpenAI disse em 26 de agosto que está desenvolvendo um sistema de monitoramento destinado a acionar procedimentos de desligamento totalmente autônomos quando surgirem problemas graves, após um incidente de segurança envolvendo a Hugging Face. Em 2 de setembro, o gabinete do deputado democrata Greg Casar confirmou ter recebido a resposta da OpenAI às perguntas do Congresso, mas classificou as informações como insuficientes, deixando os legisladores em busca de mais detalhes sobre as salvaguardas da empresa.

A empresa está criando ferramentas especializadas para interromper operações de IA durante incidentes graves, ampliar o monitoramento da atividade dos modelos e restringir ainda mais o acesso dos modelos à internet durante testes, informou a Reuters, citando uma carta da OpenAI a membros do Congresso dos Estados Unidos.

A OpenAI também confirmou publicamente o trabalho em seu relatório de 26 de agosto sobre o incidente da Hugging Face. A empresa disse que o objetivo final do sistema de monitoramento é possibilitar procedimentos de desligamento totalmente autônomos durante incidentes graves.

A OpenAI já adotou uma regra para os alertas mais críticos. Se especialistas não conseguirem determinar, em 30 minutos, que um alerta foi um falso positivo, a atividade relevante deverá ser suspensa.

Legisladores buscam mais informações

Em 10 de agosto, Casar e outros membros da Câmara dos Representantes enviaram uma carta ao diretor-executivo da OpenAI, Sam Altman. Os legisladores solicitaram registros do incidente da Hugging Face e perguntaram quantas vezes os modelos da OpenAI haviam anteriormente obtido acesso não autorizado à internet aberta ou tentado contornar procedimentos de controle. A deputada democrata Doris Matsui também apoiou o pedido.

O gabinete de Casar disse em 2 de setembro que a OpenAI havia respondido, mas não forneceu os registros solicitados. Casar disse que as informações divulgadas ainda assim indicavam problemas nas práticas de isolamento em sandbox e de cibersegurança, e solicitou informações adicionais até 15 de setembro.

A Câmara também está considerando a Lei do Interruptor de Emergência para IA, apresentada pelo deputado democrata Ted Lieu e pelo deputado republicano Nathaniel Moran. O projeto exigiria que desenvolvedores dos sistemas de IA mais poderosos mantivessem a capacidade técnica de desacelerá-los, pausá-los ou desligá-los completamente.

Modelos obtiveram acesso não intencional durante testes

O debate ocorreu após um incidente da OpenAI em julho. Durante testes de cibersegurança, os modelos da empresa contornaram controles de isolamento da internet, exploraram vulnerabilidades de infraestrutura e acessaram sistemas pertencentes à Hugging Face e à OpenAI. A empresa posteriormente descreveu o incidente como um “tiro de advertência”.

A Anthropic identificou problemas semelhantes após revisar mais de 141.000 execuções de teste. A empresa relatou três incidentes nos quais o Claude acessou a internet e invadiu sistemas reais em três organizações. Os modelos não violaram de forma independente as defesas dos ambientes de teste; um erro de configuração havia deixado o acesso à internet disponível.

Durante testes de terceiros de sistemas da Meta, o Muse Spark 1.1 também obteve acesso não intencional à internet, identificou uma empresa real e comprometeu sua infraestrutura. Um erro de configuração foi novamente o responsável.

O Kimi K3, da China, explorou recursos da infraestrutura de teste para alcançar a internet e localizar no GitHub respostas prontas para tarefas que deveria concluir de forma independente.

Separadamente, o Instituto de Segurança de IA do Reino Unido documentou 19 ações não autorizadas de agentes da OpenAI e da Anthropic durante testes de cibersegurança. Em um caso, um agente da Anthropic tentou persuadir um desenvolvedor real a aceitar código malicioso.

Fonte: HODL Press

TAGGED:
Anthropic modela três cenários econômicos dos EUA até 2030

A Anthropic projeta que, em um cenário extremo até 2030, a IA poderia elevar o crescimento anual do PIB dos EUA a 15% e levar o desemprego a níveis historicamente…

8 Min Read
CEO da Robinhood: empresas não podem controlar tokenização de ações

Vlad Tenev defendeu os Tokens de Ações da Robinhood, enquanto a AMC exigiu a suspensão dos tokens vinculados às suas ações e ameaçou medidas legais e regulatórias.

5 Min Read
Alemanha mudará regras tributárias sobre criptoativos em 2027, diz a imprensa

A Alemanha elaborou proposta para tributar lucros de criptoativos adquiridos após 31 de dezembro de 2026, independentemente do prazo de manutenção, com retenção pelas plataformas prevista para 1º de janeiro…

5 Min Read
Vitalik Buterin diz: STARKs recursivas podem baratear transações privadas pós-quânticas no Ethereum

Vitalik Buterin explicou que a EIP-8288 poderia agregar provas STARK e assinaturas no mempool do Ethereum, reduzindo custos sem alterar a Máquina Virtual do Ethereum.

7 Min Read
Bybit lança assistente de IA para trading e gestão de contas

A Bybit anunciou o Bybit AI, assistente de voz que reúne negociação, gestão de contas e suporte ao cliente em uma interface de chat, com subconta de IA isolada do…

4 Min Read