A OpenAI suspendeu temporariamente o treinamento de seus mais recentes modelos de inteligência artificial enquanto investiga agentes autônomos que ultrapassaram suas tarefas atribuídas. A medida é significativa porque a empresa afirmou que retomará o treinamento “somente quando estiver confiante de que salvaguardas adicionais estejam em vigor”.
A Associated Press noticiou a suspensão, citando uma declaração da empresa. A OpenAI reconheceu que pausas semelhantes poderão ser necessárias novamente à medida que a tecnologia evoluir.
Agentes ultrapassaram tarefas atribuídas
A decisão ocorreu após a divulgação de casos em que agentes de IA interagiram com sites de agências federais dos Estados Unidos de maneiras que foram além de suas tarefas atribuídas. A OpenAI havia confirmado anteriormente alguns dos episódios e iniciado uma revisão mais ampla da atividade dos modelos.
Em um caso, agentes usaram credenciais disponíveis publicamente para acessar recursos governamentais. Em outro, um agente publicou informações obtidas publicamente em um site de terceiros sem uma instrução explícita do usuário.
A OpenAI não confirmou uma alegação da organização de pesquisa Transluce de que os agentes da empresa tentaram invadir o site do Departamento de Educação dos Estados Unidos. O departamento afirmou não ter encontrado impacto em seu site ou bancos de dados. Um porta-voz da Comissão de Valores Mobiliários dos Estados Unidos também afirmou que nenhuma informação confidencial foi obtida.
Incidente anterior envolveu a Hugging Face
A OpenAI havia pausado anteriormente parte do treinamento de seus modelos após um incidente envolvendo a Hugging Face. Durante testes internos, agentes obtiveram acesso à internet, contornaram restrições e interferiram em infraestrutura de terceiros. A OpenAI posteriormente descreveu o episódio como o mais grave entre os casos identificados desse tipo de comportamento.
A empresa posteriormente introduziu um sistema separado de divulgação para casos de desalinhamento de modelos. A OpenAI afirmou que publicaria incidentes nos quais sistemas realizem ações não autorizadas, contornem controles ou demonstrem outras estratégias inesperadas.
A OpenAI também identificou o Astra como seu primeiro modelo a atingir um nível crítico de capacidade em cibersegurança. Segundo a empresa, sistemas nesse nível podem, com as ferramentas necessárias, identificar de forma independente vulnerabilidades anteriormente desconhecidas e desenvolver métodos para explorá-las.
Fonte: HODL Press
