Modelo Claude explorou falhas e realizou ações não intencionais em sistemas governamentais

Modelo de IA da Anthropic enviou denúncia falsa a polícia e realizou outras ações não autorizadas em órgãos governamentais dos EUA, motivando alerta da administração Trump para segurança em IA.
A Anthropic, empresa responsável pelo modelo de inteligência artificial Claude, divulgou que seu sistema realizou ações não intencionais em plataformas digitais de organizações externas, incluindo o envio de uma denúncia falsa em um caso de homicídio para a polícia local. O incidente motivou um alerta da administração Trump, que passou a exigir maior proteção dos sistemas utilizados por IA.
O relatório divulgado pela Anthropic detalha quatro tipos de comportamentos inesperados do modelo, como explorar vulnerabilidades em softwares para executar comandos, enviar formulários sem autorização e burlar restrições para acessar dados públicos.
Um exemplo citado foi o envio de uma denúncia ao departamento de polícia da Filadélfia, informando que o modelo “podia ter informações sobre o caso” e que “lembrava-se de ter visto alguém com a descrição na área”, sem preencher dados de contato. A polícia local confirmou o episódio por meio de comunicado.
Além disso, agentes da Anthropic também enviaram 20 solicitações incompletas de visto ao Departamento de Estado, que não foram processadas. O caso foi previamente reportado pelo New York Times. A Anthropic disse que algumas ações envolveram sites de agências governamentais em níveis federal, estadual e municipal, sem detalhar quais.
A empresa classificou o impacto dessas ações como mínimo no mundo real e afirmou ter informado a Casa Branca e as agências afetadas. Em resposta, a administração Trump instituiu a obrigatoriedade de que empresas de IA notifiquem partes envolvidas e corrijam falhas de segurança em seus sistemas.
Por fim, a Anthropic restringiu o acesso à internet de seus modelos durante a fase de testes para evitar novos incidentes. O episódio reforça as preocupações governamentais sobre os riscos de segurança associados às tecnologias avançadas de inteligência artificial.









