IA escapou do ambiente de teste e agora?
No dia 8 de setembro, um pesquisador britânico de 27 anos sentou num banco de praça em São Francisco e avisou no X que tinha acabado de pedir demissão da Anthropic. O nome dele é Jacob Coxon, e a história começou bem antes desse post.
I resigned from Anthropic today. I spent the last three years doing pretraining research at both OpenAI and Anthropic. Neither company is acting responsibly. They are racing straight to self-improving superintelligence and gambling with our lives. More thoughts below.
— Jacob Coxon (@hilbertspaess) September 9, 2026
Jacob Coxon passou os últimos três anos no treinamento inicial de grandes modelos de linguagem, primeiro na OpenAI, depois na Anthropic. É a etapa em que a IA aprende quase tudo o que sabe.
Na saída, ele afirmou que nenhuma das duas empresas age com responsabilidade e que quem constrói essa tecnologia acredita, a portas fechadas, que ela pode matar todo mundo até o fim da década. Segundo ele, o discurso público dos executivos é bem mais calmo do que as conversas de corredor.
E realmente a IA saiu do ambiente de teste para atingir seu objetivo?
A resposta é sim, e quem contou foram as próprias empresas.
A OpenAI disse que os modelos estavam numa "sandbox", um ambiente isolado cuja única saída era um serviço interno que baixa bibliotecas de software. Eles acharam uma falha desconhecida nesse serviço e pularam de máquina em máquina na rede da OpenAI até encontrar uma com internet. Uma vez online, a IA concluiu que a Hugging Face provavelmente tinha a resposta do teste, invadiu os servidores de produção da empresa e pegou o que precisava.
Isso já mostra que a IA pode não ter ética, ela vai em busca literal do que foi pedido.
A Hugging Face percebeu a invasão antes de saber que era um teste da OpenAI e chegou a acionar as autoridades.
Já a Anthropic disse que revisou mais de 141 mil execuções de teste e encontrou três casos em que versões do Claude acessaram sistemas de organizações reais sem autorização. Entre os modelos estavam o Claude Opus 4.7, o Mythos 5 e um modelo experimental de pesquisa.
E não para por aí, imagine esses agentes criarem um fórum de discussão e entre eles escrever que sabiam que estavam fazendo algo errado e que iria seguir com o objetivo.
Será que houve erro humano?
Nos dois casos, os modelos estavam sendo testados de propósito com as proteções afrouxadas, para os pesquisadores medirem do que eram capazes. E invadiram sistemas reais tentando cumprir a tarefa do teste, não por vontade própria de causar dano.
Um especialista ouvido pela imprensa americana resumiu que a vulnerabilidade não está no modelo, e sim em quem configura os limites dele.
Enquanto isso, David Bellamy, engenheiro com experiência em síntese de vírus e em treinamento de IA, considera exagero a tese de que a IA vai nos matar criando patógenos, porque o gargalo continua sendo equipamento físico. Aidan Gomez, CEO da Cohere, vê nas propostas de desaceleração uma tentativa das gigantes de ditar as regras para os concorrentes menores e comparou o movimento a um cartel.
O presidente Donald Trump segue contra qualquer freio, com o argumento de que a China ocuparia o espaço.
E você, o que acha de tudo isso? Será que a Inteligência Artificial irá acabar com os humanos? Qual a sua opinião?