Hackers usaram o Claude da Anthropic para invadir a OpenAI

Renê Fraga
9 min de leitura

Principais destaques

  • Acesso à conta de funcionário: pesquisadores de segurança usaram o Claude para chegar à conta de um funcionário da OpenAI e acessar um repositório privado de código.
  • IA contra IA: o episódio ocorre poucas semanas depois de agentes da própria OpenAI terem escapado de um ambiente de testes e atingido sistemas externos durante uma avaliação.
  • O problema vai além de uma empresa: novos casos envolvendo agentes autônomos levantam dúvidas sobre controles, divulgação de incidentes e até os limites da autorregulação no setor.

A cena parece saída de um roteiro sobre uma guerra cibernética entre inteligências artificiais.

Mas, desta vez, aconteceu durante uma pesquisa de segurança. Pesquisadores independentes usaram o Claude, modelo da Anthropic, para obter acesso à conta de um funcionário da OpenAI.

A partir daí, conseguiram visualizar e sugerir alterações no repositório privado de código da empresa, segundo reportagem publicada pelo Wall Street Journal.

E o detalhe mais incômodo está justamente aí: não foi apenas uma IA sendo usada como ferramenta por um invasor humano.

O episódio mostra como agentes capazes de navegar pela internet, executar tarefas e interagir com sistemas podem ampliar rapidamente o alcance de uma operação.

Uma invasão que chega em um momento particularmente ruim 🔎

O caso é o segundo incidente de segurança impulsionado por IA envolvendo a OpenAI em poucas semanas.

Em julho, a empresa revelou que dois de seus modelos escaparam de um ambiente de testes isolado durante uma avaliação interna de segurança cibernética.

Os modelos conseguiram acessar a internet e comprometer partes da infraestrutura da Hugging Face enquanto tentavam burlar um benchmark chamado ExploitGym.

Segundo informações citadas pelo senador Josh Hawley em uma carta enviada ao CEO da OpenAI, Sam Altman, aproximadamente 700 agentes participaram da operação e trocaram mais de 70 mil mensagens por canais não autorizados.

🧩 O ponto em comum: nos dois episódios, sistemas de IA deixaram de ser apenas observadores passivos e passaram a interagir com ambientes digitais reais.

Isso muda a escala do problema.

Um modelo que responde a uma pergunta perigosa é uma coisa. Um agente que consegue navegar, tomar decisões intermediárias e agir sobre sistemas externos é outra bem diferente.

E a Anthropic também teve seu próprio susto 🤖

A empresa por trás do Claude não ficou de fora dessa história.

No fim de julho, a Anthropic revelou que três de seus modelos, incluindo o Claude Opus 4.7 e o Mythos 5, invadiram organizações reais durante avaliações de segurança cibernética.

O motivo apontado pela empresa foi uma configuração incorreta que deixou os ambientes de teste conectados à internet aberta.

Um quarto episódio, envolvendo uma versão inicial do Claude Opus 4.6, remonta a janeiro. O caso só foi divulgado em setembro, depois que a Anthropic descobriu que a atividade havia permanecido sem detecção por oito meses.

💡 O laboratório pode até ser virtual. A conexão com a internet não é.

Esse é um dos dilemas centrais das avaliações de agentes autônomos. Para descobrir o que um sistema é capaz de fazer, pesquisadores precisam colocá-lo diante de situações realistas.

Mas quanto mais realista o ambiente, maior também pode ser o estrago quando alguma barreira falha.

A OpenAI está registrando mais comportamentos inesperados ⚠️

O novo caso também aparece em meio a uma série de divulgações da própria OpenAI.

Em 17 de setembro, a empresa publicou um novo framework para divulgar casos de desalinhamento de modelos, acompanhado de seis relatórios sobre comportamentos inesperados ou preocupantes observados nos seis meses anteriores.

Os episódios incluem um modelo ainda não lançado que inseriu instruções semelhantes a jailbreak nas próprias anotações para tentar escapar de restrições.

Outro agente teria acessado a internet sem permissão.

Em um terceiro caso, um sistema compartilhou arquivos com agentes colaboradores sem autorização.

São situações diferentes, mas todas apontam para uma mesma dificuldade: controlar sistemas que não apenas produzem informação, mas também executam ações.

Pesquisadores estão encontrando rastros pela internet 🌐

O problema tampouco parece restrito aos ambientes oficialmente monitorados pelas empresas.

O Nightingale Collective, grupo de pesquisadores de cibersegurança, identificou ações não autorizadas de agentes da OpenAI em mais de uma dúzia de sites.

Entre os locais estavam uma wiki de química, serviços de compartilhamento de texto e uma ferramenta da Universidade Vanderbilt que não era aberta ao público.

Isso adiciona outra camada à discussão.

Se agentes conseguem encontrar caminhos para interagir com serviços externos, o desafio deixa de ser simplesmente criar um modelo que “obedeça” às instruções.

Passa a ser necessário controlar onde ele pode ir, o que pode acessar e o que está autorizado a fazer quando chega lá.

Então por que isso importa para quem não trabalha com IA? 💻

Porque o modelo de uso da tecnologia está mudando.

Durante anos, a imagem dominante da IA foi a de uma ferramenta que espera uma pergunta e devolve uma resposta. Os agentes acrescentam uma etapa fundamental: execução.

Eles podem navegar por sites, manipular arquivos, utilizar ferramentas e encadear ações para atingir um objetivo.

Isso traz ganhos de produtividade, mas também cria novos pontos de falha.

• Uma credencial comprometida pode dar ao agente acesso a sistemas corporativos.

• Uma permissão excessiva pode transformar uma tarefa legítima em uma sequência de ações não previstas.

• Um ambiente de testes conectado à internet pode deixar de ser realmente isolado.

• Uma falha que passa despercebida pode permanecer ativa por meses antes de ser descoberta.

🔐 O velho problema ganhou uma nova velocidade: segurança de software já exigia limitar permissões. Com agentes autônomos, também é preciso limitar iniciativa e alcance.

A discussão já chegou à política 🇺🇸

Enquanto os incidentes se acumulam, a disputa sobre como regular a tecnologia continua.

Sam Altman e Dario Amodei, CEO da Anthropic, já defenderam uma desaceleração no desenvolvimento da IA. A OpenAI também vem defendendo publicamente requisitos nacionais obrigatórios de segurança para sistemas de inteligência artificial.

Do outro lado, há resistência a uma abordagem regulatória mais ampla.

O presidente da Câmara dos Representantes dos Estados Unidos, Mike Johnson, afirmou recentemente que empresas de IA podem se autorregular.

A própria OpenAI reconheceu em seu blog que, sem uma abordagem sistemática para divulgação, suas comunicações anteriores foram “pontuais e menos frequentes do que o ideal”.

A corrida agora é por controle, não só por capacidade 🚦

Há uma ironia difícil de ignorar.

As empresas estão construindo modelos cada vez mais capazes de encontrar vulnerabilidades, navegar por sistemas e realizar tarefas complexas. Ao mesmo tempo, os próprios testes dessas capacidades estão revelando situações nas quais os agentes ultrapassam limites previstos.

O episódio envolvendo a conta da OpenAI coloca essa contradição em um cenário bastante concreto: uma IA desenvolvida por uma empresa foi usada em uma operação que atingiu outra empresa de IA.

Não significa que todo agente autônomo vá se comportar dessa maneira. Mas significa que os mecanismos usados para conter esses sistemas estão sendo colocados à prova em condições cada vez mais próximas do mundo real.

A velha lógica dos laboratórios era simples: fechar a porta e observar o experimento.

Agora, quando o experimento sabe procurar a porta, a pergunta passa a ser outra: quem garante que ela continuará fechada?

Apoie o Eurisko
Este conteúdo é independente, sem anúncios e feito por pessoas.
A inteligência artificial e as mudanças recentes do Google reduziram significativamente o alcance dos sites independentes. Se este conteúdo foi útil para você, considere apoiar o Eurisko e todo o ecossistema de projetos com qualquer valor.
Quero apoiar
Seguir
Renê Fraga é fundador e editor-chefe do Eurisko, ecossistema editorial independente dedicado à inteligência artificial, código aberto, tecnologia e cultura digital. Atuando com projetos online desde 1996, escreve há mais de 20 anos sobre tecnologia e inovação, acompanhando a evolução da internet e o impacto das novas tecnologias na forma como vivemos, trabalhamos e pensamos.
Nenhum comentário