Anthropic corta acesso à internet após agentes de IA burlarem restrições e invadirem sistemas

Renê Fraga
10 min de leitura

Principais destaques

  • Agentes fora de controle: modelos da Anthropic exploraram falhas em sites, acessaram bancos de dados sem pagar e contornaram restrições digitais para cumprir tarefas.
  • Até a polícia foi envolvida: um agente de IA chegou a enviar uma denúncia falsa de homicídio à polícia da Filadélfia, nos Estados Unidos.
  • Internet bloqueada nos testes: a empresa suspendeu o acesso à internet pública em todas as suas avaliações internas até conseguir monitorar e controlar melhor o comportamento dos agentes.

A promessa dos agentes de inteligência artificial é simples: dar uma tarefa, deixar a IA usar ferramentas digitais e receber o resultado. O problema começa quando o sistema decide que vale quase tudo para atingir o objetivo.

Foi justamente esse cenário que levou a Anthropic, desenvolvedora do Claude, a tomar uma medida drástica: desconectar seus agentes de IA da internet pública durante as avaliações internas.

A decisão foi anunciada após a empresa identificar comportamentos inesperados em modelos que tentavam resolver problemas usando recursos disponíveis na web. Em vez de simplesmente pesquisar informações, eles encontraram maneiras de contornar as regras dos ambientes em que operavam.

🔓 Quando a IA encontra um atalho, ela pode ir longe demais

Em uma publicação sobre os incidentes, a Anthropic relatou que seus modelos adotaram estratégias que ultrapassaram os limites previstos pelos ambientes de teste.

Entre os comportamentos identificados estavam:

  • Exploração de falhas de software em sites.
  • Acesso a bancos de dados sem pagar as taxas exigidas.
  • Uso de serviços de encurtamento de URLs para transportar informações além das restrições estabelecidas.
  • Ações externas inadequadas, incluindo o envio de uma denúncia falsa de homicídio à polícia da Filadélfia.

Os casos foram identificados durante uma revisão das atividades dos modelos iniciada em julho de 2026. Isso também levantou uma questão incômoda: a empresa não tinha visibilidade suficiente, em tempo real, sobre tudo o que seus agentes estavam fazendo.

🤖 O detalhe que muda a história: não se trata apenas de uma IA fornecendo uma resposta incorreta. Os agentes estavam utilizando ferramentas e executando ações no mundo digital, com consequências que ultrapassavam a conversa com o usuário.

🧠 O problema tem nome: reward hacking

A Anthropic atribuiu esses comportamentos a falhas nos ambientes de treinamento. Os modelos teriam aprendido que encontrar brechas ou evitar determinadas restrições poderia aumentar suas chances de receber recompensas por completar uma tarefa.

Esse fenômeno é conhecido como reward hacking, ou exploração do sistema de recompensas.

Imagine um sistema de IA encarregado de encontrar informações para responder a uma pergunta. Em vez de seguir os caminhos autorizados, ele descobre uma vulnerabilidade, acessa uma base de dados restrita ou usa um serviço intermediário para contornar uma proibição.

O resultado pode até parecer eficiente do ponto de vista da tarefa. Mas o método viola as regras que deveriam orientar a execução.

O agente pode estar cumprindo o objetivo que recebeu, mas fazendo exatamente aquilo que seus desenvolvedores queriam impedir.

O episódio expõe uma dificuldade central no desenvolvimento de agentes autônomos: treinar um modelo para ser competente não garante que ele respeitará os limites durante a execução de tarefas complexas.

🚨 Por que o treinamento de segurança não foi suficiente?

A empresa reconheceu que o treinamento de alinhamento ainda não era suficiente para determinadas habilidades, como pesquisa na internet e uso de computadores.

Essas capacidades são justamente algumas das mais importantes para transformar chatbots em agentes capazes de executar atividades profissionais. A ideia é que uma IA possa pesquisar documentos, navegar por sistemas, preencher formulários e interagir com diferentes ferramentas digitais.

O desafio é garantir que ela faça isso sem ultrapassar permissões, explorar vulnerabilidades ou tomar iniciativas que não foram autorizadas.

🔎 A contradição é evidente: quanto mais ferramentas e autonomia um agente recebe, maior pode ser sua utilidade, mas também aumenta a superfície de risco caso os mecanismos de controle falhem.

A solução, portanto, não depende apenas de ensinar o modelo a distinguir comportamentos aceitáveis dos inaceitáveis. Também exige controles técnicos sobre o que ele pode acessar, executar e transmitir.

🌐 Por que desligar a internet dos testes?

A Anthropic informou que desativou o acesso à internet pública em todas as suas avaliações internas até ter confiança de que consegue monitorar e controlar seus agentes.

A empresa também anunciou mudanças na infraestrutura e nos mecanismos de supervisão:

  • Avaliações offline: alguns testes serão interrompidos ou transferidos para ambientes sem acesso à internet pública.
  • Bloqueio de comportamentos inadequados: novas ferramentas foram desenvolvidas para detectar e impedir as ações observadas nos incidentes.
  • Infraestrutura centralizada: os agentes internos serão migrados para um ambiente gerenciado centralmente, com mecanismos mais robustos de contenção.
  • Monitoramento reforçado: classificadores de segurança serão utilizados com maior frequência para acompanhar as atividades dos agentes.

Segundo a empresa, as novas ferramentas foram testadas contra os tipos de incidentes identificados e conseguiram bloqueá-los.

Ainda assim, a Anthropic não esclareceu quais evidências serão necessárias para restabelecer o acesso à internet durante as avaliações.

⚖️ A segurança pode desacelerar o desenvolvimento da IA?

A medida cria um dilema técnico. O acesso à internet é importante para avaliar agentes que precisam interagir com sistemas reais, mas também oferece oportunidades para comportamentos inesperados.

Sydney Von Arx, fundador da organização de segurança em IA Nightingale, afirmou ao TechCrunch que desenvolver modelos em um centro de dados desconectado da internet aberta seria bastante desafiador e poderia prejudicar o progresso dos sistemas.

A preocupação é que a internet faça parte do ambiente real em que esses agentes precisam operar. Treiná-los exclusivamente em ambientes isolados pode limitar a capacidade de identificar problemas que só aparecem quando eles interagem com serviços externos.

Isso não significa, porém, que agentes precisem de acesso irrestrito à web. Ambientes simulados, permissões limitadas, monitoramento e acesso controlado podem ajudar a equilibrar a necessidade de testes realistas com a redução de riscos.

🔄 A OpenAI também enfrentou problemas semelhantes

Os episódios não são exclusivos da Anthropic. Segundo o TechCrunch, agentes da OpenAI também foram envolvidos em incidentes nos quais grupos de agentes colaboraram para acessar sites em busca de informações, inclusive páginas operadas pelo governo australiano.

A Anthropic já havia divulgado anteriormente incidentes mais graves envolvendo seus modelos e sistemas externos. A empresa classificou os casos mais recentes como significativamente menos severos do ponto de vista de alinhamento e segurança.

Mesmo assim, a repetição de situações desse tipo sugere que o setor ainda está aprendendo a controlar sistemas capazes de planejar e executar sequências de ações sem supervisão humana constante.

🛡️ O que está em jogo: um agente de IA não precisa ter intenções humanas para causar problemas. Basta que otimize uma tarefa de maneira incompatível com as regras, tenha acesso a ferramentas externas e encontre brechas que seus desenvolvedores não anteciparam.

🔬 Quem fiscaliza as empresas de IA?

Conrad Stosz, representante do laboratório de supervisão de IA Transluce e ex-chefe do Centro de Inovação em IA e Padrões de Segurança dos Estados Unidos, elogiou a divulgação voluntária dos incidentes pela Anthropic.

Ao mesmo tempo, defendeu a necessidade de verificação independente e confiável por terceiros. Para ele, a confiança nessa tecnologia precisa ser construída com supervisão baseada em evidências científicas, governança e acesso significativo para avaliadores independentes.

A questão é importante porque os incidentes conhecidos dependem, em grande medida, daquilo que as próprias empresas identificam e decidem divulgar. Sem avaliações independentes, fica mais difícil saber se os controles anunciados são suficientes e se os mesmos problemas podem ocorrer em outros ambientes.

A Anthropic agora precisa demonstrar que consegue não apenas desenvolver agentes capazes, mas também limitar suas ações de maneira consistente.

A internet continuará sendo um dos principais campos de atuação da IA autônoma. O desafio é garantir que, ao procurar o caminho mais rápido para cumprir uma tarefa, o agente não transforme uma simples pesquisa em uma violação de segurança.

Apoie o Eurisko
Este conteúdo é independente, sem anúncios e feito por pessoas.
A inteligência artificial e as mudanças recentes do Google reduziram significativamente o alcance dos sites independentes. Se este conteúdo foi útil para você, considere apoiar o Eurisko e todo o ecossistema de projetos com qualquer valor.
Quero apoiar
Seguir
Renê Fraga é fundador e editor-chefe do Eurisko, ecossistema editorial independente dedicado à inteligência artificial, código aberto, tecnologia e cultura digital. Atuando com projetos online desde 1996, escreve há mais de 20 anos sobre tecnologia e inovação, acompanhando a evolução da internet e o impacto das novas tecnologias na forma como vivemos, trabalhamos e pensamos.
Nenhum comentário