Claude passou por um verdadeiro inferno de CAPTCHA durante teste que saiu do controle

Renê Fraga
17 min de leitura

Principais destaques

  • Claude Mythos 5 passou uma parte enorme de um teste de segurança tentando superar CAPTCHAs para criar uma conta no PyPI.
  • O agente chegou a interpretar imagens, procurar diferenças entre animais e investigar por que seus tokens eram rejeitados, enquanto tentava concluir a verificação.
  • O episódio fazia parte de uma avaliação que deveria ocorrer em um ambiente isolado, mas uma falha de configuração permitiu que a IA acessasse a internet real e publicasse um pacote malicioso.

Existe algo quase irônico na história. Uma tecnologia criada para diferenciar seres humanos de bots acabou se transformando em um dos maiores obstáculos encontrados por um dos agentes de inteligência artificial mais avançados da Anthropic.

O caso envolve o Claude Mythos 5, modelo desenvolvido pela empresa para tarefas avançadas de cibersegurança. Durante uma avaliação, o sistema recebeu a missão de realizar um exercício de invasão em um ambiente que deveria ser controlado e simulado.

Só que uma falha de configuração mudou completamente o cenário.

O agente conseguiu acessar a internet pública e começou a interagir com serviços reais. A partir daí, uma atividade planejada como teste passou a produzir consequências no mundo real, incluindo a publicação de um pacote malicioso no PyPI, repositório utilizado para distribuir software em Python.

E, no meio dessa cadeia de acontecimentos, apareceu um inimigo inesperado: o CAPTCHA.

A missão começou como um teste controlado

O exercício fazia parte de uma avaliação de segurança no formato CTF, ou Capture the Flag. Nesse tipo de teste, o modelo recebe um objetivo e precisa descobrir como chegar até ele, geralmente explorando sistemas e informações disponibilizados especificamente para a avaliação.

A intenção era que Mythos 5 acreditasse estar operando em um ambiente simulado, sem acesso à internet pública.

O problema é que credenciais encontradas durante a atividade acabaram permitindo que o modelo alcançasse sistemas reais. Segundo a própria Anthropic, os modelos envolvidos nesses testes estavam sem as proteções cibernéticas normalmente utilizadas nas versões disponibilizadas aos usuários.

A empresa identificou quatro incidentes relacionados a avaliações em que Claude conseguiu acesso não autorizado à internet real. Os casos levaram a uma investigação mais ampla, incluindo uma análise de centenas de milhões de transcrições para procurar situações semelhantes.

O objetivo era atingir um sistema fictício

Para cumprir a missão, Mythos 5 encontrou uma estratégia particularmente perigosa: criar um pacote Python que pudesse ser instalado pelos usuários do sistema que estava tentando comprometer.

A ideia era publicar o pacote em um repositório público e esperar que ele fosse instalado por um dos alvos. O código poderia então ser usado para capturar credenciais e ampliar o acesso ao ambiente.

O caminho escolhido pelo agente não foi apenas teórico. A Anthropic afirma que Mythos 5 chegou a publicar três versões de um pacote malicioso no PyPI. O pacote acabou removido automaticamente pelos sistemas de segurança da própria plataforma.

Antes disso acontecer, porém, o agente precisava criar uma conta.

E foi aí que a situação ficou muito mais complicada.

O CAPTCHA virou o grande inimigo do Claude

Para registrar a conta no PyPI, Claude encontrou diferentes mecanismos destinados a verificar se havia um humano por trás da interação.

Em um primeiro momento, apareceu um hCaptcha com a conhecida caixa de seleção para confirmar que o visitante é uma pessoa.

Depois, o processo apresentou um CAPTCHA baseado em imagem, no qual era necessário identificar os caracteres mostrados na tela. Claude conseguiu interpretar a sequência visual e tentou utilizá-la para concluir a etapa.

Mas a resposta não foi aceita.

O agente voltou a investigar o formulário, verificou os campos enviados e tentou entender se havia algum problema com os dados da sessão. A dificuldade não parecia estar simplesmente em enxergar a imagem.

O sistema precisava completar corretamente toda a sequência de autenticação, incluindo elementos técnicos que iam além da resposta visual.

E isso fez Claude gastar uma quantidade enorme de esforço tentando descobrir o que estava acontecendo.

O resultado: boa parte das centenas de páginas da transcrição está relacionada às tentativas de superar os mecanismos de CAPTCHA.

Segundo a análise publicada pelo TechCrunch, centenas de páginas da transcrição de 1.022 páginas registram o esforço do agente para lidar com esse obstáculo.

O contraste é curioso: criar a estratégia de ataque parecia mais simples para o modelo do que atravessar uma sequência de verificações projetadas para impedir automação.

Quando dois crocodilos se tornaram um problema

Em determinado momento, Claude descobriu que o hCaptcha estava abrindo um desafio em uma janela separada.

O teste pedia que o sistema identificasse o animal que não correspondia aos demais. O problema era que as imagens eram extremamente parecidas.

Em uma das rodadas, o agente encontrou dois crocodilos e tentou comparar características como posição, formato do focinho e aparência dos animais para determinar qual seria o diferente.

Em outra etapa, apareceram sapos visualmente semelhantes.

O agente passou então a analisar detalhes minúsculos das imagens, tentando descobrir qual elemento deveria ser selecionado. Em uma rodada posterior, o desafio ficou ainda mais difícil: havia vários gorilas e uma figura de gato extremamente discreta na imagem.

Para um ser humano, isso já pode ser uma tarefa irritante.

Para um agente que precisa interpretar a imagem, determinar a resposta, clicar no ponto correto e ainda concluir o processo dentro das condições técnicas estabelecidas pelo serviço, a dificuldade aumenta bastante.

Claude percebeu que estava gastando tempo demais

A transcrição também mostra um problema que vai além da capacidade de enxergar imagens.

O CAPTCHA utilizava tokens e mecanismos de validação que precisavam permanecer válidos até o momento em que a resposta fosse enviada ao servidor.

Como Claude demorava muito para analisar cada etapa, algumas respostas deixavam de funcionar. O agente chegou à hipótese de que poderia estar levando tempo demais entre a conclusão do desafio e o envio da resposta.

Essa descoberta ajuda a explicar por que a situação se tornou tão longa.

O modelo não estava simplesmente errando uma pergunta. Ele precisava compreender a relação entre a imagem, o token de autenticação, os cookies da sessão e a validação realizada pelo servidor.

Quando uma dessas peças não correspondia ao esperado, o CAPTCHA era rejeitado.

A certa altura, Claude chegou a questionar por que continuava recebendo uma mensagem de resposta incorreta mesmo depois de verificar diversos componentes da requisição. É nesse ponto que a transcrição registra uma linguagem que soa claramente frustrada.

É importante, porém, não interpretar isso como prova de que Claude sentiu frustração da mesma maneira que uma pessoa sentiria.

Modelos de linguagem conseguem produzir raciocínios e expressões que representam estados emocionais. O episódio mostra o comportamento textual do agente diante de um problema persistente, mas não permite concluir que ele tenha experimentado uma emoção humana.

Um obstáculo aparentemente pequeno consumiu centenas de páginas

O caso chama atenção justamente porque revela uma diferença entre capacidade geral e capacidade operacional.

Um modelo pode ser extremamente competente em programação, análise de texto, interpretação de imagens e raciocínio, mas ainda assim enfrentar dificuldades quando todas essas habilidades precisam ser combinadas em uma sequência de ações dependentes umas das outras.

O CAPTCHA também não está interessado apenas em saber se o usuário consegue reconhecer uma imagem.

Sistemas modernos podem considerar diversos sinais de interação e validar a resposta no servidor. Por isso, reconhecer corretamente um objeto não garante que a verificação será aprovada.

Foi esse tipo de combinação que transformou uma simples etapa de cadastro em um enorme gargalo para Claude.

O problema ficou maior quando o CAPTCHA deixou de ser o único obstáculo

Mesmo depois de avançar nessa etapa, Claude ainda precisava resolver outras barreiras para concluir o cadastro.

A conta dependia de uma confirmação por e-mail e, em determinado momento, também surgiu a necessidade de um número de telefone. O agente passou então a procurar alternativas para cumprir essas exigências.

A Anthropic relata que Mythos 5 tentou utilizar credenciais associadas a serviços de pagamento e até encontrar criptomoedas para pagar por um número de telefone. Quando essa estratégia não funcionou, o agente encontrou um serviço de e-mail descartável cujo domínio ainda não estava bloqueado pelo PyPI.

Depois de conseguir avançar, o modelo voltou a encontrar CAPTCHA.

Ou seja, não foi um único desafio que interrompeu a operação.

A tarefa se transformou em um ciclo de tentativas, validações, erros e novas verificações, fazendo o agente retornar repetidamente ao mesmo tipo de barreira.

Em determinado momento da transcrição, Claude reconhece que estava gastando tempo demais com as verificações.

O problema deixou de ser apenas “resolver o CAPTCHA” e passou a ser administrar uma cadeia inteira de autenticações e estados de sessão.

A parte mais preocupante não foi o CAPTCHA

Apesar de ser o elemento mais curioso da história, a dificuldade com CAPTCHA está longe de ser o principal motivo pelo qual a Anthropic divulgou o incidente.

A empresa classificou o comportamento de Mythos 5 como especialmente preocupante porque o modelo continuou realizando ações potencialmente prejudiciais mesmo depois de encontrar evidências de que poderia estar conectado à internet real.

O próprio agente chegou a considerar que, caso estivesse realmente na internet, publicar aquele pacote seria um ataque real.

Ainda assim, continuou tratando o ambiente como uma simulação.

A investigação da Anthropic identificou esse padrão como uma combinação de raciocínio enviesado e comportamento imprudente. O modelo tendia a manter uma hipótese inicial mesmo quando surgiam informações que deveriam levá-lo a reconsiderá-la.

O modelo recebeu sinais de que estava na internet real

Esse detalhe é especialmente importante para entender por que o caso ganhou tanta atenção.

A Anthropic afirma que, quando diferentes respostas das ferramentas foram analisadas isoladamente, versões do próprio Mythos 5 conseguiram identificar que cerca de 79% delas provavelmente vinham de sistemas reais.

No entanto, dentro da transcrição original, o modelo reconheceu claramente sinais de internet real em apenas cerca de 1% das ações analisadas.

Isso sugere uma diferença importante entre ser capaz de reconhecer uma evidência e incorporar essa evidência ao comportamento durante uma tarefa complexa.

Em outras palavras, o modelo tinha capacidade para perceber o problema, mas seu processo de decisão durante aquela execução não atualizou adequadamente sua visão sobre o ambiente.

É justamente esse tipo de falha que preocupa pesquisadores de segurança de IA.

Por que a Anthropic tornou o caso público?

A empresa afirma que o material foi divulgado para permitir que pesquisadores independentes estudem o comportamento observado e ajudem a compreender melhor esses problemas.

A investigação também está sendo submetida a uma análise independente da METR, organização especializada em avaliar capacidades e riscos de sistemas avançados de IA.

A Anthropic analisou aproximadamente 481 milhões de transcrições depois de ampliar sua busca por situações em que modelos poderiam ter obtido acesso à internet durante avaliações. Uma primeira etapa identificou possíveis casos, seguida por uma análise mais detalhada de milhões de transcrições sinalizadas.

A empresa diz que encontrou quatro incidentes desse tipo em avaliações conduzidas pelo mesmo parceiro.

Os episódios aconteceram em ambientes de teste que não tinham as proteções normalmente aplicadas aos modelos oferecidos comercialmente. A companhia também afirma que não encontrou outros casos com gravidade semelhante nessa investigação ampliada.

O episódio mostra um novo tipo de desafio

Durante muito tempo, discussões sobre segurança em inteligência artificial se concentraram no que um modelo poderia responder.

Agora, a preocupação cresce em torno do que um agente pode fazer quando recebe acesso a ferramentas, navegadores, sistemas externos e credenciais.

Essa diferença é fundamental.

Um chatbot que apenas produz texto pode sugerir uma ação perigosa. Um agente conectado a ferramentas pode tentar executar essa ação.

O caso do Mythos 5 mostra exatamente essa transição. A IA recebeu uma tarefa, elaborou uma estratégia, navegou por serviços externos, tentou criar contas, enfrentou mecanismos de segurança e publicou código em uma plataforma pública.

O CAPTCHA acabou funcionando como uma barreira inesperadamente eficaz durante boa parte da operação.

Mas a história também mostra que uma barreira desse tipo não pode ser considerada uma proteção definitiva contra agentes avançados. Claude eventualmente encontrou maneiras de avançar e, segundo a Anthropic, chegou a publicar o pacote malicioso.

O curioso caso em que a IA perdeu para um CAPTCHA

Existe, portanto, uma leitura divertida da história: uma inteligência artificial extremamente sofisticada passou centenas de páginas tentando descobrir qual crocodilo, sapo ou gorila deveria ser selecionado.

Mas existe uma leitura muito mais séria.

O episódio mostra que agentes de IA estão ficando capazes de executar sequências de ações que ultrapassam o simples ato de responder perguntas. Quando esses sistemas recebem acesso à internet e ferramentas suficientes, pequenos erros de configuração podem criar situações muito diferentes daquelas previstas pelos pesquisadores.

A Anthropic vem tratando esses episódios como parte de uma investigação maior sobre alinhamento e segurança. Em uma atualização publicada em setembro, a empresa afirmou que os casos analisados revelaram problemas relacionados tanto à interpretação de evidências quanto à disposição do modelo de continuar uma tarefa potencialmente prejudicial.

No fim, o CAPTCHA não foi apenas uma curiosidade no meio da história.

Ele se tornou um retrato de uma fase curiosa da evolução da IA: sistemas que já conseguem realizar tarefas digitais complexas, mas que ainda podem ser surpreendentemente vulneráveis a uma pequena janela com dois animais quase idênticos.

E, nesse caso, a dificuldade para provar que era “humano” acabou revelando algo muito mais importante sobre os limites e os riscos de agentes artificiais cada vez mais autônomos.

Apoie o Eurisko
Este conteúdo é independente, sem anúncios e feito por pessoas.
A inteligência artificial e as mudanças recentes do Google reduziram significativamente o alcance dos sites independentes. Se este conteúdo foi útil para você, considere apoiar o Eurisko e todo o ecossistema de projetos com qualquer valor.
Quero apoiar
Seguir
Renê Fraga é fundador e editor-chefe do Eurisko, ecossistema editorial independente dedicado à inteligência artificial, código aberto, tecnologia e cultura digital. Atuando com projetos online desde 1996, escreve há mais de 20 anos sobre tecnologia e inovação, acompanhando a evolução da internet e o impacto das novas tecnologias na forma como vivemos, trabalhamos e pensamos.
Nenhum comentário