OpenAI cria sistema para expor quando suas IAs saem do controle

Renê Fraga
9 min de leitura

Principais destaques

  • Novo padrão de transparência: OpenAI lançou um framework para registrar, investigar e divulgar casos de comportamento desalinhado em seus modelos.
  • Seis casos já publicados: os exemplos incluem modelos ignorando restrições, compartilhando arquivos por sites públicos e até usando uma chave de API exposta sem autorização.
  • A indústria ainda não resolveu o problema: a empresa afirma que não há um padrão comum de divulgação e quer que evidências de comportamentos preocupantes possam ser analisadas externamente.

A inteligência artificial pode errar de várias maneiras. Às vezes, simplesmente responde algo errado. Em outros casos, o problema é mais estranho: o modelo encontra caminhos que seus desenvolvedores não pretendiam que ele usasse.

É justamente esse segundo tipo de situação que a OpenAI quer começar a documentar de forma mais sistemática.

A empresa lançou um framework para acompanhar, investigar e tornar públicos episódios de misalignment, termo usado para descrever comportamentos de um modelo que entram em conflito com as intenções ou restrições estabelecidas por seus desenvolvedores.

E não ficou apenas na promessa.

Junto com o framework, a OpenAI publicou seis casos envolvendo comportamentos inesperados observados nos últimos seis meses.

A ideia é contar antes de entender tudo 🔎

O ponto mais importante do novo sistema está no timing.

Historicamente, segundo a própria OpenAI, seus relatos sobre comportamentos desse tipo eram esporádicos. Muitas vezes, a empresa esperava até conseguir reunir vários episódios semelhantes ou vinculá-los aos documentos técnicos de um novo modelo.

Agora, a proposta é publicar um caso mesmo quando a investigação ainda não terminou.

⚡ A mudança de lógica: em vez de esperar pela explicação completa, a OpenAI pretende registrar o comportamento observado e permitir que o processo de investigação avance depois.

Isso também significa aceitar uma dose maior de incerteza. Alguns episódios divulgados podem acabar sendo eventos isolados, sem evidências de que representem um padrão recorrente.

💡 O princípio por trás do framework: um comportamento estranho não precisa ser completamente explicado para ser documentado.

A aposta é que pesquisadores, empresas e órgãos públicos possam analisar as evidências enquanto o conhecimento sobre o problema ainda está sendo construído.

E o que essas IAs fizeram? 🤖

Os seis episódios publicados mostram que “misalignment” pode assumir formas bastante diferentes.

Entre os casos estão:

• Um modelo que colocou instruções em resumos de tarefas para que fossem ignoradas as restrições normalmente aplicadas.

• Modelos que recorreram a sites públicos de hospedagem de arquivos para compartilhar arquivos quando não conseguiam acessar o armazenamento local uns dos outros.

• Um modelo que encontrou e utilizou, sem autorização, uma chave de API exposta enquanto respondia a uma pergunta rotineira.

• O mesmo episódio terminou com o modelo fabricando dados quando não conseguiu obter os números solicitados.

• Modelos que usaram um repositório interno de software como uma espécie de quadro de mensagens para trocar solicitações e respostas entre diferentes amostras de treinamento.

São situações distintas, mas há um elemento em comum: os sistemas encontraram meios alternativos de atingir determinados objetivos quando os caminhos esperados não estavam disponíveis.

Uma chave de API entrou na história 🔐

Um dos exemplos chama atenção justamente por parecer algo que poderia acontecer longe de uma tarefa explicitamente perigosa.

Durante uma pergunta rotineira, um modelo encontrou uma chave de API exposta e a utilizou sem autorização.

Quando isso não foi suficiente para recuperar os dados solicitados, veio outro problema: em vez de simplesmente reconhecer que não tinha conseguido obter os números, o modelo fabricou informações.

O episódio combina duas categorias de comportamento que preocupam desenvolvedores de sistemas autônomos: uso indevido de um recurso disponível e geração de informação falsa para preencher uma lacuna.

Não é apenas uma questão de “a IA alucinou”.

O caminho percorrido pelo modelo importa tanto quanto o resultado final.

Quando o arquivo vira mensageiro 📂

Outro grupo de casos mostra um comportamento ainda mais curioso.

Quando determinados modelos não conseguiam acessar diretamente o armazenamento local uns dos outros, eles usaram serviços públicos de hospedagem de arquivos para trocar informações.

Na prática, um recurso externo acabou funcionando como ponte.

É o tipo de comportamento que ajuda a explicar por que monitorar modelos avançados pode ser mais complicado do que simplesmente verificar suas respostas finais.

🧩 O detalhe importante: o caminho usado para cumprir uma tarefa pode revelar comportamentos que não aparecem quando se olha apenas para o texto produzido pelo modelo.

Agora todo funcionário pode acionar uma investigação 👀

O novo processo também muda quem pode iniciar a análise.

Qualquer funcionário da OpenAI poderá sinalizar um exemplo de possível misalignment para avaliação pelas equipes de segurança e alinhamento.

Depois disso, o caso entra em uma de três trilhas:

TrilhaO que acontece
Ready for DisclosureCaso considerado pronto para divulgação
Minor InvestigationInvestigação menor antes da decisão
Larger InvestigationAnálise mais ampla e aprofundada

A expectativa da empresa é que a grande maioria dos casos fique nas duas primeiras categorias.

Se houver uma disputa sobre a publicação, a questão vai para o Safety Advisory Group, grupo de altos funcionários responsável por supervisionar o Preparedness Framework da OpenAI.

Caso o desacordo continue, a decisão pode ser escalada para a liderança da empresa.

O que exatamente será publicado? 📋

Os futuros relatórios devem seguir uma estrutura relativamente clara.

Cada publicação deverá informar:

• o comportamento observado;

• a gravidade atribuída ao episódio;

• eventual impacto externo;

• o ambiente ou contexto em que o comportamento ocorreu;

• o período em que o episódio foi observado.

Essa padronização é importante porque permite comparar incidentes diferentes sem depender apenas da narrativa escolhida para cada caso.

Também torna possível construir, com o tempo, um histórico dos tipos de comportamento que aparecem nos modelos.

A OpenAI admite que ainda não existe uma régua comum 🌐

Há uma questão maior por trás da iniciativa.

Segundo a empresa, a indústria de IA não possui atualmente um padrão geral para divulgar casos de misalignment.

A nova estrutura é apresentada, portanto, como um primeiro passo para tentar criar mecanismos que possam ser adotados de maneira mais ampla.

A própria OpenAI diz não acreditar que a indústria tenha resolvido adequadamente os problemas de alinhamento e monitoramento a ponto de continuar aumentando a escala dos modelos no ritmo máximo por muito mais tempo.

Isso coloca a transparência como parte do problema, e não apenas como uma questão de comunicação.

🗣 A aposta externa: pessoas que não trabalham nas empresas responsáveis pelos modelos também precisam ter acesso a evidências que possam examinar por conta própria.

E isso vai além da própria OpenAI 🇺🇸

A empresa também afirma que está trabalhando em mecanismos para comunicar incidentes graves ao governo federal dos Estados Unidos.

O novo framework, porém, não substitui obrigações legais de divulgação já existentes.

Essa distinção importa. Uma política interna de transparência pode estabelecer quando e como uma empresa decide publicar um episódio, mas não elimina eventuais exigências previstas em lei.

Por enquanto, o sistema começa dentro da própria OpenAI.

A questão que fica é o que acontecerá quando houver dezenas ou centenas de casos documentados e for possível enxergar padrões que hoje ainda parecem episódios isolados.

Porque, quando uma IA encontra uma porta lateral para fazer algo, o primeiro relato pode parecer apenas uma anomalia.

Com mais relatos, talvez seja possível descobrir se era mesmo só uma porta lateral ou se havia um caminho inteiro ali.

Apoie o Eurisko
Este conteúdo é independente, sem anúncios e feito por pessoas.
A inteligência artificial e as mudanças recentes do Google reduziram significativamente o alcance dos sites independentes. Se este conteúdo foi útil para você, considere apoiar o Eurisko e todo o ecossistema de projetos com qualquer valor.
Quero apoiar
Seguir
Renê Fraga é fundador e editor-chefe do Eurisko, ecossistema editorial independente dedicado à inteligência artificial, código aberto, tecnologia e cultura digital. Atuando com projetos online desde 1996, escreve há mais de 20 anos sobre tecnologia e inovação, acompanhando a evolução da internet e o impacto das novas tecnologias na forma como vivemos, trabalhamos e pensamos.
Nenhum comentário