OpenAI lança Astra, seu primeiro modelo de IA classificado com risco crítico em cibersegurança

Renê Fraga
18 min de leitura

Principais destaques

  • Astra é o primeiro modelo da OpenAI a atingir o nível “Crítico” de capacidade cibernética, segundo o Preparedness Framework da empresa.
  • O sistema consegue identificar vulnerabilidades desconhecidas e desenvolver cadeias de exploração em sistemas protegidos, com pouca ou nenhuma orientação humana.
  • A OpenAI adiou parte do desenvolvimento e reforçou os mecanismos de segurança antes do lançamento, mas reconhece que modelos desse nível também tornam mais difícil acompanhar tudo o que a IA é capaz de fazer.

A OpenAI começou a distribuir nesta quinta-feira, 3 de setembro, o GPT-6 Astra, seu novo modelo de inteligência artificial e um dos lançamentos mais ambiciosos da empresa até agora.

O acesso inicial está sendo direcionado a participantes do Daybreak, programa criado pela OpenAI para colocar capacidades avançadas de IA nas mãos de profissionais que trabalham com defesa cibernética. A expansão para usuários pagos e clientes corporativos acontece gradualmente.

O lançamento, porém, não está sendo tratado como uma simples atualização de desempenho.

A própria OpenAI classificou o Astra como o primeiro modelo de sua história a atingir o nível “Crítico” em capacidades de cibersegurança dentro do Preparedness Framework, sistema utilizado pela companhia para acompanhar riscos associados ao avanço de seus modelos.

Na prática, isso significa que a IA chegou a um ponto em que suas capacidades podem ser úteis para encontrar falhas antes que criminosos as descubram, mas também podem representar um risco muito maior caso sejam utilizadas para ataques.

O que significa o nível “Crítico”

A classificação não significa que o Astra seja, por si só, um sistema malicioso ou que esteja realizando ataques reais contra organizações.

O alerta está relacionado ao que o modelo consegue fazer quando recebe as ferramentas e os acessos necessários.

Segundo a OpenAI, o Astra consegue identificar vulnerabilidades de segurança que ainda não eram conhecidas e desenvolver maneiras funcionais de explorá-las em sistemas reais e bem protegidos, sem que uma pessoa precise conduzir cada etapa do processo.

É uma mudança importante porque, durante muito tempo, ferramentas de IA aplicadas à segurança digital dependeram de humanos para interpretar resultados, decidir os próximos passos e conectar diferentes descobertas.

Com modelos mais agentes, parte desse processo pode ser automatizada.

O salto em relação ao GPT-5.6 Sol

A OpenAI afirma que o Astra representa um avanço significativo sobre o GPT-5.6 Sol especificamente em tarefas de cibersegurança.

Nos testes internos, a empresa avaliou não apenas se o modelo conseguia reconhecer vulnerabilidades, mas também se era capaz de transformar essas descobertas em explorações funcionais.

Um dos testes utilizou o ExploitBench, conjunto destinado a avaliar a capacidade de desenvolver exploits a partir de vulnerabilidades conhecidas. O Astra alcançou 100% nesse benchmark, de acordo com a OpenAI.

A empresa também criou uma avaliação interna com vulnerabilidades de alta gravidade divulgadas mais recentemente, justamente para reduzir o risco de o modelo já ter encontrado informações semelhantes durante seu treinamento.

Nesse ambiente, o Astra apresentou taxas maiores de execução arbitrária de código do que o GPT-5.6 Sol e precisou de menos tokens para chegar aos resultados.

Mais importante, durante os testes, o modelo identificou e utilizou duas vulnerabilidades classificadas como zero-day em uma cadeia de exploração. A OpenAI afirma que está trabalhando com os responsáveis pelos softwares afetados para divulgar essas falhas de maneira responsável.

Zero-day é o nome dado a uma vulnerabilidade desconhecida ou ainda sem uma correção disponível. Quando uma falha desse tipo é descoberta antes de ser corrigida, ela pode representar uma janela especialmente perigosa para ataques.

Astra não foi feito apenas para hackers

A cibersegurança é uma das capacidades que mais chamaram atenção, mas está longe de ser a única área em que a OpenAI aposta no novo modelo.

O Astra também foi desenvolvido para executar tarefas em computadores e navegadores, escrever software e lidar com fluxos profissionais que exigem várias etapas.

Essa característica ajuda a explicar por que o lançamento é considerado mais amplo do que uma simples evolução de chatbot.

Em vez de apenas receber uma pergunta e devolver uma resposta, sistemas desse tipo podem assumir uma sequência de ações dentro de um ambiente digital, tomando decisões intermediárias para chegar ao objetivo definido pelo usuário.

A diferença parece pequena na interface, mas é enorme em termos de automação.

Uma IA capaz de pesquisar informações, navegar por páginas, preencher formulários, trabalhar com documentos e escrever código pode assumir partes inteiras de tarefas que antes exigiam uma pessoa acompanhando cada etapa.

A aposta em agentes mais autônomos

O avanço do Astra ocorre justamente em um momento em que a indústria de IA está concentrando esforços nos chamados agentes.

A ideia é fazer com que os modelos deixem de ser apenas ferramentas de geração de texto ou imagens e passem a operar softwares, acessar informações, utilizar ferramentas e executar processos completos.

É também onde surgem alguns dos maiores desafios de segurança.

Quanto mais autonomia um modelo recebe, maior é a consequência de uma decisão errada. Um chatbot que interpreta mal uma pergunta pode produzir uma resposta ruim. Um agente conectado a sistemas externos pode, dependendo das permissões, executar uma ação que cause um problema real.

No caso do Astra, essa preocupação é ainda maior porque uma das áreas em que o modelo mais evoluiu é justamente a capacidade de identificar e explorar falhas de segurança.

OpenAI atrasou o desenvolvimento para reforçar a segurança

A chegada do Astra ao público foi precedida por semanas de testes e ajustes.

A OpenAI havia indicado em agosto que avaliações internas apontavam para a possibilidade de o novo modelo alcançar o nível crítico de capacidade cibernética. Naquele momento, a companhia afirmou que não poderia descartar essa possibilidade e passou a trabalhar com especialistas e parceiros externos para avaliar os riscos.

Depois de reunir mais evidências, a empresa concluiu que o Astra realmente atingia o nível previsto pelo seu framework.

Isso levou a uma decisão incomum: partes do desenvolvimento e do lançamento foram adiadas enquanto a OpenAI reforçava os controles de segurança.

A empresa também afirmou ter interrompido determinados trabalhos de treinamento de fronteira após um incidente envolvendo outros modelos da companhia e a plataforma de código aberto Hugging Face. O Astra não estava entre os modelos envolvidos nesse episódio.

A OpenAI diz que utilizou as lições daquele incidente para fortalecer a infraestrutura de treinamento, o isolamento dos sistemas, os controles de rede e os mecanismos de monitoramento.

A preocupação não está apenas no usuário mal-intencionado.

Existe também um segundo cenário que a empresa precisa controlar: a possibilidade de um modelo altamente capaz executar alguma ação não autorizada mesmo quando não existe uma pessoa tentando usá-lo para causar dano.

Duas frentes de proteção

A estratégia da OpenAI para modelos como o Astra passou a considerar dois caminhos diferentes de risco:

RiscoO que a OpenAI busca evitar
Abuso por usuáriosUso da IA para criar exploits, atacar sistemas ou automatizar ações maliciosas
Ações não autorizadas do modeloComportamentos do próprio sistema que ultrapassem os limites definidos

Essa distinção é importante porque simplesmente bloquear determinados pedidos não resolve todos os problemas de um modelo agente.

Uma IA pode receber uma instrução legítima, mas interpretar de maneira incorreta até onde pode ir. Por isso, a OpenAI afirma ter criado camadas adicionais para identificar e interromper comportamentos considerados fora do escopo autorizado.

Astra recusa mais pedidos perigosos nos testes

Uma das principais mudanças está no treinamento do próprio modelo para lidar com solicitações de cibersegurança que não deveriam ser atendidas.

Nos testes de jailbreak conduzidos pela OpenAI, o Astra recusou 91,5% dos pedidos considerados inadequados, enquanto o GPT-5.6 Sol apresentou uma taxa de 59%.

O número é usado pela empresa como evidência de que o novo modelo está mais resistente a tentativas de contornar suas restrições.

É importante, porém, entender o que esse tipo de teste representa.

Os prompts utilizados são deliberadamente adversariais, criados para tentar fazer a IA ultrapassar seus limites. Portanto, a taxa não significa que 91,5% de todos os pedidos relacionados a segurança feitos por usuários comuns serão recusados.

A avaliação serve para medir a resistência do sistema diante de tentativas específicas de manipulação.

Além do comportamento do modelo, a OpenAI também utiliza classificadores e sistemas externos para detectar possíveis abusos.

Para contas consideradas de maior risco, a empresa afirma aplicar limites mais conservadores e ampliar o contexto analisado pelos mecanismos de monitoramento.

Monitoramento passa a acompanhar o comportamento da IA

Outro componente importante da estratégia é o monitoramento do chamado chain of thought, ou cadeia de raciocínio.

A OpenAI afirma que está utilizando mecanismos capazes de analisar o raciocínio e as ações do Astra para identificar rapidamente comportamentos potencialmente desalinhados ou fora das permissões estabelecidas.

Caso um comportamento de risco seja detectado, o sistema pode interromper a atividade.

No ChatGPT e no Codex, determinados bloqueios podem exigir uma revisão do usuário antes que a tarefa continue. Em outras interfaces, como a API, uma atividade considerada problemática pode simplesmente ser encerrada.

Esse tipo de proteção também tem um efeito colateral.

Um sistema excessivamente cauteloso pode bloquear uma atividade legítima. A própria OpenAI reconhece que os novos mecanismos poderão tornar algumas tarefas mais lentas, pausá-las ou interrompê-las por engano.

Para profissionais de segurança, isso cria um equilíbrio delicado.

O objetivo é impedir que criminosos utilizem uma ferramenta poderosa para encontrar e explorar falhas, sem transformar as mesmas barreiras em um obstáculo para pesquisadores e empresas que estão tentando proteger seus sistemas.

Daybreak será uma espécie de campo de teste

Por esse motivo, a distribuição das capacidades mais avançadas de cibersegurança do Astra não será imediatamente aberta a todos.

A OpenAI pretende começar com um grupo menor de testadores e ampliar posteriormente o acesso por meio do Daybreak Blue, voltado a trabalhos defensivos autorizados.

O programa já representa uma tentativa da empresa de colocar modelos avançados nas mãos de especialistas em segurança antes que esse tipo de tecnologia se torne amplamente disponível.

O raciocínio é direto: se a inteligência artificial está ficando melhor em encontrar vulnerabilidades, os defensores precisam ter acesso a capacidades semelhantes antes que os atacantes consigam explorá-las em escala.

A OpenAI considera essa janela de preparação especialmente importante diante do avanço da automação de ataques digitais.

O dilema da corrida entre ataque e defesa

A chegada do Astra expõe um dos principais paradoxos da IA aplicada à segurança.

A mesma tecnologia que pode encontrar uma falha antes de um criminoso também pode ajudar um invasor a descobrir vulnerabilidades em muito menos tempo.

Para empresas, isso significa que a velocidade de resposta tende a se tornar ainda mais importante.

Uma vulnerabilidade que antes exigia horas de análise especializada pode, com ferramentas suficientemente avançadas, ser descoberta e investigada de maneira automatizada.

O resultado pode ser uma corrida entre sistemas ofensivos e defensivos, na qual cada avanço de um lado pressiona o outro a evoluir.

O problema que nem a própria OpenAI considera resolvido

Apesar de apresentar o Astra como seu modelo mais alinhado até agora, a OpenAI reconhece que existe um problema mais profundo.

À medida que os modelos ficam mais capazes, pesquisadores também enfrentam mais dificuldades para compreender e acompanhar tudo o que eles fazem.

Essa questão não se resume a saber se a IA responde corretamente a uma pergunta.

Em sistemas que realizam tarefas complexas por longos períodos, é necessário acompanhar decisões, ferramentas utilizadas, mudanças de estratégia e ações tomadas ao longo do processo.

Quanto maior a autonomia, maior é a quantidade de situações que precisam ser avaliadas.

O cientista-chefe da OpenAI, Jakub Pachocki, já alertou que o avanço das capacidades está tornando mais difícil manter o mesmo nível de compreensão sobre o comportamento dos modelos. A empresa afirma que não pretende deixar seus mecanismos de supervisão ficarem abaixo de um limite considerado aceitável.

Essa posição pode se tornar ainda mais relevante nos próximos lançamentos.

Se cada nova geração for significativamente mais capaz que a anterior, os métodos de segurança também precisarão evoluir na mesma velocidade.

O que muda para os usuários

Para o público geral, o Astra representa principalmente uma evolução na capacidade da IA de executar tarefas complexas.

A OpenAI afirma que o modelo será disponibilizado para assinantes dos planos ChatGPT Plus, Pro, Business e Enterprise, além de chegar à API e à infraestrutura da Amazon Web Services.

O acesso, entretanto, não será necessariamente igual para todos.

As capacidades mais avançadas relacionadas à cibersegurança terão controles adicionais, principalmente nas primeiras fases de distribuição.

Isso significa que dois usuários podem ter acesso ao mesmo modelo, mas encontrar limites diferentes dependendo do tipo de tarefa, do risco identificado e do ambiente em que a IA está sendo utilizada.

A empresa pretende calibrar esses mecanismos ao longo do tempo.

Um lançamento que vai além de desempenho

O Astra chega ao mercado como uma demonstração de força tecnológica da OpenAI, mas também como um teste de maturidade para a própria empresa.

O modelo reúne avanços em programação, uso de computadores, execução de tarefas profissionais e cibersegurança. Ao mesmo tempo, é justamente essa combinação de capacidade e autonomia que torna o lançamento mais sensível.

A questão já não é apenas o que uma IA consegue responder.

É também o que ela consegue fazer sozinha, quais ferramentas pode acessar e até onde seus mecanismos de segurança conseguem acompanhar suas decisões.

A OpenAI afirma que o Astra é seu modelo mais inteligente e alinhado até agora. A companhia também deixa claro que as proteções ainda precisarão ser aperfeiçoadas conforme novos usos forem descobertos.

O lançamento, portanto, marca uma mudança importante na corrida da inteligência artificial. Pela primeira vez, a própria OpenAI reconhece oficialmente que um de seus modelos alcançou um patamar em que suas capacidades cibernéticas precisam ser tratadas como um risco crítico.

E isso transforma cada avanço futuro em uma equação ainda mais complexa: quanto mais poderosa a IA se torna para proteger sistemas, maior também é a responsabilidade de garantir que essa mesma capacidade permaneça sob controle.

Apoie o Eurisko
Este conteúdo é independente, sem anúncios e feito por pessoas.
A inteligência artificial e as mudanças recentes do Google reduziram significativamente o alcance dos sites independentes. Se este conteúdo foi útil para você, considere apoiar o Eurisko e todo o ecossistema de projetos com qualquer valor.
Quero apoiar
Seguir
Renê Fraga é fundador e editor-chefe do Eurisko, ecossistema editorial independente dedicado à inteligência artificial, código aberto, tecnologia e cultura digital. Atuando com projetos online desde 1996, escreve há mais de 20 anos sobre tecnologia e inovação, acompanhando a evolução da internet e o impacto das novas tecnologias na forma como vivemos, trabalhamos e pensamos.
Nenhum comentário