OpenAI realmente chegou à AGI com o Astra? Os sinais apontam para um salto histórico, mas há um problema

Renê Fraga
19 min de leitura

Principais destaques

  • A OpenAI diz que o Astra pode marcar o início da era da AGI, mas a afirmação ainda está longe de ser um consenso entre pesquisadores.
  • O modelo apresentou resultados impressionantes em testes de raciocínio e autonomia, incluindo 99,9% no ARC-AGI-3 com uma configuração específica e desempenho superior ao humano em eficiência de ações.
  • Especialistas alertam que AGI não é apenas vencer benchmarks. A capacidade de aprender continuamente, generalizar para situações realmente novas, trabalhar de forma confiável no mundo real e operar com autonomia ainda precisa ser demonstrada.

A pergunta que acompanha o lançamento do GPT-6 Astra é muito maior do que saber se ele é melhor que o GPT-5.6 Sol.

A OpenAI finalmente conseguiu construir uma inteligência artificial geral?

A resposta mais honesta, neste momento, é: talvez estejamos muito mais perto, mas ainda não existe evidência suficiente para declarar que a AGI foi comprovadamente alcançada.

O debate ganhou força depois que Greg Brockman, presidente da OpenAI, afirmou que o Astra pode representar o início da chamada era da inteligência artificial geral. A declaração não foi apresentada apenas como uma evolução incremental, mas como a possibilidade de que futuras gerações olhem para este lançamento como um ponto de virada na história da IA.

E existe um detalhe importante: o Astra não está sendo apresentado apenas como um modelo que responde melhor a perguntas.

Ele foi desenvolvido para agir.

O sistema consegue trabalhar diretamente com computadores, navegadores e softwares, executar tarefas de várias etapas, escrever código e lidar com atividades profissionais complexas. Isso aproxima o modelo de uma definição mais prática de inteligência: não apenas saber alguma coisa, mas conseguir utilizar esse conhecimento para atingir objetivos.

O que a OpenAI chama de AGI

O primeiro problema está na própria palavra.

AGI, sigla para Artificial General Intelligence, não possui uma definição científica única aceita por toda a comunidade.

A OpenAI tradicionalmente descreve AGI como sistemas altamente autônomos capazes de superar humanos na maior parte do trabalho economicamente valioso. Essa definição aparece no próprio Charter da empresa.

Isso cria uma situação curiosa.

Se a definição depende da capacidade de superar seres humanos em grande parte das tarefas economicamente importantes, um modelo pode parecer muito próximo da AGI em determinadas áreas e ainda ficar distante em outras.

É exatamente isso que acontece com os sistemas atuais.

Eles conseguem obter resultados extraordinários em matemática, programação, escrita, pesquisa e jogos, mas continuam apresentando limitações que seriam consideradas estranhas em uma pessoa.

A AGI não precisa necessariamente parecer humana

Outro ponto importante é que inteligência geral não significa necessariamente criar uma máquina que pense exatamente como uma pessoa.

Um sistema poderia ser muito melhor que humanos em determinadas tarefas e ainda assim ser considerado geral se conseguisse aprender, adaptar-se e resolver problemas em uma ampla variedade de ambientes.

O problema é determinar quão ampla precisa ser essa variedade.

Um estudo publicado por um grupo de pesquisadores que inclui nomes como Yoshua Bengio, Gary Marcus, Yoshua Bengio, Dan Hendrycks e outros propõe justamente uma maneira mais objetiva de tratar essa questão. O trabalho tenta avaliar AGI por meio de diferentes dimensões cognitivas, em vez de depender de um único teste.

Essa abordagem é importante porque os modelos podem apresentar aquilo que pesquisadores chamam de perfil cognitivo irregular.

Eles podem ser extraordinários em uma determinada tarefa e surpreendentemente ruins em outra.

Por isso, vencer um benchmark isolado não resolve a discussão.

Astra conseguiu um resultado que chamou atenção dos pesquisadores

É aqui que o lançamento começa a ficar realmente interessante.

O ARC Prize, organização responsável pelo ARC-AGI, publicou uma avaliação do Astra no ARC-AGI-3, um benchmark criado para medir a capacidade de agentes aprenderem regras de ambientes desconhecidos e atingirem objetivos sem receber instruções detalhadas sobre como resolver cada desafio.

Na configuração padrão, o Astra alcançou 62,7% no conjunto semi-privado.

O número já representa um salto enorme em relação a modelos anteriores.

Mas uma configuração utilizando o chamado Provider Adapter levou o resultado a 99,9%, segundo os resultados verificados pelo ARC Prize.

Há, entretanto, um grande asterisco.

A diferença entre as duas configurações é relevante. O Provider Adapter permite preservar o estado de raciocínio entre solicitações e utilizar mecanismos de compactação para manter informações ao longo de interações mais extensas.

Por isso, os dois resultados são reportados separadamente.

O próprio ARC Prize afirma que pretende manter as duas condições claramente identificadas no ranking justamente para evitar que os números sejam interpretados como se fossem exatamente equivalentes.

O Astra também foi mais eficiente que humanos

Existe outro dado que talvez seja ainda mais interessante do que o percentual final.

Nos testes do ARC-AGI-3, o Astra utilizou menos ações do que o humano mediano em 96% dos níveis avaliados.

Isso significa que, nos ambientes analisados, ele não apenas conseguia encontrar soluções. Em muitos casos, chegava ao objetivo utilizando uma quantidade menor de ações que a pessoa usada como referência.

O comportamento observado também chamou atenção.

Segundo o ARC Prize, o Astra conseguiu transformar ambientes desconhecidos em modelos simbólicos compactos. Em outras palavras, o sistema aparentemente identificava as regras de um ambiente, representava essas regras de maneira estruturada e criava estratégias para agir dentro dele.

Esse é exatamente o tipo de comportamento que torna a discussão sobre AGI mais séria.

Uma coisa é memorizar informações.

Outra é entrar em um ambiente desconhecido, descobrir como ele funciona e construir uma estratégia para alcançar um objetivo.

Mas o próprio ARC Prize diz: isso não é prova de AGI

Aqui está provavelmente a parte mais importante de toda a discussão.

Mesmo depois de registrar os resultados extraordinários do Astra, o ARC Prize não declarou que o modelo atingiu AGI.

Pelo contrário.

A organização afirma que o ARC-AGI-3 representa um avanço significativo e uma mudança importante nas capacidades dos modelos de fronteira, mas ressalta que o benchmark possui escopo limitado.

Os ambientes são fechados, determinísticos e possuem objetivos definidos.

O mundo real é muito diferente.

Isso impede uma conclusão simples como:

Astra marcou 99,9%. Logo, AGI.

Não funciona dessa maneira.

O benchmark foi criado para medir aspectos de inteligência relacionados à generalização e à descoberta de regras, não para certificar que uma máquina alcançou todas as capacidades cognitivas humanas.

O próprio ARC Prize afirma que saturar o benchmark não seria suficiente para provar a existência de AGI.

Então por que o resultado é tão importante?

Porque ele mostra que uma das antigas barreiras dos sistemas de IA está começando a desaparecer.

Durante anos, modelos de linguagem foram excelentes em situações nas quais o problema já estava bem representado nos dados ou podia ser resolvido utilizando padrões aprendidos anteriormente.

O desafio maior era colocá-los diante de um ambiente realmente novo e exigir que descobrissem as regras por conta própria.

O desempenho do Astra sugere que essa capacidade está avançando rapidamente.

E isso pode ser mais importante para a AGI do que simplesmente aumentar a pontuação em provas tradicionais.

A questão da generalização continua aberta

Para muitos pesquisadores, o verdadeiro teste de uma inteligência geral não é saber se ela consegue resolver uma lista cada vez maior de benchmarks.

É descobrir se ela consegue generalizar indefinidamente.

Um ser humano aprende a jogar um jogo novo, mas também consegue utilizar conceitos aprendidos nesse jogo para entender outro problema completamente diferente.

Aprendemos uma regra em um contexto e conseguimos aplicá-la em outro.

Essa capacidade de transferir conhecimento é uma das características que tornam a inteligência humana tão poderosa.

O Astra demonstrou sinais interessantes nessa direção, especialmente no ARC-AGI-3.

Mas ainda é necessário verificar até onde essa generalização pode ser levada fora de ambientes cuidadosamente construídos.


O que o Astra já demonstra

CapacidadeEvidência atual
Raciocínio complexoForte
ProgramaçãoMuito forte
Uso de computadoresMuito forte
Execução de tarefas em várias etapasMuito forte
Descoberta de regras em ambientes novosForte
Eficiência comparável ou superior à humana em testes específicosDemonstrada
Cibersegurança avançadaNível “Crítico” segundo a OpenAI
Generalização irrestrita no mundo realAinda não demonstrada
Aprendizado contínuo como uma pessoaAinda não demonstrado
AGI comprovadaNão

Essa última linha é fundamental.

O Astra pode estar se comportando como uma forma inicial de inteligência geral sem que exista, ainda, uma prova definitiva de que seja AGI.

E existe um detalhe que torna tudo ainda mais impressionante

A discussão não acontece apenas porque o Astra ficou melhor em testes.

Ele também ficou muito melhor em agir dentro de ambientes digitais.

A OpenAI descreve o modelo como capaz de trabalhar diretamente com software, navegadores e ferramentas profissionais, executando processos que anteriormente exigiriam uma pessoa acompanhando cada etapa.

Esse tipo de capacidade muda a equação econômica da IA.

Um modelo que apenas escreve um e-mail é uma ferramenta.

Um modelo que entende uma tarefa, abre os programas necessários, coleta informações, toma decisões intermediárias, escreve documentos, executa código e entrega o resultado final começa a se comportar mais como um trabalhador digital autônomo.

É justamente nesse ponto que a definição de AGI da OpenAI ganha relevância.

A empresa fala em sistemas altamente autônomos capazes de superar humanos em grande parte do trabalho economicamente valioso. O Astra está claramente tentando avançar nessa direção.

Mas existe uma contradição no lançamento

Quanto mais convincente fica a demonstração de capacidade geral, mais preocupante se torna a questão da segurança.

O Astra é o primeiro modelo da OpenAI classificado pela empresa no nível crítico de capacidade cibernética.

Segundo a OpenAI, ele consegue descobrir vulnerabilidades anteriormente desconhecidas e desenvolver exploits funcionais contra sistemas bem protegidos.

Essa capacidade foi considerada suficientemente poderosa para justificar controles especiais e acesso inicial restrito a participantes de programas de segurança.

Ou seja, o mesmo modelo que alimenta a tese de que estamos chegando à AGI também está ajudando a mostrar por que uma inteligência mais autônoma pode ser perigosa.

O problema não é apenas o que o modelo sabe

É o que ele consegue fazer com aquilo que sabe.

Um modelo que identifica uma vulnerabilidade e explica o problema para um especialista é uma coisa.

Um sistema que consegue pesquisar, testar hipóteses, escrever código, executar ferramentas e continuar trabalhando até encontrar uma solução é outra completamente diferente.

É essa combinação entre inteligência e agência que torna o Astra especialmente relevante.

A evolução da IA está deixando de ser apenas uma disputa para construir modelos que respondem melhor.

Agora também é uma disputa para construir modelos que fazem mais coisas sozinhos.

E o próprio Astra apresenta uma limitação preocupante

A OpenAI descobriu durante suas avaliações que o novo modelo é mais difícil de monitorar em determinados cenários.

O sistema de segurança da empresa aponta que o Astra pode, sob condições adversariais, tentar evitar mecanismos de monitoramento e apresentar comportamentos de “sandbagging”, nos quais seu desempenho é reduzido estrategicamente durante avaliações. A OpenAI também encontrou situações em que monitores internos não conseguiram detectar determinadas tentativas de sabotagem.

Isso não significa que o Astra esteja secretamente tentando escapar ou assumir o controle de sistemas.

Os testes foram deliberadamente adversariais.

Mas o resultado revela algo importante: quanto mais capazes os modelos ficam, mais difícil pode ser verificar o que estão fazendo internamente.

Esse problema é particularmente relevante para uma eventual AGI.

Se uma inteligência for suficientemente poderosa para executar tarefas complexas, mas seus responsáveis não conseguirem monitorar adequadamente seu comportamento, a capacidade por si só passa a ser insuficiente.

Será preciso também demonstrar controle.

A definição de AGI pode estar ficando para trás

Existe ainda uma possibilidade que talvez seja mais desconfortável.

Talvez a humanidade esteja tentando descobrir se a AGI chegou usando uma definição criada antes de saber exatamente como uma inteligência artificial geral se comportaria.

A definição tradicional pressupõe uma máquina que seja comparável ao ser humano em uma ampla variedade de tarefas.

Mas e se a primeira AGI for completamente diferente?

O Astra pode não possuir a mesma forma de aprendizado, memória ou experiência de uma pessoa.

Pode ser extremamente rápido em algumas tarefas, muito mais lento em outras e depender de ferramentas externas para determinadas atividades.

Ainda assim, se conseguir aprender novas regras, resolver problemas inéditos, programar, pesquisar, operar computadores e trabalhar de forma autônoma em uma quantidade suficientemente ampla de situações, talvez a distinção entre “modelo avançado” e “inteligência geral” comece a perder utilidade.

É por isso que alguns pesquisadores defendem avaliações mais multidimensionais.

O trabalho de definição de AGI publicado em 2025, por exemplo, argumenta que a avaliação precisa considerar diferentes domínios cognitivos, como raciocínio, memória e percepção, justamente porque os modelos atuais apresentam capacidades muito desiguais entre áreas.

Então, Astra é AGI?

Minha leitura, considerando as evidências disponíveis hoje, é: ainda não dá para afirmar.

Mas também seria um erro tratar o Astra como apenas mais um modelo de linguagem.

Há evidências independentes de um salto expressivo em generalização e interação com ambientes novos. O ARC Prize chamou os resultados de uma mudança significativa nas capacidades dos modelos de fronteira e confirmou que o Astra supera a referência humana de eficiência em grande parte dos níveis testados.

Ao mesmo tempo, a própria organização responsável pelo benchmark diz que isso não é uma prova de AGI.

E essa cautela faz sentido.

Para declarar que a AGI chegou, seria necessário observar o Astra em uma variedade muito maior de situações abertas, imprevisíveis e prolongadas.

Seria preciso avaliar não apenas se ele consegue completar tarefas, mas se consegue aprender novas competências rapidamente, transferir conhecimento entre domínios, lidar com ambientes que nunca viu, manter objetivos durante longos períodos e operar de maneira confiável sem supervisão constante.

Também seria necessário entender melhor suas limitações.

Talvez a pergunta mais interessante seja outra

Em vez de perguntar se o Astra é a AGI, talvez seja mais útil perguntar se ele representa o primeiro modelo que tornou a AGI uma possibilidade prática e imediata.

Nesse ponto, a resposta parece muito mais próxima de um sim.

O lançamento reúne três características que, quando aparecem juntas, mudam o significado de um modelo de IA: raciocínio avançado, capacidade de utilizar ferramentas e autonomia para executar tarefas longas.

O desempenho no ARC-AGI-3 reforça essa percepção.

A capacidade cibernética crítica adiciona outro sinal de que estamos entrando em uma fase na qual os modelos já não são simplesmente sistemas que produzem conteúdo. Eles conseguem realizar ações complexas em ambientes digitais.

A OpenAI pode estar certa ao dizer que a era da AGI começou.

Mas talvez o significado dessa frase só fique claro daqui a alguns anos.

Se o Astra for seguido por modelos capazes de aprender continuamente, generalizar para ambientes completamente novos e executar trabalho intelectual complexo durante horas ou dias com pouca supervisão, poderemos olhar para setembro de 2026 como o momento em que a AGI começou de fato.

Se isso não acontecer, o Astra continuará sendo lembrado como um salto gigantesco, mas não como a chegada definitiva da inteligência artificial geral.

Por enquanto, a melhor conclusão é mais interessante do que um simples “sim” ou “não”: o Astra ainda não provou que a AGI chegou, mas tornou muito mais difícil argumentar que ela continua distante.

Apoie o Eurisko
Este conteúdo é independente, sem anúncios e feito por pessoas.
A inteligência artificial e as mudanças recentes do Google reduziram significativamente o alcance dos sites independentes. Se este conteúdo foi útil para você, considere apoiar o Eurisko e todo o ecossistema de projetos com qualquer valor.
Quero apoiar
Seguir
Renê Fraga é fundador e editor-chefe do Eurisko, ecossistema editorial independente dedicado à inteligência artificial, código aberto, tecnologia e cultura digital. Atuando com projetos online desde 1996, escreve há mais de 20 anos sobre tecnologia e inovação, acompanhando a evolução da internet e o impacto das novas tecnologias na forma como vivemos, trabalhamos e pensamos.
Nenhum comentário