OpenAI declara “era da AGI” com Astra, mas Anthropic tem uma resposta poderosa com Claude Fable 5.1

Renê Fraga
22 min de leitura

Principais destaques

  • A OpenAI deu um passo além da tradicional corrida por benchmarks e declarou que o GPT-6 Astra pode marcar o início da era da AGI, conceito que a própria empresa define em termos de autonomia e capacidade de realizar trabalho economicamente valioso.
  • O Claude Fable 5.1, da Anthropic, chega com uma estratégia diferente, concentrada em programação, pesquisa e tarefas longas que exigem que a IA trabalhe durante períodos maiores com pouca intervenção humana.
  • Os números não mostram uma vitória absoluta da OpenAI: Astra abre vantagem em várias avaliações, mas Fable 5.1 continua competitivo em programação, conhecimento e tarefas agentivas, além de apostar em custos menores para fluxos complexos.

A corrida entre OpenAI e Anthropic entrou em uma nova fase.

Durante anos, a disputa entre os principais laboratórios de inteligência artificial foi medida principalmente por quem conseguia responder melhor a perguntas, resolver problemas matemáticos, escrever código ou obter a maior pontuação em algum benchmark.

Agora, a competição está mudando.

Os modelos mais avançados estão sendo avaliados pela capacidade de realizar trabalho, operar computadores, utilizar ferramentas, manter contexto durante longos processos e tomar decisões intermediárias sem precisar receber uma instrução humana a cada passo.

É justamente nesse cenário que o GPT-6 Astra chegou.

A OpenAI não apresentou o novo modelo apenas como uma evolução do GPT-5.6 Sol. Greg Brockman, presidente da companhia, afirmou que o Astra pode representar o início da “era da AGI”, expressão que coloca o lançamento em uma categoria muito diferente de uma simples atualização de produto.

A Anthropic, entretanto, havia lançado dois dias antes o Claude Fable 5.1, seu modelo mais avançado para programação e trabalho intelectual.

A empresa não fez uma declaração equivalente sobre AGI. Em vez disso, concentrou o discurso em algo mais concreto: criar uma IA capaz de executar tarefas complexas de programação, pesquisa científica e conhecimento profissional por períodos prolongados, com maior velocidade e menor custo.

O resultado é uma disputa muito mais interessante do que uma simples comparação entre dois chatbots.

Astra quer provar que a IA já consegue fazer trabalho de verdade

A principal mudança trazida pelo Astra está na combinação entre raciocínio e ação.

A OpenAI afirma que o modelo consegue utilizar computadores e navegadores, escrever software, pesquisar informações e executar fluxos de trabalho com várias etapas. Em vez de simplesmente sugerir o que o usuário deveria fazer, a IA pode realizar partes significativas da tarefa.

Essa diferença é fundamental.

Imagine que alguém peça a uma IA para preparar uma análise financeira. Um chatbot tradicional poderia explicar como fazer o trabalho ou produzir uma primeira versão do relatório.

Um agente mais avançado pode pesquisar documentos, abrir planilhas, organizar os dados, executar cálculos, conferir inconsistências e produzir o documento final.

A inteligência deixa de ser apenas uma capacidade de resposta.

Ela começa a funcionar como capacidade operacional.

Esse é um dos motivos pelos quais a OpenAI considera o Astra tão importante para a discussão sobre AGI.

O argumento mais forte da OpenAI está nos testes de raciocínio

Um dos resultados que mais chamaram atenção foi obtido no ARC-AGI-3.

O Astra chegou a 99,9% em uma configuração específica, enquanto o GPT-5.6 Sol marcou 7,8% e o Claude Opus 5, da Anthropic, registrou 30,2%.

O benchmark é interessante porque tenta avaliar uma característica diferente da simples memorização.

O sistema recebe ambientes novos e precisa descobrir suas regras, entender como funcionam e encontrar maneiras de alcançar objetivos.

Em outras palavras, o desafio está menos relacionado a “saber a resposta” e mais a descobrir como o problema funciona.

Esse tipo de generalização é especialmente importante para a AGI.

Um sistema verdadeiramente geral não poderia depender apenas de situações que já encontrou durante o treinamento. Ele precisaria conseguir entrar em um cenário desconhecido, construir uma representação do problema e adaptar sua estratégia.

O desempenho do Astra sugere que esse tipo de capacidade avançou significativamente.

Mas existe uma ressalva importante.

O próprio ARC Prize não considera o ARC-AGI-3 uma prova definitiva de AGI. O resultado demonstra uma capacidade muito relevante de generalização em ambientes específicos, mas não significa automaticamente que o modelo tenha adquirido todas as competências necessárias para atuar como uma inteligência geral no mundo real.

E há um detalhe importante sobre os 99,9%

O número de 99,9% não deve ser comparado de maneira simplista com todos os demais resultados.

A cifra foi obtida em condições específicas, enquanto a avaliação padrão produziu um resultado diferente. O ARC Prize mantém essas configurações separadas justamente porque elas medem o comportamento do modelo sob condições distintas.

Isso não diminui o resultado.

Mas muda a forma como ele deve ser interpretado.

Astra apresentou uma demonstração extraordinária de capacidade de generalização. Isso é diferente de provar que a AGI chegou.

Fable 5.1 mostra que a Anthropic está perseguindo outra definição de sucesso

Enquanto a OpenAI usa o Astra para sustentar uma narrativa de inteligência cada vez mais geral, a Anthropic está concentrando o Fable 5.1 em uma questão muito prática:

Quanto trabalho intelectual uma IA consegue realizar sozinha?

O modelo foi lançado como o mais avançado da empresa para programação e conhecimento profissional.

A Anthropic também destaca sua capacidade de conduzir tarefas longas, utilizar ferramentas e trabalhar em problemas que podem exigir muito mais do que uma única interação.

Isso coloca Fable 5.1 muito próximo da mesma tendência observada no Astra.

A diferença está principalmente no posicionamento.

A OpenAI está dizendo que a combinação dessas capacidades pode significar que a era da AGI já começou.

A Anthropic está dizendo, na prática, que modelos cada vez mais autônomos podem começar a assumir parcelas maiores do trabalho humano.

As duas ideias podem acabar levando ao mesmo destino.

Na programação, a diferença entre eles ficou pequena

A programação é talvez o melhor lugar para observar essa disputa.

No Terminal-Bench 4.0, o Astra alcançou 57,7%, enquanto o Fable 5.1 chegou a 55,8%. A diferença é pequena, especialmente considerando a dificuldade do teste.

No DeepSWE v1.1, porém, a vantagem do Astra foi maior.

O modelo da OpenAI marcou 74,1%, contra 67,4% do Fable 5.1.

Esses resultados sugerem que a OpenAI conseguiu reduzir significativamente a distância que existia em programação entre seus modelos anteriores e os sistemas da Anthropic.

Mas existe outro número que impede uma conclusão precipitada.

No AA Coding Agent Index, o Astra aparece com 67,0 pontos, enquanto o Fable 5 tinha 67,2 e o Opus 5 chegava a 68,1.

Ou seja, quando diferentes dimensões de programação são consideradas, a liderança não desaparece apenas porque um modelo venceu determinados benchmarks.

O que isso significa para desenvolvedores

A consequência mais importante talvez seja que a escolha entre OpenAI e Anthropic tende a depender cada vez menos de “qual modelo é mais inteligente”.

A pergunta passa a ser:

Qual deles consegue concluir melhor o meu trabalho?

Para um programador, isso pode significar avaliar quantas tarefas o agente consegue terminar sem intervenção, quantas vezes precisa ser corrigido e quanto custa manter uma sessão longa.

Para uma empresa, a métrica pode ser ainda mais simples: quantas horas de trabalho humano o sistema consegue economizar.

Essa mudança é muito mais significativa do que uma diferença de alguns pontos em um benchmark.

Na ciência, Astra abre uma vantagem relevante

Os resultados acadêmicos também favorecem o Astra em algumas avaliações.

No FrontierMath Tier 4 v2, o modelo marcou 97,6%, contra 87,8% do Fable 5.1.

No GPQA Diamond, um teste voltado a questões científicas de alto nível, Astra alcançou 96%, enquanto Fable 5.1 ficou em 93,7%.

Mas existe uma exceção importante.

No Humanity’s Last Exam com ferramentas, o Fable 5.1 registrou 65%, contra 57,2% do Astra.

Isso mostra mais uma vez por que não existe um único “placar da inteligência artificial”.

Um modelo pode dominar matemática e outro apresentar vantagem em determinadas tarefas de conhecimento geral ou resolução de problemas com ferramentas.

A diferença entre eles só aparece quando observamos um conjunto amplo de tarefas.

O uso do computador pode ser o verdadeiro campo de batalha

Talvez a característica mais importante do Astra não seja seu desempenho em uma prova matemática.

É sua capacidade de usar um computador como uma pessoa.

No OSWorld 2.0, que avalia tarefas executadas em ambientes computacionais, o Astra marcou 72,6%, acima dos 65,7% do Sol. A OpenAI também afirma que o modelo realiza essas tarefas em aproximadamente 40 minutos, contra cerca de 75 minutos do modelo anterior.

Esse tipo de capacidade pode mudar completamente o significado de um assistente de IA.

Se o modelo consegue utilizar aplicativos, navegar na internet, manipular documentos e operar interfaces, ele não precisa de uma integração especial para cada software.

Pode trabalhar com as mesmas ferramentas que uma pessoa utiliza.

Isso aproxima a inteligência artificial do conceito de funcionário digital.

E é justamente aí que a tese da AGI começa a ganhar uma dimensão econômica.

Fable 5.1 responde com eficiência e tarefas longas

A Anthropic está tentando vencer a mesma corrida por outro caminho.

O Fable 5.1 foi desenvolvido para reduzir o custo de tarefas agentivas complexas. A empresa afirma que o modelo pode ser até 45% mais barato em determinados fluxos de trabalho agentivos, graças principalmente à redução no custo de leitura de dados armazenados em cache.

Isso pode parecer um detalhe técnico.

Não é.

Um agente que trabalha durante horas pode consumir milhões de tokens. Se a IA precisa reler constantemente informações que já processou, o custo pode crescer rapidamente.

Reduzir o preço dessas operações significa tornar economicamente viável deixar a IA trabalhando por períodos maiores.

E esse é um ponto central da estratégia da Anthropic.

A corrida está deixando de ser por token

A OpenAI também percebeu essa mudança.

O Astra custa US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída no modo padrão. No modo rápido, o custo aumenta ainda mais.

Esses valores colocam o Astra em uma faixa semelhante à do Fable 5.1.

Greg Brockman argumenta, porém, que comparar apenas o preço dos tokens está se tornando menos útil.

O que importa seria quanto custa concluir uma tarefa.

Se um modelo mais caro por token resolve um problema utilizando menos etapas, o custo final pode ser menor.

Essa lógica é especialmente relevante para agentes.

A empresa afirma que, no DeepSWE v1.1, a configuração mais avançada do Astra pode reduzir o custo estimado por tarefa em cerca de 57% em relação ao Sol.

A batalha, portanto, começa a mudar de unidade de medida.

Não é mais apenas:

“Quanto custa usar a IA?”

Passa a ser:

“Quanto custa deixar a IA terminar o trabalho?”

Anthropic também está avançando em cibersegurança

A disputa fica ainda mais interessante quando chegamos à segurança.

Astra é o primeiro modelo da OpenAI classificado como “Crítico” em capacidades de cibersegurança dentro do Preparedness Framework da empresa.

Segundo a OpenAI, ele consegue encontrar vulnerabilidades desconhecidas e construir cadeias de exploração contra sistemas bem protegidos quando recebe as ferramentas e os acessos necessários. Durante avaliações, encontrou duas vulnerabilidades zero-day que foram reportadas aos responsáveis pelos softwares.

A Anthropic também está aumentando as capacidades de seus modelos nessa área.

O Fable 5.1 passou a permitir a identificação de vulnerabilidades em software, mas a empresa mantém restrições para tarefas mais avançadas, incluindo geração de exploits e determinados tipos de testes de penetração.

A diferença é reveladora.

As duas empresas reconhecem que IA pode ser uma ferramenta poderosa para defesa cibernética.

Mas quanto melhor o modelo fica em encontrar falhas, maior é o risco de que a mesma habilidade seja utilizada para atacar sistemas.

Por isso, os modelos mais poderosos estão sendo liberados com controles diferentes dependendo da capacidade envolvida.

Anthropic criou o Mythos 5.1 para as áreas mais sensíveis

A estratégia da Anthropic vai ainda mais longe.

Junto com o Fable 5.1, a empresa apresentou o Claude Mythos 5.1, destinado a aplicações avançadas de pesquisa e cibersegurança.

O modelo está sendo disponibilizado de maneira restrita por meio do Project Glasswing, em vez de ser oferecido imediatamente ao público geral.

Isso cria uma arquitetura interessante para a competição.

A Anthropic possui um modelo mais geral, voltado para uso amplo, e outro sistema direcionado a aplicações de fronteira que exigem controles adicionais.

A OpenAI, por outro lado, está colocando o Astra no centro de sua nova geração de modelos, mas restringindo determinadas capacidades cibernéticas avançadas a defensores confiáveis por meio do Daybreak.

Apesar das diferenças, a filosofia é parecida.

Quanto maior a capacidade, maior precisa ser o controle sobre onde e como ela pode ser utilizada.

A questão da AGI continua sem uma resposta simples

É tentador olhar para os resultados do Astra e concluir que a AGI chegou.

Mas existe um problema fundamental.

Não existe uma definição universalmente aceita de AGI.

A própria OpenAI utiliza uma definição baseada em sistemas altamente autônomos capazes de superar humanos na maior parte do trabalho economicamente valioso. Ao mesmo tempo, Greg Brockman reconheceu que não existe necessariamente um momento único e perfeitamente identificável em que todos concordarão que a AGI começou.

Isso deixa espaço para interpretações diferentes.

Para alguém que define AGI como uma máquina capaz de realizar grande parte do trabalho intelectual digital, Astra pode parecer muito próximo do objetivo.

Para quem exige aprendizado contínuo, adaptação irrestrita, autonomia prolongada e desempenho confiável em praticamente qualquer ambiente do mundo real, ainda faltam demonstrações.

E é justamente por isso que a comparação com Fable 5.1 é tão importante.

Talvez Astra e Fable 5.1 estejam seguindo caminhos diferentes para o mesmo destino

O Astra parece apostar mais fortemente na amplitude.

A OpenAI quer demonstrar que um único sistema pode raciocinar, programar, pesquisar, utilizar computadores, trabalhar com ciência, operar ferramentas e atuar em cibersegurança.

O Fable 5.1 parece apostar na profundidade operacional.

A Anthropic quer que o modelo seja excelente em programação, pesquisa e tarefas complexas de longa duração, ao mesmo tempo em que melhora velocidade, eficiência e custos.

São duas interpretações diferentes do que significa construir uma IA capaz de trabalhar.

ÁreaGPT-6 AstraClaude Fable 5.1
ARC-AGI-399,9%*Não divulgado
FrontierMath Tier 4 v297,6%87,8%
GPQA Diamond96%93,7%
Terminal-Bench 4.057,7%55,8%
DeepSWE v1.174,1%67,4%
Humanity’s Last Exam com ferramentas57,2%65%
OSWorld 2.072,6%Dados não diretamente comparáveis
ExploitBench100%Não divulgado
Foco declaradoInteligência geral e agentesCoding, pesquisa e conhecimento
Estratégia de custoCusto por tarefaForte redução em tarefas agentivas

* Resultado do Astra em uma configuração específica do teste, não equivalente a uma certificação de AGI.

Os números favorecem o Astra em várias das avaliações mais importantes.

Mas a tabela também mostra algo essencial: Fable 5.1 continua vencendo ou disputando de perto em determinadas categorias.

Não existe, portanto, uma distância tecnológica que permita dizer que a Anthropic ficou para trás.

O verdadeiro teste pode acontecer fora dos benchmarks

Existe uma pergunta que nenhum desses números consegue responder completamente.

O que acontece quando uma empresa entrega um problema real para Astra e Fable 5.1 e simplesmente deixa os dois trabalharem?

Esse cenário é muito mais próximo da realidade econômica.

Um engenheiro não precisa de uma IA que consiga 74% em um benchmark específico. Ele precisa de um agente capaz de investigar um sistema desconhecido, identificar um problema, escrever uma correção, testar a solução e saber quando algo deu errado.

Um cientista não precisa apenas de respostas corretas.

Precisa de uma IA que consiga formular hipóteses, analisar dados, executar ferramentas, revisar resultados e continuar investigando quando a primeira hipótese falha.

É nesse ambiente que a diferença entre modelo e agente desaparece.

E é também onde a discussão sobre AGI começa a ficar realmente séria.

A OpenAI ganhou a narrativa. A Anthropic ainda pode ganhar o mercado

O lançamento do Astra colocou a OpenAI novamente no centro da corrida pela inteligência artificial.

A frase de Brockman, ao declarar “bem-vindos à era da AGI”, transformou o lançamento em um possível marco histórico.

Mas uma declaração não encerra a discussão.

O Astra terá de provar sua capacidade em milhões de tarefas reais, durante períodos prolongados, em ambientes que não foram desenhados para favorecer seus pontos fortes.

A Anthropic enfrenta um desafio diferente.

O Fable 5.1 não precisa provar que inaugurou a AGI.

Se conseguir se tornar o sistema que programadores, pesquisadores e empresas preferem deixar trabalhando durante horas, já terá conquistado uma posição extremamente valiosa.

Essa talvez seja a parte mais fascinante da atual corrida.

A OpenAI está tentando definir a próxima era da IA. A Anthropic está tentando definir como essa era será utilizada no trabalho.

E talvez as duas estejam certas.

A AGI não precisa necessariamente aparecer como um momento cinematográfico em que uma máquina subitamente se torna consciente e declara que ultrapassou a humanidade.

Pode chegar de maneira muito mais silenciosa.

Primeiro, uma IA termina uma tarefa que levaria oito horas.

Depois, outra consegue conduzir uma pesquisa inteira.

Em seguida, agentes começam a operar computadores, escrever software, analisar documentos e resolver problemas sem supervisão constante.

Quando percebermos, talvez a pergunta já não seja mais “a AGI chegou?”

Será:

“Quanto do nosso trabalho já está sendo feito por ela?”

O Astra pode ser o modelo que fez a OpenAI se sentir confortável para declarar que essa transição começou.

O Fable 5.1 mostra que a Anthropic não precisa aceitar a definição da rival para participar da mesma corrida.

E, pela primeira vez, a competição parece menos centrada em quem possui o melhor chatbot e mais em quem consegue construir a primeira inteligência artificial que realmente faz o trabalho por nós.

Apoie o Eurisko
Este conteúdo é independente, sem anúncios e feito por pessoas.
A inteligência artificial e as mudanças recentes do Google reduziram significativamente o alcance dos sites independentes. Se este conteúdo foi útil para você, considere apoiar o Eurisko e todo o ecossistema de projetos com qualquer valor.
Quero apoiar
Seguir
Renê Fraga é fundador e editor-chefe do Eurisko, ecossistema editorial independente dedicado à inteligência artificial, código aberto, tecnologia e cultura digital. Atuando com projetos online desde 1996, escreve há mais de 20 anos sobre tecnologia e inovação, acompanhando a evolução da internet e o impacto das novas tecnologias na forma como vivemos, trabalhamos e pensamos.
Nenhum comentário