- O benchmark em que Argon passou o Claude 🚀
- No terminal, a conversa muda de tom 💻
- A verdadeira novidade pode estar no milhão de tokens 🧠
- Só existe um problema: um milhão de tokens custa caro 💸
- E ainda existe uma questão maior: qualidade em 1 milhão
- Qual modelo faz mais sentido? 🤔
- O Argon ainda está atrás de uma porta 🚪
- Como testar quando a Google abrir o acesso 🧪
- Então o Gemini 4 Argon é melhor que Claude?
Principais destaques
- 77,9% no DeepSWE: Gemini 4 Argon supera Claude Opus 5.5 nesse teste, mas o resultado foi calculado pela própria Google.
- 1 milhão de tokens: o novo limite de saída abre espaço para migrações gigantescas e tarefas de programação que antes precisavam ser divididas.
- Acesso restrito: por enquanto, Argon está disponível apenas para defensores cibernéticos do programa Fairwind, sem previsão para liberação ampla.
O Gemini 4 Argon chega com uma promessa difícil de ignorar: produzir até 1 milhão de tokens em uma única resposta e atacar problemas de programação que exigem horas de trabalho.
Nos benchmarks publicados até agora, porém, a história é menos simples.
O modelo da Google alcança 77,9% no DeepSWE v1.1, acima dos 74,2% do Claude Opus 5.5. Mas perde para o próprio Claude no Terminal-Bench 4.0 e fica atrás do GPT-6 Astra no FrontierSWE v2.
Em outras palavras: Argon parece muito forte. Só ainda não parece ser o campeão absoluto.
O benchmark em que Argon passou o Claude 🚀
O melhor cartão de visitas do novo modelo é o DeepSWE v1.1.
| Benchmark | Gemini 4 Argon | Principal rival |
|---|---|---|
| DeepSWE v1.1 | 77,9% | Claude Opus 5.5: 74,2% |
| Terminal-Bench 4.0 | 57,4% | Claude Opus 5.5: 66,4% |
| FrontierSWE v2 | 55,0% | GPT-6 Astra: 65,5% |
| Code Arena WebDev | 8º lugar | 7 modelos à frente |
Há, entretanto, uma ressalva importante.
🔎 Quem fez o teste importa: o resultado de 77,9% do Argon foi calculado pela própria Google, usando seu próprio ambiente de avaliação e o nível máximo de raciocínio.
Os números dos concorrentes vieram de outras fontes, como sistemas de avaliação da Anthropic e rankings públicos.
Isso não invalida o resultado. Mas significa que o número deve ser interpretado como um sinal de desempenho, e não como uma prova definitiva de superioridade.
💡 O Argon parece ter entrado na corrida para valer, mas ainda falta a etapa mais importante: deixar outras equipes colocarem o modelo para trabalhar em seus próprios ambientes.
No terminal, a conversa muda de tom 💻
Quando o cenário muda, o desempenho do Argon também muda.
No Terminal-Bench 4.0, o Gemini 4 Argon marca 57,4%, enquanto o Claude Opus 5.5 chega a 66,4%.
No FrontierSWE v2, a diferença aumenta: Argon fica em 55%, contra 65,5% do GPT-6 Astra.
E há uma característica importante nesse último benchmark: cada tarefa pode levar até 20 horas.
Isso ajuda a explicar por que não existe um único ranking capaz de responder qual é “o melhor modelo para programar”.
Um modelo pode ser excelente para corrigir um bug em uma tentativa e menos eficiente quando precisa passar horas explorando um terminal, executando ferramentas, revisando resultados e tentando novamente.
A verdadeira novidade pode estar no milhão de tokens 🧠
O número mais chamativo do anúncio talvez nem seja o benchmark.
É o limite de saída.
Modelos Gemini anteriores ficavam limitados a cerca de 64 mil tokens de saída. O Argon aumenta esse teto para 1 milhão.
É um salto de aproximadamente 15 vezes.
Na prática, isso muda o tipo de problema que um agente de programação pode tentar resolver em uma única execução.
🛠️ Pense em uma migração gigantesca: em vez de transformar um projeto em dezenas de pequenas tarefas, o agente pode trabalhar com uma quantidade muito maior de código e produzir uma resposta extremamente extensa.
A Google cita alguns casos para ilustrar esse potencial:
• substituição de 32 mil linhas de código SIMD no decodificador de vídeo libgav1;
• uma aceleração de 2,7 vezes em relação à implementação em Rust, mantendo a mesma saída de vídeo;
• conversões de C/C++ para Rust de até 800 mil linhas no kernel Zircon do Fuchsia;
• identificação, validação e correção automatizada de vulnerabilidades.
É o tipo de capacidade que faz mais sentido para migrações, ports, refatorações e grandes transformações de código do que simplesmente para escrever uma função de 50 linhas.
Só existe um problema: um milhão de tokens custa caro 💸
Quanto mais o modelo escreve, maior tende a ser a conta.
Testes da Artificial Analysis indicaram que o Argon produziu aproximadamente 62 mil tokens de saída por tarefa, contra 27 mil do GPT-6 Astra.
Ou seja, mais de duas vezes mais tokens.
Esse detalhe é fundamental porque comparar apenas o preço por milhão de tokens pode produzir uma impressão enganosa.
| Modelo | Entrada / 1M | Saída / 1M | Cache read / 1M |
|---|---|---|---|
| Gemini 4 Argon, introdutório | US$ 2 | US$ 10 | US$ 0,10 |
| Gemini 4 Argon, padrão | US$ 4 | US$ 20 | US$ 0,20 |
| Claude Opus 5.5 | US$ 4 | US$ 20 | US$ 0,20 |
| GPT-6 Astra | US$ 10 | US$ 50 | US$ 1,00 |
Na tarifa promocional, o Argon parece bastante competitivo.
A Artificial Analysis calculou cerca de US$ 1,99 por tarefa em seu Intelligence Index, contra US$ 3,26 para o GPT-6 Astra.
Mas há uma pegadinha.
Quando o desconto introdutório acabar, a estimativa sobe para aproximadamente US$ 3,98 por tarefa. Isso coloca o Argon em cerca de 1,2 vez o custo do Astra naquele teste.
💰 O paradoxo: o modelo é mais barato por token, mas pode consumir tantos tokens que a vantagem desaparece.
E ainda existe uma questão maior: qualidade em 1 milhão
Ter capacidade para gerar 1 milhão de tokens não significa necessariamente que o modelo seja igualmente bom durante toda essa geração.
Nos testes citados, o desempenho do Google em GraphWalks cai de 99,7% com até 128 mil tokens para 84,2% entre 256 mil e 1 milhão.
E existe outro vazio importante.
Os benchmarks analisados ainda não demonstram de maneira convincente a qualidade do código produzido próximo do limite de 1 milhão de tokens.
Portanto, o número é impressionante como capacidade técnica. Mas ainda falta provar quanto dessa capacidade é realmente útil.
Qual modelo faz mais sentido? 🤔
A resposta depende do trabalho.
Para uma correção de bug em um repositório real, Argon merece ser testado. Seu resultado no DeepSWE é forte.
Para sessões longas de terminal, os números favorecem o Claude Opus 5.5.
Para tarefas extremamente longas de engenharia e pesquisa, o GPT-6 Astra lidera o FrontierSWE v2, embora com um custo muito maior.
E para desenvolvimento de interfaces web, o Argon ainda tem trabalho pela frente: ocupa apenas a oitava posição no Code Arena WebDev.
A fotografia atual fica mais ou menos assim:
| Tarefa | Modelo favorecido pelos dados |
|---|---|
| Correção de bugs em uma tentativa | Gemini 4 Argon, para testar |
| Sessões longas de terminal | Claude Opus 5.5 |
| Engenharia de longo horizonte | GPT-6 Astra |
| Front-end / WebDev | Modelos acima do Argon no ranking |
| Execuções sensíveis a custo | Argon, enquanto durar o desconto |
Isso pode mudar rapidamente quando o modelo chegar a mais usuários.
O Argon ainda está atrás de uma porta 🚪
Por enquanto, quase ninguém pode fazer esse teste por conta própria.
O acesso começou exclusivamente pelo programa Fairwind, voltado a defensores cibernéticos confiáveis.
A Google descreveu três fases:
1️⃣ Fairwind: acesso já disponível para defensores cibernéticos participantes.
2️⃣ API e AI Ultra: acesso para clientes pagos da API e assinantes do Google AI Ultra, ainda sem data anunciada.
3️⃣ Disponibilidade ampla: desenvolvedores, empresas e consumidores em geral, também sem prazo divulgado.
Há ainda uma peculiaridade técnica.
O modelo não possui, segundo as informações disponíveis, um model ID público para utilização normal na API. Ele também não aparece na página pública de preços do Gemini.
Portanto, quem encontrar algum código na internet com um suposto identificador do Argon deve desconfiar.
Como testar quando a Google abrir o acesso 🧪
A melhor maneira de avaliar o Argon não será simplesmente reproduzir os benchmarks da Google.
Será colocá-lo para trabalhar no código que realmente importa.
1️⃣ Use problemas reais: selecione de 10 a 20 tarefas do próprio repositório, incluindo bugs, refatorações e migrações.
2️⃣ Repita os testes: rode cada tarefa cinco vezes. Isso ajuda a reduzir o impacto de resultados ocasionais.
3️⃣ Padronize o ambiente: mesmos prompts, ferramentas, limites de tempo e níveis de raciocínio para todos os modelos.
4️⃣ Calcule custo por solução: não basta olhar preço por token. O que importa é quanto custa chegar a uma solução funcional.
5️⃣ Teste a escala: avalie gerações de 100 mil, 500 mil e 1 milhão de tokens e compile o código a cada etapa.
6️⃣ Faça a validação completa: rode toda a suíte de testes e uma verificação de segurança antes de aceitar o código.
7️⃣ Separe erro de recusa: uma coisa é o modelo dizer que não consegue realizar uma tarefa. Outra é produzir uma solução errada acreditando que está certa.
Essa última distinção pode ser especialmente importante. Os dados citados para o AA-Omniscience apontam para 50% de precisão e 15% de alucinação no Argon.
Então o Gemini 4 Argon é melhor que Claude?
Ainda não dá para afirmar.
O que os números mostram é algo mais interessante: a Google conseguiu colocar o Gemini 4 Argon entre os modelos de programação mais competitivos, mas não apresentou evidências suficientes para dizer que ele domina a categoria.
O 77,9% no DeepSWE é excelente.
Os 57,4% no Terminal-Bench e os 55% no FrontierSWE mostram que o resultado não se repete em todos os ambientes.
E o milhão de tokens é uma capacidade extraordinária, mas ainda precisa provar que é uma vantagem prática e economicamente racional.
Por enquanto, portanto, o Argon parece menos um “Claude killer” e mais uma nova peça pesada na caixa de ferramentas dos desenvolvedores.
A grande virada acontecerá quando ele deixar o laboratório controlado da Google e começar a enfrentar código real, bugs reais e contas reais de API. É aí que saberemos se aquele milhão de tokens é uma superpotência ou apenas um tanque enorme de combustível.
