O que é o NVIDIA Nemotron 3 Ultra? O modelo de pesos abertos de 550 bilhões de parâmetros feito para agentes

Renê Fraga
14 min de leitura

Principais destaques

  • 🧠 Lançado em 1º de junho de 2026 no Computex de Taipei, o Nemotron 3 Ultra é um modelo de Mistura de Especialistas (MoE) com 550 bilhões de parâmetros totais, mas apenas 55 bilhões ativados por token, uma proporção de esparsidade de 10 vezes que entrega desempenho de fronteira com custo computacional muito mais próximo de um modelo denso bem menor.
  • 🏗️ Sua arquitetura híbrida combina camadas Mamba (eficientes para contexto longo) com camadas de atenção tradicionais (fortes em raciocínio denso), suportando uma janela de contexto de até 1 milhão de tokens, voltada especificamente para agentes autônomos de longa duração.
  • 📜 O modelo é distribuído com pesos totalmente abertos, sob a licença OpenMDW, e já está disponível no Hugging Face, na NVIDIA NIM, e em provedores como DeepInfra e OpenRouter, com requisitos de hardware que vão de clusters multi-GPU a acesso via API sem infraestrutura própria.

A maioria dos grandes modelos de linguagem é construída para responder perguntas.

O NVIDIA Nemotron 3 Ultra foi construído para tomar ações. Anunciado por Jensen Huang no palco do Computex, em Taipei, em 1º de junho de 2026, o Nemotron 3 Ultra é um modelo de pesos abertos com 550 bilhões de parâmetros, desenhado especificamente para cargas de trabalho agênticas: raciocínio em várias etapas, uso de ferramentas, planejamento complexo e conclusão autônoma de tarefas.

Ele ocupa o topo da família Nemotron da NVIDIA e compete diretamente com os melhores modelos de fronteira de código fechado em benchmarks de raciocínio, sendo totalmente aberto para que desenvolvedores e empresas rodem em sua própria infraestrutura.

Este artigo detalha o que é o Nemotron 3 Ultra, o que o diferencia de outros modelos grandes, como ele se compara a concorrentes, e como começar a usá-lo hoje, com prompts prontos para testar.

🏔️ Onde o Nemotron 3 Ultra se encaixa na família da NVIDIA

A NVIDIA vem construindo, de forma discreta, uma das famílias de modelos de pesos abertos mais completas do ecossistema. A geração Nemotron 3 cobre três tamanhos:

  • 🐜 Nemotron 3 Nano: 30 bilhões de parâmetros totais, ativando até 3 bilhões por token, voltado para cargas de trabalho eficientes e específicas
  • ⚖️ Nemotron 3 Super: cerca de 120 bilhões de parâmetros totais, com até 12 bilhões ativos por token, posicionado para uso multiagente
  • 🏔️ Nemotron 3 Ultra: o carro-chefe, com 550 bilhões de parâmetros totais e 55 bilhões ativos por token, voltado para fluxos de trabalho de IA complexos

O Ultra é o modelo mais capaz da linha, posicionado pela NVIDIA não como um chatbot de propósito geral, mas como um motor de raciocínio de nível de infraestrutura, para sistemas que precisam planejar, raciocinar sobre contextos longos, e interagir com ferramentas externas.

🧩 O que torna o Nemotron 3 Ultra diferente

Com 550 bilhões de parâmetros totais, o Nemotron 3 Ultra está em companhia rara. Mas a contagem de parâmetros sozinha não explica por que esse modelo importa; algumas decisões arquiteturais e de treinamento o diferenciam.

Mistura de Especialistas, não um modelo denso. Esse é o ponto técnico mais importante e frequentemente mal compreendido: apesar dos 550 bilhões de parâmetros totais, o modelo ativa apenas 55 bilhões por token, uma proporção de esparsidade de 10 vezes. Isso significa que o custo computacional real de cada inferência fica muito mais próximo de um modelo denso de 55 bilhões de parâmetros do que de um modelo denso completo de 550 bilhões, entregando qualidade de raciocínio de fronteira com throughput bem mais alto.

Arquitetura híbrida Mamba-Transformer. Modelos puramente baseados em transformer são poderosos, mas consomem muita memória em contextos longos. Modelos de espaço de estado puros, como o Mamba, são eficientes em memória, mas têm um teto de precisão conhecido em tarefas de raciocínio complexo. A aposta da NVIDIA é um híbrido: camadas Mamba cuidam da modelagem eficiente de sequências de longo alcance (crítico para contextos acima de 200 mil tokens), enquanto camadas de atenção tradicionais cuidam do raciocínio denso e dos padrões que os benchmarks recompensam. O modelo também incorpora uma técnica chamada LatentMoE, que comprime tokens em um espaço latente de baixa dimensão antes do roteamento entre especialistas, permitindo quatro vezes mais especialistas pelo mesmo custo de inferência, além de camadas de Predição de Múltiplos Tokens (MTP), que preveem vários tokens futuros em uma única passagem, melhorando a coerência do raciocínio em cadeia e permitindo decodificação especulativa nativa.

Contexto de até 1 milhão de tokens. Graças às camadas Mamba-2, que oferecem complexidade linear em relação ao tamanho da sequência, o modelo consegue manter estado de agente, registros e planos ao longo de sessões prolongadas, algo essencial para tarefas agênticas que envolvem documentos longos ou bases de código inteiras.

Pós-treinamento com destilação de múltiplos professores. Em vez de depender apenas de ajuste fino supervisionado e aprendizado por reforço tradicional, a NVIDIA introduziu uma técnica chamada Destilação On-Policy Multi-Professor (MOPD): mais de dez modelos professores especializados guiam o treinamento a partir das próprias tentativas geradas pelo modelo estudante, em código, raciocínio, uso de ferramentas e sequências de ação de agente. Essa etapa vem depois de uma fase de aprendizado por reforço com recompensas verificáveis (RLVR), e é o que dá ao modelo uma generalização mais forte em fluxos de trabalho agênticos, em vez de apenas um bom desempenho isolado em uma categoria de benchmark.

📊 Desempenho em benchmarks: como ele se compara

Medido em hardware NVIDIA GB200 NVL72, contra o GLM-4.5-355B-A32B e o Kimi-K2-1026B-A33B, o modelo base do Nemotron 3 Ultra entrega os seguintes resultados:

BenchmarkNemotron 3 UltraGLM-4.5-355B-A32BKimi-K2-1026B-A33B
MMLU Pro79,065,669,3
MMLU89,186,388,0
Código85,376,275,3
Matemática85,472,179,5
Senso comum81,081,381,6
Multilíngue89,083,384,2
Throughput de pico5x1x~2,5x

Vale destacar o throughput: segundo a NVIDIA, o Nemotron 3 Ultra atinge de 5,9x a 1,6x mais throughput de inferência do que concorrentes como o GLM-5.1-754B-A40B, o Kimi-K2.6-1T-A32B e o Qwen-3.5-397B-17B, dependendo da configuração de entrada e saída, o que reforça o argumento central do modelo: qualidade de raciocínio de fronteira a um custo computacional muito mais próximo de um modelo denso de 55 bilhões de parâmetros. O modelo também suporta dez idiomas, incluindo português brasileiro.

🔓 Pesos abertos, acesso real

Vale enfatizar isso: “pesos abertos” significa que os parâmetros do modelo podem ser baixados publicamente, você pode rodá-los em seus próprios servidores, fazer ajuste fino e inspecioná-los sem passar por uma API comercial. O Nemotron 3 Ultra é distribuído sob a licença OpenMDW (Open Model, Weights & Data License), versão 1.1, liberado tanto para uso comercial quanto não comercial. Para empresas com requisitos rígidos de privacidade de dados, ou times que querem personalizar o comportamento do modelo, essa é uma diferença real em relação a modelos como o GPT-4o ou o Claude.

A NVIDIA distribui o Nemotron 3 Ultra por alguns caminhos:

  • 🤗 Hugging Face: para download direto dos pesos, com versões em BF16 (nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16) e quantizada em NVFP4
  • 📦 NVIDIA NIM: containers Docker prontos para produção, com o mecanismo de inferência já otimizado, disponíveis em build.nvidia.com
  • 🌐 Provedores de API terceirizados: como DeepInfra e OpenRouter, já indexando o modelo para acesso sem necessidade de hospedagem própria, com preços competitivos (exemplo citado por analistas independentes: cerca de US$ 0,37 por milhão de tokens de entrada e US$ 1,08 por milhão de saída)

🖥️ Requisitos de hardware para rodar localmente

Os requisitos são substanciais. O modelo completo em BF16 exige uma configuração multi-GPU (o equivalente a 8 GPUs H100, ou 4 GPUs GB200 como requisito mínimo citado pela própria NVIDIA). A versão quantizada em NVFP4, formato nativo de pré-treinamento do modelo, oferece um caminho de autohospedagem mais prático para times com infraestrutura Blackwell mais recente. Para quem não tem acesso a hardware da classe H100 ou superior, o acesso via API, seja pela NVIDIA diretamente ou por provedores como DeepInfra e OpenRouter, é o ponto de partida mais prático.

Prompt para avaliar se vale a pena autohospedar o modelo no seu caso:

Com base na minha infraestrutura de GPU disponível, descrita abaixo,
avalie se faz sentido autohospedar o Nemotron 3 Ultra (versão NVFP4 ou
BF16), ou se o mais indicado seria acessá-lo via API de um provedor
terceirizado. Considere custo de infraestrutura, volume esperado de
requisições e requisitos de privacidade de dados.

Minha infraestrutura de GPU disponível (ou orçamento mensal estimado):
[DESCREVA SEU HARDWARE OU ORÇAMENTO]

Volume estimado de requisições por dia:
[DESCREVA O VOLUME ESPERADO]

🤖 O que “feito para agentes” realmente significa

A frase “otimizado para tarefas agênticas” costuma ser usada de forma vaga. No caso do Nemotron 3 Ultra, isso se traduz em capacidades concretas: decomposição de tarefas em várias etapas, uso de ferramentas e chamadas de função estruturadas, e retenção de contexto ao longo de sessões longas, sustentando decisões arquiteturais ao longo de sessões de codificação inteiras, sintetizando evidências contraditórias entre centenas de fontes de pesquisa, ou verificando restrições em projetos complexos com milhares de condições.

Prompt de teste para decomposição de tarefa em várias etapas:

Você é um agente de planejamento. Divida a tarefa abaixo em subtarefas
claras e sequenciais, identificando quais etapas podem rodar em paralelo
e quais dependem do resultado de etapas anteriores. Para cada subtarefa,
indique qual ferramenta (busca na web, execução de código, consulta a
banco de dados) seria necessária, se houver.

Tarefa completa:
[DESCREVA UM OBJETIVO COMPLEXO E DE VÁRIAS ETAPAS]

Prompt de teste para uso de ferramentas com chamada de função:

Você tem acesso às seguintes ferramentas: busca_web(consulta),
executa_codigo(codigo), consulta_banco(query_sql). Com base na pergunta
abaixo, identifique exatamente qual ferramenta (ou sequência de
ferramentas) você chamaria, e com quais argumentos, antes de dar a
resposta final.

Pergunta:
[DESCREVA UMA PERGUNTA QUE EXIGE DADOS EXTERNOS OU CÁLCULO]

🔗 Compatibilidade com frameworks de agentes

O Nemotron 3 Ultra funciona com frameworks padrão do ecossistema de agentes, incluindo LangChain (via endpoint compatível com OpenAI), LlamaIndex, CrewAI e AutoGen, todos se conectando através da camada de API padrão ou de endpoints da NVIDIA NIM.


O NVIDIA Nemotron 3 Ultra representa um avanço real na fronteira de modelos de pesos abertos: 550 bilhões de parâmetros totais, mas apenas 55 bilhões ativados por token, graças a uma arquitetura híbrida de Mistura de Especialistas que combina camadas Mamba e de atenção, sustentando contexto de até 1 milhão de tokens e um pipeline de pós-treinamento que usa mais de dez modelos professores especializados para melhorar generalização em tarefas agênticas.

Com pesos totalmente abertos sob a licença OpenMDW, e caminhos de acesso que vão de autohospedagem em hardware NVIDIA de ponta a APIs de provedores terceirizados, o modelo dá a desenvolvedores e empresas uma alternativa genuína aos modelos de fronteira fechados, especialmente para quem precisa rodar agentes de longa duração com controle total sobre a infraestrutura.

Apoie o Eurisko
Este conteúdo é independente, sem anúncios e feito por pessoas.
A inteligência artificial e as mudanças recentes do Google reduziram significativamente o alcance dos sites independentes. Se este conteúdo foi útil para você, considere apoiar o Eurisko e todo o ecossistema de projetos com qualquer valor.
Quero apoiar
Seguir
Renê Fraga é fundador e editor-chefe do Eurisko, ecossistema editorial independente dedicado à inteligência artificial, código aberto, tecnologia e cultura digital. Atuando com projetos online desde 1996, escreve há mais de 20 anos sobre tecnologia e inovação, acompanhando a evolução da internet e o impacto das novas tecnologias na forma como vivemos, trabalhamos e pensamos.
Nenhum comentário