Principais destaques
- 🔌 O Claude Desktop e o Claude Cowork têm um recurso oficial chamado “Configurar inferência de terceiros” (third-party inference), que permite trocar o modelo por trás da interface por qualquer gateway compatível com a API de mensagens da Anthropic, mantendo toda a experiência do aplicativo.
- 💰 Isso abre a porta para rodar a interface do Claude usando provedores como OpenRouter, gateways corporativos, ou até modelos gratuitos ou de baixo custo de terceiros, pagando bem menos do que a assinatura completa da Anthropic para tarefas de baixo risco.
- ⚠️ Modelos gratuitos costumam ter contrapartidas, como o uso dos dados enviados para melhorar o modelo durante o período gratuito, então vale reservar essa rota para tarefas de baixo risco, e nunca colar chaves de API em ferramentas de terceiros sem antes revisar o que elas fazem com esses dados.
Em 31 de março de 2026, a Anthropic publicou acidentalmente boa parte do código-fonte do Claude Code dentro de um pacote do npm, através de um arquivo de mapa de código (source map) que não deveria estar público.
Em poucas horas, o código foi espelhado em milhares de repositórios no GitHub, alguns acumulando dezenas de milhares de estrelas antes que a empresa começasse a enviar notificações de remoção.
A Anthropic confirmou publicamente que se tratou de um erro humano de empacotamento, não uma falha de segurança, e que nenhum dado de cliente ou credencial foi exposto, mas a repercussão do episódio ainda assim expôs decisões internas de arquitetura do produto e recursos ainda não lançados.
Esse episódio reacendeu um interesse que já existia: rodar a experiência do Claude usando outros modelos por trás da interface. E, ao contrário do que se poderia imaginar, isso não exige nenhum tipo de gambiarra ou violação de termos de uso. A Anthropic disponibiliza oficialmente um recurso para isso, chamado inferência de terceiros.
Este guia explica como esse recurso funciona, como configurá-lo, e como usar modelos gratuitos ou mais baratos para tarefas do dia a dia, reservando o Claude “oficial” para o que realmente exige o melhor raciocínio disponível.
🔌 O que é a inferência de terceiros no Claude Desktop e no Cowork
Diferente do que muita gente pensa, o Claude Desktop (e, dentro dele, o Claude Cowork) não está travado ao modelo da própria Anthropic. Existe um modo oficial, chamado “Cowork em inferência de terceiros” (Cowork on third-party inference, ou 3P), que permite apontar o aplicativo para qualquer gateway que implemente a API de mensagens da Anthropic. Isso inclui provedores como AWS Bedrock, Google Vertex AI, Azure AI Foundry, gateways corporativos internos, e serviços de terceiros como OpenRouter.
Na prática, isso significa que toda a camada de interface, o painel de projetos, as skills, os plugins, os servidores MCP e os controles administrativos continuam os mesmos. Só o modelo por trás dessa experiência muda. Esse recurso resolve algumas necessidades reais: dar uma resposta objetiva quando o time jurídico pergunta onde exatamente a inferência está acontecendo, contornar limitações de taxa quando a Anthropic está sobrecarregada, e usar um modelo mais barato ou de código aberto quando a tarefa não exige a robustez de um modelo de fronteira.
⚙️ Como configurar a inferência de terceiros
O caminho para ativar esse recurso é o mesmo, independentemente de qual gateway você vai usar:
- Abra o Claude Desktop e vá em Ajuda → Solução de problemas → Ativar Modo Desenvolvedor
- O aplicativo reinicia e passa a exibir um novo menu Desenvolvedor na barra superior
- Vá em Desenvolvedor → Configurar inferência de terceiros
- Escolha a opção Gateway como tipo de conexão
- Preencha a URL base do gateway e a chave de API correspondente
- Adicione manualmente o identificador do modelo, ou deixe a descoberta automática de modelos ativada, se o gateway suportar
- Clique em Aplicar localmente, feche o Claude Desktop completamente e abra novamente
Vale destacar: você não precisa estar logado em uma conta pessoal da Anthropic para usar esse modo. É possível configurar a inferência de terceiros direto na tela inicial do aplicativo.
🌉 Usando um gateway para modelos gratuitos ou mais baratos
Uma abordagem específica, adotada por alguns desenvolvedores, é usar um pequeno proxy (por exemplo, hospedado em um Cloudflare Worker) que traduz as requisições no formato da Anthropic para o formato esperado por outro provedor de modelos, como o OpenCode. A ideia central é simples: o Claude continua sendo a interface, mas o provedor por trás muda para uma rota gratuita ou mais barata.
Esse tipo de configuração costuma envolver dois caminhos: um lane gratuito, voltado para modelos oferecidos sem custo por tempo limitado, e um lane pago, com um plano mensal de assinatura por valor fixo, com limites de uso expressos em dólares (por exemplo, um limite de 5 horas, um limite semanal e um limite mensal, cada um com um teto de gasto correspondente, em vez de um número vago de mensagens).
Prompt de teste seguro antes de usar em um repositório real:
Leia o arquivo project-notes.md.
Resuma o projeto em até 10 tópicos.
Crie um segundo arquivo chamado next-actions.md com uma lista curta de
próximos passos de implementação.
Não modifique o arquivo project-notes.md.
Esse tipo de teste, feito em uma pasta descartável, com anotações fictícias, é uma forma segura de verificar se o roteamento e o comportamento das ferramentas estão funcionando corretamente antes de apontar a configuração para um projeto de verdade.
Prompt para uma primeira revisão de código de baixo risco:
Revise esta função em busca de bugs.
Não edite nenhum arquivo ainda.
Primeiro, me dê uma lista dos riscos encontrados.
Manter a IA longe de edições até você observar como ela se comporta é uma forma prudente de calibrar a confiança em um novo provedor de modelo antes de liberar acesso de escrita.
⚠️ O que observar antes de confiar dados sensíveis a um modelo gratuito
Aqui vale um alerta importante, e talvez o ponto mais relevante deste guia: “gratuito” não costuma significar “sem contrapartida nenhuma”. É comum que modelos oferecidos de graça, durante um período promocional, utilizem os dados enviados para ajudar a melhorar o próprio modelo enquanto essa oferta gratuita estiver ativa. Isso é exatamente o oposto do que você quer para código sensível, proprietário ou de clientes.
Por isso, a recomendação é tratar a rota gratuita como uma pista de teste: use-a para resumos, revisões de código de baixo risco, organização de documentação e pequenas edições em pastas descartáveis. Não comece apontando esse tipo de configuração para o seu repositório principal com acesso de escrita liberado.
Rotas pagas, por outro lado, costumam ter uma postura de privacidade mais clara, com provedores declarando seguir políticas de retenção zero de dados e não usar as informações enviadas para treinar modelos. Ainda assim, vale sempre conferir a documentação atual do provedor antes de assumir qualquer garantia de privacidade, já que essas políticas podem mudar.
Prompt para checar riscos antes de liberar acesso de escrita a um modelo novo:
Antes de eu liberar acesso de escrita para este ambiente, compare dois
arquivos deste projeto [especifique quais] e crie uma nota curta
resumindo as diferenças. Não faça nenhuma alteração nos arquivos
originais.
🔄 Por que essa rota, e não OpenRouter ou um modelo local direto
Vale uma distinção importante: o objetivo aqui não é simplesmente “encontrar qualquer provedor mais barato”. É manter a interface e o fluxo de ferramentas do Claude, apenas trocando a camada de modelo por baixo. Se o objetivo for só trocar de provedor da forma mais simples possível, um serviço como o OpenRouter, conectado diretamente pelo modo de inferência de terceiros, já resolve. Se o objetivo for inferência totalmente local, uma ferramenta como o Ollama é uma resposta mais direta. Mas se você especificamente quer manter o Claude Desktop, o Claude Code ou o Claude Cowork como interface, com outro provedor de modelo trabalhando nos bastidores, o caminho do gateway é a peça certa.
Isso importa mais do que parece à primeira vista. Muita gente não quer necessariamente uma interface nova, apenas uma rota de inferência mais barata ou mais flexível por trás da interface que já gosta de usar.
📋 Checklist rápido para começar
- Escolha um gateway compatível com a API de mensagens da Anthropic (um serviço já estabelecido como OpenRouter, ou um proxy próprio, revisado com cuidado antes do uso)
- No Claude Desktop, vá em Ajuda → Solução de problemas → Ativar Modo Desenvolvedor
- Reabra o aplicativo e acesse Desenvolvedor → Configurar inferência de terceiros
- Escolha Gateway como tipo de conexão, informe a URL base e a chave de API
- Adicione o identificador do modelo manualmente, ou deixe a descoberta automática ativada
- Clique em Aplicar localmente, feche e reabra o Claude Desktop
- Rode um teste seguro em uma pasta descartável antes de usar em um projeto real
- Avalie migrar para uma rota paga quando o trabalho exigir mais confiabilidade, menos ressalvas sobre uso de dados, ou raciocínio mais forte sobre uma base de código maior
A possibilidade de usar o Claude Desktop, o Claude Code e o Claude Cowork com modelos de terceiros por trás da interface é um recurso oficial da Anthropic, não uma brecha ou uma forma de burlar os termos de uso.
Isso abre espaço real para economizar em tarefas de baixo risco, como resumos, revisões simples e organização de documentação, reservando o orçamento e a capacidade de raciocínio mais forte para o trabalho que realmente exige isso.
Ainda assim, vale lembrar que “gratuito” quase sempre vem com alguma contrapartida, geralmente relacionada ao uso dos seus dados durante o período promocional, e que qualquer proxy de terceiros que intermedeie suas chaves de API merece uma revisão cuidadosa antes de receber qualquer coisa além de anotações de teste.
