Cloudflare entra na corrida pelos modelos de decisão para IA

Renê Fraga
10 min de leitura

Principais destaques

  • Clef chega com pesos abertos e transforma decisões rápidas, como escolher ferramentas e bloquear ações, em uma tarefa específica para modelos menores.
  • Dois tamanhos, dois perfis: o Clef tem 27 bilhões de parâmetros, enquanto o Clef-flash tem 9 bilhões e alcança latência mediana de 38,8 milissegundos nos testes da Cloudflare.
  • ○A aposta vai além do modelo: a empresa também lançou uma plataforma de fine-tuning com aprendizado por reforço integrada ao Workers AI, AI Gateway e Containers.

A Cloudflare quer ensinar a IA a decidir, não a conversar 🤖

A próxima disputa da inteligência artificial pode não acontecer entre modelos que escrevem melhor. Pode acontecer entre aqueles que decidem mais rápido.

É nessa frente que a Cloudflare entrou com o Clef e o Clef-flash, dois modelos de decisão com pesos abertos apresentados em 1º de outubro.

A ideia é simples: em vez de gerar um texto inteiro, o modelo recebe um estado e um conjunto limitado de possibilidades. Então escolhe entre elas e informa a probabilidade de cada resposta.

Isso parece uma diferença pequena. Para agentes de IA, não é.

🔎 Pense no trabalho de um agente: ele precisa decidir se deve chamar uma ferramenta, continuar uma tarefa, interromper uma operação, aplicar uma política ou encaminhar uma solicitação para outro modelo.

Para essas situações, gastar centenas de tokens produzindo uma resposta que depois será interpretada pelo software pode ser desperdício.

O Clef tenta cortar justamente essa etapa.

O modelo não precisa escrever uma palavra

A Cloudflare descreve seus modelos como sistemas para saídas estruturadas e limitadas.

O desenvolvedor pode enviar um estado acompanhado de até 64 perguntas tipadas. O modelo então calcula as probabilidades das respostas possíveis em uma única passagem direta, conhecida como forward pass.

Na prática, o código recebe algo muito mais próximo de:

“A ação deve ser permitida? Sim: 96%. Não: 4%.”

Do que de uma resposta produzida por um chatbot.

Isso permite que a decisão seja incorporada diretamente ao fluxo de execução de um agente.

Dois Clefs para tarefas diferentes ⚡

A Cloudflare lançou duas versões:

ModeloParâmetrosCaracterísticas
Clef27 bilhõesMais capacidade, aceita imagens e contexto de até 64 mil tokens
Clef-flash9 bilhõesMais rápido, voltado a decisões de baixa latência

Os dois são baseados em versões pós-treinadas e congeladas das famílias Qwen3.8-27B e Qwen3.5-9B, segundo a Cloudflare.

Os pesos foram disponibilizados no Hugging Face sob a licença Apache 2.0.

E aqui está a jogada mais interessante da Cloudflare 🧩

O lançamento não termina nos modelos.

A empresa também apresentou uma nova plataforma de fine-tuning por aprendizado por reforço para adaptar os modelos às necessidades específicas de cada aplicação.

Inicialmente, engenheiros da própria Cloudflare trabalharão com os clientes nesse processo. Uma versão de autoatendimento está prevista para posteriormente.

A arquitetura aproveita justamente o ecossistema que a companhia vem construindo para aplicações de IA:

• Workers AI para execução dos modelos;

• AI Gateway para gerenciamento das chamadas;

• Containers para infraestrutura de execução;

• Trainer para treinamento e ajuste dos modelos.

A proposta é colocar tudo no mesmo lugar: coletar dados, ajustar o modelo e colocá-lo novamente em produção.

💡 A aposta da Cloudflare não é apenas vender um modelo de decisão. É transformar a decisão em uma peça de infraestrutura para agentes de IA.

39 milissegundos mudam a conversa ⏱️

A Cloudflare testou o Clef contra o Jev, modelo de decisão criado pela TypeSafe AI.

Nos testes divulgados pela empresa, o Clef apresentou latência mediana de 209,3 milissegundos, enquanto o Clef-flash ficou em 38,8 milissegundos.

O Jev marcou 524,1 milissegundos nos mesmos testes citados pela Cloudflare.

A diferença é particularmente relevante em sistemas que tomam dezenas ou centenas de pequenas decisões durante uma única execução.

Uma economia de algumas centenas de milissegundos pode se acumular rapidamente quando um agente precisa escolher ferramentas, validar ações e determinar os próximos passos.

Mas tem um detalhe importante nos benchmarks 👀

A Cloudflare afirma que seus modelos superaram o Jev em diversos testes de classificação e chamada de funções.

Também diz que venceu três dos quatro testes de fluxo de trabalho apresentados pela TypeSafe.

Mas os próprios números precisam ser lidos com cuidado.

Os resultados foram produzidos pela Cloudflare em seus testes do Jev Decision Index e, segundo o material fornecido, ainda não foram reproduzidos no índice oficial.

Além disso, o Jev manteve vantagem em avaliações que exigem mais raciocínio, como GPQA Diamond e MMLU-Pro.

Ou seja: o Clef pode ser muito rápido em decisões delimitadas sem necessariamente substituir modelos capazes de realizar raciocínios mais complexos.

O preço conta uma história diferente 💰

No Workers AI, o Clef custa US$ 0,24 por milhão de tokens de entrada.

O Clef-flash custa US$ 0,09.

O Jev, por comparação, é oferecido pela TypeSafe por US$ 0,042 por milhão de tokens.

ModeloPreço informado
JevUS$ 0,042/milhão
Clef-flashUS$ 0,09/milhão
ClefUS$ 0,24/milhão

A diferença diminui quando o desenvolvedor baixa os pesos e executa o modelo por conta própria.

Mas aí aparece outro obstáculo.

“Aberto” não significa necessariamente “fácil de rodar” 🖥️

O Clef-flash exige, segundo a Cloudflare, uma GPU com pelo menos 41 GB de VRAM.

O Clef precisa de aproximadamente 85 GB.

Portanto, embora os pesos estejam disponíveis gratuitamente, executar esses modelos localmente não é exatamente uma tarefa para qualquer notebook.

Também há outra distinção importante: os conjuntos de dados usados no treinamento não foram publicados.

Por isso, a classificação como “open weights”, e não necessariamente como código aberto no sentido mais amplo, já gerou discussão entre desenvolvedores.

A corrida começou rápido demais

O contexto talvez seja a parte mais interessante da história.

A TypeSafe apresentou o Jev em meados de setembro.

Pouco mais de duas semanas depois, três grandes empresas apareceram com respostas próprias.

  • A OpenAI apresentou uma Decisions API no Dev Day.
  • A Amazon lançou o Strands Decider 2B, com 2 bilhões de parâmetros e licença Apache 2.0.
  • E a Cloudflare chegou com dois modelos, uma infraestrutura de inferência e uma plataforma de fine-tuning.

Isso indica que a ideia de separar “gerar” de “decidir” começou a ganhar espaço na arquitetura dos agentes.

O chatbot pode não ser o centro de tudo

Durante anos, a discussão sobre IA generativa esteve concentrada em uma pergunta: qual modelo escreve, programa ou raciocina melhor?

Os agentes estão mudando essa equação.

Um agente precisa tomar inúmeras decisões pequenas para chegar ao resultado final. Muitas delas não exigem criatividade nem uma resposta textual sofisticada.

Elas exigem apenas uma escolha rápida e confiável.

🧠 É aí que os modelos de decisão entram: em vez de usar um modelo gigantesco para cada bifurcação do fluxo, desenvolvedores podem delegar decisões específicas a modelos especializados.

A consequência pode ser uma arquitetura híbrida: modelos grandes para tarefas complexas e modelos de decisão menores para o restante.

É uma lógica parecida com colocar um motor enorme em um carro e descobrir, depois, que boa parte do trajeto poderia ser feita com um motor muito menor.

E a Cloudflare quer ficar justamente nesse caminho

A empresa já ocupa uma posição relevante na infraestrutura que conecta aplicações à internet.

Ao colocar modelos de decisão dentro do Workers AI e adicionar ferramentas para treinamento e implantação, a Cloudflare tenta ocupar outra camada: a infraestrutura operacional dos agentes.

Ainda é cedo para saber se Clef se tornará um padrão ou apenas mais uma alternativa em um mercado que está surgindo rapidamente.

Mas uma coisa já mudou.

A decisão deixou de ser apenas uma pequena etapa escondida dentro de um LLM. Está começando a virar uma categoria própria de modelo.

E, nesse novo mercado, a Cloudflare parece interessada em vender não apenas o “cérebro” que escolhe uma resposta, mas também a estrada, o posto de combustível e a oficina onde esse cérebro será treinado.

Apoie o Eurisko
Este conteúdo é independente, sem anúncios e feito por pessoas.
A inteligência artificial e as mudanças recentes do Google reduziram significativamente o alcance dos sites independentes. Se este conteúdo foi útil para você, considere apoiar o Eurisko e todo o ecossistema de projetos com qualquer valor.
Quero apoiar
Seguir
Renê Fraga é fundador e editor-chefe do Eurisko, ecossistema editorial independente dedicado à inteligência artificial, código aberto, tecnologia e cultura digital. Atuando com projetos online desde 1996, escreve há mais de 20 anos sobre tecnologia e inovação, acompanhando a evolução da internet e o impacto das novas tecnologias na forma como vivemos, trabalhamos e pensamos.
Nenhum comentário