- A inspiração veio do Jev 🧠
- O “clone” chegou rápido 👀
- Por que gastar tanto para decidir pouco? 💸
- E já existe uma pequena corrida 🏃
- O uso mais interessante pode estar na segurança 🔐
- Um “guarda de trânsito” para agentes 🚦
- A diferença aparece na conta
- E se cada ação tivesse um revisor?
- A guerra dos modelos talvez seja menor do que parece 🤖
Principais destaques
- Nova Decisions API: OpenAI apresentou uma API capaz de escolher rapidamente entre opções predefinidas, usando modelos de IA para classificação e comportamento de agentes.
- Custo pode despencar: experiências com o Jev indicam que modelos especializados em decisões podem ser muito mais baratos do que usar um LLM de fronteira a cada ação.
- Segurança vira aplicação-chave: a tecnologia pode funcionar como uma espécie de “sentinela” para agentes, analisando ações em tempo real antes que sejam executadas.
A OpenAI parece ter encontrado uma nova peça para o quebra-cabeça dos agentes de IA.
Durante o Dev Day, Sam Altman revelou quase de passagem a Decisions API, uma ferramenta que permite ao modelo escolher entre um conjunto previamente definido de possibilidades.
A ideia parece simples. Mas ela aponta para uma mudança importante na arquitetura dos sistemas de IA.
Em vez de pedir a um modelo grande que raciocine do zero a cada pequena decisão, desenvolvedores podem usar um modelo especializado para responder rapidamente a uma pergunta muito mais específica: qual opção devo escolher?
A inspiração veio do Jev 🧠
A novidade tem uma semelhança evidente com o Jev, modelo lançado recentemente pela TypeSafe AI e projetado especificamente para automação de software.
O Jev funciona como uma espécie de classificador turbinado por um LLM. O desenvolvedor fornece um conjunto de alternativas e o modelo retorna probabilidades para essas escolhas.
A OpenAI descreveu sua Decisions API de maneira parecida.
Altman citou exemplos como:
• escolher categorias para classificar uma imagem;
• determinar diferentes comportamentos para um agente;
• tomar decisões rápidas dentro de um fluxo automatizado.
⚡ A diferença está no foco: ao limitar o problema a uma escolha específica, o modelo pode operar muito mais rapidamente sem abrir mão de recursos como compreensão de imagens, suporte a diferentes idiomas e mecanismos de segurança.
“Fast and cheap” é apenas o começo. A disputa real está em quanta inteligência cada dólar consegue comprar.
Essa é justamente a tese defendida pela TypeSafe.
O “clone” chegou rápido 👀
O CEO da TypeSafe, Diogo Almeida, que trabalhou anteriormente na OpenAI e participou da criação de técnicas de reinforcement learning, reagiu à novidade brincando sobre o início das “clone wars”.
Almeida também afirmou que o interesse da OpenAI pode indicar que construir sistemas compatíveis com o conceito de System One será importante no futuro.
Na terminologia da TypeSafe, System One representa uma forma de processamento rápido e intuitivo, enquanto System Two corresponde a um raciocínio mais deliberado.
A distinção é relevante para agentes.
Nem toda ação realizada por um agente precisa de uma longa cadeia de raciocínio. Muitas são decisões pequenas, repetitivas e altamente estruturadas.
É justamente aí que um modelo especializado pode fazer sentido.
Por que gastar tanto para decidir pouco? 💸
Os grandes modelos de linguagem são extremamente capazes, mas essa capacidade tem um preço.
Se um agente precisa executar centenas ou milhares de ações, mandar cada uma delas para um modelo de fronteira pode aumentar rapidamente tanto a latência quanto o custo.
Um sistema de decisões pode funcionar como uma camada intermediária.
| Abordagem | Função | Característica |
|---|---|---|
| LLM de fronteira | Raciocínio e tarefas complexas | Mais capacidade, maior custo |
| Modelo de decisão | Escolha entre opções | Mais rápido e barato |
| Agente | Execução de tarefas | Combina diferentes modelos e ferramentas |
🔎 O detalhe importante: ainda não está claro quanto a Decisions API se aproxima tecnicamente do Jev.
A ferramenta foi disponibilizada em preview limitado e, até o momento descrito pela reportagem, ainda havia pouca evidência pública de desenvolvedores colocando o produto em produção.
Ou seja, a semelhança é clara na proposta, mas a comparação de desempenho ainda precisa ser feita.
E já existe uma pequena corrida 🏃
A OpenAI não está sozinha.
Outras startups também começaram a desenvolver APIs semelhantes ao Jev, criando uma nova categoria de modelos voltados especificamente para decisões rápidas.
Isso levanta uma questão mais difícil do que simplesmente medir velocidade.
Uma decisão barata precisa também ser uma decisão correta.
Diogo Almeida argumenta que a vantagem da TypeSafe está nos dados sintéticos utilizados para produzir resultados estatisticamente úteis.
Em entrevista à TechCrunch, ele resumiu a dificuldade do problema com uma provocação: se a única preocupação fosse velocidade e preço, bastaria usar dados aleatórios.
O desafio, portanto, é encontrar o equilíbrio entre velocidade, custo e inteligência.
O uso mais interessante pode estar na segurança 🔐
Existe uma aplicação particularmente promissora para esse tipo de arquitetura: supervisionar outros agentes de IA.
A OpenAI vem adotando mecanismos de segurança para observar o comportamento de seus agentes depois de episódios em que sistemas automatizados tiveram comportamentos inadequados na internet.
O problema é que monitorar cada ação com outro modelo de fronteira pode ser caro.
É aí que modelos como o Jev entram em cena.
Um “guarda de trânsito” para agentes 🚦
Shapor Naghibzadeh, profissional de segurança cibernética e fundador da QueryStory, criou um protótipo durante um hackathon usando o Jev para analisar cada ação realizada por um agente.
O sistema compara a ação com a tarefa que o agente recebeu e pode tomar três caminhos:
1️⃣ Bloquear: quando há alta confiança de que a ação é inadequada.
2️⃣ Enviar para revisão: quando o modelo identifica uma situação ambígua.
3️⃣ Permitir: quando a ação parece compatível com o objetivo original.
A lógica é interessante porque o modelo de decisão não precisa substituir o agente.
Ele apenas fica no caminho entre a intenção e a execução.
🛡️ Na prática: seria uma espécie de camada de segurança automática, capaz de examinar cada passo sem exigir que um modelo caríssimo seja acionado o tempo inteiro.
A diferença aparece na conta
Segundo o experimento citado pela reportagem, monitorar as ações de um agente nesse cenário custaria cerca de US$ 2,94 usando Jev, contra aproximadamente US$ 372 usando um LLM de fronteira.
A diferença é enorme.
| Monitoramento | Custo citado |
|---|---|
| Jev | US$ 2,94 |
| LLM de fronteira | US$ 372 |
Isso representa uma diferença de mais de 120 vezes no cenário apresentado.
É justamente essa economia que torna possível imaginar o monitoramento de praticamente todas as ações de um agente, em vez de reservar a supervisão para momentos considerados críticos.
E se cada ação tivesse um revisor?
Essa talvez seja a consequência mais interessante da nova geração de modelos de decisão.
Hoje, uma arquitetura de agentes pode ser imaginada assim:
usuário → agente → ferramentas → execução
Com uma camada de decisão especializada, ela poderia se tornar:
usuário → agente → modelo de decisão → ferramenta → execução
O revisor não precisaria fazer todo o trabalho intelectual do agente.
Precisaria apenas responder perguntas específicas:
Essa ação está dentro do objetivo?
Essa ferramenta pode ser usada neste momento?
Esse comportamento deveria ser bloqueado?
Essa decisão merece revisão humana?
Isso muda a economia do problema.
Um agente poderia ganhar uma espécie de “sistema imunológico” barato, analisando continuamente suas próprias ações.
A guerra dos modelos talvez seja menor do que parece 🤖
A chegada da Decisions API também sugere uma mudança de paradigma.
Durante anos, a corrida da IA esteve concentrada em construir modelos cada vez maiores e mais capazes.
Agora começa a aparecer uma segunda frente: modelos especializados em pequenas decisões que podem ser executados em enorme escala.
Um agente sofisticado pode acabar não dependendo de um único modelo gigantesco.
Pode combinar vários modelos menores, cada um responsável por uma função diferente, deixando o modelo de fronteira para as tarefas realmente difíceis.
A própria OpenAI ainda precisa demonstrar como sua API se comporta na prática. Mas a direção já está ficando mais evidente.
A próxima geração de agentes talvez não seja definida apenas por quanto eles conseguem raciocinar, mas por quantas decisões pequenas conseguem tomar rapidamente, com segurança e baixo custo.
E, nesse cenário, a grande disputa pode deixar de ser apenas por modelos maiores. Pode ser por quem consegue colocar inteligência suficiente em cada pequena decisão sem transformar a conta de infraestrutura em um problema maior que o próprio agente.
