Principais destaques
- 57% de erro em média: estudo da fintech Saturn encontrou respostas incorretas em mais da metade das consultas financeiras avaliadas.
- Tarefas complexas pioram tudo: quando as perguntas exigiam múltiplos cálculos, a taxa média de erro subiu para 88%, chegando a 99% em alguns modelos.
- O problema vai além da matemática: os chatbots também omitiram alertas importantes, ignoraram mudanças tributárias e chegaram a inventar regras que não existem.
Pedir ajuda à inteligência artificial para entender investimentos, impostos ou dívidas parece cada vez mais natural. O problema é que, quando a pergunta envolve dinheiro de verdade, uma resposta convincente não é necessariamente uma resposta correta.
Um estudo realizado pela fintech Saturn colocou 18 modelos de IA à prova, incluindo ChatGPT, Claude, Gemini, Copilot e Grok. Foram 121 perguntas sobre aposentadoria, impostos, dívidas e poupança, cada uma repetida cinco vezes para avaliar também a consistência das respostas.
No total, os pesquisadores analisaram mais de 10 mil respostas.
E o resultado acende um alerta: 57% das respostas foram classificadas como incorretas.
Quando a conta fica complicada, a taxa dispara 🧮
O cenário ficou ainda mais problemático nas perguntas que exigiam múltiplos cálculos ou etapas de raciocínio.
Nessas situações, a taxa média de erro chegou a 88%. Em alguns modelos, os pesquisadores classificaram como incorretas nada menos que 99% das respostas para as tarefas mais difíceis.
💸 Não era apenas uma questão de fazer contas: a metodologia da Saturn considerou incorreta uma resposta que apresentasse cálculos ou fatos errados, mas também aquela que deixasse de mencionar informações relevantes ou alertas importantes para a decisão financeira.
Isso é especialmente importante em assuntos como impostos e aposentadoria, nos quais uma pequena omissão pode produzir consequências financeiras bastante concretas.
Como os modelos se saíram?
Entre os resultados apresentados no relatório, as taxas de erro foram:
| Modelo | Taxa de erro |
|---|---|
| Claude Haiku 4.5 | 82% |
| Gemini 3.1 Pro | 73% |
| Grok 4.5 | 59% |
| GPT-5.6 Luna | 58% |
| Claude Opus 5, modo de raciocínio | 39% |
O Claude Opus 5 em modo de raciocínio apresentou a menor taxa de erro entre os modelos incluídos nos resultados citados pelo estudo. Ainda assim, 39% das respostas foram classificadas como incorretas.
Ou seja, mesmo o melhor resultado apresentado pela pesquisa está longe de significar precisão garantida.
O perigo não está só na matemática ⚠️
Um dos pontos mais interessantes do estudo é que os erros não se resumiram a operações matemáticas.
Segundo a Saturn, os modelos também deixaram de considerar mudanças futuras na legislação tributária, omitiram advertências importantes e, em alguns casos, inventaram regras que não existiam.
🧾 Um exemplo bastante caro: em um caso envolvendo tributação de aposentadorias no Reino Unido, o Claude Haiku 4.5 apresentou uma explicação considerada incorreta pelos pesquisadores. A Saturn estimou que seguir aquela orientação poderia resultar em uma cobrança adicional de £17.500.
Em outro exemplo, o modelo teria inventado uma regra segundo a qual um graduado poderia interromper o pagamento de um empréstimo estudantil depois de se mudar para outro país.
A resposta podia parecer plausível. O problema é justamente esse.
Uma resposta de IA pode soar segura, detalhada e profissional mesmo quando a regra que ela descreve simplesmente não existe.
Até conselhos sobre dívidas podem esconder uma armadilha 💳
O estudo também encontrou problemas em orientações relacionadas ao pagamento de dívidas.
Alguns modelos recomendaram a estratégia tradicional de priorizar a dívida com a maior taxa de juros. Isoladamente, isso pode parecer uma orientação financeira bastante conhecida.
Mas existe uma questão anterior: quais despesas precisam ser pagas primeiro?
Segundo os pesquisadores, algumas respostas não consideraram pagamentos prioritários, como aluguel e impostos municipais.
🔎 A ordem importa: uma estratégia matematicamente eficiente para reduzir juros pode não ser adequada se, antes disso, uma pessoa corre o risco de perder a moradia ou deixar de cumprir uma obrigação prioritária.
É uma diferença importante entre responder a uma pergunta financeira e realmente compreender o contexto em que aquela decisão será tomada.
Modelos pagos também erraram
O estudo encontrou uma diferença entre modelos gratuitos e pagos, mas nenhum grupo apresentou precisão suficiente para eliminar o problema.
Em média:
• Modelos gratuitos tiveram taxa de erro de 63%.
• Modelos pagos apresentaram taxa de erro de 49%.
Nas perguntas consideradas mais difíceis, os modelos gratuitos erraram 93% das vezes.
Isso sugere uma diferença de desempenho entre as categorias, mas também mostra que pagar pelo acesso a um modelo não transforma automaticamente a IA em uma fonte confiável de aconselhamento financeiro.
E existe um detalhe importante sobre o estudo 🧐
A pesquisa precisa ser interpretada dentro de sua própria metodologia.
A Saturn é uma fintech que desenvolve ferramentas de IA para consultores financeiros e, segundo o material apresentado, defende a regulamentação do aconselhamento financeiro oferecido por chatbots generalistas.
Isso não invalida os resultados, mas significa que os critérios utilizados para classificar uma resposta como correta ou incorreta são parte importante da análise.
O estudo avaliou não apenas erros objetivos, mas também omissões de informações relevantes e advertências consideradas necessárias pelos pesquisadores.
Por isso, os números não devem ser interpretados simplesmente como uma medição universal da “inteligência” de cada modelo.
A IA pode ajudar. O problema é tratá-la como autoridade 💡
Há uma diferença fundamental entre usar um chatbot para entender um conceito financeiro e utilizá-lo para tomar uma decisão que envolve milhares de reais.
A primeira situação pode ser útil: pedir uma explicação sobre juros compostos, comparar conceitos ou transformar uma regra complexa em uma linguagem mais simples.
A segunda exige outra camada de verificação, especialmente quando envolve legislação, impostos, aposentadoria, contratos ou grandes quantias.
A própria natureza dessas respostas torna o problema mais difícil: modelos de linguagem podem produzir textos extremamente convincentes mesmo quando estão errados.
E, em finanças, uma resposta errada não precisa parecer absurda para custar caro.
No fim, a promessa de ter um “especialista” disponível na tela em segundos esbarra em uma realidade menos confortável: quanto mais importante for a decisão financeira, menos sentido faz tratar uma única resposta de IA como a última palavra.
A pergunta que fica para a próxima geração desses sistemas não é apenas se eles conseguem responder. É se conseguem reconhecer, com consistência, quando não deveriam responder com tanta confiança.
