OpenAI transforma voz do ChatGPT em porta de entrada para tarefas agênticas

Renê Fraga
9 min de leitura

Principais destaques

  • Voz agora executa tarefas: o ChatGPT Voice passa a acionar recursos de trabalho agêntico, incluindo documentos, calendários, e-mails e navegação na web.
  • Do celular para o computador: usuários podem iniciar uma tarefa por voz no smartphone e continuar o trabalho em outros dispositivos.
  • A disputa pelos assistentes pessoais: a atualização aproxima o ChatGPT de uma experiência em que falar com a IA pode ser apenas o primeiro passo para ela realizar uma sequência de ações.

Durante muito tempo, falar com um chatbot significava fazer uma pergunta e ouvir uma resposta. A OpenAI agora quer mudar essa lógica.

A empresa começou a liberar novos recursos do ChatGPT Voice que conectam a interação por voz aos modelos capazes de executar tarefas em navegadores, aplicativos e serviços conectados. Na prática, a conversa deixa de ser necessariamente o destino final e passa a funcionar como o ponto de partida para um trabalho mais amplo.

A mudança está chegando ao celular e à web, com disponibilidade gradual e recursos que dependem do plano contratado e das configurações do espaço de trabalho.

E se bastasse pedir? 🎙️

A proposta é relativamente simples de entender: em vez de falar com o ChatGPT apenas para obter uma informação, o usuário pode pedir que ele faça alguma coisa.

Isso inclui tarefas como redigir documentos, organizar compromissos, navegar pela internet, trabalhar com apresentações e interagir com serviços conectados.

🔎 A diferença está na ação: a voz deixa de ser apenas uma interface para conversar com a IA e passa a ser uma forma de comandar fluxos de trabalho com várias etapas.

Segundo Atty Eleti, líder de produto de voz do ChatGPT na OpenAI, a empresa imagina um futuro em que a voz se torne a principal modalidade de interação das pessoas com a IA.

“Não encaramos isso como simplesmente voz de entrada e voz de saída.”

A ideia, segundo Eleti, é que a IA determine a melhor maneira de entregar a resposta. Em alguns casos será por voz, em outros por texto, ou combinando os dois.

A demonstração que mostra onde isso pode chegar 🧩

Em uma demonstração para o Business Insider, Eleti utilizou comandos de voz para realizar uma sequência de tarefas que normalmente exigiria alternar entre diferentes aplicativos.

Ele analisou gastos no DoorDash, reservou uma quadra de pickleball e reorganizou sua agenda.

Não é apenas uma questão de reconhecimento de fala. O ponto central é conectar a compreensão do pedido à execução de ações em diferentes serviços.

É justamente aí que entra o conceito de agente.

Voz encontra o modo Work

A atualização conecta o ChatGPT Voice aos recursos agênticos da empresa, incluindo a capacidade de operar navegadores e aplicativos conectados.

Assinantes dos planos Plus e Pro podem usar a voz no celular para acionar fluxos de trabalho disponíveis na aba Work. Entre os exemplos estão:

• criação de apresentações;

• resumo de mensagens do Slack;

• redação de e-mails;

• gerenciamento de calendários;

• navegação na internet;

• produção e edição de documentos.

A integração também inclui plugins voltados a serviços como e-mail, calendário e Slack.

💡 O detalhe importante: antes, o usuário podia conversar por voz, mas precisava mudar para a interface de texto para acessar determinadas ferramentas conectadas. Agora, a OpenAI está tentando eliminar essa troca de contexto.

O celular vira o controle remoto da IA 📱

A experiência também foi pensada para não ficar presa a um único dispositivo.

Uma tarefa pode começar no celular e continuar no computador. A conversa por voz também pode gerar respostas textuais mais completas, permitindo alternar entre voz e texto durante o mesmo fluxo.

Isso aproxima o ChatGPT de uma ideia menos parecida com um chatbot tradicional e mais próxima de um assistente digital que acompanha o usuário durante uma tarefa.

A própria OpenAI afirma que mais de 150 milhões de pessoas já utilizam os recursos de ditado e voz do ChatGPT.

Três modelos entram na conversa

Outra mudança está relacionada aos modelos disponíveis para a experiência de voz.

Segundo o material divulgado, o ChatGPT Voice passa a ser alimentado pelos três modelos GPT-6 da OpenAI:

ModeloPapel descrito
AstraModelo mais poderoso
SolModelo menor
LunaModelo menor

Os modelos Sol e Luna haviam recebido a atualização para GPT-6 no dia anterior, de acordo com o material.

A combinação entre modelos de voz em tempo real e modelos capazes de executar tarefas é o que permite à OpenAI transformar uma solicitação falada em uma sequência de ações.

A voz não precisa responder falando

Essa talvez seja uma das mudanças mais interessantes na experiência.

A OpenAI não está tratando voz simplesmente como uma versão falada do ChatGPT. A intenção é que a modalidade de entrada não determine necessariamente a modalidade da resposta.

Você pode falar.

O sistema pode responder com voz.

Ou texto.

Ou os dois.

🗣️ A lógica muda: o usuário escolhe como iniciar a interação, enquanto o sistema decide, dentro da experiência, como apresentar o resultado.

Isso pode ser especialmente útil para tarefas que exigem informações visuais ou resultados estruturados. Uma pessoa pode pedir algo por voz e receber uma apresentação, uma lista, um documento ou outro resultado visual na tela.

A corrida pelos assistentes pessoais acelera ⚡

O movimento acontece em um mercado no qual diferentes empresas estão tentando transformar seus modelos de IA em assistentes capazes de realizar tarefas no mundo digital.

A OpenAI vem ampliando sua estratégia justamente às vésperas do DevDay, previsto para a próxima semana, enquanto também surgem movimentos de outras empresas e startups em torno dos chamados assistentes pessoais de IA.

O cenário pode mudar ainda mais com investimentos em hardware. Segundo a Bloomberg, a OpenAI estaria desenvolvendo uma caixa de som inteligente para lançamento em 2027.

Se confirmado, isso colocaria a estratégia de voz em uma dimensão que vai além do aplicativo.

Nem todo mundo terá acesso agora 🚦

Apesar do anúncio, a experiência não está sendo liberada de maneira uniforme.

O acesso aos modelos GPT-6 e aos recursos do Work depende do plano contratado e das configurações do espaço de trabalho. A distribuição também está acontecendo gradualmente.

Existe ainda uma divisão entre as experiências Chat e Work no ChatGPT, com determinados recursos de modelos disponíveis apenas no segundo ambiente.

Isso cria uma experiência mais poderosa, mas também potencialmente mais complexa para quem está tentando entender exatamente onde cada ferramenta está disponível.

O próximo passo pode ser simplesmente falar

A evolução parece seguir uma direção bastante clara: reduzir a quantidade de interfaces que o usuário precisa manipular para fazer alguma coisa.

Hoje, realizar uma tarefa digital normalmente significa abrir aplicativos, procurar informações, copiar dados, preencher campos e alternar entre telas.

A proposta dos agentes é condensar tudo isso em uma instrução.

E a voz pode ser justamente a maneira mais natural de dar essa instrução.

A grande mudança não é o ChatGPT aprender a conversar melhor. É começar a tratar a conversa como o começo do trabalho.

Se essa experiência ganhar escala, o botão de microfone poderá deixar de ser apenas uma alternativa ao teclado. Poderá se tornar uma espécie de comando universal para iniciar tarefas digitais, enquanto o trabalho pesado acontece nos bastidores.

A pergunta que fica é quanto dessa experiência será realmente invisível para o usuário quando os agentes começarem a operar cada vez mais serviços ao mesmo tempo.

Apoie o Eurisko
Este conteúdo é independente, sem anúncios e feito por pessoas.
A inteligência artificial e as mudanças recentes do Google reduziram significativamente o alcance dos sites independentes. Se este conteúdo foi útil para você, considere apoiar o Eurisko e todo o ecossistema de projetos com qualquer valor.
Quero apoiar
Seguir
Renê Fraga é fundador e editor-chefe do Eurisko, ecossistema editorial independente dedicado à inteligência artificial, código aberto, tecnologia e cultura digital. Atuando com projetos online desde 1996, escreve há mais de 20 anos sobre tecnologia e inovação, acompanhando a evolução da internet e o impacto das novas tecnologias na forma como vivemos, trabalhamos e pensamos.
Nenhum comentário