ChatGPT Voice agora pesquisa a internet durante conversas com o GPT-Live

Renê Fraga
10 min de leitura

Principais destaques

  • A OpenAI começou a liberar o GPT-Live, nova geração de modelos que passa a comandar o ChatGPT Voice.
  • Durante uma conversa por voz, o sistema pode recorrer ao GPT-5.5 para pesquisar informações atualizadas na internet e realizar raciocínios mais complexos.
  • A experiência também ganha cartões visuais com dados como previsão do tempo, ações da bolsa e resultados esportivos, tornando as conversas muito mais completas.

A OpenAI deu mais um passo na evolução da inteligência artificial conversacional ao iniciar a distribuição global do GPT-Live, uma nova família de modelos desenvolvida para oferecer uma experiência de voz muito mais natural dentro do ChatGPT.

A novidade representa uma mudança importante na forma como usuários interagem com a IA, já que agora o assistente consegue pesquisar informações atualizadas na internet durante uma conversa, sem que seja necessário interromper o diálogo ou trocar para outro modo de uso.

Até então, as conversas por voz eram limitadas ao conhecimento disponível no modelo em execução. Com o GPT-Live, esse cenário muda significativamente.

Sempre que o sistema identifica que uma pergunta depende de acontecimentos recentes, dados em tempo real ou uma análise mais elaborada, ele encaminha a solicitação para o GPT-5.5, que realiza a pesquisa ou o processamento adicional antes de devolver a resposta ao usuário. Todo esse processo acontece de forma praticamente invisível, preservando a fluidez da conversa.

Além da integração com a busca na web, o ChatGPT Voice passa a oferecer uma experiência multimodal ainda mais rica. Enquanto responde por voz, o aplicativo também pode apresentar cartões visuais contendo informações complementares, permitindo que o usuário acompanhe gráficos, indicadores ou dados importantes diretamente na tela.

GPT-Live inaugura uma nova geração de conversas por voz

O GPT-Live-1 passa a ser o modelo padrão do ChatGPT Voice para assinantes dos planos Go, Plus e Pro. Já quem utiliza o plano gratuito receberá o GPT-Live-1 mini, uma versão otimizada para entregar boa qualidade com menor consumo de recursos.

Segundo a OpenAI, a principal evolução está na arquitetura full-duplex. Diferentemente dos sistemas tradicionais de voz, que alternam momentos de escuta e resposta, essa tecnologia permite que o modelo processe áudio enquanto continua produzindo fala. Na prática, isso torna as conversas muito mais naturais.

O resultado é um assistente que entende melhor quando o usuário faz uma pausa, reduz interrupções desnecessárias e consegue responder de maneira mais parecida com uma conversa entre duas pessoas.

Essa mudança pode parecer apenas um detalhe técnico, mas altera completamente a percepção da experiência. Em vez de esperar que a pessoa termine completamente uma frase para então iniciar uma resposta, o GPT-Live consegue interpretar melhor o ritmo da conversa, tornando o diálogo menos mecânico e muito mais confortável.

Outro benefício é a redução da latência. As respostas chegam mais rapidamente, principalmente quando o usuário escolhe o modo Instant, voltado para perguntas simples e interações rápidas.

GPT-5.5 entra em ação quando a pergunta exige mais

Um dos recursos mais interessantes apresentados pela OpenAI é a capacidade do GPT-Live de identificar automaticamente quando uma solicitação exige capacidades além do processamento local.

Se alguém perguntar, por exemplo, sobre um evento que aconteceu naquele dia, uma cotação da bolsa, uma previsão do tempo, o resultado de uma partida esportiva ou qualquer informação recente, o GPT-Live poderá recorrer ao GPT-5.5 para buscar esses dados na internet.

O usuário não precisa solicitar uma pesquisa nem mudar de modo manualmente. O próprio sistema decide quando a busca é necessária e devolve a resposta dentro da mesma conversa.

Essa integração faz com que a experiência seja muito mais fluida do que alternar entre aplicativos ou abrir um navegador para encontrar a informação desejada.

Além das pesquisas na web, o GPT-5.5 também é utilizado quando a pergunta exige um raciocínio mais complexo, análise de múltiplos fatores ou resolução de problemas mais elaborados.

A OpenAI informou que existem diferentes níveis de processamento disponíveis para essas tarefas.

O modo Instant prioriza velocidade e utiliza o GPT-5.5 Instant.

Já os níveis Medium e High empregam o GPT-5.5 Thinking, modelo projetado para dedicar mais tempo ao raciocínio antes de produzir uma resposta, sendo especialmente útil para questões técnicas, planejamento, programação, matemática e análises mais profundas.

Essa flexibilidade permite que cada usuário escolha entre respostas quase imediatas ou uma IA que dedica mais tempo para encontrar a melhor solução.

Cartões visuais tornam a experiência ainda mais completa

Outra novidade importante é a chegada dos cartões visuais ao ChatGPT Voice.

Durante determinadas conversas, o aplicativo deixa de responder apenas por áudio e passa a apresentar informações gráficas na tela sempre que isso fizer sentido.

Entre os exemplos divulgados pela OpenAI estão previsões do tempo, cotações do mercado financeiro e resultados esportivos.

Na prática, isso significa que uma pessoa pode perguntar sobre a temperatura prevista para o fim de semana e, enquanto escuta a resposta da IA, visualizar um cartão contendo máximas, mínimas, condições climáticas e outras informações relevantes.

O mesmo acontece ao consultar ações negociadas em bolsa ou resultados de competições esportivas.

Essa integração entre voz e elementos visuais aproxima ainda mais o ChatGPT da ideia de um verdadeiro assistente digital, capaz de reunir diferentes formatos de informação em uma única interação.

A OpenAI também destacou que o ChatGPT Voice continua oferecendo suporte a recursos como memória, envio de imagens, upload de arquivos e pesquisas na web, ampliando ainda mais suas possibilidades de uso tanto para tarefas pessoais quanto profissionais.

Os testes mostram evolução na qualidade das conversas

Antes do lançamento, a OpenAI realizou uma série de avaliações comparando o GPT-Live com o antigo Advanced Voice Mode.

Segundo a empresa, os novos modelos foram os preferidos pelos participantes em conversas com duração entre cinco e dez minutos.

Os testes analisaram diferentes aspectos da interação, incluindo naturalidade, qualidade das respostas, fluidez da conversa, tempo de resposta, capacidade de lidar com interrupções e facilidade para manter um diálogo contínuo.

A empresa afirma que mais de 150 milhões de pessoas utilizam semanalmente recursos de voz e ditado no ChatGPT, um número que demonstra como as interações por áudio deixaram de ser um recurso secundário para se tornar uma das principais formas de utilizar a inteligência artificial.

Com essa base crescente de usuários, melhorias na experiência de voz passam a ter impacto direto na forma como milhões de pessoas pesquisam informações, estudam, trabalham e utilizam assistentes digitais no dia a dia.

Nem todos os recursos chegaram nesta primeira versão

Apesar das novidades, o GPT-Live ainda possui algumas limitações.

No lançamento inicial, ele não oferece suporte para chamadas por voz com vídeo nem para compartilhamento de tela durante as conversas.

Esses recursos continuam disponíveis apenas nos modos de voz anteriores, onde já eram compatíveis.

A OpenAI informou que essas funcionalidades continuam em desenvolvimento e deverão ser incorporadas ao GPT-Live em futuras atualizações.

Isso indica que a empresa pretende transformar o novo modelo na principal plataforma para todas as experiências de voz dentro do ChatGPT.

O impacto pode ir muito além da experiência do usuário

Embora o lançamento tenha como foco melhorar a experiência de conversação, seus efeitos podem alcançar também produtores de conteúdo, veículos de imprensa e profissionais de SEO.

Quando o GPT-Live utiliza o GPT-5.5 para realizar uma pesquisa na internet, ainda não está totalmente claro como as fontes utilizadas serão apresentadas durante uma conversa por voz.

Nas respostas em texto, o ChatGPT normalmente exibe links para os sites consultados. Já nas conversas por áudio, permanece a dúvida sobre como essas referências aparecerão.

Elas poderão ser exibidas apenas em cartões visuais, mencionadas verbalmente ou permanecer invisíveis para o usuário.

Esse detalhe pode influenciar diretamente o tráfego enviado para sites, já que uma parcela crescente das pesquisas poderá acontecer inteiramente dentro das conversas com inteligência artificial.

Para empresas, criadores de conteúdo e profissionais de marketing digital, essa será uma das mudanças mais importantes a acompanhar nos próximos meses.

Se o modelo mantiver boa visibilidade para as fontes originais, ele poderá fortalecer a descoberta de conteúdo de qualidade. Caso contrário, as estratégias de otimização para mecanismos de busca poderão passar por uma nova transformação, impulsionada pelo crescimento das interfaces conversacionais baseadas em IA.

Apoie o Eurisko
Este conteúdo é independente, sem anúncios e feito por pessoas.
A inteligência artificial e as mudanças recentes do Google reduziram significativamente o alcance dos sites independentes. Se este conteúdo foi útil para você, considere apoiar o Eurisko e todo o ecossistema de projetos com qualquer valor.
Quero apoiar
Seguir:
Renê Fraga é fundador e editor-chefe do Eurisko, ecossistema editorial independente dedicado à inteligência artificial, código aberto, tecnologia e cultura digital. Atuando com projetos online desde 1996, escreve há mais de 20 anos sobre tecnologia e inovação, acompanhando a evolução da internet e o impacto das novas tecnologias na forma como vivemos, trabalhamos e pensamos.
Nenhum comentário