Ubuntu ganha uma IA que transforma sua voz em texto, direto no desktop

Renê Fraga
11 min de leitura

Principais destaques

  • Myna já pode ser testado: a nova ferramenta de ditado com IA funciona localmente no Ubuntu 26.04 LTS e 26.10, embora ainda esteja em fase experimental.
  • Tudo roda no dispositivo: modelos como Whisper e Parakeet processam a fala localmente, sem enviar os áudios para a nuvem.
  • Ainda há arestas: instalação, foco das janelas e alguns componentes continuam sujeitos a erros enquanto a Canonical prepara o recurso para testes mais amplos.

O Ubuntu está começando a ganhar algo que usuários de smartphones já consideram banal: falar e deixar a máquina escrever.

O nome da novidade é Myna, uma ferramenta de ditado baseada em inteligência artificial que transforma voz em texto diretamente no desktop. A diferença é que, em vez de depender de um serviço online, o processamento acontece localmente.

A Canonical ainda não abriu oficialmente uma rodada de testes. Mas praticamente todas as peças necessárias já estão disponíveis para quem quiser montar o quebra-cabeça.

E, sim, ainda é um quebra-cabeça.

O Myna está quase pronto. Quase. 🐧

A Canonical adicionou recentemente o orquestrador Myna e seus modelos de reconhecimento de fala à Snap Store. Também disponibilizou o aplicativo Myna Settings, responsável por configurar o sistema.

No Ubuntu 26.10, há ainda outro componente importante: uma extensão do GNOME Shell capaz de exibir na tela o status do reconhecimento de voz.

No Ubuntu 26.04 LTS, a situação é um pouco diferente. Em vez do HUD visual, o sistema utiliza notificações para informar o usuário sobre o estado do Myna.

🔎 O detalhe importante: apesar de ainda estar em desenvolvimento, o conjunto já permite experimentar a tecnologia.

O sistema foi pensado para funcionar quando o usuário pressiona uma tecla de atalho. O Myna então começa a escutar, processa a fala e insere a transcrição no campo de texto que estiver em foco.

Nada de deixar um microfone permanentemente ouvindo.

💡 A ideia é simples: pressione um botão, fale, pressione novamente e o Ubuntu transforma sua fala em texto.

E o áudio fica onde? No computador. 🔒

Um dos aspectos mais interessantes do Myna é justamente a arquitetura local.

Os modelos de reconhecimento de voz são executados no próprio dispositivo. Segundo a documentação apresentada no material, os trechos de áudio não deixam o computador nem são armazenados nele.

Isso coloca o Myna em uma categoria diferente de soluções de ditado baseadas em nuvem.

Para quem trabalha com textos longos, anotações, documentos ou mensagens, a proposta pode ser especialmente útil. O usuário pode simplesmente começar a falar e deixar a IA cuidar da transcrição.

Sem precisar abrir um navegador. Sem depender de uma conexão com a internet.

Mas primeiro vem a parte menos divertida: instalar tudo 🛠️

Para testar o Myna no Ubuntu 26.04 LTS ou 26.10, são necessários três componentes principais:

ComponenteFunção
Myna SettingsConfigura o sistema e suas preferências
MynaCliente responsável pelo ditado
Modelo de IAFaz o reconhecimento e a transcrição da fala

Quem estiver no Ubuntu 26.10 ainda terá acesso à extensão Myna Shell, responsável pelo HUD visual.

A instalação do aplicativo de configurações começa pela adição de um PPA:

sudo add-apt-repository ppa:charles05/myna-config

Depois:

sudo apt install myna-config

O cliente Myna exige uma funcionalidade experimental do Snap:

sudo snap set system experimental.user-daemons=true

E então pode ser instalado:

sudo snap install myna --edge

O uso do canal --edge já dá uma pista importante: não estamos diante de uma ferramenta finalizada.

Você ainda precisa escolher o cérebro da IA 🧠

O Myna não faz a transcrição sozinho. É necessário instalar um modelo de reconhecimento de fala.

Atualmente, três opções aparecem na Snap Store:

• Whisper, da OpenAI
• Parakeet, da NVIDIA
• FunASR

Os modelos são executados localmente, mas não são exatamente leves. Dependendo da opção escolhida, é necessário reservar aproximadamente 1 GB a 2 GB de espaço em disco.

Para instalar o Parakeet:

sudo snap install myna-parakeet --edge

Ou o Whisper:

sudo snap install myna-whisper --edge

Também é possível experimentar o FunASR:

sudo snap install myna-funasr --edge

Parakeet ou Whisper? 🤔

Nos testes relatados pelo autor, o Parakeet apresentou maior precisão, chegando a reconhecer corretamente até mesmo o sobrenome do jornalista.

O Whisper, por outro lado, pareceu mais rápido, mas apresentou alguns erros relacionados a palavras com pronúncia semelhante.

É justamente aí que entra uma das vantagens do Myna Settings.

Mais velocidade ou mais precisão?

O aplicativo permite escolher diferentes tamanhos de modelo.

Modelos menores tendem a exigir menos recursos e processar a fala mais rapidamente, algo interessante para computadores modestos.

Modelos maiores podem reduzir erros de transcrição e lidar melhor com palavras difíceis, mas obviamente exigem mais capacidade de processamento.

⚙️ É o velho equilíbrio da IA local: quanto mais cérebro você coloca na máquina, mais recursos ela precisa.

Depois de instalar o modelo, o Myna Settings deve deixar de exibir a tela inicial de configuração e passar a mostrar as opções disponíveis.

O curioso é que o próprio assistente de primeira execução ainda não funciona corretamente. Se você tentar instalar o modelo por meio do botão apresentado no aplicativo, poderá receber um erro.

Por enquanto, o terminal resolve o problema.

E como usar o Myna no dia a dia? 🎙️

Depois de instalar os componentes, é preciso verificar se o microfone está funcionando em Configurações > Som > Entrada.

Em seguida, o usuário define uma tecla de atalho no Myna Settings.

Os atalhos podem variar. Em um dos computadores testados pelo autor, o padrão era Super + J. Em outro, Super + T.

Com um campo de texto selecionado, basta pressionar o atalho.

No Ubuntu 26.10, o HUD aparece na tela. No 26.04, uma notificação informa o estado do recurso.

Então é só falar.

Quando terminar, pressione novamente o atalho e o texto será inserido no aplicativo que estava em foco.

O problema é perder o foco 👀

É aqui que o Myna ainda mostra sua juventude.

Se você clicar fora do campo de texto, abrir outro aplicativo ou fizer alguma ação que altere o foco da janela, o sistema pode interromper a operação.

O HUD então informa algo como “focus lost”.

Nesse caso, é preciso começar novamente.

Isso pode ser particularmente irritante durante uma fala longa. Imagine ditar um parágrafo inteiro e, no meio do processo, clicar acidentalmente em outra janela.

A IA não vai simplesmente esperar você voltar.

🗣️ Para textos longos, porém, a proposta faz bastante sentido: em vez de digitar dezenas ou centenas de palavras, você simplesmente fala e deixa o reconhecimento de voz trabalhar.

Não espere chamar “Hey Myna” ainda

O Myna também não funciona como um assistente virtual tradicional.

Não existe, pelo menos por enquanto, um comando de ativação por voz como “Hey Myna”.

O sistema só começa a ouvir depois que o usuário pressiona a tecla configurada.

Isso também ajuda a explicar a proposta de privacidade: o computador não precisa ficar escutando continuamente.

A gravação acontece quando o usuário explicitamente ativa o recurso.

Uma novidade importante para a acessibilidade ♿

Mesmo em estágio experimental, o Myna pode representar uma mudança interessante para o Ubuntu.

O ditado offline amplia as possibilidades de interação para pessoas que têm dificuldades com teclado ou simplesmente preferem falar a escrever.

Mas existe uma questão maior.

Smartphones e smartwatches já oferecem reconhecimento de voz local há anos. Ainda assim, para muitas tarefas cotidianas, as pessoas continuam digitando mensagens, e-mails e até prompts para ferramentas de IA.

Talvez o desafio do Myna não seja provar que a tecnologia funciona.

É convencer o usuário a mudar um hábito.

🎯 O Ubuntu está tentando transformar o ditado em uma função nativa do desktop, e não apenas em um recurso escondido dentro de um aplicativo.

E o Myna quer ir além do GNOME

A primeira implementação está bastante ligada ao ambiente GNOME, Wayland e Mutter.

Mas a tecnologia está sendo desenvolvida com uma ambição mais ampla: tornar-se independente do desktop utilizado.

Isso abre uma possibilidade interessante para o futuro.

Em vez de o reconhecimento de voz ser uma função exclusiva de um determinado aplicativo, ele poderia se tornar uma camada de entrada disponível praticamente em qualquer lugar do sistema.

Você abre um editor, navegador, terminal ou aplicativo de mensagens, coloca o cursor em um campo de texto e fala.

O computador escreve.

Ainda não é exatamente essa experiência em todos os casos. O Myna pode perder o foco, a configuração ainda exige comandos no terminal e o instalador automático não está funcionando como deveria.

Mas a direção está bastante clara.

O Ubuntu está colocando uma IA de reconhecimento de voz dentro do próprio desktop. E, quando a Canonical finalmente abrir o recurso para testes oficiais, talvez a pergunta deixe de ser se o Myna funciona.

A questão será outra: quantas pessoas vão preferir falar com o computador em vez de continuar digitando?

Apoie o Eurisko
Este conteúdo é independente, sem anúncios e feito por pessoas.
A inteligência artificial e as mudanças recentes do Google reduziram significativamente o alcance dos sites independentes. Se este conteúdo foi útil para você, considere apoiar o Eurisko e todo o ecossistema de projetos com qualquer valor.
Quero apoiar
Seguir
Renê Fraga é fundador e editor-chefe do Eurisko, ecossistema editorial independente dedicado à inteligência artificial, código aberto, tecnologia e cultura digital. Atuando com projetos online desde 1996, escreve há mais de 20 anos sobre tecnologia e inovação, acompanhando a evolução da internet e o impacto das novas tecnologias na forma como vivemos, trabalhamos e pensamos.
Nenhum comentário