Tecnologia

Meta lança IA que transcreve conversas em tempo real e muito mais

A Meta apresentou nesta terça-feira (1) o Muse Voice Transcribe, seu primeiro modelo de inteligência artificial (IA) voltado à percepção de áudio em tempo real. A tecnologia consegue transcrever conversas enquanto elas acontecem, distinguir quem está falando e lidar com mais de 20 pessoas simultaneamente.

Continua após a publicidade

O modelo foi desenvolvido pelo Meta Superintelligence Labs (MSL) e também consegue trabalhar com diferentes idiomas em uma mesma conversa. Segundo a empresa, ele foi treinado com mais de 70 idiomas, sendo que 25 deles foram amplamente validados para o lançamento.


Uma das características mais interessantes do Muse Voice Transcribe é a capacidade de realizar o chamado code-switching, quando uma pessoa alterna entre idiomas durante uma conversa. A tecnologia consegue reconhecer essa mudança mesmo no meio de uma frase.

Em uma demonstração divulgada pela Meta, oito pessoas conversam simultaneamente e o sistema consegue identificar cada participante e associar corretamente suas falas. A IA também consegue lidar com interrupções, sobreposição de vozes e diferentes sotaques.

A tecnologia combina três funções principais em um único modelo: reconhecimento automático de fala em fluxo contínuo (ASR, na sigla em inglês), identificação dos diferentes participantes da conversa, conhecida como speaker diarization, e identificação dos momentos em que uma fala começa ou termina.

Leia mais:

Exemplo de uso da nova IA da Meta
Modelo também consegue trabalhar com diferentes idiomas em uma mesma conversa – Imagem: Reprodução/Meta

IA decide quanto tempo deve ouvir

  • O Muse Voice Transcribe processa o áudio em blocos de 80 milissegundos. A cada novo trecho, o modelo decide se deve continuar ouvindo ou começar a produzir o texto;
  • A Meta chama esse mecanismo de “atraso adaptativo”. Na prática, a IA pode esperar um pouco mais quando encontra uma palavra difícil e produzir a transcrição mais rapidamente quando identifica uma palavra simples;
  • A estratégia busca equilibrar velocidade e precisão. Quanto mais tempo o modelo espera antes de transcrever, maior tende a ser a precisão, mas também aumenta o atraso na resposta;
  • A tecnologia também pode utilizar informações sobre o idioma, palavras-chave e contexto para melhorar a precisão das transcrições;
  • Segundo a Meta, o Muse Voice Transcribe alcançou a primeira posição nos rankings da Artificial Analysis para reconhecimento de fala em streaming e também em benchmarks públicos de identificação de participantes. A classificação considera os resultados disponíveis em 1º de setembro de 2026.

Continua após a publicidade

Onde a tecnologia pode ser usada

O novo modelo já está sendo utilizado para recursos de ditado no aplicativo Meta AI para Mac. Como o aplicativo consegue oferecer recursos de voz para outros serviços, o Muse Voice Transcribe também pode ser usado para ditado em diferentes aplicações.

A tecnologia ainda está disponível para desenvolvedores por meio do Muse Code e da API de modelos da Meta. O acesso custa US$ 3 (cerca de R$ 15,50) por mil minutos de áudio. A Meta também disponibilizou uma demonstração do modelo em sua página de pesquisa, permitindo testar a transcrição de áudio em tempo real.

O lançamento acontece menos de uma semana depois da apresentação do Gemini 3.5 Transcribe, do Google, que também aposta em recursos avançados de reconhecimento de áudio. A diferença é que o Muse Voice Transcribe chega com foco explícito em combinar transcrição, identificação de múltiplos participantes e processamento multilíngue em tempo real.

Rodrigo Mozelli

Rodrigo Mozelli

Rodrigo Mozelli é jornalista formado pela Universidade Metodista de São Paulo (UMESP) e, atualmente, é redator do Olhar Digital.


Olhar Digital

Artigos relacionados

Botão Voltar ao topo