Comparação

Parakeet vs Whisper vs Nemotron: o melhor sistema local de voz para texto em 2026

Três modelos abertos já conseguem converter voz em texto inteiramente no seu computador. Veja como realmente se comparam em precisão, velocidade, idiomas e streaming, com números fiáveis de fontes primárias.

OpenWhispr

OpenWhispr

Engenharia

18 de julho de 2026
Índice

Para inglês e os principais idiomas europeus, o NVIDIA Parakeet TDT 0.6B v3 é o melhor modelo local de voz para texto em 2026: supera o Whisper large-v3 em precisão medida, ocupa um quarto do espaço e é muito mais rápido numa CPU comum. Para texto que aparece ao vivo enquanto fala, os novos modelos de streaming Nemotron da NVIDIA são os primeiros modelos locais concebidos precisamente para isso. E para um dos muitos idiomas não cobertos pela NVIDIA, o Whisper da OpenAI — com 99 idiomas — continua a ser a escolha certa.

A surpresa de 2026 é que o Whisper já não detém a liderança de precisão entre modelos abertos que manteve durante três anos. Mas a pergunta «qual é o melhor?» tornou-se uma verdadeira disputa a três, pois cada modelo se destaca num aspeto: Parakeet otimiza a precisão por watt, Nemotron a latência e Whisper a abrangência. Este artigo compara-os com números das próprias fichas e do leaderboard público, sem impressões vagas nem exagerar as diferenças.

Última atualização: 18 de julho de 2026. Desenvolvemos o OpenWhispr, um aplicativo de ditado de código aberto que inclui as três famílias; por isso, testamos e suportamos todas em produção. Esse é também o nosso ponto de vista: não vendemos nenhum destes modelos, e os compromissos abaixo são os mesmos que explicamos aos nossos usuários.

Resumo da verificação de factos (fontes primárias)

  • O Parakeet TDT 0.6B v3 tem WER médio de 6.34% nos oito testes do Open ASR Leaderboard, com débito de 3,332× tempo real. 600M parâmetros, 25 idiomas, licença CC-BY-4.0. Ficha do Parakeet TDT v3 · Open ASR Leaderboard
  • O Whisper large-v3 obtém cerca de 7.4% no mesmo leaderboard e suporta 99 idiomas com 1.55B parâmetros e licença MIT. Repositório OpenAI Whisper · Ficha do Whisper large-v3
  • O Nemotron Speech Streaming EN 0.6B obtém WER médio de 6.93% em streaming (blocos de 1.12 segundos), chega a 2.32% no LibriSpeech test-clean e foi treinado com 530,000 horas de áudio. Ficha do Nemotron Streaming EN
  • O Nemotron 3.5 ASR cobre 40 variantes regionais num único modelo de streaming de 600M com deteção automática do idioma, lançado em 4 de junho de 2026 sob licença OpenMDW. Ficha do Nemotron 3.5 ASR
  • Todos os tamanhos em disco e comportamentos no aplicativo referidos abaixo podem ser verificados no registro de modelos de código aberto do OpenWhispr. OpenWhispr no GitHub · Página de modelos do OpenWhispr

Os três concorrentes

Os três são modelos gratuitos de pesos abertos, que pode descarregar e executar offline. As arquiteturas diferem e explicam quase todas as diferenças práticas.

OpenAI Whisper (2022)

O modelo que popularizou o reconhecimento de voz aberto. Um transformer codificador-descodificador treinado com 680,000 horas de áudio, disponível em seis tamanhos de 75MB (tiny) a 3GB (large-v3), com 99 idiomas. Gera texto token a token, como um modelo de linguagem — razão pela qual é o mais lento dos três. Licença MIT.

NVIDIA Parakeet (2024–2025)

Um transdutor (TDT) de 600M parâmetros para transcrição em lote. Em vez de gerar tokens autorregressivamente, emite texto numa única passagem pelo áudio — muito mais rápido e sem inventar texto no silêncio. Há duas variantes importantes: v3 multilingue (25 idiomas, 680MB como INT8 ONNX) e Unified exclusivo para inglês (631MB), atualmente com precisão de ponta em inglês. Licença CC-BY-4.0.

NVIDIA Nemotron ASR (2026)

A família mais recente, criada para streaming: um transdutor FastConformer com cache que transcreve o áudio à medida que chega, sem esperar pelo fim da gravação. O modelo inglês chegou em janeiro de 2026; o 3.5 multilingue para 40 variantes seguiu-se em junho. Ambos têm 600M parâmetros (632–650MB como INT8 ONNX) e licença aberta (OpenMDW).

Precisão: Parakeet vence, mas por menos do que parece

Os modelos de voz são avaliados pela taxa de erro de palavras (WER) — a percentagem de palavras erradas. Quanto menor, melhor. A referência é o Open ASR Leaderboard da Hugging Face, que calcula a média do WER em oito conjuntos de dados variados em inglês (reuniões, apresentações de resultados, palestras TED, audiolivros e outros), impedindo que um único conjunto fácil favoreça um modelo.

Precisão em inglês: taxa média de erro de palavras

Médias de vários conjuntos de dados dos testes do Open ASR Leaderboard da Hugging Face (quanto menor, melhor). O Nemotron é mostrado em sua configuração de streaming.

Fontes: cartões de modelos da NVIDIA no Hugging Face e Open ASR Leaderboard, julho de 2026. WER = porcentagem de palavras transcritas incorretamente.

Leia o gráfico com rigor: todos estes modelos estão prontos para produção, e a diferença total ronda 1.5 pontos. No ditado diário, 6.3% e 7.4% parecem semelhantes em áudio limpo; as diferenças surgem em áudio difícil (sotaques, ruído, jargão). O destaque dos números da NVIDIA é o custo: Parakeet atinge esta precisão com 600M parâmetros contra 1.55B do Whisper, e Nemotron regista 6.93% durante o streaming, sem conhecer o áudio futuro.

A fraqueza conhecida do Whisper: alucinações no silêncio

Como o descodificador do Whisper funciona como um modelo de linguagem, pode gerar frases fluentes mas totalmente inventadas durante silêncio ou ruído, uma falha documentada no ecossistema. Transdutores como Parakeet e Nemotron resistem estruturalmente: sem evidência no áudio, não há tokens. No ditado, em que as gravações começam e acabam em silêncio, isso importa mais do que um ponto de benchmark.

Velocidade e eficiência: nem se compara

No hardware do leaderboard, o Parakeet TDT v3 transcreve a 3,332× tempo real — uma hora de áudio em cerca de um segundo. O Whisper large-v3 fica muito abaixo de um décimo disso. A razão é arquitetural: o Whisper escreve token a token, com cada passo à espera do anterior; um transdutor lê o áudio uma vez e emite texto à medida que avança. Sem ciclos nem idas e voltas por palavra.

Em um notebook, os números absolutos são menores, mas a proporção se mantém: um parágrafo que o Whisper large leva segundos para processar surge quase imediatamente com Parakeet, em CPU e sem GPU. Testes independentes indicam ainda que os transdutores NVIDIA usam cerca de 8–10× menos energia por hora de áudio do que o Whisper com qualidade comparável, relevante para quem dita todo o dia com bateria.

A resposta do Whisper é turbo (1.6GB), uma versão destilada do large-v3 que troca alguma precisão por cerca de 8× a velocidade do Whisper-large. É o Whisper certo para ditado, mas reduz a distância sem a eliminar. Consulte a comparação de tamanhos no nosso guia de tamanhos dos modelos Whisper.

Cobertura de idiomas: a vantagem do Whisper

ModeloIdiomasNotas
Whisper large-v399Maior cobertura entre modelos abertos, incluindo idiomas com poucos recursos
Nemotron 3.5 ASR40 variantes regionaisDeteção automática; 15 idiomas prontos para transcrição, incluindo japonês, coreano, árabe e hindi
Parakeet TDT v325Idiomas europeus, inglês e russo; deteção automática
Parakeet Unified / Nemotron EN1Apenas inglês, em troca da melhor precisão da categoria

A regra é simples. Para inglês ou um grande idioma europeu, qualquer um serve; escolha pela velocidade. Japonês, coreano, vietnamita, árabe e hindi já têm streaming no Nemotron 3.5, uma verdadeira estreia em modelos locais. Para mandarim, tailandês, indonésio, suaíli ou forte alternância de idiomas, Whisper continua a ser a única opção séria, e isso não deve mudar em breve.

Streaming: a verdadeira diferença

No streaming, o Nemotron não é apenas um pouco melhor — faz algo que a arquitetura dos outros dois não permite. O Whisper processa áudio em janelas de 30 segundos e volta a codificar tudo. Por isso, Whisper «ao vivo» é o mesmo modelo em lote executado repetidamente sobre áudio sobreposto — dispendioso, lento e instável nas junções. A arquitetura com cache do Nemotron foi treinada para streaming: processa apenas o bloco mais recente, mantém o estado interno e emite texto parcial com latência configurável de 80 milissegundos a 1.12 segundos.

Em grande escala, a diferença de eficiência é enorme: a NVIDIA indica 17× mais streams simultâneos do que o modelo de streaming anterior na mesma GPU. Em um notebook, a vantagem é simples: o texto aparece enquanto você fala, a partir de um modelo na sua CPU. Explicamos a engenharia necessária para disponibilizá-lo em um aplicativo de desktop na nossa análise técnica de ASR em streaming.

Se não precisa de texto ao vivo — dita, para e quer a transcrição final — o streaming não acrescenta nada, e os modelos em lote do Parakeet são melhores. Streaming serve para legendas ao vivo, agentes de voz e a pré-visualização do ditado enquanto fala.

Hardware: os três funcionam num notebook normal

Nenhum precisa de GPU. Os modelos NVIDIA são arquivos ONNX quantizados em INT8 (631–680MB) que funcionam em qualquer CPU recente — Apple Silicon ou x86 — via sherpa-onnx, um binário nativo sem Python nem PyTorch. Whisper funciona em qualquer lugar com whisper.cpp; small e turbo são adequados para CPU, enquanto large-v3 (3GB, ~10GB RAM) beneficia realmente de aceleração.

Se tiver GPU, use-a com Whisper: Metal está integrado em Apple Silicon, e o OpenWhispr oferece runtimes CUDA (NVIDIA) e Vulkan (AMD e Intel) com um clique e retorno automático à CPU em caso de falha. Os transdutores NVIDIA já são tão rápidos em CPU que a aceleração GPU pouco acrescenta ao ditado.

Qual deve usar?

A sua situaçãoUse este
Ditado em inglês, máxima precisãoParakeet Unified EN 0.6B
Idiomas europeus, transcrição rápida em loteParakeet TDT 0.6B v3
Texto ao vivo enquanto fala (inglês)Nemotron Speech Streaming EN
Texto ao vivo em espanhol, japonês, coreano, árabe, hindi…Nemotron 3.5 ASR Streaming
Idioma não coberto pela NVIDIAWhisper large-v3 ou turbo
Hardware antigo ou pouca RAM, notas rápidasWhisper tiny ou base

Se a privacidade é a razão para usar modelos locais, os três são equivalentes: o áudio é processado no computador e nunca enviado. Saiba mais sobre essa escolha em transcrição local versus cloud.

Experimente os três em dois minutos

A forma mais honesta de escolher é ditar o mesmo parágrafo em cada modelo. O OpenWhispr inclui todos — seis tamanhos do Whisper, os dois Parakeet e os dois Nemotron — num único menu, de forma gratuita e aberta em macOS, Windows e Linux. Descarregue um modelo, prima o atalho e fale. A nossa página de modelos lista tamanhos e compromissos.

Perguntas frequentes

Qual é o melhor modelo local de voz para texto em 2026?

Para inglês e os principais idiomas europeus, o NVIDIA Parakeet TDT 0.6B v3 oferece o melhor equilíbrio: tem WER médio de 6.34% nos testes do Open ASR Leaderboard — contra cerca de 7.4% do Whisper large-v3 —, ocupa um quarto do espaço e apresenta um desempenho muito superior em CPU. Para ver texto ao vivo enquanto fala, os modelos de streaming NVIDIA Nemotron são a melhor escolha. Para idiomas não cobertos pelos modelos NVIDIA, use Whisper.

O Parakeet é mais preciso do que o Whisper?

Nos testes em inglês do Open ASR Leaderboard, sim: o Parakeet TDT 0.6B v3 tem WER médio de 6.34%, contra cerca de 7.4% do Whisper large-v3, e o Parakeet Unified exclusivo para inglês chega a 5.91%. A ressalva: uma diferença de ~1 ponto de WER quase não se nota no ditado diário. As vantagens mais claras do Parakeet são velocidade, eficiência e não alucinar texto durante o silêncio, uma falha conhecida do Whisper.

Preciso de uma GPU para executar estes modelos localmente?

Não. Os três funcionam numa CPU moderna. Parakeet e Nemotron usam modelos ONNX quantizados em INT8 (cerca de 630–680MB em disco), concebidos para inferência em CPU. Whisper funciona em CPU via whisper.cpp, embora o modelo grande de 3GB beneficie de aceleração por GPU. O OpenWhispr suporta Metal em Apple Silicon, CUDA em NVIDIA e Vulkan em GPUs AMD/Intel, com retorno automático à CPU.

Que idiomas o Nemotron ASR suporta?

O Nemotron 3.5 ASR da NVIDIA cobre 40 variantes regionais num único modelo de 600M parâmetros com deteção automática do idioma. No OpenWhispr estão ativos os 15 idiomas prontos para transcrição: inglês, espanhol, francês, italiano, português, neerlandês, alemão, turco, russo, árabe, hindi, japonês, coreano, vietnamita e ucraniano. O modelo Nemotron de streaming exclusivo para inglês também está disponível.

O Whisper está obsoleto?

Não. O Whisper ainda cobre 99 idiomas — muito mais do que os 25 do Parakeet ou as 40 variantes do Nemotron — e continua a ser a escolha mais segura para idiomas asiáticos além de japonês, coreano e vietnamita, idiomas com poucos recursos e áudio com forte alternância de idiomas. É também o modelo mais testado e com o maior ecossistema. O que mudou é que já não lidera a precisão nem a velocidade em inglês.

Quais destes modelos o OpenWhispr suporta?

Todos. O OpenWhispr inclui seis tamanhos do Whisper via whisper.cpp, os dois modelos Parakeet e os dois modelos de streaming Nemotron via sherpa-onnx, e permite alternar entre eles nas Configurações. Tudo é executado no seu dispositivo — o áudio nunca sai do computador — e o aplicativo é gratuito e de código aberto.