Comparação

Transcrição local vs. nuvem: privacidade, velocidade e precisão comparadas

Os dados da sua voz são valiosos. Veja o que acontece com eles dependendo de onde você os processa.

OpenWhispr

OpenWhispr

Engenharia

8 de fevereiro de 2026
Índice

A transcrição local processa o seu áudio inteiramente no seu dispositivo usando modelos como o OpenAI Whisper e o NVIDIA Parakeet, executados por meio de runtimes otimizados como o whisper.cpp. Nenhum áudio jamais sai da sua máquina. A transcrição na nuvem envia o seu áudio para servidores remotos operados por provedores como Google, AWS, Microsoft, Deepgram ou AssemblyAI, onde grandes clusters de GPU o processam e devolvem uma transcrição em texto. Os principais trade-offs entre as duas abordagens se resumem a cinco fatores: privacidade, latência, precisão, custo e capacidade offline. Este artigo examina cada um deles com números reais e políticas reais, para você tomar uma decisão informada.

Última atualização: 17 de fevereiro de 2026. As afirmações quantitativas e de políticas são verificadas com base em pelo menos duas fontes primárias.

Resumo da checagem de fatos (fontes duplas)

  • Modelos locais abertos são prontos para produção: o Whisper e o Parakeet têm cards de modelo públicos e implementações abertas adequadas para inferência no dispositivo. OpenAI Whisper · NVIDIA Parakeet
  • O STT na nuvem é cobrado por uso: os principais provedores medem o consumo por volume de áudio e camada do modelo. Preços do Google · Preços da AWS
  • O tratamento de dados varia conforme o provedor: as configurações de registro/retenção e os opt-outs são específicos de cada serviço e precisam ser configurados. Registro de dados do Google · Política de opt-out de IA da AWS
  • O contexto regulatório importa: as obrigações relativas a dados biométricos e sensíveis variam conforme a jurisdição e o caso de uso. Texto oficial do GDPR · Texto oficial do EU AI Act
  • Modelo de implantação do OpenWhispr: o OpenWhispr usa o processamento local por padrão e também oferece roteamento BYOK para a nuvem quando os usuários precisam. OpenWhispr · Runtime whisper.cpp

Local versus nuvem: principais compensações

Local (OpenWhispr)
  • Privacidade: O áudio permanece no dispositivo
  • Latência: Nenhuma viagem de ida e volta da rede
  • Custo: Sem cobrança API por minuto
  • Off-line: Funciona sem internet
  • Controle: Comportamento local determinístico
APIs na nuvem
  • Privacidade: Dependente de política + configuração
  • Latência: Sensível à rede e à região
  • Custo: Faturamento baseado no uso
  • Off-line: Indisponível
  • Escala: Fácil para grandes cargas de trabalho em lote

Melhor padrão prático: primeiro local, encaminhar casos extremos para a nuvem somente quando necessário.

Como funciona a transcrição na nuvem

Quando você usa um serviço de conversão de fala em texto na nuvem, o seu áudio percorre um caminho de várias etapas. Primeiro, o seu dispositivo captura o áudio bruto do microfone e o comprime em um formato adequado à transmissão — normalmente Opus, FLAC ou PCM linear. Esse áudio comprimido é então enviado pela internet até o endpoint da API do provedor, em geral via HTTPS ou uma conexão WebSocket para streaming em tempo real.

Do lado do servidor, o provedor processa o seu áudio em grandes modelos de rede neural hospedados em clusters de GPU. Esses modelos costumam ser treinados com centenas de milhares de horas de dados de fala rotulados, muito mais do que qualquer pessoa conseguiria reunir sozinha. A transcrição resultante é devolvida ao seu dispositivo.

Os principais provedores de transcrição na nuvem incluem:

  • Google Cloud Speech-to-Text — Ampla cobertura de idiomas, com opções de processamento em lote e streaming em tempo real.
  • AWS Transcribe — A oferta da Amazon, com identificação automática de idioma, suporte a vocabulário personalizado e redação de PII.
  • Microsoft Azure Speech — Integração profunda com o ecossistema Microsoft, modelos de fala personalizados e transcrição em tempo real.
  • Deepgram — Conhecido pela velocidade e pela experiência do desenvolvedor, com o modelo Nova-3 oferecendo alta precisão a preços competitivos.
  • AssemblyAI — Focado em precisão e ferramentas para desenvolvedores, com diarização de falantes e moderação de conteúdo integradas.

A latência na nuvem é variável porque inclui captura, upload, inferência no servidor e entrega da resposta. Em ambientes bem conectados, ela pode parecer rápida, enquanto redes instáveis ou regiões de alta latência podem tornar a experiência visivelmente mais lenta. A transcrição em lote pode levar de segundos a minutos, dependendo do tamanho do arquivo e da fila.

Como funciona a transcrição local

A transcrição local executa o modelo de reconhecimento de fala diretamente no seu dispositivo. Não há rede envolvida — o áudio vai do microfone direto para um modelo rodando na sua CPU ou GPU, e o texto sai do outro lado. Todo o processo acontece na memória da sua máquina.

O avanço que tornou prática a transcrição local de alta qualidade foi o lançamento do Whisper pela OpenAI em setembro de 2022 — um modelo de código aberto treinado com 680.000 horas de áudio multilíngue. Mais recentemente, a NVIDIA lançou sua família de modelos de ASR Parakeet, que alcançam precisão de ponta em benchmarks em inglês e estão disponíveis sob licenças abertas. Pouco depois, Georgi Gerganov criou o whisper.cpp, uma reimplementação em C/C++ otimizada para inferência em CPU, que levou a precisão do Whisper para hardware comum, sem exigir uma GPU dedicada.

O Whisper vem em vários tamanhos de modelo, cada um trocando precisão por velocidade:

ModeloParâmetrosVRAMVelocidade relativa
Tiny39M~1 GB~10x
Base74M~1 GB~7x
Small244M~2 GB~4x
Medium769M~5 GB~2x
Large-v31550M~10 GB1x (referência)
Turbo809M~6 GB~8x

No Apple Silicon (do M1 ao M4), o whisper.cpp executa a inferência inteiramente na GPU via Metal, atingindo velocidades em tempo real ou superiores ao tempo real mesmo com o modelo medium. O modelo Turbo — uma variante otimizada do large-v3 com perda mínima de precisão — roda com alto throughput nos MacBooks modernos, e é por isso que ele é comumente usado em fluxos de ditado local de baixa latência.

Outros motores de transcrição local incluem o Vosk (leve, com precisão menor) e o Sherpa-ONNX (Kaldi de nova geração com suporte ao runtime ONNX). Ainda assim, o OpenAI Whisper via whisper.cpp e o NVIDIA Parakeet seguem como o padrão-ouro em qualidade de transcrição local.

Privacidade: o trade-off central

A privacidade é o maior diferencial entre a transcrição local e a transcrição na nuvem. Com o processamento local, a pergunta "o que acontece com os dados do meu áudio?" tem uma resposta simples: nada. Eles ficam no seu dispositivo, na sua RAM, e são descartados após a transcrição. Não há terceiros em quem confiar, política para ler nem vazamento de dados com que se preocupar.

A transcrição na nuvem exige que você confie no seu provedor. Veja o que os principais provedores realmente dizem sobre como tratam o seu áudio:

Google Cloud Speech-to-Text

O registro de dados do Google para o Speech-to-Text vem desativado por padrão. Quando desativado, o Google afirma que os dados de áudio são processados em memória, usados apenas para retornar o resultado da transcrição e não armazenados em servidores. No entanto, se você optar pelo registro de dados (ou usar certos recursos que o exigem), seu áudio e suas transcrições podem ser armazenados e usados para aprimorar os modelos do Google. A documentação de registro de dados do Google detalha essas distinções.

A localização do processamento de dados pode ser especificada por região, o que é importante para a conformidade com o GDPR.

AWS Transcribe

Por padrão, a AWS pode usar o conteúdo processado pelo Amazon Transcribe para desenvolver e aprimorar os serviços de IA/ML da AWS. No entanto, você pode optar por sair disso usando as políticas de opt-out dos serviços de IA da AWS. Quando você opta por sair, a AWS afirma que o seu conteúdo não é armazenado nem usado para aprimorar serviços. Os dados de áudio são criptografados em trânsito e em repouso.

Importante: o opt-out não é o padrão. Você precisa configurá-lo ativamente.

Microsoft Azure Speech

O Azure não usa dados de clientes para aprimorar seus modelos base por padrão. Sua documentação de privacidade de dados afirma que o áudio enviado ao serviço Speech é processado e imediatamente excluído de seus servidores. Se você criar um modelo personalizado, os dados de treinamento que fornecer ficam armazenados na mesma região do recurso até que você os exclua explicitamente.

O Azure oferece implantação em contêiner desconectado para processamento totalmente local (on-premises).

Considerações regulatórias

GDPR: Gravações de voz são consideradas dados biométricos sob a legislação da UE. Enviar áudio para provedores de nuvem sediados nos EUA levanta preocupações sobre transferência de dados no âmbito do GDPR, mesmo com Cláusulas Contratuais Padrão (SCCs) ou o Data Privacy Framework UE-EUA. O processamento local evita isso por completo, mantendo os dados biométricos dentro do próprio dispositivo do titular dos dados.

HIPAA: Prestadores de serviços de saúde que usam transcrição na nuvem precisam garantir que o provedor ofereça um Acordo de Associado Comercial (BAA). Google, AWS e Azure oferecem BAAs, mas os requisitos de configuração são rigorosos. A transcrição local contorna as regras de tratamento de dados do HIPAA, porque as informações de saúde protegidas nunca saem do controle da entidade coberta.

A vantagem local

Com a transcrição local, não há política de privacidade para interpretar, cronograma de retenção de dados em que confiar nem botão de opt-out para encontrar. Seu áudio é processado na RAM e nunca gravado em disco (a menos que você opte por salvar uma gravação). É um modelo de confiança fundamentalmente diferente — você não precisa confiar em ninguém, porque os dados nunca saem da sua máquina.

Precisão: o quão perto o local chega?

Sejamos honestos: os melhores provedores de nuvem ainda levam vantagem em precisão bruta para certos casos de uso. Eles treinam com vastos conjuntos de dados proprietários, oferecem atualizações de modelo em tempo real e podem aproveitar vocabulários personalizados específicos do contexto. Para áudios difíceis — sotaques fortes, ambientes barulhentos, jargão específico de um domínio — serviços de nuvem como o Chirp 2 do Google ou o Nova-3 da Deepgram tendem a ter bom desempenho.

Dito isso, a diferença diminuiu drasticamente. O OpenAI Whisper large-v3, treinado com 680.000 horas de áudio multilíngue, alcança Taxas de Erro de Palavra (WER) competitivas na maioria dos idiomas comuns. Os modelos Parakeet da NVIDIA elevaram ainda mais o nível, atingindo algumas das menores WERs em benchmarks padrão de inglês. Benchmarks independentes mostram de forma consistente que esses modelos abertos têm desempenho a poucos pontos percentuais dos serviços de nuvem comerciais para o inglês e, às vezes, superando-os em idiomas específicos da cauda longa.

O modelo Turbo — uma variante destilada do large-v3 com 809M de parâmetros em vez de 1,55B — mantém a maior parte da precisão enquanto roda cerca de 8x mais rápido. Para ditado em tempo real, em que você fala com clareza em um microfone decente, a diferença entre o Turbo e uma API de nuvem é desprezível para a maioria dos usuários.

Vantagens de precisão da nuvem

  • Vocabulário personalizado e adaptação a domínios
  • Melhorias contínuas dos modelos no servidor
  • Melhor diarização de falantes (quem disse o quê)
  • Pontuação e formatação automáticas ajustadas por idioma

Vantagens de precisão do local

  • Sem artefatos de compressão de áudio da transmissão pela rede
  • Desempenho consistente e determinístico — sem variação de servidor
  • Áudio completo e sem compressão de 16 kHz alimentado diretamente no modelo
  • Whisper large-v3 e Parakeet equiparam-se à nuvem para ditado com fala clara

Resumo: se você dita em um ambiente silencioso com um microfone decente, modelos como o Whisper Turbo, o Whisper large-v3 ou o Parakeet rodando localmente vão lhe dar resultados indistinguíveis dos serviços de nuvem para a maioria dos fins práticos. A nuvem sai na frente em cenários ruidosos com vários falantes, idiomas de nicho e vocabulários específicos de domínio.

Velocidade e latência

A latência importa mais para o ditado em tempo real, em que você quer ver suas palavras aparecerem imediatamente após falar. Aqui, a transcrição local e a transcrição na nuvem têm perfis de latência fundamentalmente diferentes.

Detalhamento da latência na nuvem

  • Captura + codificação do áudio
  • Upload e download pela rede (varia conforme a qualidade da rota)
  • Fila + inferência no servidor (varia conforme a carga do provedor)
  • A latência percebida pelo usuário pode variar bastante de acordo com a rede e a região.

Latência local (Apple Silicon)

  • Tiny/base: resposta mais rápida, teto de qualidade menor
  • Small: equilíbrio entre velocidade e qualidade
  • Turbo: candidato a ditado em tempo real de alta qualidade
  • Modelos grandes: qualidade máxima, mais pesados em computação
  • Sem dependência de rede. Consistente, independentemente da conexão.

Para streaming em tempo real, os provedores de nuvem conseguem devolver hipóteses parciais rapidamente quando a conectividade está boa. Mas isso ainda exige uma conexão estável e de baixa latência. Em um avião, em um Wi-Fi público congestionado ou atrás de rotas de VPN restritivas, a latência percebida pode se degradar rapidamente.

A transcrição local com whisper.cpp não é streaming em tempo real no sentido tradicional. A maioria das implementações locais usa um padrão de "apertar para falar": você fala, o áudio é armazenado em buffer e então o modelo processa o segmento completo. Com o modelo Turbo em um chip Apple série M, essa etapa de processamento é rápida o suficiente para que o atraso pareça desprezível no ditado — normalmente menos de um segundo para frases curtas.

Para a transcrição de arquivos longos pré-gravados, os serviços de nuvem conseguem paralelizar entre clusters de GPU e muitas vezes concluem grandes lotes rapidamente. O throughput local é limitado pela sua máquina e pela escolha do modelo, então o tempo de execução pode ser mais lento para gravações muito longas.

Custo: grátis vs. pagamento por minuto

A transcrição local não custa nada além do hardware que você já possui. Não há chave de API, painel de cobrança nem cobrança por minuto. Você baixa um arquivo de modelo (de 75 MB para o Tiny a 3 GB para o Large-v3) e pronto. Para sempre.

Os provedores de nuvem cobram por uso (por minuto ou por hora, dependendo do fornecedor e do modelo). Planos e descontos mudam com frequência, então verifique as tarifas atuais antes de fazer um orçamento:

ProvedorEm lote / pré-gravadoStreaming / tempo realCamada gratuita
Google Speech-to-TextCobrado por uso (em camadas por modelo)Cobrado por uso (em camadas por modelo)Cotas de teste/gratuitas variam por conta
AWS TranscribeCobrado por usoCobrado por usoCamada gratuita inicial (por tempo limitado)
Azure SpeechVaria por região/modeloVaria por região/modeloCota gratuita limitada
DeepgramCobrado por uso, por camada de modeloCobrado por uso, por camada de modeloTeste com base em créditos
AssemblyAICobrado por uso, por camada de modeloCobrado por uso, por camada de modeloTeste com base em créditos
Local (Whisper / Parakeet)GrátisGrátisIlimitado, para sempre

Como estimar o seu gasto com a nuvem

Use esta fórmula simples: minutos anuais de áudio x tarifa do fornecedor. Se a sua equipe dita muito, o custo total cresce de forma linear com o uso e o número de assentos.

A inferência local (Whisper/Parakeet) evita cobranças contínuas de API, e é por isso que muitas equipes mantêm o local como padrão e só roteiam casos especiais para a nuvem.

Observação: os preços da nuvem muitas vezes incluem cobranças adicionais por recursos como diarização de falantes, redação de PII ou vocabulários personalizados. Os preços base acima referem-se apenas à transcrição padrão.

Capacidade offline: quando o local vence em definitivo

Esta é binária: a transcrição na nuvem exige internet, a transcrição local não. Para muita gente, esse é o fator decisivo.

Cenários em que a capacidade offline não é opcional:

Viagens e trabalho remoto

Voos, trens, áreas rurais, regiões em desenvolvimento — qualquer lugar com Wi-Fi instável ou inexistente. A transcrição local funciona exatamente igual a 10.000 metros de altitude e na sua mesa.

Ambientes isolados (air-gapped)

Instalações governamentais, contratantes de defesa, laboratórios de pesquisa seguros e instituições financeiras costumam operar em redes isoladas, onde o acesso de saída à internet é totalmente bloqueado. A transcrição local é a única opção.

Trabalho de campo

Jornalistas em zonas de conflito, pesquisadores em estações de campo remotas, profissionais de saúde em clínicas rurais — esses profissionais precisam de transcrição confiável em ambientes onde o sinal de celular pode ser instável ou inexistente.

Confiabilidade

Mesmo em escritórios bem conectados, os serviços de nuvem sofrem interrupções. AWS, Google Cloud e Azure já tiveram incidentes de várias horas que afetaram APIs de fala. A transcrição local não tem nenhuma dependência externa que possa cair.

Comparação lado a lado

FatorLocalNuvem
Privacidade
Precisão (inglês)
Precisão (multilíngue)
Latência
Custo
Uso offline
Facilidade de configuração
Diarização de falantes
Escalabilidade

Quando escolher cada um

Nenhuma das abordagens é universalmente melhor. A escolha certa depende do que você prioriza.

Escolha o local se...

  • A privacidade é inegociável (área médica, jurídica, diários pessoais)
  • Você precisa de operação offline ou em ambiente isolado (air-gapped)
  • Você quer custo zero contínuo para transcrição
  • Seu caso de uso principal é o ditado (um único falante, áudio claro)
  • Você está sujeito ao GDPR, à HIPAA ou a regulamentações semelhantes

Escolha a nuvem se...

  • Você precisa de diarização de falantes para reuniões com várias pessoas
  • Máxima precisão em condições de áudio difíceis
  • Você está criando um aplicativo que precisa escalar para muitos usuários
  • Você precisa de transcrição por streaming em tempo real
  • Seu hardware é limitado e não consegue rodar modelos grandes

A abordagem híbrida

Você não precisa escolher uma exclusivamente. Alguns aplicativos — incluindo o OpenWhispr — oferecem os dois modos: use modelos locais como o Whisper e o Parakeet por padrão, em prol da privacidade e do custo zero, e, opcionalmente, traga a sua própria chave de API de nuvem (OpenAI, Deepgram etc.) quando precisar da precisão ou dos recursos extras que a nuvem oferece. Esse modelo "BYOK" (Traga Sua Própria Chave) lhe dá o melhor dos dois mundos sem prendê-lo a nenhuma das abordagens.

Fontes e leitura complementar

Experimente as duas abordagens em um só aplicativo

O OpenWhispr oferece tanto modelos locais (OpenAI Whisper e NVIDIA Parakeet) para privacidade e custo zero quanto chaves de API de nuvem do tipo traga-a-sua-própria quando você precisa de máxima precisão. Código aberto, grátis para sempre.

Sem necessidade de conta · Funciona offline · Código aberto para sempre