Técnico

Como o Whisper IA funciona: um guia completo

Um mergulho técnico no modelo de reconhecimento de fala de código aberto da OpenAI — dos espectrogramas mel à decodificação por transformer.

OpenWhispr

OpenWhispr

Engenharia

3 de fevereiro de 2026
Índice

O Whisper é um modelo de reconhecimento automático de fala (ASR) desenvolvido pela OpenAI. Lançado em setembro de 2022, é um sistema de reconhecimento de fala de uso geral treinado com 680.000 horas de dados de áudio multilíngue coletados da internet. O Whisper usa uma arquitetura Transformer de codificador-decodificador que converte o áudio em espectrogramas log-mel, os processa por meio de um codificador de rede neural e decodifica tokens de texto de forma autorregressiva. Ele oferece suporte a transcrição em 99 idiomas, tradução para o inglês, identificação de idioma e previsão de marcações de tempo — tudo dentro de um único modelo unificado. Ao contrário da maioria dos serviços comerciais de ASR, os pesos do Whisper são totalmente de código aberto sob a licença MIT, o que permitiu o florescimento de um ecossistema de ports, otimizações e aplicações — incluindo o whisper.cpp, a implementação em C/C++ que torna o Whisper prático para reconhecimento de fala em tempo real e no próprio dispositivo.

Última atualização: 17 de fevereiro de 2026. As afirmações quantitativas deste artigo são verificadas com pelo menos duas fontes primárias.

Resumo da checagem de fatos (fontes duplas)

  • Lançamento, escala de treinamento e licença do Whisper: A OpenAI lançou o Whisper em setembro de 2022, treinado com 680.000 horas, sob a licença MIT. Artigo no arXiv · Repositório do OpenAI Whisper
  • Escopo das tarefas e suporte a idiomas: O Whisper oferece suporte a transcrição, tradução para o inglês, identificação de idioma e tokens de marcação de tempo em 99 idiomas. Cartão do modelo Whisper · README do Whisper
  • Contexto do benchmark em inglês: cerca de 3% de WER é um número de benchmark no LibriSpeech test-clean para avaliação focada em inglês, e não uma taxa universal do mundo real. Cartão do modelo large-v2 · Detalhes do benchmark
  • Atualizações recentes do modelo: o large-v3 registra menos erros que o large-v2 em muitos idiomas, e o turbo prioriza menor latência com menor custo de computação do decodificador. Cartão do modelo large-v3 · Discussão do lançamento do turbo
  • Relevância para o OpenWhispr: o OpenWhispr usa o Whisper por meio do whisper.cpp para ditado local e offline-first em todas as plataformas desktop. whisper.cpp · OpenWhispr

Como Whisper processa áudio

Entrada de áudio
Recursos do Log-Mel
Codificador
Decodificador
Texto

Por que é importante para OpenWhispr:

É executado localmente via whisper.cpp – o áudio bruto permanece no dispositivo.

O tamanho do modelo controla a compensação entre velocidade e precisão.

O mesmo pipeline alimenta o ditado em macOS, Windows e Linux.

O que é o Whisper?

O Whisper foi apresentado no artigo "Robust Speech Recognition via Large-Scale Weak Supervision" por Alec Radford, Jong Wook Kim, Tao Xu, Greg Brockman, Christine McLeavey e Ilya Sutskever, da OpenAI. O código e os pesos do modelo foram publicados no GitHub em setembro de 2022 sob a licença MIT.

Antes do Whisper, os sistemas de reconhecimento de fala de última geração eram tipicamente treinados com conjuntos de dados curados e rotulados por humanos — muitas vezes limitados a idiomas, sotaques ou domínios específicos. O Whisper rompeu com essa abordagem ao treinar com um conjunto de dados massivo e diversificado de 680.000 horas de áudio pareadas com transcrições extraídas da internet. A ideia-chave foi que essa abordagem "fracamente supervisionada" — usando transcrições imperfeitas, geradas por máquina ou enviadas por usuários, em vez de dados rotulados à mão — poderia produzir um modelo com robustez notável em diferentes idiomas, sotaques, ruídos de fundo e vocabulário técnico.

O resultado é um único modelo capaz de lidar com várias tarefas de processamento de fala: transcrição (fala para texto no mesmo idioma), tradução (fala em qualquer idioma para texto em inglês), identificação de idioma e detecção de atividade de voz com marcações de tempo. Essa capacidade multitarefa está incorporada à arquitetura do modelo por meio de um sistema de tokens especiais que especificam qual tarefa executar.

O lançamento de código aberto do Whisper foi significativo. Ele democratizou o acesso a ASR de alta qualidade, permitindo que desenvolvedores, pesquisadores e empresas usassem um modelo competitivo com as APIs comerciais — sem cobrança por minuto, sem enviar áudio para a nuvem e sem dependência de fornecedor. Isso impulsionou o desenvolvimento de ferramentas como o whisper.cpp, o Faster Whisper e dezenas de aplicações construídas sobre eles — incluindo o OpenWhispr.

Mergulho na arquitetura

O Whisper usa uma arquitetura Transformer de codificador-decodificador — o mesmo design fundamental por trás de modelos como o Transformer original (Vaswani et al., 2017) e muitos sistemas de tradução automática. O codificador processa o áudio; o decodificador gera o texto. Veja como funciona cada etapa.

Pré-processamento de áudio

Antes de qualquer processamento por rede neural, o áudio bruto é convertido em uma representação visual do som chamada espectrograma log-mel. O processo funciona assim:

  1. O áudio é reamostrado para 16.000 Hz (16 kHz mono).
  2. Uma Transformada de Fourier de Tempo Curto (STFT) é calculada usando janelas de 25 milissegundos com um passo de 10 milissegundos (hop length).
  3. O espectro de frequências é projetado em 80 bancos de filtros de frequência mel (128 no large-v3), que aproximam a percepção auditiva humana ao espaçar as bandas de frequência de forma logarítmica.
  4. Uma escala logarítmica é aplicada, produzindo o espectrograma log-mel final.
  5. O espectrograma é dividido em blocos de 30 segundos. Áudio com menos de 30 segundos recebe preenchimento com zeros; áudio mais longo é processado em blocos sequenciais.

O resultado é uma representação 2D com formato (80, 3000) — 80 canais mel por 3.000 passos de tempo (30 segundos a um passo de 10 ms). Isso é análogo a uma imagem, e o codificador a processa de forma muito parecida com a maneira como um modelo de visão processa dados de pixels.

O codificador

O codificador converte o espectrograma mel em uma sequência de representações de áudio aprendidas. Ele é composto por:

  1. Duas camadas de convolução 1D — A primeira convolução tem tamanho de kernel 3 e padding 1, seguida por uma ativação GELU. A segunda convolução tem tamanho de kernel 3, stride 2 e padding 1, o que reduz pela metade a dimensão temporal. Isso reduz os 3.000 passos de tempo para 1.500 posições.
  2. Embeddings posicionais senoidais — Ao contrário do decodificador, o codificador usa embeddings senoidais fixos (não aprendidos) para codificar a posição de cada passo de tempo.
  3. Blocos Transformer — Uma pilha de camadas de codificador Transformer padrão, cada uma contendo autoatenção multi-cabeça e uma rede feed-forward com ativação GELU, conectadas por conexões residuais e normalização de camada.

A saída é uma sequência de 1.500 vetores de características de áudio contextualizados — um para cada 20 milissegundos de áudio de entrada — aos quais o decodificador prestará atenção durante a geração de texto.

O decodificador

O decodificador gera tokens de texto de forma autorregressiva — um token por vez, cada um condicionado ao áudio codificado e a todos os tokens gerados anteriormente. Ele é composto por:

  1. Camada de embedding de tokens — Converte os IDs dos tokens em representações vetoriais densas.
  2. Embeddings posicionais aprendidos — Diferentemente dos embeddings senoidais do codificador, o decodificador usa embeddings de posição aprendidos que são treinados junto com o modelo.
  3. Blocos Transformer com atenção cruzada — Cada camada do decodificador tem três subcamadas: autoatenção mascarada (que impede o modelo de olhar tokens futuros), atenção cruzada à saída do codificador (que permite ao modelo "ouvir" o áudio) e uma rede feed-forward.

A saída final do decodificador é projetada no vocabulário para produzir as probabilidades dos tokens. As estratégias de decodificação incluem busca gulosa, busca em feixe (beam search) e amostragem baseada em temperatura.

Tokens especiais e treinamento multitarefa

O Whisper executa várias tarefas com um único modelo por meio de um engenhoso sistema de tokens especiais que funcionam como instruções. A entrada do decodificador segue um formato estruturado:

<|startoftranscript|> <|en|> <|transcribe|> <|notimestamps|> Hello, how are you today? <|endoftext|>
  • <|startoftranscript|> — Sinaliza o início da sequência de saída.
  • <|en|> — Especifica o idioma (um dos 99 tokens de idioma). Pode ser detectado automaticamente ou definido manualmente.
  • <|transcribe|> ou <|translate|> — Especifica se o áudio deve ser transcrito no idioma original ou traduzido para o inglês.
  • <|notimestamps|> — Controla se devem ser produzidos tokens de marcação de tempo. Quando as marcações de tempo estão ativadas, o modelo gera tokens de deslocamento temporal como <|0.00|> e <|2.40|> que alinham o texto ao áudio.

Esse formato unificado de tokens significa que um único modelo pode realizar transcrição, tradução, detecção de idioma e transcrição com marcações de tempo — tudo sem cabeçotes de modelo separados ou ajuste fino. A tarefa é determinada inteiramente pela sequência de tokens fornecida ao decodificador.

Dados de treinamento

Os modelos Whisper originais (do tiny ao large-v2) foram treinados com 680.000 horas de áudio pareadas com transcrições coletadas da internet. Esse conjunto de dados não está disponível publicamente. A característica principal é que ele é fracamente supervisionado — os rótulos de transcrição não foram verificados manualmente por anotadores humanos. Em vez disso, vieram de fontes como legendas, closed captions e outros textos gerados por usuários pareados com áudio.

Composição dos dados

De acordo com o cartão oficial do modelo, o conjunto de treinamento de 680.000 horas se distribui da seguinte forma:

SegmentoHorasParticipaçãoDescrição
ASR em inglês438.00065%Áudio em inglês com transcrições em inglês
Tradução (X para inglês)126.00018%Áudio em outros idiomas com transcrições em inglês
ASR multilíngue117.00017%Áudio em outros idiomas com transcrições no idioma nativo (cobrindo 98 idiomas)

O forte viés para o inglês (65% dos dados de treinamento) explica por que o Whisper tem desempenho significativamente melhor em inglês do que em idiomas de menos recursos. Para o modelo large-v3, lançado em novembro de 2023, a OpenAI ampliou o conjunto de treinamento para 1 milhão de horas de áudio fracamente rotulado, mais 4 milhões de horas adicionais de áudio pseudo-rotulado, gerado ao executar o Whisper large-v2 sobre dados não rotulados — uma forma de autotreinamento ou destilação de conhecimento.

Por que "fracamente supervisionado" importa

A maioria dos sistemas de ASR anteriores era treinada com conjuntos de dados como LibriSpeech (960 horas) ou Common Voice (alguns milhares de horas por idioma) — conjuntos cuidadosamente curados e verificados por humanos. A abordagem do Whisper trocou a qualidade dos rótulos pela escala bruta: 680.000 horas contra as centenas ou poucos milhares de horas usadas por sistemas convencionais. O artigo demonstrou que essa troca valeu a pena. A diversidade dos dados extraídos da internet deu ao Whisper uma robustez excepcional para condições do mundo real: ruído de fundo, fala sobreposta, sotaques, vocabulário específico de domínio e ambientes acústicos que desafiariam modelos treinados com fala lida em qualidade de estúdio.

No entanto, a supervisão fraca também introduz uma limitação conhecida: a alucinação. Como as transcrições de treinamento são imperfeitas, o modelo às vezes gera textos que parecem plausíveis, mas que não foram de fato ditos — especialmente durante silêncios ou trechos muito baixos. Essa é uma contrapartida inerente à abordagem e continua sendo uma área ativa de melhoria.

Tamanhos de modelo

O Whisper está disponível em vários tamanhos, que vão de 39 milhões a 1,55 bilhão de parâmetros. Modelos menores são mais rápidos, mas menos precisos; modelos maiores são mais precisos, mas exigem mais computação e memória. As variantes .en são modelos somente em inglês que tendem a ter melhor desempenho em inglês, especialmente nos tamanhos menores. Não existem variantes somente em inglês para os modelos large.

ModeloParâmetrosSomente inglêsVRAMVelocidade relativa
tiny39 Mtiny.en~1 GB~10x
base74 Mbase.en~1 GB~7x
small244 Msmall.en~2 GB~4x
medium769 Mmedium.en~5 GB~2x
large (v1, v2, v3)1.550 M--~10 GB1x
turbo (large-v3-turbo)809 M--~6 GB~8x

A velocidade é relativa ao modelo large. Os requisitos de VRAM são para inferência em GPU usando precisão fp16 via a implementação original em Python. O whisper.cpp usa significativamente menos memória (por exemplo, o modelo large exige cerca de 3,9 GB de RAM em vez de cerca de 10 GB de VRAM).

O modelo turbo (lançado em outubro de 2024) é uma versão destilada do large-v3 com um decodificador significativamente menor. Ele mantém a maior parte da precisão do large-v3 enquanto roda cerca de 8x mais rápido — o que o torna uma ótima escolha quando a velocidade importa. Observe que o turbo não oferece suporte à tarefa de tradução.

O modelo large passou por três iterações: large-v1 (setembro de 2022), large-v2 (dezembro de 2022) e large-v3 (novembro de 2023). Cada versão melhorou a precisão, com o large-v3 introduzindo 128 bins de frequência mel (em vez de 80) e treinando com um conjunto de dados muito maior. Para um detalhamento de cada tamanho e como escolher, veja nosso guia sobre os tamanhos de modelo do Whisper.

Quão preciso é o Whisper?

A precisão do Whisper costuma ser medida usando a Taxa de Erro de Palavras (WER) — a porcentagem de palavras transcritas incorretamente (inserções, exclusões e substituições somadas). Quanto menor a WER, melhor.

Benchmarks em inglês

No LibriSpeech test-clean — o benchmark de ASR em inglês mais utilizado, composto por fala lida limpa de audiolivros — o Whisper large-v2 atinge uma WER de aproximadamente 3,0%[1][2]. Isso é competitivo com os sistemas comerciais de ASR e modelos treinados para fins específicos, embora modelos especializados ajustados com o LibriSpeech possam alcançar WER menor nesse benchmark específico. A força do Whisper não está em vencer benchmarks restritos, mas na robustez — desempenhando consistentemente bem em uma ampla gama de condições do mundo real.

Melhorias do large-v3

De acordo com a avaliação da OpenAI, o Whisper large-v3 apresenta uma redução de 10 a 20% nos erros em comparação com o large-v2, nos idiomas em que o modelo atinge taxa de erro abaixo de 60% nos conjuntos de avaliação Common Voice 15 e Fleurs[2][3]. As melhorias são particularmente notáveis em idiomas que não o inglês, onde os dados de treinamento ampliados (5 milhões de horas no total) fazem a maior diferença.

Como o Whisper se compara (fevereiro de 2026)

Desde o lançamento do Whisper, modelos de ASR de código aberto mais recentes o superaram em benchmarks de fala limpa. O Parakeet TDT (0,6 B de parâmetros) da NVIDIA atinge 1,69% de WER, e o modelo Canary deles chega a 1,6% de WER no LibriSpeech test-clean — ambos bem abaixo dos ~2,7% do Whisper large-v3. No entanto, o Whisper continua sendo o modelo de ASR de código aberto mais implantado, graças à maturidade de seu ecossistema, à cobertura de idiomas e à disponibilidade de runtimes otimizados como o whisper.cpp.

Taxa de erro de palavras: Whisper vs concorrentes de código aberto

LibriSpeech test-clean (leitura de fala em inglês) - quanto menor, melhor

NVIDIA
Outro código aberto
OpenAI Whisper

Fontes: cartões modelo Hugging Face, cartões modelo NVIDIA, Open ASR Leaderboard (Feb 2026). Apenas fala de leitura limpa em inglês – a precisão do mundo real varia de acordo com a qualidade do áudio, sotaque e domínio. APIs comerciais omitidos porque não publicam benchmarks LibriSpeech.

Observação: as APIs comerciais em nuvem (Deepgram Nova-3, Google Chirp, AssemblyAI Universal-2) não publicam números de WER no LibriSpeech, por isso não podem ser comparadas diretamente neste gráfico. Seus benchmarks usam conjuntos de teste proprietários do mundo real. A OpenAI também lançou o GPT-4o-transcribe em março de 2025 como um modelo disponível apenas via API (não de código aberto e não baseado em Whisper), com taxas de erro supostamente menores — mas ele é exclusivo da nuvem e não está disponível para inferência local.

Onde o Whisper se destaca

  • +Robustez a sotaques e dialetos — Treinado com áudio diversificado da internet, o Whisper lida com sotaques regionais melhor do que sistemas treinados com fala lida.
  • +Tolerância a ruído de fundo — O modelo mantém precisão razoável mesmo com música, outros locutores ou ruído ambiente presentes.
  • +Vocabulário técnico — Devido à amplitude de seus dados de treinamento, o Whisper lida com termos específicos de domínio (médicos, jurídicos, técnicos) melhor do que muitos sistemas de ASR de uso geral.
  • +Capacidade multilíngue — Um único modelo com suporte a 99 idiomas, sem necessidade de ajuste fino por idioma.

Onde o Whisper tem dificuldades

  • -Alucinação — O problema mais citado. Durante silêncios ou trechos muito baixos, o Whisper pode gerar texto que nunca foi dito. Isso é uma consequência da abordagem de treinamento fracamente supervisionada.
  • -Idiomas de poucos recursos — Idiomas com poucos dados de treinamento (grande parte das 680 mil horas é em inglês) têm taxas de erro significativamente mais altas.
  • -Geração de texto repetitivo — O decodificador autorregressivo pode "travar" em loops, produzindo a mesma frase repetidamente. A busca em feixe com parâmetros específicos pode mitigar, mas não eliminar, esse problema.
  • -Não é em tempo real por padrão — O Whisper processa blocos de 30 segundos, então há uma latência inerente. Soluções de streaming (como o modo em tempo real do whisper.cpp) contornam isso, mas adicionam complexidade.

whisper.cpp e inferência local

A implementação original do Whisper requer Python, PyTorch e uma GPU compatível com CUDA para um desempenho razoável. Isso a torna impraticável para aplicações desktop, dispositivos móveis e implantações em edge. O whisper.cpp, criado por Georgi Gerganov, resolve esse problema.

O whisper.cpp é uma reimplementação completa da inferência do Whisper em C/C++ puro, sem dependências. Ele lê os mesmos pesos do modelo, mas roda sem Python, sem PyTorch e sem GPU (embora se beneficie enormemente de uma). Os principais recursos incluem:

  • Zero alocações de memória em tempo de execução — Toda a memória é pré-alocada, tornando o desempenho previsível e adequado para sistemas embarcados.
  • Otimização para Apple Silicon — Em Macs com chips da série M, o codificador pode rodar no Apple Neural Engine via Core ML, oferecendo inferência mais de 3x mais rápida em comparação com a execução somente em CPU. A aceleração por GPU Metal também é suportada para inferência completa em GPU.
  • Suporte a quantização — Os modelos podem ser quantizados para precisão inteira de 4, 5 ou 8 bits, reduzindo drasticamente o uso de memória e aumentando a velocidade com mínima perda de precisão.
  • Aceleração por GPU — Oferece suporte a NVIDIA CUDA (via cuBLAS), Vulkan (multifornecedor), OpenVINO (Intel) e OpenBLAS para aceleração em CPU.
  • Detecção de Atividade de Voz (VAD) — VAD integrado para pular segmentos silenciosos, melhorando tanto a velocidade quanto a qualidade da transcrição.

Requisitos de memória (whisper.cpp)

ModeloTamanho em discoRAM necessária
tiny75 MB~273 MB
base142 MB~388 MB
small466 MB~852 MB
medium1,5 GB~2,1 GB
large2,9 GB~3,9 GB

O whisper.cpp roda em macOS (Intel e Apple Silicon), Linux, Windows, iOS, Android, FreeBSD, Raspberry Pi e até no navegador via WebAssembly. Ele atinge transcrição mais rápida que o tempo real em hardware de consumo modesto — incluindo dispositivos tão pequenos quanto o Raspberry Pi 4 e o iPhone 13.

É essa portabilidade que torna prático o reconhecimento de fala local e privado. Aplicativos como o OpenWhispr usam o whisper.cpp internamente para oferecer ditado push-to-talk em tempo real que roda inteiramente no dispositivo do usuário — nenhum áudio jamais sai da máquina.

Whisper vs outros sistemas de ASR

O Whisper existe dentro de um cenário mais amplo de sistemas de reconhecimento de fala. Veja como ele se compara às alternativas mais comuns.

Google Cloud Speech-to-Text

O serviço de ASR em nuvem do Google. Excelente precisão, especialmente em inglês, com suporte a streaming em tempo real e diarização de locutores. As principais diferenças: é proprietário, requer o envio de áudio para os servidores do Google e é cobrado por minuto de áudio processado. O Whisper oferece precisão comparável para uso geral, roda localmente e é gratuito — mas não tem streaming nem diarização integrados.

Somente nuvemProprietárioPagamento por uso

Amazon Transcribe (AWS)

O ASR em nuvem da Amazon, fortemente integrado ao ecossistema AWS. Oferece transcrição médica, análise de chamadas e vocabulário personalizado. Contrapartidas semelhantes às do Google: dependência da nuvem, cobrança por minuto e código proprietário. O Whisper é mais adequado para aplicações que precisam de operação offline, licenciamento de código aberto ou ausência de dependência de fornecedor.

Somente nuvemProprietárioIntegração com AWS

Mozilla DeepSpeech

O motor de ASR de código aberto da Mozilla, baseado na pesquisa Deep Speech da Baidu. Foi um dos primeiros modelos abertos de ASR de alta qualidade, mas a Mozilla descontinuou o desenvolvimento ativo em 2021. O Whisper efetivamente superou o DeepSpeech em precisão, suporte multilíngue e impulso da comunidade. O DeepSpeech ainda é útil como uma baseline leve e bem compreendida, mas não é mais recomendado para novos projetos.

Código abertoDescontinuadoFocado em inglês

Vosk

Um toolkit de reconhecimento de fala offline de código aberto, com suporte a mais de 20 idiomas usando modelos pequenos e rápidos. O Vosk é excelente para ambientes com recursos limitados — seus modelos têm uma fração do tamanho dos do Whisper e rodam bem em hardware de baixa potência. A contrapartida é a precisão: o Vosk é nitidamente menos preciso que o Whisper, especialmente em fala com sotaque, áudio ruidoso e vocabulário técnico.

Código abertoLeveMenor precisão

Faster Whisper (CTranslate2)

Uma reimplementação do Whisper usando o motor de inferência CTranslate2 da SYSTRAN. Ele roda os mesmos modelos Whisper com a mesma precisão, mas é até 4x mais rápido que a implementação original da OpenAI, com menor uso de memória. O Faster Whisper é baseado em Python (ao contrário do C/C++ do whisper.cpp) e é uma ótima escolha para transcrição em lote do lado do servidor. Ele oferece suporte a GPUs CUDA e inferência em CPU com quantização INT8.

Código abertoPython / CTranslate2Mesma precisão do Whisper

Aplicações práticas

A combinação de precisão, suporte multilíngue e disponibilidade de código aberto do Whisper o tornou a espinha dorsal de uma ampla gama de aplicações:

Ditado em desktop

Apps como o OpenWhispr usam o whisper.cpp para oferecer ditado push-to-talk em todo o sistema no macOS, Windows e Linux. O áudio é processado localmente — nada é enviado para a nuvem.

Geração de legendas

A previsão de marcações de tempo do Whisper o torna bem adequado para gerar legendas e closed captions. Ferramentas como o stable-ts e o auto-subtitle automatizam esse fluxo de trabalho.

Transcrição de podcasts e reuniões

O Whisper lida bem com a transcrição de áudio longo, especialmente com a abordagem de processamento em blocos. Muitos editores de podcasts e ferramentas de anotação de reuniões usam o Whisper (ou o Faster Whisper) para transcrição em lote de gravações.

Tradução e localização

A capacidade de tradução integrada do Whisper (de qualquer idioma para o inglês) é usada para acesso a conteúdo entre idiomas, localização de mídia e protótipos de tradução em tempo real.

Acessibilidade

Legendagem em tempo real para usuários surdos e com deficiência auditiva, interfaces de voz para usuários com deficiências motoras e transcrição de audiodescrição são áreas ativas onde o Whisper é implantado.

Anotação de dados e pesquisa

Pesquisadores usam o Whisper para criar conjuntos de dados pseudo-rotulados para treinar outros modelos — a mesma abordagem que a OpenAI usou para criar os dados de treinamento do large-v3. Ele também é amplamente usado em pesquisa linguística e na criação de corpora.

Fontes e leituras adicionais

  1. [Artigo] Radford, A., Kim, J. W., Xu, T., Brockman, G., McLeavey, C., & Sutskever, I. (2022). Robust Speech Recognition via Large-Scale Weak Supervision. arXiv:2212.04356. arxiv.org/abs/2212.04356
  2. [Código] Repositório do OpenAI Whisper no GitHub. github.com/openai/whisper
  3. [Código] whisper.cpp — port em C/C++ por Georgi Gerganov. github.com/ggml-org/whisper.cpp
  4. [Cartão do modelo] Whisper large-v2 no Hugging Face (benchmark de WER: ~3,0% no LibriSpeech test-clean). huggingface.co/openai/whisper-large-v2
  5. [Cartão do modelo] Whisper large-v3 no Hugging Face (redução de erro de 10 a 20% em relação ao v2). huggingface.co/openai/whisper-large-v3
  6. [Cartão do modelo] Whisper large-v3-turbo no Hugging Face (variante destilada focada em latência). huggingface.co/openai/whisper-large-v3-turbo
  7. [Cartão do modelo] Cartão do modelo OpenAI Whisper (detalhamento da composição dos dados de treinamento). github.com/openai/whisper/blob/main/model-card.md
  8. [Notas de versão] Anúncio do large-v3 e notas de avaliação da OpenAI. github.com/openai/whisper/discussions/1762
  9. [Notas de versão] Discussão do lançamento do turbo e contrapartidas focadas em velocidade da OpenAI. github.com/openai/whisper/discussions/2363
  10. [Código] Faster Whisper — reimplementação baseada em CTranslate2 pela SYSTRAN. github.com/SYSTRAN/faster-whisper
  11. [Produto] O OpenWhispr usa o Whisper por meio do whisper.cpp para fluxos de trabalho de ditado local. openwhispr.com

Experimente o Whisper localmente com o OpenWhispr

O OpenWhispr usa o Whisper (via whisper.cpp) para ditado local e privado no macOS, Windows e Linux. Push-to-talk, mais de 99 idiomas, sem necessidade de nuvem. Experimente grátis.

Sem necessidade de conta · Funciona offline · Código aberto para sempre