Como o Whisper IA funciona: um guia completo
Um mergulho técnico no modelo de reconhecimento de fala de código aberto da OpenAI — dos espectrogramas mel à decodificação por transformer.
OpenWhispr
Engenharia
Índice
O Whisper é um modelo de reconhecimento automático de fala (ASR) desenvolvido pela OpenAI. Lançado em setembro de 2022, é um sistema de reconhecimento de fala de uso geral treinado com 680.000 horas de dados de áudio multilíngue coletados da internet. O Whisper usa uma arquitetura Transformer de codificador-decodificador que converte o áudio em espectrogramas log-mel, os processa por meio de um codificador de rede neural e decodifica tokens de texto de forma autorregressiva. Ele oferece suporte a transcrição em 99 idiomas, tradução para o inglês, identificação de idioma e previsão de marcações de tempo — tudo dentro de um único modelo unificado. Ao contrário da maioria dos serviços comerciais de ASR, os pesos do Whisper são totalmente de código aberto sob a licença MIT, o que permitiu o florescimento de um ecossistema de ports, otimizações e aplicações — incluindo o whisper.cpp, a implementação em C/C++ que torna o Whisper prático para reconhecimento de fala em tempo real e no próprio dispositivo.
Última atualização: 17 de fevereiro de 2026. As afirmações quantitativas deste artigo são verificadas com pelo menos duas fontes primárias.
Resumo da checagem de fatos (fontes duplas)
- Lançamento, escala de treinamento e licença do Whisper: A OpenAI lançou o Whisper em setembro de 2022, treinado com 680.000 horas, sob a licença MIT. Artigo no arXiv · Repositório do OpenAI Whisper
- Escopo das tarefas e suporte a idiomas: O Whisper oferece suporte a transcrição, tradução para o inglês, identificação de idioma e tokens de marcação de tempo em 99 idiomas. Cartão do modelo Whisper · README do Whisper
- Contexto do benchmark em inglês: cerca de 3% de WER é um número de benchmark no LibriSpeech test-clean para avaliação focada em inglês, e não uma taxa universal do mundo real. Cartão do modelo large-v2 · Detalhes do benchmark
- Atualizações recentes do modelo: o large-v3 registra menos erros que o large-v2 em muitos idiomas, e o turbo prioriza menor latência com menor custo de computação do decodificador. Cartão do modelo large-v3 · Discussão do lançamento do turbo
- Relevância para o OpenWhispr: o OpenWhispr usa o Whisper por meio do whisper.cpp para ditado local e offline-first em todas as plataformas desktop. whisper.cpp · OpenWhispr
Como Whisper processa áudio
Por que é importante para OpenWhispr:
É executado localmente via whisper.cpp – o áudio bruto permanece no dispositivo.
O tamanho do modelo controla a compensação entre velocidade e precisão.
O mesmo pipeline alimenta o ditado em macOS, Windows e Linux.
O que é o Whisper?
O Whisper foi apresentado no artigo "Robust Speech Recognition via Large-Scale Weak Supervision" por Alec Radford, Jong Wook Kim, Tao Xu, Greg Brockman, Christine McLeavey e Ilya Sutskever, da OpenAI. O código e os pesos do modelo foram publicados no GitHub em setembro de 2022 sob a licença MIT.
Antes do Whisper, os sistemas de reconhecimento de fala de última geração eram tipicamente treinados com conjuntos de dados curados e rotulados por humanos — muitas vezes limitados a idiomas, sotaques ou domínios específicos. O Whisper rompeu com essa abordagem ao treinar com um conjunto de dados massivo e diversificado de 680.000 horas de áudio pareadas com transcrições extraídas da internet. A ideia-chave foi que essa abordagem "fracamente supervisionada" — usando transcrições imperfeitas, geradas por máquina ou enviadas por usuários, em vez de dados rotulados à mão — poderia produzir um modelo com robustez notável em diferentes idiomas, sotaques, ruídos de fundo e vocabulário técnico.
O resultado é um único modelo capaz de lidar com várias tarefas de processamento de fala: transcrição (fala para texto no mesmo idioma), tradução (fala em qualquer idioma para texto em inglês), identificação de idioma e detecção de atividade de voz com marcações de tempo. Essa capacidade multitarefa está incorporada à arquitetura do modelo por meio de um sistema de tokens especiais que especificam qual tarefa executar.
O lançamento de código aberto do Whisper foi significativo. Ele democratizou o acesso a ASR de alta qualidade, permitindo que desenvolvedores, pesquisadores e empresas usassem um modelo competitivo com as APIs comerciais — sem cobrança por minuto, sem enviar áudio para a nuvem e sem dependência de fornecedor. Isso impulsionou o desenvolvimento de ferramentas como o whisper.cpp, o Faster Whisper e dezenas de aplicações construídas sobre eles — incluindo o OpenWhispr.
Mergulho na arquitetura
O Whisper usa uma arquitetura Transformer de codificador-decodificador — o mesmo design fundamental por trás de modelos como o Transformer original (Vaswani et al., 2017) e muitos sistemas de tradução automática. O codificador processa o áudio; o decodificador gera o texto. Veja como funciona cada etapa.
Pré-processamento de áudio
Antes de qualquer processamento por rede neural, o áudio bruto é convertido em uma representação visual do som chamada espectrograma log-mel. O processo funciona assim:
- O áudio é reamostrado para 16.000 Hz (16 kHz mono).
- Uma Transformada de Fourier de Tempo Curto (STFT) é calculada usando janelas de 25 milissegundos com um passo de 10 milissegundos (hop length).
- O espectro de frequências é projetado em 80 bancos de filtros de frequência mel (128 no large-v3), que aproximam a percepção auditiva humana ao espaçar as bandas de frequência de forma logarítmica.
- Uma escala logarítmica é aplicada, produzindo o espectrograma log-mel final.
- O espectrograma é dividido em blocos de 30 segundos. Áudio com menos de 30 segundos recebe preenchimento com zeros; áudio mais longo é processado em blocos sequenciais.
O resultado é uma representação 2D com formato (80, 3000) — 80 canais mel por 3.000 passos de tempo (30 segundos a um passo de 10 ms). Isso é análogo a uma imagem, e o codificador a processa de forma muito parecida com a maneira como um modelo de visão processa dados de pixels.
O codificador
O codificador converte o espectrograma mel em uma sequência de representações de áudio aprendidas. Ele é composto por:
- Duas camadas de convolução 1D — A primeira convolução tem tamanho de kernel 3 e padding 1, seguida por uma ativação GELU. A segunda convolução tem tamanho de kernel 3, stride 2 e padding 1, o que reduz pela metade a dimensão temporal. Isso reduz os 3.000 passos de tempo para 1.500 posições.
- Embeddings posicionais senoidais — Ao contrário do decodificador, o codificador usa embeddings senoidais fixos (não aprendidos) para codificar a posição de cada passo de tempo.
- Blocos Transformer — Uma pilha de camadas de codificador Transformer padrão, cada uma contendo autoatenção multi-cabeça e uma rede feed-forward com ativação GELU, conectadas por conexões residuais e normalização de camada.
A saída é uma sequência de 1.500 vetores de características de áudio contextualizados — um para cada 20 milissegundos de áudio de entrada — aos quais o decodificador prestará atenção durante a geração de texto.
O decodificador
O decodificador gera tokens de texto de forma autorregressiva — um token por vez, cada um condicionado ao áudio codificado e a todos os tokens gerados anteriormente. Ele é composto por:
- Camada de embedding de tokens — Converte os IDs dos tokens em representações vetoriais densas.
- Embeddings posicionais aprendidos — Diferentemente dos embeddings senoidais do codificador, o decodificador usa embeddings de posição aprendidos que são treinados junto com o modelo.
- Blocos Transformer com atenção cruzada — Cada camada do decodificador tem três subcamadas: autoatenção mascarada (que impede o modelo de olhar tokens futuros), atenção cruzada à saída do codificador (que permite ao modelo "ouvir" o áudio) e uma rede feed-forward.
A saída final do decodificador é projetada no vocabulário para produzir as probabilidades dos tokens. As estratégias de decodificação incluem busca gulosa, busca em feixe (beam search) e amostragem baseada em temperatura.
Tokens especiais e treinamento multitarefa
O Whisper executa várias tarefas com um único modelo por meio de um engenhoso sistema de tokens especiais que funcionam como instruções. A entrada do decodificador segue um formato estruturado:
<|startoftranscript|> <|en|> <|transcribe|> <|notimestamps|> Hello, how are you today? <|endoftext|><|startoftranscript|>— Sinaliza o início da sequência de saída.<|en|>— Especifica o idioma (um dos 99 tokens de idioma). Pode ser detectado automaticamente ou definido manualmente.<|transcribe|>ou<|translate|>— Especifica se o áudio deve ser transcrito no idioma original ou traduzido para o inglês.<|notimestamps|>— Controla se devem ser produzidos tokens de marcação de tempo. Quando as marcações de tempo estão ativadas, o modelo gera tokens de deslocamento temporal como<|0.00|>e<|2.40|>que alinham o texto ao áudio.
Esse formato unificado de tokens significa que um único modelo pode realizar transcrição, tradução, detecção de idioma e transcrição com marcações de tempo — tudo sem cabeçotes de modelo separados ou ajuste fino. A tarefa é determinada inteiramente pela sequência de tokens fornecida ao decodificador.
Dados de treinamento
Os modelos Whisper originais (do tiny ao large-v2) foram treinados com 680.000 horas de áudio pareadas com transcrições coletadas da internet. Esse conjunto de dados não está disponível publicamente. A característica principal é que ele é fracamente supervisionado — os rótulos de transcrição não foram verificados manualmente por anotadores humanos. Em vez disso, vieram de fontes como legendas, closed captions e outros textos gerados por usuários pareados com áudio.
Composição dos dados
De acordo com o cartão oficial do modelo, o conjunto de treinamento de 680.000 horas se distribui da seguinte forma:
| Segmento | Horas | Participação | Descrição |
|---|---|---|---|
| ASR em inglês | 438.000 | 65% | Áudio em inglês com transcrições em inglês |
| Tradução (X para inglês) | 126.000 | 18% | Áudio em outros idiomas com transcrições em inglês |
| ASR multilíngue | 117.000 | 17% | Áudio em outros idiomas com transcrições no idioma nativo (cobrindo 98 idiomas) |
O forte viés para o inglês (65% dos dados de treinamento) explica por que o Whisper tem desempenho significativamente melhor em inglês do que em idiomas de menos recursos. Para o modelo large-v3, lançado em novembro de 2023, a OpenAI ampliou o conjunto de treinamento para 1 milhão de horas de áudio fracamente rotulado, mais 4 milhões de horas adicionais de áudio pseudo-rotulado, gerado ao executar o Whisper large-v2 sobre dados não rotulados — uma forma de autotreinamento ou destilação de conhecimento.
Por que "fracamente supervisionado" importa
A maioria dos sistemas de ASR anteriores era treinada com conjuntos de dados como LibriSpeech (960 horas) ou Common Voice (alguns milhares de horas por idioma) — conjuntos cuidadosamente curados e verificados por humanos. A abordagem do Whisper trocou a qualidade dos rótulos pela escala bruta: 680.000 horas contra as centenas ou poucos milhares de horas usadas por sistemas convencionais. O artigo demonstrou que essa troca valeu a pena. A diversidade dos dados extraídos da internet deu ao Whisper uma robustez excepcional para condições do mundo real: ruído de fundo, fala sobreposta, sotaques, vocabulário específico de domínio e ambientes acústicos que desafiariam modelos treinados com fala lida em qualidade de estúdio.
No entanto, a supervisão fraca também introduz uma limitação conhecida: a alucinação. Como as transcrições de treinamento são imperfeitas, o modelo às vezes gera textos que parecem plausíveis, mas que não foram de fato ditos — especialmente durante silêncios ou trechos muito baixos. Essa é uma contrapartida inerente à abordagem e continua sendo uma área ativa de melhoria.
Tamanhos de modelo
O Whisper está disponível em vários tamanhos, que vão de 39 milhões a 1,55 bilhão de parâmetros. Modelos menores são mais rápidos, mas menos precisos; modelos maiores são mais precisos, mas exigem mais computação e memória. As variantes .en são modelos somente em inglês que tendem a ter melhor desempenho em inglês, especialmente nos tamanhos menores. Não existem variantes somente em inglês para os modelos large.
| Modelo | Parâmetros | Somente inglês | VRAM | Velocidade relativa |
|---|---|---|---|---|
| tiny | 39 M | tiny.en | ~1 GB | ~10x |
| base | 74 M | base.en | ~1 GB | ~7x |
| small | 244 M | small.en | ~2 GB | ~4x |
| medium | 769 M | medium.en | ~5 GB | ~2x |
| large (v1, v2, v3) | 1.550 M | -- | ~10 GB | 1x |
| turbo (large-v3-turbo) | 809 M | -- | ~6 GB | ~8x |
A velocidade é relativa ao modelo large. Os requisitos de VRAM são para inferência em GPU usando precisão fp16 via a implementação original em Python. O whisper.cpp usa significativamente menos memória (por exemplo, o modelo large exige cerca de 3,9 GB de RAM em vez de cerca de 10 GB de VRAM).
O modelo turbo (lançado em outubro de 2024) é uma versão destilada do large-v3 com um decodificador significativamente menor. Ele mantém a maior parte da precisão do large-v3 enquanto roda cerca de 8x mais rápido — o que o torna uma ótima escolha quando a velocidade importa. Observe que o turbo não oferece suporte à tarefa de tradução.
O modelo large passou por três iterações: large-v1 (setembro de 2022), large-v2 (dezembro de 2022) e large-v3 (novembro de 2023). Cada versão melhorou a precisão, com o large-v3 introduzindo 128 bins de frequência mel (em vez de 80) e treinando com um conjunto de dados muito maior. Para um detalhamento de cada tamanho e como escolher, veja nosso guia sobre os tamanhos de modelo do Whisper.
Quão preciso é o Whisper?
A precisão do Whisper costuma ser medida usando a Taxa de Erro de Palavras (WER) — a porcentagem de palavras transcritas incorretamente (inserções, exclusões e substituições somadas). Quanto menor a WER, melhor.
Benchmarks em inglês
No LibriSpeech test-clean — o benchmark de ASR em inglês mais utilizado, composto por fala lida limpa de audiolivros — o Whisper large-v2 atinge uma WER de aproximadamente 3,0%[1][2]. Isso é competitivo com os sistemas comerciais de ASR e modelos treinados para fins específicos, embora modelos especializados ajustados com o LibriSpeech possam alcançar WER menor nesse benchmark específico. A força do Whisper não está em vencer benchmarks restritos, mas na robustez — desempenhando consistentemente bem em uma ampla gama de condições do mundo real.
Melhorias do large-v3
De acordo com a avaliação da OpenAI, o Whisper large-v3 apresenta uma redução de 10 a 20% nos erros em comparação com o large-v2, nos idiomas em que o modelo atinge taxa de erro abaixo de 60% nos conjuntos de avaliação Common Voice 15 e Fleurs[2][3]. As melhorias são particularmente notáveis em idiomas que não o inglês, onde os dados de treinamento ampliados (5 milhões de horas no total) fazem a maior diferença.
Como o Whisper se compara (fevereiro de 2026)
Desde o lançamento do Whisper, modelos de ASR de código aberto mais recentes o superaram em benchmarks de fala limpa. O Parakeet TDT (0,6 B de parâmetros) da NVIDIA atinge 1,69% de WER, e o modelo Canary deles chega a 1,6% de WER no LibriSpeech test-clean — ambos bem abaixo dos ~2,7% do Whisper large-v3. No entanto, o Whisper continua sendo o modelo de ASR de código aberto mais implantado, graças à maturidade de seu ecossistema, à cobertura de idiomas e à disponibilidade de runtimes otimizados como o whisper.cpp.
Taxa de erro de palavras: Whisper vs concorrentes de código aberto
LibriSpeech test-clean (leitura de fala em inglês) - quanto menor, melhor
Fontes: cartões modelo Hugging Face, cartões modelo NVIDIA, Open ASR Leaderboard (Feb 2026). Apenas fala de leitura limpa em inglês – a precisão do mundo real varia de acordo com a qualidade do áudio, sotaque e domínio. APIs comerciais omitidos porque não publicam benchmarks LibriSpeech.
Observação: as APIs comerciais em nuvem (Deepgram Nova-3, Google Chirp, AssemblyAI Universal-2) não publicam números de WER no LibriSpeech, por isso não podem ser comparadas diretamente neste gráfico. Seus benchmarks usam conjuntos de teste proprietários do mundo real. A OpenAI também lançou o GPT-4o-transcribe em março de 2025 como um modelo disponível apenas via API (não de código aberto e não baseado em Whisper), com taxas de erro supostamente menores — mas ele é exclusivo da nuvem e não está disponível para inferência local.
Onde o Whisper se destaca
- +Robustez a sotaques e dialetos — Treinado com áudio diversificado da internet, o Whisper lida com sotaques regionais melhor do que sistemas treinados com fala lida.
- +Tolerância a ruído de fundo — O modelo mantém precisão razoável mesmo com música, outros locutores ou ruído ambiente presentes.
- +Vocabulário técnico — Devido à amplitude de seus dados de treinamento, o Whisper lida com termos específicos de domínio (médicos, jurídicos, técnicos) melhor do que muitos sistemas de ASR de uso geral.
- +Capacidade multilíngue — Um único modelo com suporte a 99 idiomas, sem necessidade de ajuste fino por idioma.
Onde o Whisper tem dificuldades
- -Alucinação — O problema mais citado. Durante silêncios ou trechos muito baixos, o Whisper pode gerar texto que nunca foi dito. Isso é uma consequência da abordagem de treinamento fracamente supervisionada.
- -Idiomas de poucos recursos — Idiomas com poucos dados de treinamento (grande parte das 680 mil horas é em inglês) têm taxas de erro significativamente mais altas.
- -Geração de texto repetitivo — O decodificador autorregressivo pode "travar" em loops, produzindo a mesma frase repetidamente. A busca em feixe com parâmetros específicos pode mitigar, mas não eliminar, esse problema.
- -Não é em tempo real por padrão — O Whisper processa blocos de 30 segundos, então há uma latência inerente. Soluções de streaming (como o modo em tempo real do whisper.cpp) contornam isso, mas adicionam complexidade.
whisper.cpp e inferência local
A implementação original do Whisper requer Python, PyTorch e uma GPU compatível com CUDA para um desempenho razoável. Isso a torna impraticável para aplicações desktop, dispositivos móveis e implantações em edge. O whisper.cpp, criado por Georgi Gerganov, resolve esse problema.
O whisper.cpp é uma reimplementação completa da inferência do Whisper em C/C++ puro, sem dependências. Ele lê os mesmos pesos do modelo, mas roda sem Python, sem PyTorch e sem GPU (embora se beneficie enormemente de uma). Os principais recursos incluem:
- Zero alocações de memória em tempo de execução — Toda a memória é pré-alocada, tornando o desempenho previsível e adequado para sistemas embarcados.
- Otimização para Apple Silicon — Em Macs com chips da série M, o codificador pode rodar no Apple Neural Engine via Core ML, oferecendo inferência mais de 3x mais rápida em comparação com a execução somente em CPU. A aceleração por GPU Metal também é suportada para inferência completa em GPU.
- Suporte a quantização — Os modelos podem ser quantizados para precisão inteira de 4, 5 ou 8 bits, reduzindo drasticamente o uso de memória e aumentando a velocidade com mínima perda de precisão.
- Aceleração por GPU — Oferece suporte a NVIDIA CUDA (via cuBLAS), Vulkan (multifornecedor), OpenVINO (Intel) e OpenBLAS para aceleração em CPU.
- Detecção de Atividade de Voz (VAD) — VAD integrado para pular segmentos silenciosos, melhorando tanto a velocidade quanto a qualidade da transcrição.
Requisitos de memória (whisper.cpp)
| Modelo | Tamanho em disco | RAM necessária |
|---|---|---|
| tiny | 75 MB | ~273 MB |
| base | 142 MB | ~388 MB |
| small | 466 MB | ~852 MB |
| medium | 1,5 GB | ~2,1 GB |
| large | 2,9 GB | ~3,9 GB |
O whisper.cpp roda em macOS (Intel e Apple Silicon), Linux, Windows, iOS, Android, FreeBSD, Raspberry Pi e até no navegador via WebAssembly. Ele atinge transcrição mais rápida que o tempo real em hardware de consumo modesto — incluindo dispositivos tão pequenos quanto o Raspberry Pi 4 e o iPhone 13.
É essa portabilidade que torna prático o reconhecimento de fala local e privado. Aplicativos como o OpenWhispr usam o whisper.cpp internamente para oferecer ditado push-to-talk em tempo real que roda inteiramente no dispositivo do usuário — nenhum áudio jamais sai da máquina.
Whisper vs outros sistemas de ASR
O Whisper existe dentro de um cenário mais amplo de sistemas de reconhecimento de fala. Veja como ele se compara às alternativas mais comuns.
Google Cloud Speech-to-Text
O serviço de ASR em nuvem do Google. Excelente precisão, especialmente em inglês, com suporte a streaming em tempo real e diarização de locutores. As principais diferenças: é proprietário, requer o envio de áudio para os servidores do Google e é cobrado por minuto de áudio processado. O Whisper oferece precisão comparável para uso geral, roda localmente e é gratuito — mas não tem streaming nem diarização integrados.
Amazon Transcribe (AWS)
O ASR em nuvem da Amazon, fortemente integrado ao ecossistema AWS. Oferece transcrição médica, análise de chamadas e vocabulário personalizado. Contrapartidas semelhantes às do Google: dependência da nuvem, cobrança por minuto e código proprietário. O Whisper é mais adequado para aplicações que precisam de operação offline, licenciamento de código aberto ou ausência de dependência de fornecedor.
Mozilla DeepSpeech
O motor de ASR de código aberto da Mozilla, baseado na pesquisa Deep Speech da Baidu. Foi um dos primeiros modelos abertos de ASR de alta qualidade, mas a Mozilla descontinuou o desenvolvimento ativo em 2021. O Whisper efetivamente superou o DeepSpeech em precisão, suporte multilíngue e impulso da comunidade. O DeepSpeech ainda é útil como uma baseline leve e bem compreendida, mas não é mais recomendado para novos projetos.
Vosk
Um toolkit de reconhecimento de fala offline de código aberto, com suporte a mais de 20 idiomas usando modelos pequenos e rápidos. O Vosk é excelente para ambientes com recursos limitados — seus modelos têm uma fração do tamanho dos do Whisper e rodam bem em hardware de baixa potência. A contrapartida é a precisão: o Vosk é nitidamente menos preciso que o Whisper, especialmente em fala com sotaque, áudio ruidoso e vocabulário técnico.
Faster Whisper (CTranslate2)
Uma reimplementação do Whisper usando o motor de inferência CTranslate2 da SYSTRAN. Ele roda os mesmos modelos Whisper com a mesma precisão, mas é até 4x mais rápido que a implementação original da OpenAI, com menor uso de memória. O Faster Whisper é baseado em Python (ao contrário do C/C++ do whisper.cpp) e é uma ótima escolha para transcrição em lote do lado do servidor. Ele oferece suporte a GPUs CUDA e inferência em CPU com quantização INT8.
Aplicações práticas
A combinação de precisão, suporte multilíngue e disponibilidade de código aberto do Whisper o tornou a espinha dorsal de uma ampla gama de aplicações:
Ditado em desktop
Apps como o OpenWhispr usam o whisper.cpp para oferecer ditado push-to-talk em todo o sistema no macOS, Windows e Linux. O áudio é processado localmente — nada é enviado para a nuvem.
Geração de legendas
A previsão de marcações de tempo do Whisper o torna bem adequado para gerar legendas e closed captions. Ferramentas como o stable-ts e o auto-subtitle automatizam esse fluxo de trabalho.
Transcrição de podcasts e reuniões
O Whisper lida bem com a transcrição de áudio longo, especialmente com a abordagem de processamento em blocos. Muitos editores de podcasts e ferramentas de anotação de reuniões usam o Whisper (ou o Faster Whisper) para transcrição em lote de gravações.
Tradução e localização
A capacidade de tradução integrada do Whisper (de qualquer idioma para o inglês) é usada para acesso a conteúdo entre idiomas, localização de mídia e protótipos de tradução em tempo real.
Acessibilidade
Legendagem em tempo real para usuários surdos e com deficiência auditiva, interfaces de voz para usuários com deficiências motoras e transcrição de audiodescrição são áreas ativas onde o Whisper é implantado.
Anotação de dados e pesquisa
Pesquisadores usam o Whisper para criar conjuntos de dados pseudo-rotulados para treinar outros modelos — a mesma abordagem que a OpenAI usou para criar os dados de treinamento do large-v3. Ele também é amplamente usado em pesquisa linguística e na criação de corpora.
Fontes e leituras adicionais
- [Artigo] Radford, A., Kim, J. W., Xu, T., Brockman, G., McLeavey, C., & Sutskever, I. (2022). Robust Speech Recognition via Large-Scale Weak Supervision. arXiv:2212.04356. arxiv.org/abs/2212.04356
- [Código] Repositório do OpenAI Whisper no GitHub. github.com/openai/whisper
- [Código] whisper.cpp — port em C/C++ por Georgi Gerganov. github.com/ggml-org/whisper.cpp
- [Cartão do modelo] Whisper large-v2 no Hugging Face (benchmark de WER: ~3,0% no LibriSpeech test-clean). huggingface.co/openai/whisper-large-v2
- [Cartão do modelo] Whisper large-v3 no Hugging Face (redução de erro de 10 a 20% em relação ao v2). huggingface.co/openai/whisper-large-v3
- [Cartão do modelo] Whisper large-v3-turbo no Hugging Face (variante destilada focada em latência). huggingface.co/openai/whisper-large-v3-turbo
- [Cartão do modelo] Cartão do modelo OpenAI Whisper (detalhamento da composição dos dados de treinamento). github.com/openai/whisper/blob/main/model-card.md
- [Notas de versão] Anúncio do large-v3 e notas de avaliação da OpenAI. github.com/openai/whisper/discussions/1762
- [Notas de versão] Discussão do lançamento do turbo e contrapartidas focadas em velocidade da OpenAI. github.com/openai/whisper/discussions/2363
- [Código] Faster Whisper — reimplementação baseada em CTranslate2 pela SYSTRAN. github.com/SYSTRAN/faster-whisper
- [Produto] O OpenWhispr usa o Whisper por meio do whisper.cpp para fluxos de trabalho de ditado local. openwhispr.com
Experimente o Whisper localmente com o OpenWhispr
O OpenWhispr usa o Whisper (via whisper.cpp) para ditado local e privado no macOS, Windows e Linux. Push-to-talk, mais de 99 idiomas, sem necessidade de nuvem. Experimente grátis.
Sem necessidade de conta · Funciona offline · Código aberto para sempre