Come funziona Whisper AI: guida completa
Un approfondimento tecnico sul modello di riconoscimento vocale open source di OpenAI, dagli spettrogrammi log-mel alla decodifica Transformer.
OpenWhispr
Ingegneria
Sommario
Whisper è un modello di riconoscimento automatico del parlato (ASR) sviluppato da OpenAI. Rilasciato a settembre 2022, è un sistema di riconoscimento vocale general-purpose addestrato su 680.000 ore di audio multilingue raccolto da internet. Whisper usa un'architettura Transformer encoder-decoder che converte l'audio in spettrogrammi log-mel, li elabora con un encoder neurale e decodifica autoregressivamente token testuali. Supporta la trascrizione in 99 lingue, la traduzione in inglese, l'identificazione della lingua e la previsione dei timestamp, tutto in un unico modello unificato. A differenza della maggior parte dei servizi ASR commerciali, i pesi di Whisper sono completamente open source sotto licenza MIT, e questo ha reso possibile un ecosistema vivace di port, ottimizzazioni e applicazioni, incluso whisper.cpp, l'implementazione C/C++ che rende Whisper pratico per il riconoscimento vocale in tempo reale e on-device.
Ultimo aggiornamento: 17 febbraio 2026. Le affermazioni quantitative in questo articolo sono verificate con almeno due fonti primarie.
Riepilogo fact-check (due fonti)
- Rilascio di Whisper, scala di addestramento e licenza: OpenAI ha rilasciato Whisper a settembre 2022, addestrato su 680.000 ore, sotto licenza MIT. articolo arXiv · repository OpenAI Whisper
- Ambito delle attività e supporto linguistico: Whisper supporta trascrizione, traduzione in inglese, identificazione della lingua e token di timestamp in 99 lingue. model card di Whisper · README di Whisper
- Contesto dei benchmark in inglese: circa il 3% di WER è un dato di benchmark su LibriSpeech test-clean per valutazioni incentrate sull'inglese, non un tasso universale nel mondo reale. model card di large-v2 · dettagli del benchmark
- Aggiornamenti recenti del modello: large-v3 riporta meno errori di large-v2 in molte lingue, mentre turbo punta a una latenza inferiore con meno calcolo nel decoder. model card di large-v3 · discussione sul rilascio di turbo
- Rilevanza per OpenWhispr: OpenWhispr usa Whisper tramite whisper.cpp per dettatura locale e offline-first su piattaforme desktop. whisper.cpp · OpenWhispr
Come Whisper elabora l'audio
Perché è importante per OpenWhispr:
Funziona localmente tramite whisper.cpp: l'audio non elaborato rimane sul dispositivo.
Le dimensioni del modello controllano il compromesso velocità/precisione.
La stessa pipeline alimenta la dettatura su macOS, Windows e Linux.
Cos'è Whisper
Whisper è stato presentato nel paper "Robust Speech Recognition via Large-Scale Weak Supervision" di Alec Radford, Jong Wook Kim, Tao Xu, Greg Brockman, Christine McLeavey e Ilya Sutskever presso OpenAI. Il codice e i pesi del modello sono stati pubblicati su GitHub a settembre 2022 sotto licenza MIT.
Prima di Whisper, i sistemi di riconoscimento vocale allo stato dell'arte venivano in genere addestrati su dataset curati ed etichettati da esseri umani, spesso limitati a lingue, accenti o domini specifici. Whisper ha rotto con questo approccio addestrandosi su un dataset enorme e diversificato di 680.000 ore di audio abbinate a trascrizioni raccolte da internet. L'intuizione chiave era che questo approccio "debolmente supervisionato", basato su trascrizioni imperfette generate da macchine o caricate dagli utenti invece che su dati etichettati a mano, potesse produrre un modello notevolmente robusto tra lingue, accenti, rumore di fondo e vocabolario tecnico.
Il risultato è un unico modello capace di gestire più attività di elaborazione del parlato: trascrizione (da voce a testo nella stessa lingua), traduzione (voce in qualsiasi lingua verso testo inglese), identificazione della lingua e rilevamento dell'attività vocale con timestamp. Questa capacità multitask è incorporata nell'architettura del modello tramite un sistema di token speciali che specificano quale attività eseguire.
Il rilascio open source di Whisper è stato significativo. Ha democratizzato l'accesso ad ASR di alta qualità, consentendo a sviluppatori, ricercatori e aziende di usare un modello competitivo con le API commerciali senza tariffe al minuto, senza inviare audio al cloud e senza lock-in del fornitore. Questo ha catalizzato lo sviluppo di strumenti come whisper.cpp, Faster Whisper e decine di applicazioni costruite sopra di essi, incluso OpenWhispr.
Approfondimento sull'architettura
Whisper usa un'architettura Transformer encoder-decoder: lo stesso disegno fondamentale alla base di modelli come il Transformer originale (Vaswani et al., 2017) e di molti sistemi di traduzione automatica. L'encoder elabora l'audio, il decoder genera testo. Ecco come funziona ogni fase.
Pre-elaborazione dell'audio
Prima di qualsiasi elaborazione neurale, l'audio grezzo viene convertito in una rappresentazione visiva del suono chiamata spettrogramma log-mel. Il processo funziona così:
- L'audio viene ricampionato a 16.000 Hz (mono a 16 kHz).
- Viene calcolata una Short-Time Fourier Transform (STFT) usando finestre da 25 millisecondi con uno stride da 10 millisecondi (hop length).
- Lo spettro di frequenza viene proiettato su 80 banchi di filtri mel-frequency (128 per large-v3), che approssimano la percezione uditiva umana disponendo le bande di frequenza in modo logaritmico.
- Viene applicata una scala logaritmica, producendo lo spettrogramma log-mel finale.
- Lo spettrogramma viene diviso in chunk da 30 secondi. L'audio più breve di 30 secondi viene riempito con zeri; l'audio più lungo viene elaborato in chunk sequenziali.
Il risultato è una rappresentazione 2D con forma (80, 3000): 80 canali mel per 3.000 passi temporali (30 secondi con stride da 10 ms). È analoga a un'immagine, e l'encoder la elabora in modo molto simile a come un modello di visione elabora i dati dei pixel.
L'encoder
L'encoder converte lo spettrogramma mel in una sequenza di rappresentazioni audio apprese. È composto da:
- Due layer convoluzionali 1D: la prima convoluzione ha kernel size 3 e padding 1, seguita da un'attivazione GELU. La seconda convoluzione ha kernel size 3, stride 2 e padding 1, dimezzando la dimensione temporale. Questo riduce i 3.000 passi temporali a 1.500 posizioni.
- Embedding posizionali sinusoidali: a differenza del decoder, l'encoder usa embedding sinusoidali fissi (non appresi) per codificare la posizione di ogni passo temporale.
- Blocchi Transformer: una pila di layer encoder Transformer standard, ciascuno con self-attention multi-head e una rete feed-forward con attivazione GELU, collegati da connessioni residuali e layer normalization.
L'output è una sequenza di 1.500 vettori di caratteristiche audio contestualizzate, uno per ogni 20 millisecondi di audio in input, a cui il decoder presterà attenzione durante la generazione del testo.
Il decoder
Il decoder genera token testuali in modo autoregressivo: un token alla volta, ognuno condizionato dall'audio codificato e da tutti i token generati in precedenza. È composto da:
- Layer di embedding dei token: converte gli ID dei token in rappresentazioni vettoriali dense.
- Embedding posizionali appresi: a differenza degli embedding sinusoidali dell'encoder, il decoder usa embedding posizionali appresi che vengono addestrati insieme al modello.
- Blocchi Transformer con cross-attention: ogni layer del decoder ha tre sottolayer: self-attention mascherata (per impedire al modello di guardare i token futuri), cross-attention verso l'output dell'encoder (per permettere al modello di "ascoltare" l'audio) e una rete feed-forward.
L'output finale del decoder viene proiettato sul vocabolario per produrre probabilità dei token. Le strategie di decodifica includono greedy search, beam search e campionamento basato sulla temperatura.
Token speciali e addestramento multitask
Whisper svolge più attività con un unico modello grazie a un sistema intelligente di token speciali che fungono da istruzioni. L'input del decoder segue un formato strutturato:
<|startoftranscript|> <|en|> <|transcribe|> <|notimestamps|> Hello, how are you today? <|endoftext|><|startoftranscript|>— Segnala l'inizio della sequenza di output.<|en|>— Specifica la lingua (uno dei 99 token di lingua). Può essere rilevata automaticamente o impostata manualmente.<|transcribe|>o<|translate|>— Specifica se trascrivere nella lingua originale o tradurre in inglese.<|notimestamps|>— Controlla se produrre token di timestamp. Quando i timestamp sono attivati, il modello genera token di offset temporale come<|0.00|>e<|2.40|>che allineano il testo all'audio.
Questo formato di token unificato significa che un singolo modello può eseguire trascrizione, traduzione, rilevamento della lingua e trascrizione con timestamp, tutto senza teste di modello separate né fine-tuning. L'attività è determinata interamente dalla sequenza di token fornita al decoder.
Dati di addestramento
I modelli Whisper originali (da tiny a large-v2) sono stati addestrati su 680.000 ore di audio abbinate a trascrizioni raccolte da internet. Questo dataset non è disponibile pubblicamente. La caratteristica chiave è che è debolmente supervisionato: le etichette delle trascrizioni non sono state verificate manualmente da annotatori umani. Provenivano invece da fonti come sottotitoli, closed caption e altro testo generato dagli utenti e abbinato ad audio.
Composizione dei dati
Secondo la model card ufficiale, il set di addestramento da 680.000 ore si suddivide così:
| Segmento | Ore | Quota | Descrizione |
|---|---|---|---|
| ASR in inglese | 438,000 | 65% | Audio in inglese con trascrizioni in inglese |
| Traduzione (X verso inglese) | 126,000 | 18% | Audio non inglese con trascrizioni in inglese |
| ASR multilingue | 117,000 | 17% | Audio non inglese con trascrizioni nella lingua nativa (copre 98 lingue) |
Il forte sbilanciamento verso l'inglese (65% dei dati di addestramento) spiega perché Whisper funziona significativamente meglio in inglese rispetto alle lingue con meno risorse. Per il modello large-v3, rilasciato a novembre 2023, OpenAI ha ampliato il set di addestramento a 1 milione di ore di audio debolmente etichettato più altre 4 milioni di ore di audio pseudo-etichettato generato eseguendo Whisper large-v2 su dati non etichettati: una forma di self-training o distillazione della conoscenza.
Perché "debolmente supervisionato" conta
La maggior parte dei sistemi ASR precedenti veniva addestrata su dataset come LibriSpeech (960 ore) o Common Voice (alcune migliaia di ore per lingua), accuratamente curati e verificati da esseri umani. L'approccio di Whisper ha scambiato la qualità delle etichette con la scala pura: 680.000 ore contro le centinaia o poche migliaia di ore usate dai sistemi convenzionali. Il paper ha dimostrato che questo compromesso valeva la pena. La diversità dei dati provenienti da internet ha dato a Whisper una robustezza eccezionale in condizioni reali: rumore di fondo, parlato sovrapposto, accenti, vocabolario specifico di dominio e ambienti acustici che metterebbero in difficoltà modelli addestrati su parlato letto in qualità da studio.
Tuttavia, la supervisione debole introduce anche una limitazione nota: allucinazione. Poiché le trascrizioni di addestramento sono imperfette, il modello a volte genera testo plausibile che in realtà non è stato pronunciato, soprattutto durante silenzi o passaggi molto quieti. È un compromesso intrinseco all'approccio e rimane un'area attiva di miglioramento.
Dimensioni dei modelli
Whisper è disponibile in più dimensioni, da 39 milioni a 1,55 miliardi di parametri. I modelli più piccoli sono più veloci ma meno accurati; quelli più grandi sono più accurati ma richiedono più calcolo e memoria. Le varianti .en sono modelli solo in inglese che tendono a funzionare meglio per l'inglese, soprattutto nelle dimensioni più piccole. Non esistono varianti solo in inglese per i modelli large.
| Modello | Parametri | Solo inglese | VRAM | Velocità relativa |
|---|---|---|---|---|
| tiny | 39 M | tiny.en | ~1 GB | ~10x |
| base | 74 M | base.en | ~1 GB | ~7x |
| small | 244 M | small.en | ~2 GB | ~4x |
| medium | 769 M | medium.en | ~5 GB | ~2x |
| large (v1, v2, v3) | 1,550 M | -- | ~10 GB | 1x |
| turbo (large-v3-turbo) | 809 M | -- | ~6 GB | ~8x |
La velocità è relativa al modello large. I requisiti di VRAM sono per inferenza GPU con precisione fp16 tramite l'implementazione Python originale. whisper.cpp usa molta meno memoria (per esempio, il modello large richiede ~3,9 GB di RAM invece di ~10 GB di VRAM).
Il modello turbo (rilasciato a ottobre 2024) è una versione distillata di large-v3 con un decoder significativamente più piccolo. Mantiene gran parte dell'accuratezza di large-v3 mentre gira circa 8 volte più velocemente, rendendolo una scelta forte quando la velocità conta. Nota che turbo non supporta il task di traduzione.
Il modello large ha attraversato tre iterazioni: large-v1 (settembre 2022), large-v2 (dicembre 2022) e large-v3 (novembre 2023). Ogni versione ha migliorato l'accuratezza; large-v3 ha introdotto 128 bin mel-frequency (rispetto a 80) ed è stato addestrato su un dataset molto più grande. Per un approfondimento dettagliato su ogni dimensione e su come scegliere, consulta la nostra guida alle dimensioni dei modelli Whisper.
Quanto è accurato Whisper
L'accuratezza di Whisper viene in genere misurata con il Word Error Rate (WER): la percentuale di parole trascritte in modo errato (inserimenti, eliminazioni e sostituzioni combinati). Più basso è il WER, meglio è.
Benchmark in inglese
Su LibriSpeech test-clean, il benchmark ASR in inglese più usato, composto da parlato letto pulito tratto da audiolibri, Whisper large-v2 raggiunge un WER di circa 3,0%[1][2]. È competitivo con sistemi ASR commerciali e modelli addestrati appositamente, anche se modelli specializzati fine-tuned su LibriSpeech possono ottenere un WER più basso su quello specifico benchmark. La forza di Whisper non sta nel battere benchmark ristretti, ma nella robustezza: funziona in modo costantemente buono in un'ampia gamma di condizioni reali.
Miglioramenti di large-v3
Secondo la valutazione di OpenAI, Whisper large-v3 mostra una riduzione degli errori del 10-20% rispetto a large-v2 nelle lingue in cui il modello ottiene un tasso di errore inferiore al 60% sui dataset di valutazione Common Voice 15 e Fleurs[2][3]. I miglioramenti sono particolarmente evidenti per le lingue diverse dall'inglese, dove l'espansione dei dati di addestramento (5 milioni di ore totali) fa la differenza maggiore.
Come si confronta Whisper (febbraio 2026)
Dal rilascio di Whisper, modelli ASR open source più recenti lo hanno superato nei benchmark su parlato pulito. Parakeet TDT di NVIDIA (0,6B parametri) raggiunge 1,69% di WER e il loro modello Canary arriva a 1,6% di WER su LibriSpeech test-clean, entrambi significativamente sotto il ~2,7% di Whisper large-v3. Tuttavia, Whisper rimane il modello ASR open source più distribuito grazie alla maturità del suo ecosistema, alla copertura linguistica e alla disponibilità di runtime ottimizzati come whisper.cpp.
Tasso di errore di parole: Whisper rispetto ai concorrenti open source
LibriSpeech test-clean (discorso letto in inglese) — più basso è meglio
Fonti: schede modello Hugging Face, schede modello NVIDIA, Open ASR Leaderboard (Feb 2026). Solo lettura vocale in inglese pulito: la precisione nel mondo reale varia in base alla qualità audio, all'accento e al dominio. API commerciali omessi in quanto non pubblicano benchmark LibriSpeech.
Nota: le API commerciali cloud (Deepgram Nova-3, Google Chirp, AssemblyAI Universal-2) non pubblicano valori WER su LibriSpeech, quindi non possono essere confrontate direttamente in questo grafico. I loro benchmark usano set di test proprietari del mondo reale. OpenAI ha anche rilasciato GPT-4o-transcribe a marzo 2025 come modello solo API (non open source, non basato su Whisper) con tassi di errore dichiarati inferiori, ma è solo cloud e non disponibile per inferenza locale.
Dove Whisper eccelle
- +Robustezza ad accenti e dialetti — Addestrato su audio internet diversificato, Whisper gestisce gli accenti regionali meglio dei sistemi addestrati su parlato letto.
- +Tolleranza al rumore di fondo — Il modello mantiene una precisione ragionevole anche con musica, altri parlanti o rumore ambientale presente.
- +Vocabolario tecnico — Grazie all'ampiezza dei dati di addestramento, Whisper gestisce termini specifici di dominio (medici, legali, tecnici) meglio di molti sistemi ASR general-purpose.
- +Capacità multilingue — Un unico modello che supporta 99 lingue, senza bisogno di fine-tuning per lingua.
Dove Whisper fatica
- -Allucinazione — Il problema citato più spesso. Durante silenzi o passaggi molto quieti, Whisper può generare testo mai pronunciato. È una conseguenza dell'approccio di addestramento debolmente supervisionato.
- -Lingue con poche risorse — Le lingue con pochi dati di addestramento (gran parte delle 680.000 ore è in inglese) hanno tassi di errore significativamente più alti.
- -Generazione ripetitiva del testo — Il decoder autoregressivo può rimanere "bloccato" in loop, producendo ripetutamente la stessa frase. Beam search con parametri specifici può mitigare, ma non eliminare, questo problema.
- -Non è real-time di default — Whisper elabora chunk da 30 secondi, quindi esiste una latenza intrinseca. Le soluzioni di streaming (come la modalità real-time di whisper.cpp) aggirano il problema, ma aggiungono complessità.
whisper.cpp e inferenza locale
L'implementazione originale di Whisper richiede Python, PyTorch e una GPU compatibile con CUDA per prestazioni ragionevoli. Questo la rende poco pratica per applicazioni desktop, dispositivi mobili e deployment edge. whisper.cpp, creato da Georgi Gerganov, risolve questo problema.
whisper.cpp è una reimplementazione completa dell'inferenza Whisper in C/C++ puro, senza dipendenze. Legge gli stessi pesi del modello ma gira senza Python, senza PyTorch e senza GPU (anche se ne trae enorme beneficio). Le caratteristiche principali includono:
- Zero allocazioni di memoria a runtime — Tutta la memoria viene preallocata, rendendo le prestazioni prevedibili e adatte ai sistemi embedded.
- Ottimizzazione per Apple Silicon — Sui Mac con chip serie M, l'encoder può girare su Apple Neural Engine tramite Core ML, offrendo inferenza oltre 3 volte più veloce rispetto alla sola CPU. È supportata anche l'accelerazione Metal GPU per inferenza completa su GPU.
- Supporto alla quantizzazione — I modelli possono essere quantizzati a precisione intera a 4, 5 o 8 bit, riducendo drasticamente l'uso di memoria e aumentando la velocità con una perdita minima di accuratezza.
- Accelerazione GPU — Supporta NVIDIA CUDA (tramite cuBLAS), Vulkan (cross-vendor), OpenVINO (Intel) e OpenBLAS per accelerazione CPU.
- Rilevamento dell'attività vocale (VAD) — VAD integrata per saltare i segmenti silenziosi, migliorando sia la velocità sia la qualità della trascrizione.
Requisiti di memoria (whisper.cpp)
| Modello | Dimensione su disco | RAM richiesta |
|---|---|---|
| tiny | 75 MB | ~273 MB |
| base | 142 MB | ~388 MB |
| small | 466 MB | ~852 MB |
| medium | 1.5 GB | ~2.1 GB |
| large | 2.9 GB | ~3.9 GB |
whisper.cpp gira su macOS (Intel e Apple Silicon), Linux, Windows, iOS, Android, FreeBSD, Raspberry Pi e perfino nel browser tramite WebAssembly. Raggiunge trascrizione più veloce del tempo reale su hardware consumer modesto, inclusi dispositivi piccoli come Raspberry Pi 4 e iPhone 13.
Questa portabilità è ciò che rende pratico il riconoscimento vocale locale e privato. Applicazioni come OpenWhispr usano whisper.cpp sotto il cofano per fornire dettatura push-to-talk in tempo reale eseguita interamente sul dispositivo dell'utente: l'audio non lascia mai la macchina.
Whisper rispetto ad altri sistemi ASR
Whisper esiste in un panorama più ampio di sistemi di riconoscimento vocale. Ecco come si confronta con le alternative più comuni.
Google Cloud Speech-to-Text
Il servizio ASR cloud di Google. Accuratezza eccellente, soprattutto in inglese, con supporto allo streaming real-time e diarizzazione dei parlanti. Le differenze principali: è proprietario, richiede di inviare audio ai server di Google e ha un prezzo al minuto di audio elaborato. Whisper offre accuratezza comparabile per uso generale, gira localmente ed è gratuito, ma non include streaming e diarizzazione integrati.
Amazon Transcribe (AWS)
L'ASR cloud di Amazon, strettamente integrato con l'ecosistema AWS. Offre trascrizione medica, analisi delle chiamate e vocabolario personalizzato. Compromessi simili a Google: dipendenza dal cloud, prezzo al minuto e tecnologia proprietaria. Whisper è più adatto alle applicazioni che richiedono funzionamento offline, licenza open source o assenza di lock-in del fornitore.
Mozilla DeepSpeech
Il motore ASR open source di Mozilla basato sulla ricerca Deep Speech di Baidu. È stato uno dei primi modelli ASR aperti di alta qualità, ma Mozilla ha interrotto lo sviluppo attivo nel 2021. Whisper ha di fatto superato DeepSpeech in accuratezza, supporto multilingue e slancio della community. DeepSpeech rimane utile come baseline leggera e ben compresa, ma non è più consigliato per nuovi progetti.
Vosk
Un toolkit open source per riconoscimento vocale offline che supporta oltre 20 lingue con modelli piccoli e veloci. Vosk è eccellente per ambienti con risorse limitate: i suoi modelli sono una frazione della dimensione di quelli di Whisper e girano bene su hardware a bassa potenza. Il compromesso è l'accuratezza: Vosk è sensibilmente meno accurato di Whisper, soprattutto con parlato accentato, audio rumoroso e vocabolario tecnico.
Faster Whisper (CTranslate2)
Una reimplementazione di Whisper che usa il motore di inferenza CTranslate2 di SYSTRAN. Esegue gli stessi modelli Whisper con la stessa accuratezza, ma può essere fino a 4 volte più veloce dell'implementazione originale di OpenAI e usare meno memoria. Faster Whisper è basato su Python (a differenza del C/C++ di whisper.cpp) ed è una scelta solida per trascrizione batch lato server. Supporta GPU CUDA e inferenza CPU con quantizzazione INT8.
Applicazioni pratiche
La combinazione di accuratezza, supporto multilingue e disponibilità open source di Whisper lo ha reso la spina dorsale di una vasta gamma di applicazioni:
Dettatura desktop
App come OpenWhispr usano whisper.cpp per offrire dettatura push-to-talk a livello di sistema su macOS, Windows e Linux. L'audio viene elaborato localmente: nulla viene inviato al cloud.
Generazione di sottotitoli
La previsione dei timestamp di Whisper lo rende adatto alla generazione di sottotitoli e closed caption. Strumenti come stable-ts e auto-subtitle automatizzano questo flusso di lavoro.
Trascrizione di podcast e riunioni
Whisper gestisce bene la trascrizione di audio long-form, soprattutto con l'approccio di elaborazione a chunk. Molti editor di podcast e strumenti per note di riunione usano Whisper (o Faster Whisper) per la trascrizione batch delle registrazioni.
Traduzione e localizzazione
La capacità di traduzione integrata di Whisper (da qualsiasi lingua all'inglese) viene usata per accesso cross-lingue ai contenuti, localizzazione dei media e prototipi di traduzione real-time.
Accessibilità
Sottotitoli real-time per persone sorde o con ipoacusia, interfacce vocali per utenti con disabilità motorie e trascrizione di descrizioni audio sono tutte aree attive in cui Whisper viene impiegato.
Annotazione dei dati e ricerca
I ricercatori usano Whisper per creare dataset pseudo-etichettati con cui addestrare altri modelli, lo stesso approccio usato da OpenAI per creare i dati di addestramento di large-v3. È usato ampiamente anche nella ricerca linguistica e nella creazione di corpus.
Fonti e ulteriori letture
- [Articolo] Radford, A., Kim, J. W., Xu, T., Brockman, G., McLeavey, C., & Sutskever, I. (2022). Robust Speech Recognition via Large-Scale Weak Supervision. arXiv:2212.04356. arxiv.org/abs/2212.04356
- [Codice] Repository GitHub di OpenAI Whisper. github.com/openai/whisper
- [Codice] whisper.cpp: port C/C++ di Georgi Gerganov. github.com/ggml-org/whisper.cpp
- [Model card] Whisper large-v2 su Hugging Face (benchmark WER: ~3,0% su LibriSpeech test-clean). huggingface.co/openai/whisper-large-v2
- [Model card] Whisper large-v3 su Hugging Face (riduzione degli errori del 10-20% rispetto a v2). huggingface.co/openai/whisper-large-v3
- [Model card] Whisper large-v3-turbo su Hugging Face (variante distillata orientata alla latenza). huggingface.co/openai/whisper-large-v3-turbo
- [Model card] Model card di OpenAI Whisper (scomposizione della composizione dei dati di addestramento). github.com/openai/whisper/blob/main/model-card.md
- [Note di rilascio] Annuncio di OpenAI large-v3 e note di valutazione. github.com/openai/whisper/discussions/1762
- [Note di rilascio] Discussione sul rilascio di OpenAI turbo e compromessi orientati alla velocità. github.com/openai/whisper/discussions/2363
- [Codice] Faster Whisper: reimplementazione basata su CTranslate2 di SYSTRAN. github.com/SYSTRAN/faster-whisper
- [Prodotto] OpenWhispr usa Whisper tramite whisper.cpp per flussi di dettatura locale. openwhispr.com
Prova Whisper localmente con OpenWhispr
OpenWhispr usa Whisper (tramite whisper.cpp) per dettatura locale e privata su macOS, Windows e Linux. Push-to-talk, oltre 99 lingue, nessun cloud richiesto. Provalo gratis.
Nessun account richiesto · Funziona offline · Open source per sempre