Confronto

Parakeet vs Whisper vs Nemotron: il miglior speech-to-text locale nel 2026

Tre modelli aperti possono ormai convertire la voce in testo interamente sul tuo computer. Ecco il confronto reale su accuratezza, velocità, lingue e streaming, con dati affidabili provenienti da fonti primarie.

OpenWhispr

OpenWhispr

Ingegneria

18 luglio 2026
Sommario

Per l'inglese e le principali lingue europee, NVIDIA Parakeet TDT 0.6B v3 è il miglior modello speech-to-text locale del 2026: supera Whisper large-v3 nell'accuratezza misurata, occupa un quarto dello spazio ed è molto più veloce su una normale CPU. Se vuoi vedere il testo apparire in diretta mentre parli, i nuovi modelli Nemotron di NVIDIA sono i primi modelli locali progettati esattamente per lo streaming. Se invece parli una delle tante lingue non coperte dai modelli NVIDIA, Whisper di OpenAI — con 99 lingue — resta la scelta giusta.

La sorpresa del 2026 è che Whisper non detiene più il primato di accuratezza tra i modelli aperti, mantenuto per tre anni. Ma la domanda «qual è il modello migliore?» è diventata una vera sfida a tre, perché ciascuno eccelle in un ambito diverso: Parakeet ottimizza l'accuratezza per watt, Nemotron la latenza e Whisper l'ampiezza della copertura. Questo articolo li confronta usando i dati delle rispettive schede e del leaderboard pubblico, senza impressioni vaghe né differenze gonfiate.

Ultimo aggiornamento: 18 luglio 2026. Sviluppiamo OpenWhispr, un'app di dettatura open source che include tutte e tre le famiglie; per questo le valutiamo e le supportiamo in produzione. È anche il nostro punto di vista: non vendiamo nessuno di questi modelli e i compromessi descritti di seguito sono gli stessi che spieghiamo ai nostri utenti.

Verifica rapida dei fatti (fonti primarie)

I tre contendenti

Sono tutti modelli gratuiti a pesi aperti, scaricabili ed eseguibili offline. Le loro architetture sono diverse, e spiegano quasi ogni differenza pratica.

OpenAI Whisper (2022)

Il modello che ha reso popolare il riconoscimento vocale aperto. Un transformer encoder-decoder addestrato su 680,000 ore di audio, disponibile in sei dimensioni da 75MB (tiny) a 3GB (large-v3), con copertura di 99 lingue. Genera il testo un token alla volta, come un modello linguistico; è anche il motivo per cui è il più lento dei tre. Licenza MIT.

NVIDIA Parakeet (2024–2025)

Un trasduttore (TDT) da 600M parametri creato per la trascrizione batch. Invece di generare token in modo autoregressivo, emette il testo in un solo passaggio sull'audio: è molto più veloce e non inventa testo durante i silenzi. Contano due varianti: v3 multilingue (25 lingue, 680MB come INT8 ONNX) e Unified solo in inglese (631MB), che oggi offre un'accuratezza all'avanguardia in inglese. Licenza CC-BY-4.0.

NVIDIA Nemotron ASR (2026)

La famiglia più recente, progettata per lo streaming: un trasduttore FastConformer con cache trascrive l'audio mentre arriva, senza attendere la fine della registrazione. Il modello inglese è uscito a gennaio 2026; il modello multilingue 3.5 per 40 varianti è seguito a giugno. Entrambi hanno 600M parametri (632–650MB come INT8 ONNX) e licenza aperta (OpenMDW).

Accuratezza: vince Parakeet, ma il divario è minore di quanto sembri

I modelli vocali si misurano tramite il tasso di errore sulle parole (WER), cioè la percentuale di parole riconosciute male. Più è basso, meglio è. Il riferimento standard è l'Open ASR Leaderboard di Hugging Face, che calcola il WER medio su otto dataset inglesi eterogenei (riunioni, presentazioni finanziarie, TED Talk, audiolibri e altro), così un singolo dataset facile non può favorire un modello.

Accuratezza in inglese: tasso medio di errore delle parole

Medie su più set di dati dai benchmark dell’Open ASR Leaderboard di Hugging Face (più basso è il valore, meglio è). Nemotron è mostrato nella configurazione di streaming.

Fonti: schede dei modelli NVIDIA su Hugging Face e Open ASR Leaderboard, luglio 2026. WER = percentuale di parole trascritte in modo errato.

Il grafico va letto con onestà: ogni modello è pronto per la produzione e l'intero intervallo è di circa 1.5 punti. Nella dettatura quotidiana, 6.3% e 7.4% sembrano simili con audio pulito; le differenze emergono con audio difficile (accenti, rumore, gergo). I dati NVIDIA colpiscono per il costo con cui sono ottenuti: Parakeet raggiunge la sua accuratezza con 600M parametri contro 1.55B di Whisper, e Nemotron segna 6.93% durante lo streaming, senza poter conoscere l'audio successivo.

Il noto punto debole di Whisper: allucinazioni nel silenzio

Poiché il decoder di Whisper funziona come un modello linguistico, durante silenzi o rumore può generare frasi scorrevoli ma completamente inventate, un problema documentato in tutto l'ecosistema. I trasduttori come Parakeet e Nemotron vi resistono per struttura: senza evidenza audio, niente token. Nella dettatura, in cui le registrazioni iniziano e finiscono nel silenzio, conta più di un punto di benchmark.

Velocità ed efficienza: non c'è confronto

Sull'hardware del leaderboard, Parakeet TDT v3 trascrive a 3,332× il tempo reale: un'ora di audio in circa un secondo. Whisper large-v3 non arriva a un decimo. La ragione è nell'architettura: Whisper scrive la trascrizione token per token, aspettando ogni volta il passaggio precedente; un trasduttore legge l'audio una volta ed emette testo procedendo. Nessun ciclo né passaggi ripetuti per ogni parola.

Sul portatile i numeri assoluti sono inferiori, ma il rapporto resta: un paragrafo che Whisper large elabora in diversi secondi appare quasi subito con Parakeet, su CPU e senza GPU. Benchmark indipendenti riferiscono anche che i trasduttori NVIDIA consumano circa 8–10× meno energia per ora di audio rispetto a Whisper a qualità simile, un dato importante se detti tutto il giorno a batteria.

La risposta di Whisper è turbo (1.6GB), una versione distillata di large-v3 che scambia un po' di accuratezza per circa 8× la velocità di Whisper-large. È il Whisper giusto per la dettatura, ma riduce il divario senza chiuderlo. Per il confronto completo di tutte le dimensioni, consulta la nostra guida alle dimensioni dei modelli Whisper.

Copertura linguistica: il vantaggio di Whisper

ModelloLingueNote
Whisper large-v399La copertura più ampia tra i modelli aperti, incluse lingue con poche risorse
Nemotron 3.5 ASR40 varianti localiRilevamento automatico; 15 lingue pronte per la trascrizione, tra cui giapponese, coreano, arabo e hindi
Parakeet TDT v325Lingue europee, inglese e russo; rilevamento automatico
Parakeet Unified / Nemotron EN1Solo inglese, in cambio della migliore accuratezza della categoria

La regola generale è semplice. Per l'inglese o una delle principali lingue europee, vanno bene tutti e tre: scegli in base alla velocità. Nemotron 3.5 copre ora giapponese, coreano, vietnamita, arabo e hindi in streaming, una vera novità per i modelli locali. Per mandarino, thailandese, indonesiano, swahili o audio con frequenti cambi di lingua, Whisper resta l'unica opzione seria, e difficilmente cambierà presto.

Streaming: la vera differenza

Nello streaming, Nemotron non è solo un po' migliore: fa qualcosa che gli altri due non possono fare per architettura. Whisper elabora l'audio in finestre di 30 secondi e ricodifica tutto. Di fatto, Whisper «in diretta» è lo stesso modello batch ripetuto su audio sovrapposto: costoso, lento e instabile nei punti di giunzione. L'architettura con cache di Nemotron è stata addestrata per lo streaming: elabora solo il blocco più recente, conserva lo stato interno ed emette testo parziale con latenza configurabile da 80 millisecondi a 1.12 secondi.

Su larga scala la differenza di efficienza è enorme: NVIDIA dichiara 17× più stream simultanei rispetto al precedente modello di streaming sulla stessa GPU. Sul portatile il vantaggio è più semplice: il testo appare mentre parli, da un modello eseguito sulla tua CPU. Abbiamo descritto l'ingegneria necessaria per inserirlo in un'app desktop nel nostro approfondimento tecnico sull'ASR in streaming.

Se il testo in diretta non ti interessa — detti, ti fermi e vuoi la trascrizione finale — lo streaming non offre vantaggi e i modelli batch di Parakeet sono preferibili. Lo streaming serve per sottotitoli dal vivo, agenti vocali e anteprima della dettatura mentre parli.

Hardware: tutti e tre funzionano su un normale portatile

Nessuno richiede una GPU. I modelli NVIDIA sono file ONNX quantizzati INT8 (631–680MB) che funzionano senza problemi su qualsiasi CPU recente — Apple Silicon o x86 — tramite sherpa-onnx, un binario nativo senza Python né PyTorch. Whisper funziona ovunque con whisper.cpp; small e turbo vanno bene su CPU, mentre large-v3 (3GB, ~10GB RAM) beneficia davvero dell'accelerazione.

Se hai una GPU, usala per Whisper: Metal è integrato in Apple Silicon e OpenWhispr offre runtime CUDA (NVIDIA) e Vulkan (AMD e Intel) con un clic e ripiego automatico sulla CPU in caso di errore. I trasduttori NVIDIA sono già tanto veloci su CPU che l'accelerazione GPU è poco rilevante per la dettatura.

Quale scegliere?

La tua esigenzaUsa questo
Dettatura in inglese, massima accuratezzaParakeet Unified EN 0.6B
Lingue europee, trascrizione batch veloceParakeet TDT 0.6B v3
Testo in diretta mentre parli (inglese)Nemotron Speech Streaming EN
Testo in diretta in spagnolo, giapponese, coreano, arabo, hindi…Nemotron 3.5 ASR Streaming
Lingua non coperta dai modelli NVIDIAWhisper large-v3 o turbo
Hardware vecchio o poca RAM, appunti rapidiWhisper tiny o base

Se la privacy è il motivo per cui scegli l'elaborazione locale, i tre modelli si equivalgono: l'audio viene elaborato sul computer e non viene mai caricato. Abbiamo approfondito questo compromesso in trascrizione locale o cloud.

Provali tutti e tre in due minuti

Il modo più onesto per scegliere è dettare lo stesso paragrafo a ogni modello. OpenWhispr include tutti quelli citati — sei dimensioni Whisper, entrambi i Parakeet ed entrambi i Nemotron — in un solo menu, gratuitamente e con codice aperto su macOS, Windows e Linux. Scarica un modello, premi la scorciatoia e parla. La nostra pagina dei modelli elenca dimensioni e compromessi.

Domande frequenti

Qual è il miglior modello speech-to-text locale nel 2026?

Per l'inglese e le principali lingue europee, NVIDIA Parakeet TDT 0.6B v3 offre il miglior equilibrio complessivo: registra un tasso medio di errore sulle parole del 6.34% nei benchmark dell'Open ASR Leaderboard — contro circa il 7.4% di Whisper large-v3 — occupando un quarto dello spazio e con un throughput su CPU nettamente superiore. Per vedere il testo in diretta mentre parli, i modelli di streaming NVIDIA Nemotron sono la scelta migliore. Per una lingua non coperta dai modelli NVIDIA, usa Whisper.

Parakeet è più accurato di Whisper?

Nei benchmark inglesi dell'Open ASR Leaderboard, sì: Parakeet TDT 0.6B v3 registra un WER medio del 6.34%, contro circa il 7.4% di Whisper large-v3, mentre Parakeet Unified, solo in inglese, raggiunge il 5.91%. Va però detto che una differenza di ~1 punto WER si nota poco nella dettatura quotidiana. I vantaggi più evidenti di Parakeet sono velocità, efficienza e assenza di testo allucinato durante il silenzio, un problema noto di Whisper.

Serve una GPU per eseguire questi modelli in locale?

No. Tutti e tre funzionano su una CPU moderna. Parakeet e Nemotron usano modelli ONNX quantizzati INT8 (circa 630–680MB su disco), progettati per l'inferenza su CPU. Whisper funziona su CPU tramite whisper.cpp, anche se il modello grande da 3GB beneficia dell'accelerazione GPU. OpenWhispr supporta Metal su Apple Silicon, CUDA su NVIDIA e Vulkan sulle GPU AMD/Intel, con ripiego automatico sulla CPU.

Quali lingue supporta Nemotron ASR?

Nemotron 3.5 ASR di NVIDIA copre 40 varianti locali in un unico modello da 600M parametri con rilevamento automatico della lingua. In OpenWhispr sono abilitate le 15 lingue pronte per la trascrizione: inglese, spagnolo, francese, italiano, portoghese, olandese, tedesco, turco, russo, arabo, hindi, giapponese, coreano, vietnamita e ucraino. È disponibile anche il modello Nemotron di streaming solo in inglese.

Whisper è ormai obsoleto?

No. Whisper copre ancora 99 lingue — molte più delle 25 di Parakeet o delle 40 varianti di Nemotron — e rimane la scelta più sicura per le lingue asiatiche diverse da giapponese, coreano e vietnamita, per le lingue con poche risorse e per l'audio con frequenti cambi di lingua. È inoltre il modello più collaudato e con l'ecosistema più ampio. È cambiato soltanto il fatto che Whisper non detiene più il primato di accuratezza o velocità in inglese.

Quali di questi modelli supporta OpenWhispr?

Tutti. OpenWhispr include sei dimensioni di Whisper tramite whisper.cpp, entrambi i modelli Parakeet ed entrambi i modelli Nemotron di streaming tramite sherpa-onnx, e permette di passare dall'uno all'altro nelle Impostazioni. Tutto viene eseguito sul dispositivo — l'audio non lascia mai il computer — e l'app è gratuita e open source.