Parakeet vs Whisper vs Nemotron : la meilleure transcription vocale locale en 2026
Trois modèles ouverts savent désormais convertir la parole en texte entièrement sur votre ordinateur. Voici ce qui les distingue réellement en matière de précision, de vitesse, de langues et de streaming, avec des chiffres fiables issus de sources primaires.
OpenWhispr
Ingénierie
Table des matières
Pour l'anglais et les principales langues européennes, NVIDIA Parakeet TDT 0.6B v3 est le meilleur modèle local de transcription vocale en 2026 : il devance Whisper large-v3 en précision mesurée, occupe quatre fois moins d'espace et s'exécute nettement plus vite sur un CPU ordinaire. Si vous voulez voir le texte apparaître en direct pendant que vous parlez, les nouveaux modèles de streaming Nemotron de NVIDIA sont les premiers modèles locaux conçus précisément pour cela. Et si vous parlez l'une des nombreuses langues que les modèles NVIDIA ne couvrent pas, Whisper d'OpenAI — avec ses 99 langues — reste le bon choix.
La surprise de 2026, c'est que Whisper ne détient plus la première place en précision parmi les modèles ouverts, après l'avoir occupée pendant trois ans. Mais la question du « meilleur modèle » se joue désormais réellement à trois, car chacun excelle dans un domaine différent : Parakeet optimise la précision par watt, Nemotron la latence et Whisper l'étendue linguistique. Cet article les compare à partir des chiffres de leurs propres fiches et du classement public, sans jugements vagues ni écarts artificiellement grossis.
Dernière mise à jour le 18 juillet 2026. Nous développons OpenWhispr, une application de dictée open source qui intègre les trois familles de modèles ; nous évaluons et maintenons donc chacune d'elles en production. C'est aussi notre parti pris : nous ne vendons aucun de ces modèles, et les compromis exposés ci-dessous sont exactement ceux que nous expliquons à nos utilisateurs.
Les faits en bref (sources primaires)
- Parakeet TDT 0.6B v3 affiche un taux d'erreur de mots moyen de 6.34% sur les huit benchmarks de l'Open ASR Leaderboard, avec un débit de 3,332× le temps réel. 600M paramètres, 25 langues, licence CC-BY-4.0. Fiche du modèle Parakeet TDT v3 · Open ASR Leaderboard
- Whisper large-v3 obtient environ 7.4% sur le même classement et prend en charge 99 langues avec 1.55B paramètres sous licence MIT. Dépôt OpenAI Whisper · Fiche du modèle Whisper large-v3
- Nemotron Speech Streaming EN 0.6B affiche un WER moyen de 6.93% en streaming (segments de 1.12 seconde), atteint 2.32% sur LibriSpeech test-clean et a été entraîné sur 530,000 heures d'audio. Fiche de Nemotron Streaming EN
- Nemotron 3.5 ASR couvre 40 paramètres régionaux dans un unique modèle de streaming de 600M avec détection automatique de la langue, publié le 4 juin 2026 sous licence OpenMDW. Fiche du modèle Nemotron 3.5 ASR
- Toutes les tailles sur disque et tous les comportements dans l'application mentionnés ci-dessous sont vérifiables dans le registre open source des modèles d'OpenWhispr. OpenWhispr sur GitHub · Page des modèles OpenWhispr
Les trois concurrents
Tous trois sont des modèles gratuits à poids ouverts, téléchargeables et utilisables hors ligne. Leur architecture diffère, et elle explique presque toutes les différences concrètes que vous constaterez.
OpenAI Whisper (2022)
Le modèle qui a démocratisé la reconnaissance vocale ouverte. Ce transformer encodeur-décodeur, entraîné sur 680,000 heures d'audio, existe en six tailles allant de 75MB (tiny) à 3GB (large-v3) et couvre 99 langues. Il produit le texte token par token, à la manière d'un modèle de langage, ce qui explique aussi pourquoi il est le plus lent des trois. Licence MIT.
NVIDIA Parakeet (2024–2025)
Un modèle transducteur (TDT) de 600M paramètres conçu pour la transcription par lots. Au lieu de générer les tokens de manière autorégressive, il produit le texte en un seul passage sur l'audio : il est beaucoup plus rapide et n'invente pas de texte pendant les silences. Deux variantes comptent : v3 multilingue (25 langues, 680MB en INT8 ONNX) et Unified, réservé à l'anglais (631MB), qui affiche actuellement la meilleure précision en anglais. Licence CC-BY-4.0.
NVIDIA Nemotron ASR (2026)
La famille la plus récente, conçue pour le streaming : un transducteur FastConformer avec cache qui transcrit l'audio à mesure qu'il arrive, sans attendre la fin de l'enregistrement. Le modèle anglais est sorti en janvier 2026, suivi en juin du modèle multilingue 3.5 couvrant 40 paramètres régionaux. Tous deux comptent 600M paramètres (632–650MB en INT8 ONNX) et disposent d'une licence ouverte (OpenMDW).
Précision : Parakeet l'emporte, mais de moins qu'il n'y paraît
Les modèles de reconnaissance vocale sont évalués selon le taux d'erreur de mots (WER), soit le pourcentage de mots mal reconnus. Plus il est bas, mieux c'est. La référence habituelle est l'Open ASR Leaderboard de Hugging Face, qui calcule la moyenne du WER sur huit jeux de données anglais variés (réunions, présentations de résultats, conférences TED, livres audio, etc.) afin qu'un seul jeu facile ne puisse avantager artificiellement un modèle.
Précision en anglais : taux d’erreur moyen par mot
Moyennes sur plusieurs jeux de données issues des évaluations de l’Open ASR Leaderboard de Hugging Face (plus le score est bas, mieux c’est). Nemotron est présenté dans sa configuration de streaming.
Sources : fiches des modèles NVIDIA sur Hugging Face et Open ASR Leaderboard, juillet 2026. WER = pourcentage de mots transcrits incorrectement.
Lisez ce graphique avec recul : tous les modèles présentés sont aptes à la production et l'écart total n'est que d'environ 1.5 point. En dictée quotidienne, des modèles à 6.3% et 7.4% semblent proches sur un son clair ; les différences apparaissent sur les enregistrements difficiles (accents, bruit, jargon). Ce qui rend les chiffres de NVIDIA remarquables, c'est le coût nécessaire pour les atteindre : Parakeet obtient cette précision avec 600M paramètres contre 1.55B pour Whisper, tandis que Nemotron atteint 6.93% en streaming, sans jamais connaître la suite du signal audio.
Faiblesse connue de Whisper : les hallucinations pendant les silences
Le décodeur de Whisper fonctionnant comme un modèle de langage, il peut produire des phrases fluides mais entièrement inventées pendant un silence ou du bruit, un mode de défaillance documenté dans tout l'écosystème. Les modèles transducteurs tels que Parakeet et Nemotron y résistent par construction : sans indice audio, aucun token. Pour la dictée, où les enregistrements commencent et finissent par du silence, cela compte davantage qu'un point de benchmark.
Vitesse et efficacité : aucune comparaison possible
Sur le matériel du classement, Parakeet TDT v3 transcrit à 3,332× le temps réel, soit environ une seconde pour une heure d'audio. Whisper large-v3 reste très en dessous d'un dixième de ce débit. L'explication tient à l'architecture : Whisper écrit sa transcription token par token, chaque étape attendant la précédente, alors qu'un transducteur lit l'audio une seule fois et émet le texte au fil de l'eau. Ni boucle ni aller-retour pour chaque mot.
Sur votre ordinateur portable, les chiffres absolus sont plus faibles, mais le rapport reste le même : un paragraphe dicté que Whisper large met plusieurs secondes à traiter apparaît presque instantanément avec Parakeet, sur CPU et sans GPU. Des benchmarks indépendants indiquent aussi que les transducteurs NVIDIA consomment environ 8–10× moins d'énergie par heure d'audio que Whisper à qualité comparable, ce qui compte si vous dictez toute la journée sur batterie.
La réponse de Whisper est turbo (1.6GB), une version distillée de large-v3 qui sacrifie un peu de précision pour offrir environ 8× la vitesse de Whisper-large. C'est le Whisper adapté à la dictée, mais il réduit l'écart sans le combler. Pour une comparaison détaillée de chaque taille, consultez notre guide des tailles de modèles Whisper.
Langues prises en charge : l'avantage durable de Whisper
| Modèle | Langues | Remarques |
|---|---|---|
| Whisper large-v3 | 99 | La plus vaste couverture parmi les modèles ouverts, y compris les langues peu dotées |
| Nemotron 3.5 ASR | 40 paramètres régionaux | Détection automatique ; 15 langues prêtes à transcrire, dont le japonais, le coréen, l'arabe et l'hindi |
| Parakeet TDT v3 | 25 | Langues européennes, anglais et russe ; détection automatique |
| Parakeet Unified / Nemotron EN | 1 | Anglais uniquement, en échange de la meilleure précision de leur catégorie |
La règle générale est simple. Pour l'anglais ou une grande langue européenne, les trois conviennent : choisissez selon la vitesse. Nemotron 3.5 couvre désormais le japonais, le coréen, le vietnamien, l'arabe et l'hindi en streaming, une véritable première pour les modèles locaux. Pour le mandarin, le thaï, l'indonésien, le swahili ou les enregistrements alternant fortement les langues, Whisper reste la seule option sérieuse, et cela ne devrait pas changer de sitôt.
Streaming : le vrai facteur décisif
En streaming, Nemotron ne se contente pas d'une amélioration marginale : il fait ce que l'architecture des deux autres ne permet pas. Whisper traite l'audio par fenêtres de 30 secondes et réencode tout ce qu'il reçoit. Whisper « en direct » consiste donc à relancer sans cesse le même modèle par lots sur des segments audio qui se chevauchent : c'est coûteux, lent et irrégulier aux raccords. L'architecture avec cache de Nemotron a été entraînée pour le streaming : elle ne traite que le dernier segment audio, conserve son état interne et produit du texte partiel avec une latence configurable de 80 millisecondes à 1.12 seconde.
À grande échelle, l'écart d'efficacité est spectaculaire : NVIDIA annonce 17× plus de flux simultanés que son modèle de streaming de génération précédente sur le même GPU. Sur un portable, l'avantage se résume plus simplement : le texte apparaît pendant que vous parlez, grâce à un modèle exécuté sur votre propre CPU. Nous détaillons tout le travail d'ingénierie nécessaire pour l'intégrer à une application de bureau dans notre analyse approfondie du streaming ASR.
Si le texte en direct ne vous intéresse pas — vous dictez, vous vous arrêtez, puis vous voulez la transcription finale — le streaming ne vous apporte rien, et les modèles par lots de Parakeet sont préférables. Le streaming sert aux sous-titres en direct, aux agents vocaux et à l'aperçu de dictée qui s'affiche à mesure que vous parlez.
Matériel : les trois fonctionnent sur un portable ordinaire
Aucun de ces modèles n'exige de GPU. Les modèles NVIDIA sont distribués sous forme de fichiers ONNX quantifiés en INT8 (631–680MB), qui s'exécutent sans difficulté sur tout CPU récent — Apple Silicon ou x86 — via sherpa-onnx, un binaire natif sans Python ni PyTorch. Whisper fonctionne partout grâce à whisper.cpp ; ses tailles small et turbo conviennent au CPU, tandis que large-v3 (3GB, ~10GB RAM) profite réellement de l'accélération.
Si vous avez un GPU, utilisez-le pour Whisper : Metal est intégré sur Apple Silicon, et OpenWhispr propose en un clic les runtimes CUDA (NVIDIA) et Vulkan (AMD et Intel), avec repli automatique sur le CPU en cas d'échec du runtime GPU. Les transducteurs NVIDIA sont déjà assez rapides sur CPU pour que l'accélération GPU ait peu d'intérêt en dictée.
Lequel choisir ?
| Votre besoin | Modèle conseillé |
|---|---|
| Dictée en anglais, priorité à la précision | Parakeet Unified EN 0.6B |
| Langues européennes, transcription par lots rapide | Parakeet TDT 0.6B v3 |
| Texte en direct pendant que vous parlez (anglais) | Nemotron Speech Streaming EN |
| Texte en direct en espagnol, japonais, coréen, arabe, hindi… | Nemotron 3.5 ASR Streaming |
| Langue non couverte par les modèles NVIDIA | Whisper large-v3 ou turbo |
| Matériel ancien ou peu de RAM, notes rapides | Whisper tiny ou base |
Et si vous optez pour une solution locale pour protéger votre vie privée, les trois se valent : l'audio est traité sur votre machine et n'est jamais envoyé ailleurs. Nous approfondissons ce compromis dans notre comparatif transcription locale ou cloud.
Essayez les trois en deux minutes
La façon la plus honnête de choisir consiste à dicter le même paragraphe à chaque modèle. OpenWhispr réunit tous ceux de cet article — six tailles de Whisper, les deux Parakeet et les deux Nemotron — dans un seul menu de réglages, gratuitement et en open source, sur macOS, Windows et Linux. Téléchargez un modèle, appuyez sur le raccourci et parlez. Notre page des modèles les répertorie tous avec leurs tailles et leurs compromis.
Questions fréquentes
Quel est le meilleur modèle local de transcription vocale en 2026 ?
Pour l'anglais et les principales langues européennes, NVIDIA Parakeet TDT 0.6B v3 offre le meilleur compromis global : il affiche un taux d'erreur de mots moyen de 6.34% sur les benchmarks de l'Open ASR Leaderboard — contre environ 7.4% pour Whisper large-v3 — tout en étant quatre fois plus compact et nettement plus rapide sur CPU. Pour afficher le texte en direct pendant que vous parlez, les modèles de streaming NVIDIA Nemotron sont le meilleur choix. Pour une langue non prise en charge par les modèles NVIDIA, choisissez Whisper.
Parakeet est-il plus précis que Whisper ?
Sur les benchmarks anglais de l'Open ASR Leaderboard, oui : Parakeet TDT 0.6B v3 obtient un WER moyen de 6.34%, contre environ 7.4% pour Whisper large-v3, et le modèle Parakeet Unified réservé à l'anglais atteint 5.91%. Nuance importante : un écart de WER d'environ 1 point se remarque peu dans la dictée quotidienne. Les avantages les plus nets de Parakeet sont sa vitesse, son efficacité et l'absence d'hallucinations textuelles pendant les silences, un défaut connu de Whisper.
Faut-il un GPU pour exécuter ces modèles localement ?
Non. Les trois fonctionnent sur un CPU moderne. Parakeet et Nemotron utilisent des modèles ONNX quantifiés en INT8 (environ 630–680MB sur disque), conçus pour l'inférence sur CPU. Whisper fonctionne sur CPU via whisper.cpp, même si son grand modèle de 3GB profite d'une accélération GPU. OpenWhispr prend en charge Metal sur Apple Silicon, CUDA sur NVIDIA et Vulkan sur les GPU AMD/Intel, avec repli automatique sur le CPU.
Quelles langues Nemotron ASR prend-il en charge ?
Le modèle Nemotron 3.5 ASR de NVIDIA couvre 40 paramètres régionaux au sein d'un unique modèle de 600M paramètres avec détection automatique de la langue. OpenWhispr active les 15 langues prêtes pour la transcription : anglais, espagnol, français, italien, portugais, néerlandais, allemand, turc, russe, arabe, hindi, japonais, coréen, vietnamien et ukrainien. Le modèle de streaming Nemotron réservé à l'anglais est également disponible.
Whisper est-il désormais obsolète ?
Non. Whisper couvre encore 99 langues — bien plus que les 25 de Parakeet ou les 40 paramètres régionaux de Nemotron — et reste le choix le plus sûr pour les langues asiatiques autres que le japonais, le coréen et le vietnamien, pour les langues peu dotées et pour l'audio qui mêle fortement plusieurs langues. C'est aussi le modèle le plus éprouvé, doté du plus vaste écosystème. Ce qui a changé, c'est que Whisper ne domine plus la précision ni la vitesse en anglais.
Lesquels de ces modèles OpenWhispr prend-il en charge ?
Tous. OpenWhispr propose six tailles de Whisper via whisper.cpp, les deux modèles Parakeet et les deux modèles de streaming Nemotron via sherpa-onnx, et permet de passer de l'un à l'autre dans les réglages. Tout s'exécute sur votre appareil — l'audio ne quitte jamais votre machine — et l'application est gratuite et open source.