Technique

Comment fonctionne Whisper AI : guide complet

Une plongée technique dans le modèle open source de reconnaissance vocale d'OpenAI — des spectrogrammes mel au décodage transformer.

OpenWhispr

OpenWhispr

Ingénierie

3 février 2026
Table des matières

Whisper est un modèle de reconnaissance automatique de la parole (ASR) développé par OpenAI. Publié en septembre 2022, c'est un système de reconnaissance vocale généraliste entraîné sur 680 000 heures de données audio multilingues collectées sur internet. Whisper utilise une architecture Transformer encodeur-décodeur qui convertit l'audio en spectrogrammes log-mel, les traite avec un encodeur de réseau neuronal, puis décode autorégressivement des jetons de texte. Il prend en charge la transcription dans 99 langues, la traduction vers l'anglais, l'identification de la langue et la prédiction d'horodatages — le tout dans un modèle unifié. Contrairement à la plupart des services ASR commerciaux, les poids de Whisper sont entièrement open source sous licence MIT, ce qui a permis l'essor d'un écosystème de ports, d'optimisations et d'applications — dont whisper.cpp, l'implémentation C/C++ qui rend Whisper praticable pour la reconnaissance vocale en temps réel directement sur l'appareil.

Dernière mise à jour : 17 février 2026. Les affirmations quantitatives de cet article sont vérifiées auprès d'au moins deux sources primaires.

Synthèse de vérification (sources doubles)

  • Publication de Whisper, volume d'entraînement et licence : OpenAI a publié Whisper en septembre 2022, entraîné sur 680 000 heures, sous licence MIT. article arXiv · repo OpenAI Whisper
  • Périmètre des tâches et prise en charge linguistique : Whisper prend en charge la transcription, la traduction vers l'anglais, l'identification de la langue et les jetons d'horodatage dans 99 langues. carte de modèle Whisper · README Whisper
  • Contexte des benchmarks anglais : un WER d'environ 3 % est un chiffre de benchmark sur LibriSpeech test-clean pour une évaluation centrée sur l'anglais, pas un taux universel en conditions réelles. carte de modèle large-v2 · détails du benchmark
  • Mises à jour récentes des modèles : large-v3 annonce moins d'erreurs que large-v2 dans de nombreuses langues, tandis que turbo vise une latence plus faible avec moins de calcul côté décodeur. carte de modèle large-v3 · discussion de publication de turbo
  • Pertinence pour OpenWhispr : OpenWhispr utilise Whisper via whisper.cpp pour une dictée locale, conçue d'abord pour le hors ligne, sur les plateformes desktop. whisper.cpp · OpenWhispr

Comment Whisper traite l'audio

Entrée audio
Fonctionnalités Log-Mel
Encodeur
Décodeur
Texte

Pourquoi c'est important pour OpenWhispr:

S'exécute localement via whisper.cpp — l'audio brut reste sur l'appareil.

La taille du modèle contrôle le compromis vitesse/précision.

Le même pipeline alimente la dictée sur macOS, Windows et Linux.

Qu'est-ce que Whisper ?

Whisper a été présenté dans l'article "Robust Speech Recognition via Large-Scale Weak Supervision" d'Alec Radford, Jong Wook Kim, Tao Xu, Greg Brockman, Christine McLeavey et Ilya Sutskever chez OpenAI. Le code et les poids du modèle ont été publiés sur GitHub en septembre 2022 sous licence MIT.

Avant Whisper, les systèmes de reconnaissance vocale à l'état de l'art étaient généralement entraînés sur des jeux de données soigneusement préparés et annotés par des humains — souvent limités à certaines langues, certains accents ou certains domaines. Whisper a rompu avec cette approche en s'entraînant sur un jeu de données massif et diversifié de 680 000 heures d'audio associé à des transcriptions extraites d'internet. L'idée clé était que cette approche "faiblement supervisée" — qui utilise des transcriptions imparfaites, générées par machine ou téléversées par des utilisateurs plutôt que des données annotées manuellement — pouvait produire un modèle remarquablement robuste face aux langues, aux accents, au bruit de fond et au vocabulaire technique.

Le résultat est un modèle unique capable de gérer plusieurs tâches de traitement de la parole : transcription (parole vers texte dans la même langue), traduction (parole dans n'importe quelle langue vers un texte en anglais), identification de la langue et détection d'activité vocale avec horodatages. Cette capacité multitâche est intégrée dans l'architecture du modèle grâce à un système de jetons spéciaux qui indiquent la tâche à effectuer.

La publication open source de Whisper a été importante. Elle a démocratisé l'accès à une ASR de haute qualité, permettant aux développeurs, chercheurs et entreprises d'utiliser un modèle concurrentiel face aux API commerciales — sans tarification à la minute, sans envoyer l'audio dans le cloud et sans verrouillage fournisseur. Cela a catalysé le développement d'outils comme whisper.cpp, Faster Whisper et des dizaines d'applications construites dessus — dont OpenWhispr.

Plongée dans l'architecture

Whisper utilise une architecture Transformer encodeur-décodeur — la même conception fondamentale que le Transformer original (Vaswani et al., 2017) et de nombreux systèmes de traduction automatique. L'encodeur traite l'audio, le décodeur génère le texte. Voici le fonctionnement de chaque étape.

Prétraitement audio

Avant tout traitement par réseau neuronal, l'audio brut est converti en représentation visuelle du son appelée spectrogramme log-mel. Le processus se déroule ainsi :

  1. L'audio est rééchantillonné à 16 000 Hz (16 kHz mono).
  2. Une transformée de Fourier à court terme (STFT) est calculée avec des fenêtres de 25 millisecondes et un pas de 10 millisecondes (hop length).
  3. Le spectre de fréquences est projeté sur 80 banques de filtres en fréquences mel (128 pour large-v3), qui approximent la perception auditive humaine en espaçant les bandes de fréquence de façon logarithmique.
  4. Une mise à l'échelle logarithmique est appliquée, produisant le spectrogramme log-mel final.
  5. Le spectrogramme est divisé en segments de 30 secondes. L'audio plus court que 30 secondes est complété par des zéros ; l'audio plus long est traité en segments successifs.

Le résultat est une représentation 2D de forme (80, 3000) — 80 canaux mel par 3 000 pas temporels (30 secondes avec un pas de 10 ms). C'est analogue à une image, et l'encodeur la traite un peu comme un modèle de vision traite des pixels.

L'encodeur

L'encodeur convertit le spectrogramme mel en une séquence de représentations audio apprises. Il se compose de :

  1. Deux couches de convolution 1D — La première convolution a une taille de noyau de 3 et un padding de 1, suivie d'une activation GELU. La seconde convolution a une taille de noyau de 3, un pas de 2 et un padding de 1, ce qui divise par deux la dimension temporelle. Les 3 000 pas temporels sont ainsi ramenés à 1 500 positions.
  2. Embeddings positionnels sinusoïdaux — Contrairement au décodeur, l'encodeur utilise des embeddings sinusoïdaux fixes (non appris) pour encoder la position de chaque pas temporel.
  3. Blocs Transformer — Une pile de couches d'encodeur Transformer standard, chacune contenant de l'auto-attention multi-têtes et un réseau feed-forward avec activation GELU, reliés par des connexions résiduelles et une normalisation de couche.

La sortie est une séquence de 1 500 vecteurs de caractéristiques audio contextualisées — un pour chaque tranche de 20 millisecondes d'audio d'entrée — que le décodeur consultera pendant la génération du texte.

Le décodeur

Le décodeur génère les jetons de texte de manière autorégressive — un jeton à la fois, chacun conditionné par l'audio encodé et tous les jetons déjà générés. Il se compose de :

  1. Couche d'embedding de jetons — Convertit les ID de jetons en représentations vectorielles denses.
  2. Embeddings positionnels appris — Contrairement aux embeddings sinusoïdaux de l'encodeur, le décodeur utilise des embeddings de position appris, entraînés avec le modèle.
  3. Blocs Transformer avec attention croisée — Chaque couche du décodeur comporte trois sous-couches : auto-attention masquée (pour empêcher le modèle de regarder les futurs jetons), attention croisée vers la sortie de l'encodeur (pour permettre au modèle d'"écouter" l'audio) et réseau feed-forward.

La sortie finale du décodeur est projetée sur le vocabulaire afin de produire des probabilités de jetons. Les stratégies de décodage incluent la recherche gloutonne, le beam search et l'échantillonnage basé sur la température.

Jetons spéciaux et entraînement multitâche

Whisper réalise plusieurs tâches avec un seul modèle grâce à un système astucieux de jetons spéciaux qui servent d'instructions. L'entrée du décodeur suit un format structuré :

<|startoftranscript|> <|en|> <|transcribe|> <|notimestamps|> Hello, how are you today? <|endoftext|>
  • <|startoftranscript|> — Signale le début de la séquence de sortie.
  • <|en|> — Indique la langue (l'un des 99 jetons de langue). Elle peut être détectée automatiquement ou définie manuellement.
  • <|transcribe|> ou <|translate|> — Indique s'il faut transcrire dans la langue d'origine ou traduire vers l'anglais.
  • <|notimestamps|> — Contrôle la production de jetons d'horodatage. Lorsque les horodatages sont activés, le modèle génère des jetons de décalage temporel comme <|0.00|> et <|2.40|> qui alignent le texte sur l'audio.

Ce format de jetons unifié signifie qu'un seul modèle peut effectuer transcription, traduction, détection de langue et transcription horodatée — sans têtes de modèle séparées ni fine-tuning. La tâche est entièrement déterminée par la séquence de jetons fournie au décodeur.

Données d'entraînement

Les modèles Whisper originaux (de tiny à large-v2) ont été entraînés sur 680 000 heures d'audio associé à des transcriptions collectées sur internet. Ce jeu de données n'est pas public. Sa caractéristique clé est d'être faiblement supervisé — les libellés de transcription n'ont pas été vérifiés manuellement par des annotateurs humains. Ils proviennent plutôt de sources comme des sous-titres, des closed captions et d'autres textes générés par les utilisateurs et associés à de l'audio.

Composition des données

Selon la carte de modèle officielle, l'ensemble d'entraînement de 680 000 heures se répartit ainsi :

SegmentHeuresPartDescription
ASR anglais438,00065%Audio en anglais avec transcriptions en anglais
Traduction (X vers anglais)126,00018%Audio non anglais avec transcriptions en anglais
ASR multilingue117,00017%Audio non anglais avec transcriptions dans la langue d'origine (couvrant 98 langues)

Le fort biais en faveur de l'anglais (65 % des données d'entraînement) explique pourquoi Whisper fonctionne nettement mieux en anglais que dans les langues à faibles ressources. Pour le modèle large-v3, publié en novembre 2023, OpenAI a étendu l'ensemble d'entraînement à 1 million d'heures d'audio faiblement étiqueté, auxquelles s'ajoutent 4 millions d'heures d'audio pseudo-étiqueté généré en exécutant Whisper large-v2 sur des données non annotées — une forme d'auto-entraînement ou de distillation de connaissances.

Pourquoi le "faiblement supervisé" compte

La plupart des systèmes ASR précédents étaient entraînés sur des jeux de données comme LibriSpeech (960 heures) ou Common Voice (quelques milliers d'heures par langue) — des jeux soigneusement préparés et vérifiés par des humains. L'approche de Whisper échangeait la qualité des libellés contre une échelle massive : 680 000 heures contre les centaines ou quelques milliers d'heures utilisées par les systèmes conventionnels. L'article a montré que ce compromis en valait la peine. La diversité des données issues d'internet a donné à Whisper une robustesse exceptionnelle en conditions réelles : bruit de fond, paroles qui se chevauchent, accents, vocabulaire propre à un domaine et environnements acoustiques qui mettraient en difficulté des modèles entraînés sur de la parole lue en studio.

La supervision faible introduit toutefois une limite connue : l'hallucination. Comme les transcriptions d'entraînement sont imparfaites, le modèle génère parfois du texte plausible qui n'a pas réellement été prononcé — en particulier pendant les silences ou les passages très calmes. C'est un compromis inhérent à l'approche et un domaine d'amélioration toujours actif.

Tailles de modèles

Whisper est disponible en plusieurs tailles, de 39 millions à 1,55 milliard de paramètres. Les petits modèles sont plus rapides mais moins précis ; les grands modèles sont plus précis mais exigent davantage de calcul et de mémoire. Les variantes .en sont des modèles anglais uniquement, qui ont tendance à mieux fonctionner pour l'anglais, surtout dans les petites tailles. Il n'existe pas de variante anglais uniquement pour les grands modèles.

ModèleParamètresAnglais uniquementVRAMVitesse relative
tiny39 Mtiny.en~1 GB~10x
base74 Mbase.en~1 GB~7x
small244 Msmall.en~2 GB~4x
medium769 Mmedium.en~5 GB~2x
large (v1, v2, v3)1,550 M--~10 GB1x
turbo (large-v3-turbo)809 M--~6 GB~8x

La vitesse est relative au modèle large. Les besoins en VRAM concernent l'inférence GPU en précision fp16 via l'implémentation Python d'origine. whisper.cpp utilise nettement moins de mémoire (par exemple, le modèle large nécessite ~3,9 GB de RAM au lieu de ~10 GB de VRAM).

Le modèle turbo (publié en octobre 2024) est une version distillée de large-v3 avec un décodeur beaucoup plus petit. Il conserve l'essentiel de la précision de large-v3 tout en étant environ 8x plus rapide — ce qui en fait un excellent choix lorsque la vitesse compte. Notez que turbo ne prend pas en charge la tâche de traduction.

Le modèle large a connu trois itérations : large-v1 (septembre 2022), large-v2 (décembre 2022) et large-v3 (novembre 2023). Chaque version a amélioré la précision, large-v3 introduisant 128 bandes de fréquences mel (au lieu de 80) et un entraînement sur un jeu de données beaucoup plus vaste. Pour une analyse détaillée de chaque taille et savoir laquelle choisir, consultez notre guide des tailles de modèles Whisper.

Quelle est la précision de Whisper ?

La précision de Whisper est généralement mesurée avec le Word Error Rate (WER) — le pourcentage de mots mal transcrits (insertions, suppressions et substitutions combinées). Plus le WER est bas, mieux c'est.

Benchmarks en anglais

Sur LibriSpeech test-clean — le benchmark ASR anglais le plus utilisé, composé de parole lue propre provenant de livres audio — Whisper large-v2 atteint un WER d'environ 3,0 %[1][2]. C'est compétitif avec les systèmes ASR commerciaux et les modèles entraînés spécifiquement, même si des modèles spécialisés fine-tunés sur LibriSpeech peuvent atteindre un WER plus faible sur ce benchmark précis. La force de Whisper n'est pas de battre des benchmarks étroits, mais sa robustesse : il reste performant sur un large éventail de conditions réelles.

Améliorations de large-v3

Selon l'évaluation d'OpenAI, Whisper large-v3 affiche une réduction des erreurs de 10 à 20 % par rapport à large-v2 dans les langues où le modèle reste sous 60 % de taux d'erreur sur les jeux d'évaluation Common Voice 15 et Fleurs[2][3]. Les améliorations sont particulièrement notables pour les langues autres que l'anglais, où l'élargissement des données d'entraînement (5 millions d'heures au total) fait la plus grande différence.

Comparaison de Whisper (février 2026)

Depuis la sortie de Whisper, de nouveaux modèles ASR open source l'ont dépassé sur les benchmarks de parole propre. NVIDIA Parakeet TDT (0,6B paramètres) atteint 1,69 % de WER et leur modèle Canary atteint 1,6 % de WER sur LibriSpeech test-clean — tous deux nettement sous les ~2,7 % de Whisper large-v3. Whisper reste toutefois le modèle ASR open source le plus largement déployé grâce à la maturité de son écosystème, sa couverture linguistique et la disponibilité de runtimes optimisés comme whisper.cpp.

Taux d'erreur sur les mots : Whisper par rapport aux concurrents open source

LibriSpeech test-clean (discours lu en anglais) – plus bas est mieux

NVIDIA
Autre open source
OpenAI Whisper

Sources : cartes modèles Hugging Face, cartes modèles NVIDIA, Open ASR Leaderboard (Feb 2026). Lecture vocale en anglais uniquement : la précision réelle varie en fonction de la qualité audio, de l'accent et du domaine. Les API commerciaux sont omis car ils ne publient pas de références LibriSpeech.

Remarque : les API cloud commerciales (Deepgram Nova-3, Google Chirp, AssemblyAI Universal-2) ne publient pas de chiffres WER sur LibriSpeech, elles ne peuvent donc pas être comparées directement dans ce graphique. Leurs benchmarks utilisent des jeux de test propriétaires en conditions réelles. OpenAI a également publié GPT-4o-transcribe en mars 2025 comme modèle disponible uniquement via API (non open source, non basé sur Whisper), avec des taux d'erreur annoncés plus faibles — mais il fonctionne uniquement dans le cloud et n'est pas disponible pour l'inférence locale.

Là où Whisper excelle

  • +Robustesse aux accents et dialectes — Entraîné sur de l'audio internet diversifié, Whisper gère mieux les accents régionaux que les systèmes entraînés sur de la parole lue.
  • +Tolérance au bruit de fond — Le modèle conserve une précision raisonnable même en présence de musique, d'autres locuteurs ou de bruit ambiant.
  • +Vocabulaire technique — Grâce à l'ampleur de ses données d'entraînement, Whisper gère les termes propres à certains domaines (médical, juridique, technique) mieux que de nombreux systèmes ASR généralistes.
  • +Capacité multilingue — Un seul modèle prend en charge 99 langues, sans fine-tuning requis par langue.

Là où Whisper rencontre des limites

  • -Hallucination — Le problème le plus souvent cité. Pendant les silences ou les passages très calmes, Whisper peut générer du texte qui n'a jamais été prononcé. C'est une conséquence de l'approche d'entraînement faiblement supervisée.
  • -Langues à faibles ressources — Les langues avec peu de données d'entraînement (une grande partie des 680 000 heures est en anglais) ont des taux d'erreur nettement plus élevés.
  • -Génération de texte répétitif — Le décodeur autorégressif peut rester "bloqué" dans des boucles et produire la même phrase à répétition. Le beam search avec des paramètres spécifiques peut atténuer ce problème, mais pas l'éliminer.
  • -Pas temps réel par défaut — Whisper traite des segments de 30 secondes, ce qui introduit une latence intrinsèque. Les solutions de streaming (comme le mode temps réel de whisper.cpp) contournent cela, mais ajoutent de la complexité.

whisper.cpp et l'inférence locale

L'implémentation Whisper d'origine exige Python, PyTorch et un GPU compatible CUDA pour offrir des performances raisonnables. Cela la rend peu pratique pour les applications desktop, les appareils mobiles et les déploiements en périphérie. whisper.cpp, créé par Georgi Gerganov, résout ce problème.

whisper.cpp est une réimplémentation complète de l'inférence Whisper en C/C++ pur, sans dépendances. Il lit les mêmes poids de modèle, mais fonctionne sans Python, sans PyTorch et sans GPU (même s'il en bénéficie énormément). Ses principales fonctionnalités incluent :

  • Aucune allocation mémoire à l'exécution — Toute la mémoire est préallouée, ce qui rend les performances prévisibles et adaptées aux systèmes embarqués.
  • Optimisation Apple Silicon — Sur les Mac dotés de puces M-series, l'encodeur peut s'exécuter sur l'Apple Neural Engine via Core ML, offrant une inférence plus de 3x plus rapide que l'exécution CPU seule. L'accélération GPU Metal est également prise en charge pour une inférence entièrement sur GPU.
  • Prise en charge de la quantification — Les modèles peuvent être quantifiés en précision entière 4 bits, 5 bits ou 8 bits, ce qui réduit fortement l'utilisation mémoire et augmente la vitesse avec une perte de précision minimale.
  • Accélération GPU — Prend en charge NVIDIA CUDA (via cuBLAS), Vulkan (multi-fournisseurs), OpenVINO (Intel) et OpenBLAS pour l'accélération CPU.
  • Détection d'activité vocale (VAD) — VAD intégrée pour ignorer les segments silencieux, améliorant à la fois la vitesse et la qualité des transcriptions.

Besoins mémoire (whisper.cpp)

ModèleTaille disqueRAM requise
tiny75 MB~273 MB
base142 MB~388 MB
small466 MB~852 MB
medium1.5 GB~2.1 GB
large2.9 GB~3.9 GB

whisper.cpp fonctionne sur macOS (Intel et Apple Silicon), Linux, Windows, iOS, Android, FreeBSD, Raspberry Pi et même dans le navigateur via WebAssembly. Il atteint une transcription plus rapide que le temps réel sur du matériel grand public modeste — y compris des appareils aussi compacts que le Raspberry Pi 4 et l'iPhone 13.

Cette portabilité rend la reconnaissance vocale locale et privée réellement pratique. Des applications comme OpenWhispr utilisent whisper.cpp en interne pour proposer une dictée push-to-talk en temps réel qui s'exécute entièrement sur l'appareil de l'utilisateur — aucun audio ne quitte jamais la machine.

Whisper face aux autres systèmes ASR

Whisper s'inscrit dans un paysage plus large de systèmes de reconnaissance vocale. Voici sa comparaison avec les alternatives les plus courantes.

Google Cloud Speech-to-Text

Le service ASR cloud de Google. Excellente précision, surtout en anglais, avec prise en charge du streaming en temps réel et de la diarisation des locuteurs. Les principales différences : il est propriétaire, nécessite d'envoyer l'audio aux serveurs de Google et se facture à la minute d'audio traitée. Whisper offre une précision comparable pour un usage général, fonctionne localement et est gratuit — mais ne propose pas de streaming ni de diarisation intégrés.

Cloud uniquementPropriétairePaiement à l'usage

Amazon Transcribe (AWS)

L'ASR cloud d'Amazon, étroitement intégré à l'écosystème AWS. Il propose la transcription médicale, l'analyse d'appels et le vocabulaire personnalisé. Les compromis sont similaires à ceux de Google : dépendance au cloud, tarification à la minute et technologie propriétaire. Whisper convient mieux aux applications qui exigent un fonctionnement hors ligne, une licence open source ou l'absence de verrouillage fournisseur.

Cloud uniquementPropriétaireIntégration AWS

Mozilla DeepSpeech

Le moteur ASR open source de Mozilla, basé sur les travaux Deep Speech de Baidu. C'était l'un des premiers modèles ASR ouverts de haute qualité, mais Mozilla a arrêté le développement actif en 2021. Whisper a effectivement dépassé DeepSpeech en précision, en prise en charge multilingue et en dynamique communautaire. DeepSpeech reste utile comme base légère et bien comprise, mais n'est plus recommandé pour les nouveaux projets.

Open sourceArrêtéCentré sur l'anglais

Vosk

Une boîte à outils open source de reconnaissance vocale hors ligne qui prend en charge plus de 20 langues avec des modèles petits et rapides. Vosk est excellent pour les environnements contraints en ressources — ses modèles sont beaucoup plus petits que ceux de Whisper et tournent bien sur du matériel peu puissant. Le compromis est la précision : Vosk est nettement moins précis que Whisper, en particulier sur la parole accentuée, l'audio bruité et le vocabulaire technique.

Open sourceLégerPrécision plus faible

Faster Whisper (CTranslate2)

Une réimplémentation de Whisper utilisant le moteur d'inférence CTranslate2 de SYSTRAN. Elle exécute les mêmes modèles Whisper avec la même précision, mais jusqu'à 4x plus vite que l'implémentation OpenAI d'origine et avec moins de mémoire. Faster Whisper est basé sur Python (contrairement au C/C++ de whisper.cpp) et constitue un bon choix pour la transcription batch côté serveur. Il prend en charge les GPU CUDA et l'inférence CPU avec quantification INT8.

Open sourcePython / CTranslate2Même précision que Whisper

Applications pratiques

La combinaison de précision, de prise en charge multilingue et de disponibilité open source de Whisper en a fait la colonne vertébrale d'un large éventail d'applications :

Dictée sur ordinateur

Des apps comme OpenWhispr utilisent whisper.cpp pour proposer une dictée push-to-talk à l'échelle du système sur macOS, Windows et Linux. L'audio est traité localement — rien n'est envoyé dans le cloud.

Génération de sous-titres

La prédiction d'horodatages de Whisper le rend bien adapté à la génération de sous-titres et de closed captions. Des outils comme stable-ts et auto-subtitle automatisent ce flux de travail.

Transcription de podcasts et de réunions

Whisper gère bien la transcription d'audio long, surtout avec une approche de traitement par segments. De nombreux éditeurs de podcasts et outils de notes de réunion utilisent Whisper (ou Faster Whisper) pour la transcription batch d'enregistrements.

Traduction et localisation

La capacité de traduction intégrée de Whisper (n'importe quelle langue vers l'anglais) est utilisée pour l'accès multilingue aux contenus, la localisation de médias et les prototypes de traduction en temps réel.

Accessibilité

Le sous-titrage en temps réel pour les personnes sourdes et malentendantes, les interfaces vocales pour les personnes ayant un handicap moteur et la transcription d'audiodescriptions sont autant de domaines actifs où Whisper est déployé.

Annotation de données et recherche

Les chercheurs utilisent Whisper pour créer des jeux de données pseudo-étiquetés afin d'entraîner d'autres modèles — la même approche qu'OpenAI a utilisée pour créer les données d'entraînement de large-v3. Il est aussi largement utilisé en recherche linguistique et pour la création de corpus.

Sources et lectures complémentaires

  1. [Article] Radford, A., Kim, J. W., Xu, T., Brockman, G., McLeavey, C., & Sutskever, I. (2022). Robust Speech Recognition via Large-Scale Weak Supervision. arXiv:2212.04356. arxiv.org/abs/2212.04356
  2. [Code] Dépôt GitHub OpenAI Whisper. github.com/openai/whisper
  3. [Code] whisper.cpp — port C/C++ par Georgi Gerganov. github.com/ggml-org/whisper.cpp
  4. [Carte de modèle] Whisper large-v2 sur Hugging Face (benchmark WER : ~3,0 % sur LibriSpeech test-clean). huggingface.co/openai/whisper-large-v2
  5. [Carte de modèle] Whisper large-v3 sur Hugging Face (réduction des erreurs de 10 à 20 % par rapport à v2). huggingface.co/openai/whisper-large-v3
  6. [Carte de modèle] Whisper large-v3-turbo sur Hugging Face (variante distillée axée sur la latence). huggingface.co/openai/whisper-large-v3-turbo
  7. [Carte de modèle] Carte de modèle OpenAI Whisper (répartition de la composition des données d'entraînement). github.com/openai/whisper/blob/main/model-card.md
  8. [Notes de version] Annonce d'OpenAI large-v3 et notes d'évaluation. github.com/openai/whisper/discussions/1762
  9. [Notes de version] Discussion de publication d'OpenAI turbo et compromis axés sur la vitesse. github.com/openai/whisper/discussions/2363
  10. [Code] Faster Whisper — réimplémentation basée sur CTranslate2 par SYSTRAN. github.com/SYSTRAN/faster-whisper
  11. [Produit] OpenWhispr utilise Whisper via whisper.cpp pour des flux de dictée locale. openwhispr.com

Essayez Whisper localement avec OpenWhispr

OpenWhispr utilise Whisper (via whisper.cpp) pour une dictée locale et privée sur macOS, Windows et Linux. Push-to-talk, plus de 99 langues, aucun cloud requis. Essayez-le gratuitement.

Aucun compte requis · Fonctionne hors ligne · Open source pour toujours