Comparaison

Transcription locale ou cloud : confidentialité, vitesse et précision comparées

Vos données vocales ont de la valeur. Voici ce qu'il advient d'elles selon l'endroit où vous les traitez.

OpenWhispr

OpenWhispr

Ingénierie

8 février 2026
Table des matières

La transcription locale traite votre audio entièrement sur votre appareil à l'aide de modèles comme OpenAI Whisper et NVIDIA Parakeet, exécutés via des moteurs optimisés tels que whisper.cpp. Aucun audio ne quitte jamais votre machine. La transcription cloud envoie votre audio vers des serveurs distants exploités par des fournisseurs comme Google, AWS, Microsoft, Deepgram ou AssemblyAI, où de grands clusters GPU le traitent et renvoient une transcription textuelle. Les principaux compromis entre les deux approches reposent sur cinq facteurs : la confidentialité, la latence, la précision, le coût et la capacité hors ligne. Cet article examine chacun d'eux avec des chiffres concrets et des politiques réelles, afin que vous puissiez prendre une décision éclairée.

Dernière mise à jour : 17 février 2026. Les affirmations chiffrées et les éléments de politique sont recoupés avec au moins deux sources primaires.

Vérification des faits en bref (double source)

Local vs Cloud : compromis clés

Local (OpenWhispr)
  • Confidentialité: L'audio reste sur l'appareil
  • Latence: Pas d'aller-retour réseau
  • Coût: Pas de facturation API à la minute
  • Hors ligne: Fonctionne sans internet
  • Contrôle: Comportement local déterministe
API cloud
  • Confidentialité: Dépend de la stratégie et de la configuration
  • Latence: Sensible au réseau et à la région
  • Coût: Facturation basée sur l'utilisation
  • Hors ligne: Indisponible
  • Échelle: Facile pour les charges de travail par lots importantes

Meilleur modèle pratique : priorité locale, acheminement des cas extrêmes vers le cloud uniquement en cas de besoin.

Comment fonctionne la transcription cloud

Lorsque vous utilisez un service de reconnaissance vocale dans le cloud, votre audio suit un parcours en plusieurs étapes. D'abord, votre appareil capture l'audio brut de votre microphone et le compresse dans un format adapté à la transmission — généralement Opus, FLAC ou PCM linéaire. Cet audio compressé est ensuite envoyé sur Internet vers le point de terminaison de l'API du fournisseur, le plus souvent via HTTPS ou une connexion WebSocket pour le streaming en temps réel.

Côté serveur, le fournisseur fait passer votre audio dans de grands modèles de réseaux de neurones hébergés sur des clusters GPU. Ces modèles sont généralement entraînés sur des centaines de milliers d'heures de données vocales annotées, bien plus que ce qu'un particulier pourrait réunir. La transcription obtenue est renvoyée à votre appareil.

Les principaux fournisseurs de transcription cloud comprennent :

  • Google Cloud Speech-to-Text — Couverture linguistique étendue, avec des options de traitement par lots et de streaming en temps réel.
  • AWS Transcribe — L'offre d'Amazon, avec identification automatique de la langue, prise en charge de vocabulaire personnalisé et masquage des données personnelles (PII).
  • Microsoft Azure Speech — Intégration poussée à l'écosystème Microsoft, modèles vocaux personnalisés et transcription en temps réel.
  • Deepgram — Réputé pour sa vitesse et son expérience développeur, avec son modèle Nova-3 offrant une grande précision à un tarif compétitif.
  • AssemblyAI — Axé sur la précision et l'outillage pour développeurs, avec diarisation des locuteurs et modération de contenu intégrées.

La latence du cloud est variable, car elle inclut la capture, l'envoi, l'inférence côté serveur et la livraison de la réponse. Dans un environnement bien connecté, cela peut sembler rapide, tandis que des réseaux instables ou des régions à forte latence peuvent rendre l'expérience sensiblement plus lente. La transcription par lots peut prendre de quelques secondes à plusieurs minutes selon la longueur du fichier et la file d'attente.

Comment fonctionne la transcription locale

La transcription locale exécute le modèle de reconnaissance vocale directement sur votre appareil. Aucun réseau n'intervient — l'audio passe de votre microphone directement à un modèle tournant sur votre processeur (CPU) ou votre carte graphique (GPU), et le texte ressort de l'autre côté. L'ensemble du processus se déroule en mémoire, sur votre machine.

L'avancée qui a rendu la transcription locale de haute qualité possible fut la publication par OpenAI de Whisper en septembre 2022 — un modèle open source entraîné sur 680 000 heures d'audio multilingue. Plus récemment, NVIDIA a publié sa famille de modèles ASR Parakeet, qui atteignent une précision de pointe sur les références anglophones et sont disponibles sous licences ouvertes. Peu après, Georgi Gerganov a créé whisper.cpp, une réimplémentation en C/C++ optimisée pour l'inférence sur CPU, qui a porté la précision de Whisper sur du matériel grand public sans nécessiter de GPU dédié.

Whisper se décline en plusieurs tailles de modèle, chacune arbitrant entre précision et vitesse :

ModèleParamètresVRAMVitesse relative
Tiny39 M~1 Go~10x
Base74 M~1 Go~7x
Small244 M~2 Go~4x
Medium769 M~5 Go~2x
Large-v31550 M~10 Go1x (référence)
Turbo809 M~6 Go~8x

Sur Apple Silicon (du M1 au M4), whisper.cpp réalise l'inférence entièrement sur le GPU via Metal, atteignant des vitesses égales ou supérieures au temps réel, même avec le modèle medium. Le modèle Turbo — une variante optimisée de large-v3 avec une perte de précision minime — fonctionne à haut débit sur les MacBooks récents, ce qui explique pourquoi il est couramment utilisé pour les workflows de dictée locale à faible latence.

Parmi les autres moteurs de transcription locale figurent Vosk (léger, précision moindre) et Sherpa-ONNX (Kaldi nouvelle génération avec prise en charge du moteur ONNX). Cependant, OpenAI Whisper via whisper.cpp et NVIDIA Parakeet restent la référence absolue en matière de qualité de transcription locale.

Confidentialité : le compromis fondamental

La confidentialité est le plus grand facteur de différenciation entre transcription locale et cloud. Avec le traitement local, la question « qu'advient-il de mes données audio ? » a une réponse simple : rien. Elles restent sur votre appareil, dans votre mémoire vive, et sont supprimées après la transcription. Aucun tiers à qui faire confiance, aucune politique à lire, aucune fuite de données à craindre.

La transcription cloud exige de faire confiance à votre fournisseur. Voici ce que les principaux fournisseurs déclarent réellement quant au traitement de votre audio :

Google Cloud Speech-to-Text

La journalisation des données de Google pour Speech-to-Text est désactivée par défaut. Lorsqu'elle est désactivée, Google indique que les données audio sont traitées en mémoire, utilisées uniquement pour renvoyer la transcription, et non stockées sur ses serveurs. Cependant, si vous activez la journalisation des données (ou utilisez certaines fonctionnalités qui l'exigent), votre audio et vos transcriptions peuvent être stockés et utilisés pour améliorer les modèles de Google. La documentation sur la journalisation des données de Google détaille ces distinctions.

Le lieu de traitement des données peut être spécifié par région, ce qui est important pour la conformité au RGPD.

AWS Transcribe

Par défaut, AWS peut utiliser le contenu traité par Amazon Transcribe pour développer et améliorer ses services d'IA/ML. Vous pouvez toutefois vous y opposer en recourant aux politiques de désinscription des services d'IA d'AWS. Une fois désinscrit, AWS indique que votre contenu n'est ni stocké ni utilisé pour l'amélioration des services. Les données audio sont chiffrées en transit et au repos.

Important : la désinscription n'est pas activée par défaut. Vous devez la configurer activement.

Microsoft Azure Speech

Par défaut, Azure n'utilise pas les données des clients pour améliorer ses modèles de base. Sa documentation sur la confidentialité des données indique que l'audio envoyé au service Speech est traité puis immédiatement supprimé de ses serveurs. Si vous créez un modèle personnalisé, les données d'entraînement que vous fournissez sont stockées dans la même région que la ressource jusqu'à ce que vous les supprimiez explicitement.

Azure propose un déploiement en conteneur déconnecté pour un traitement entièrement sur site.

Considérations réglementaires

RGPD : Les enregistrements vocaux sont considérés comme des données biométriques selon le droit de l'UE. Envoyer de l'audio à des fournisseurs cloud basés aux États-Unis soulève des questions de transfert de données au regard du RGPD, même avec des clauses contractuelles types (CCT) ou le cadre de protection des données UE–États-Unis. Le traitement local évite entièrement ce problème en conservant les données biométriques sur l'appareil de la personne concernée.

HIPAA : Les professionnels de santé qui recourent à la transcription cloud doivent s'assurer que leur fournisseur propose un accord de partenariat commercial (BAA). Google, AWS et Azure proposent tous des BAA, mais les exigences de configuration sont strictes. La transcription locale contourne les règles de traitement des données HIPAA, car les informations de santé protégées ne quittent jamais le contrôle de l'entité couverte.

L'avantage du local

Avec la transcription locale, aucune politique de confidentialité à décortiquer, aucun calendrier de conservation des données à croire sur parole, aucune case de désinscription à dénicher. Votre audio est traité en mémoire vive et n'est jamais écrit sur le disque (sauf si vous choisissez d'enregistrer un fichier). C'est un modèle de confiance fondamentalement différent — vous n'avez à faire confiance à personne, puisque les données ne quittent jamais votre machine.

Précision : à quel point le local s'en approche-t-il ?

Soyons honnêtes : les meilleurs fournisseurs cloud conservent un avantage en précision brute pour certains cas d'usage. Ils s'entraînent sur de vastes jeux de données propriétaires, proposent des mises à jour de modèles en temps réel et peuvent exploiter des vocabulaires personnalisés adaptés au contexte. Pour de l'audio difficile — accents marqués, environnements bruyants, jargon spécialisé — des services cloud comme Chirp 2 de Google ou Nova-3 de Deepgram ont tendance à bien s'en sortir.

Cela dit, l'écart s'est considérablement réduit. OpenAI Whisper large-v3, entraîné sur 680 000 heures d'audio multilingue, atteint des taux d'erreur sur les mots (WER) compétitifs dans la plupart des langues courantes. Les modèles Parakeet de NVIDIA ont repoussé la limite plus loin encore, atteignant certains des WER les plus bas sur les références anglophones standard. Les évaluations indépendantes montrent systématiquement que ces modèles ouverts se situent à quelques points de pourcentage des services cloud commerciaux pour l'anglais, et les surpassent parfois pour certaines langues de la longue traîne.

Le modèle Turbo — une variante distillée de large-v3 avec 809 M de paramètres au lieu de 1,55 milliard — conserve l'essentiel de la précision tout en s'exécutant environ 8 fois plus vite. Pour la dictée en temps réel, lorsque vous parlez clairement dans un microphone correct, la différence entre Turbo et une API cloud est négligeable pour la plupart des utilisateurs.

Avantages du cloud en précision

  • Vocabulaire personnalisé et adaptation au domaine
  • Améliorations continues des modèles côté serveur
  • Meilleure diarisation des locuteurs (qui a dit quoi)
  • Ponctuation et mise en forme automatiques optimisées par langue

Avantages du local en précision

  • Aucun artefact de compression audio lié à la transmission réseau
  • Performances constantes et déterministes — aucune variabilité serveur
  • Audio 16 kHz complet et non compressé fourni directement au modèle
  • Whisper large-v3 et Parakeet égalent le cloud pour la dictée à voix claire

En résumé : si vous dictez dans un environnement calme avec un microphone correct, des modèles comme Whisper Turbo, Whisper large-v3 ou Parakeet exécutés en local vous donneront des résultats impossibles à distinguer de ceux des services cloud dans la plupart des cas pratiques. Le cloud prend l'avantage pour les scénarios bruyants à plusieurs locuteurs, les langues de niche et les vocabulaires spécialisés.

Vitesse et latence

La latence compte avant tout pour la dictée en temps réel, où vous voulez voir vos mots apparaître immédiatement après les avoir prononcés. Sur ce point, les transcriptions locale et cloud présentent des profils de latence fondamentalement différents.

Détail de la latence cloud

  • Capture audio + encodage
  • Envoi et réception réseau (variable selon la qualité de la route)
  • Mise en file d'attente côté serveur + inférence (variable selon la charge du fournisseur)
  • La latence perçue par l'utilisateur peut varier sensiblement selon le réseau et la région.

Latence locale (Apple Silicon)

  • Tiny/base : réponse la plus rapide, plafond de qualité plus bas
  • Small : équilibre entre vitesse et qualité
  • Turbo : candidat idéal pour la dictée en temps réel de haute qualité
  • Modèles Large : qualité maximale, plus gourmand en calcul
  • Aucune dépendance au réseau. Constant, quelle que soit la connexion.

Pour le streaming en temps réel, les fournisseurs cloud peuvent renvoyer rapidement des hypothèses partielles lorsque la connexion est bonne. Mais cela suppose tout de même une connexion stable et à faible latence. Dans un avion, sur un Wi-Fi public saturé ou derrière des routes VPN restrictives, la latence perçue peut se dégrader rapidement.

La transcription locale avec whisper.cpp n'est pas du streaming en temps réel au sens classique. La plupart des implémentations locales utilisent un schéma « appuyer pour parler » (push-to-talk) : vous parlez, l'audio est mis en mémoire tampon, puis le modèle traite le segment complet. Avec le modèle Turbo sur une puce Apple série M, cette étape de traitement est suffisamment rapide pour que le délai semble négligeable en dictée — généralement moins d'une seconde pour de courts énoncés.

Pour la transcription longue de fichiers préenregistrés, les services cloud peuvent paralléliser le traitement sur des clusters GPU et terminent souvent rapidement les grands lots. Le débit local est limité par votre machine et le choix du modèle, de sorte que le temps de traitement peut être plus lent pour des enregistrements très longs.

Coût : gratuit ou facturé à la minute

La transcription locale ne coûte rien au-delà du matériel que vous possédez déjà. Pas de clé d'API, pas de tableau de bord de facturation, pas de coût à la minute. Vous téléchargez un fichier de modèle (de 75 Mo pour Tiny à 3 Go pour Large-v3), et c'est terminé. Pour toujours.

Les fournisseurs cloud facturent l'usage (à la minute ou à l'heure, selon le fournisseur et le modèle). Les forfaits et les remises évoluent fréquemment, alors vérifiez les tarifs en vigueur avant d'établir votre budget :

FournisseurPar lots / PréenregistréStreaming / Temps réelOffre gratuite
Google Speech-to-TextFacturé à l'usage (par paliers de modèle)Facturé à l'usage (par paliers de modèle)Quotas d'essai/gratuits variables selon le compte
AWS TranscribeFacturé à l'usageFacturé à l'usageOffre gratuite d'initiation (durée limitée)
Azure SpeechVariable selon la région/le modèleVariable selon la région/le modèleQuota gratuit limité
DeepgramFacturé à l'usage par palier de modèleFacturé à l'usage par palier de modèleEssai avec crédits
AssemblyAIFacturé à l'usage par palier de modèleFacturé à l'usage par palier de modèleEssai avec crédits
Local (Whisper / Parakeet)GratuitGratuitIllimité, pour toujours

Comment estimer votre dépense cloud

Utilisez cette formule simple : minutes d'audio par an x tarif du fournisseur. Si votre équipe dicte beaucoup, le coût total augmente de façon linéaire avec l'usage et le nombre de licences.

L'inférence locale (Whisper/Parakeet) évite les frais d'API récurrents, raison pour laquelle de nombreuses équipes conservent le local par défaut et ne basculent que les cas particuliers vers le cloud.

Remarque : la tarification cloud inclut souvent des frais supplémentaires pour des fonctionnalités comme la diarisation des locuteurs, le masquage des données personnelles (PII) ou les vocabulaires personnalisés. Les prix de base ci-dessus ne concernent que la transcription standard.

Capacité hors ligne : là où le local l'emporte sans appel

Ce point est binaire : la transcription cloud exige Internet, la transcription locale non. Pour beaucoup de gens, c'est le critère décisif.

Scénarios où la capacité hors ligne n'est pas optionnelle :

Voyages et travail à distance

Vols, trains, zones rurales, régions en développement — partout où le Wi-Fi est intermittent ou inexistant. La transcription locale fonctionne exactement de la même façon à 10 000 mètres d'altitude qu'à votre bureau.

Environnements isolés (air-gapped)

Les administrations, les sous-traitants de la défense, les laboratoires de recherche sécurisés et les institutions financières opèrent souvent sur des réseaux isolés où tout accès Internet sortant est totalement bloqué. La transcription locale est alors la seule option.

Travail de terrain

Journalistes en zone de conflit, chercheurs dans des stations de terrain reculées, soignants dans des cliniques rurales — ces professionnels ont besoin d'une transcription fiable dans des environnements où la couverture mobile peut être instable ou indisponible.

Fiabilité

Même dans des bureaux bien connectés, les services cloud subissent des pannes. AWS, Google Cloud et Azure ont tous connu des incidents de plusieurs heures ayant affecté les API vocales. La transcription locale n'a aucune dépendance externe susceptible de tomber en panne.

Comparaison côte à côte

FacteurLocalCloud
Confidentialité
Précision (anglais)
Précision (multilingue)
Latence
Coût
Utilisation hors ligne
Facilité de configuration
Diarisation des locuteurs
Évolutivité

Quand choisir quoi

Aucune approche n'est universellement meilleure. Le bon choix dépend de vos priorités.

Choisissez le local si...

  • La confidentialité est non négociable (médical, juridique, journaux personnels)
  • Vous avez besoin d'un fonctionnement hors ligne ou en environnement isolé (air-gapped)
  • Vous voulez zéro coût récurrent pour la transcription
  • Votre cas d'usage principal est la dictée (locuteur unique, audio clair)
  • Vous êtes soumis au RGPD, à la loi HIPAA ou à des réglementations similaires

Choisissez le cloud si...

  • Vous avez besoin de la diarisation des locuteurs pour des réunions à plusieurs participants
  • Vous recherchez une précision maximale dans des conditions audio difficiles
  • Vous développez une application qui doit passer à l'échelle pour de nombreux utilisateurs
  • Vous avez besoin de transcription en streaming en temps réel
  • Votre matériel est limité et ne peut pas exécuter de grands modèles

L'approche hybride

Vous n'êtes pas obligé d'en choisir une seule. Certaines applications — dont OpenWhispr — prennent en charge les deux modes : utiliser par défaut des modèles locaux comme Whisper et Parakeet pour la confidentialité et la gratuité, et apporter en option votre propre clé d'API cloud (OpenAI, Deepgram, etc.) lorsque vous avez besoin du surcroît de précision ou de fonctionnalités qu'offre le cloud. Ce modèle « BYOK » (apportez votre propre clé) vous donne le meilleur des deux mondes sans vous enfermer dans l'une ou l'autre approche.

Sources et lectures complémentaires

Essayez les deux approches dans une seule application

OpenWhispr prend en charge à la fois les modèles locaux (OpenAI Whisper et NVIDIA Parakeet) pour la confidentialité et la gratuité, et vos propres clés d'API cloud lorsque vous avez besoin d'une précision maximale. Open source, gratuit pour toujours.

Aucun compte requis · Fonctionne hors ligne · Open source pour toujours