So funktioniert Whisper AI: Ein vollständiger Leitfaden
Ein technischer Deep Dive in OpenAIs Open-Source-Modell für Spracherkennung — von Mel-Spektrogrammen bis zur Transformer-Decodierung.
OpenWhispr
Ingenieurwesen
Inhaltsverzeichnis
Whisper ist ein Modell für automatische Spracherkennung (ASR), das von OpenAI entwickelt wurde. Es wurde im September 2022 veröffentlicht und ist ein universelles Spracherkennungssystem, das auf 680.000 Stunden mehrsprachiger Audiodaten aus dem Internet trainiert wurde. Whisper nutzt eine Encoder-Decoder-Transformer-Architektur, die Audio in Log-Mel-Spektrogramme umwandelt, diese durch einen neuronalen Encoder verarbeitet und Text-Tokens autoregressiv decodiert. Es unterstützt Transkription in 99 Sprachen, Übersetzung ins Englische, Spracherkennung und Zeitstempelvorhersage — alles in einem einheitlichen Modell. Anders als bei den meisten kommerziellen ASR-Diensten sind die Gewichte von Whisper unter der MIT-Lizenz vollständig Open Source. Dadurch ist ein lebendiges Ökosystem aus Portierungen, Optimierungen und Anwendungen entstanden — darunter whisper.cpp, die C/C++-Implementierung, die Whisper für Echtzeit-Spracherkennung direkt auf dem Gerät praktikabel macht.
Zuletzt aktualisiert: 17. Februar 2026. Quantitative Aussagen in diesem Artikel werden mit mindestens zwei Primärquellen abgeglichen.
Faktencheck im Überblick (doppelte Quellen)
- Whisper-Veröffentlichung, Trainingsumfang und Lizenz: OpenAI veröffentlichte Whisper im September 2022, trainiert auf 680.000 Stunden, unter MIT-Lizenz. arXiv-Paper · OpenAI-Whisper-Repository
- Aufgabenumfang und Sprachunterstützung: Whisper unterstützt Transkription, Übersetzung ins Englische, Spracherkennung und Zeitstempel-Tokens für 99 Sprachen. Whisper-Modellkarte · Whisper-README
- Kontext des englischen Benchmarks: rund 3 % WER ist ein Benchmarkwert auf LibriSpeech test-clean für englisch fokussierte Evaluationen, keine universelle Rate für reale Nutzung. large-v2-Modellkarte · Benchmark-Details
- Aktuelle Modellupdates: large-v3 meldet in vielen Sprachen geringere Fehler als large-v2, während turbo auf niedrigere Latenz durch weniger Decoder-Rechenaufwand ausgerichtet ist. large-v3-Modellkarte · turbo-Release-Diskussion
- OpenWhispr-Relevanz: OpenWhispr nutzt Whisper über whisper.cpp für lokale, offline-orientierte Diktierfunktionen auf Desktop-Plattformen. whisper.cpp · OpenWhispr
Wie Whisper Audio verarbeitet
Warum es für OpenWhispr: wichtig ist
Läuft lokal über whisper.cpp – Rohaudio bleibt auf dem Gerät.
Die Modellgröße steuert den Kompromiss zwischen Geschwindigkeit und Genauigkeit.
Dieselbe Pipeline ermöglicht das Diktat über macOS, Windows und Linux.
Was ist Whisper?
Whisper wurde im Paper "Robust Speech Recognition via Large-Scale Weak Supervision" von Alec Radford, Jong Wook Kim, Tao Xu, Greg Brockman, Christine McLeavey und Ilya Sutskever bei OpenAI vorgestellt. Der Code und die Modellgewichte wurden im September 2022 unter der MIT-Lizenz auf GitHub veröffentlicht.
Vor Whisper wurden moderne Spracherkennungssysteme typischerweise auf kuratierten, von Menschen annotierten Datensätzen trainiert — oft beschränkt auf bestimmte Sprachen, Akzente oder Domänen. Whisper wich von diesem Ansatz ab und wurde auf einem riesigen, vielfältigen Datensatz von 680.000 Stunden Audio mit aus dem Internet extrahierten Transkripten trainiert. Die zentrale Erkenntnis war, dass dieser "weakly supervised" Ansatz — also die Nutzung unvollkommener, maschinell erzeugter oder von Nutzern hochgeladener Transkripte statt handbeschrifteter Daten — ein Modell hervorbringen kann, das gegenüber Sprachen, Akzenten, Hintergrundgeräuschen und Fachvokabular bemerkenswert robust ist.
Das Ergebnis ist ein einzelnes Modell, das mehrere Sprachverarbeitungsaufgaben bewältigen kann: Transkription (Sprache zu Text in derselben Sprache), Übersetzung (Sprache in beliebiger Sprache zu englischem Text), Spracherkennung und Sprecheraktivitätserkennung mit Zeitstempeln. Diese Multitask-Fähigkeit ist über ein System spezieller Tokens direkt in die Modellarchitektur eingebettet; sie legen fest, welche Aufgabe ausgeführt werden soll.
Die Open-Source-Veröffentlichung von Whisper war bedeutsam. Sie demokratisierte den Zugang zu hochwertiger ASR und ermöglichte Entwicklern, Forschern und Unternehmen den Einsatz eines Modells, das mit kommerziellen APIs konkurrieren kann — ohne minutengenaue Preise, ohne Audio in die Cloud zu senden und ohne Anbieterbindung. Das befeuerte die Entwicklung von Werkzeugen wie whisper.cpp, Faster Whisper und Dutzenden darauf aufbauenden Anwendungen — einschließlich OpenWhispr.
Architektur im Detail
Whisper nutzt eine Encoder-Decoder-Transformer-Architektur — dasselbe Grunddesign, das auch hinter Modellen wie dem ursprünglichen Transformer (Vaswani et al., 2017) und vielen maschinellen Übersetzungssystemen steht. Der Encoder verarbeitet Audio, der Decoder erzeugt Text. So funktioniert jede Stufe.
Audio-Vorverarbeitung
Bevor ein neuronales Netz arbeitet, wird Roh-Audio in eine visuelle Darstellung von Klang umgewandelt, ein sogenanntes Log-Mel-Spektrogramm. Der Prozess läuft so ab:
- Audio wird auf 16.000 Hz (16 kHz mono) resampelt.
- Eine Short-Time Fourier Transform (STFT) wird mit 25-Millisekunden-Fenstern und einem 10-Millisekunden-Schritt (Hop Length) berechnet.
- Das Frequenzspektrum wird auf 80 Mel-Frequenz-Filterbänke projiziert (128 bei large-v3), die die menschliche Hörwahrnehmung annähern, indem Frequenzbänder logarithmisch verteilt werden.
- Eine logarithmische Skalierung wird angewendet und erzeugt das finale Log-Mel-Spektrogramm.
- Das Spektrogramm wird in 30-Sekunden-Blöcke geteilt. Kürzeres Audio wird mit Nullen aufgefüllt; längeres Audio wird in aufeinanderfolgenden Blöcken verarbeitet.
Das Ergebnis ist eine 2D-Darstellung mit der Form (80, 3000) — 80 Mel-Kanäle mal 3.000 Zeitschritte (30 Sekunden bei 10 ms Schrittweite). Sie ist einem Bild vergleichbar, und der Encoder verarbeitet sie ähnlich wie ein Vision-Modell Pixeldaten verarbeitet.
Der Encoder
Der Encoder wandelt das Mel-Spektrogramm in eine Sequenz gelernter Audiodarstellungen um. Er besteht aus:
- Zwei 1D-Convolution-Layern — Die erste Convolution hat eine Kernelgröße von 3 und Padding von 1, gefolgt von einer GELU-Aktivierung. Die zweite Convolution hat eine Kernelgröße von 3, einen Stride von 2 und Padding von 1; dadurch halbiert sie die Zeitdimension. So werden die 3.000 Zeitschritte auf 1.500 Positionen heruntergerechnet.
- Sinusoidale Positions-Embeddings — Anders als der Decoder nutzt der Encoder feste sinusoidale Embeddings (nicht gelernte), um die Position jedes Zeitschritts zu codieren.
- Transformer-Blöcke — Ein Stack standardmäßiger Transformer-Encoder-Layer, jeweils mit Multi-Head Self-Attention und Feed-Forward-Netzwerk mit GELU-Aktivierung, verbunden durch Residual Connections und Layer Normalization.
Die Ausgabe ist eine Sequenz von 1.500 kontextualisierten Audio-Feature-Vektoren — einer für jeweils 20 Millisekunden Eingabeaudio — auf die der Decoder während der Texterzeugung zugreift.
Der Decoder
Der Decoder erzeugt Text-Tokens autoregressiv — jeweils ein Token nach dem anderen, bedingt durch das encodierte Audio und alle zuvor erzeugten Tokens. Er besteht aus:
- Token-Embedding-Layer — Wandelt Token-IDs in dichte Vektordarstellungen um.
- Gelernte Positions-Embeddings — Anders als die sinusoidalen Embeddings des Encoders nutzt der Decoder gelernte Positions-Embeddings, die zusammen mit dem Modell trainiert werden.
- Transformer-Blöcke mit Cross-Attention — Jeder Decoder-Layer hat drei Unter-Layer: maskierte Self-Attention (damit das Modell nicht in zukünftige Tokens blickt), Cross-Attention auf die Encoder-Ausgabe (damit das Modell dem Audio "zuhören" kann) und ein Feed-Forward-Netzwerk.
Die finale Decoder-Ausgabe wird auf das Vokabular projiziert, um Token-Wahrscheinlichkeiten zu erzeugen. Zu den Decodierstrategien gehören Greedy Search, Beam Search und temperaturbasiertes Sampling.
Spezielle Tokens und Multitask-Training
Whisper erledigt mehrere Aufgaben mit einem einzigen Modell, indem es ein cleveres System spezieller Tokens als Anweisungen verwendet. Die Decoder-Eingabe folgt einem strukturierten Format:
<|startoftranscript|> <|en|> <|transcribe|> <|notimestamps|> Hello, how are you today? <|endoftext|><|startoftranscript|>— Signalisiert den Beginn der Ausgabesequenz.<|en|>— Gibt die Sprache an (eines von 99 Sprach-Tokens). Kann automatisch erkannt oder manuell gesetzt werden.<|transcribe|>oder<|translate|>— Gibt an, ob in der Originalsprache transkribiert oder ins Englische übersetzt werden soll.<|notimestamps|>— Steuert, ob Zeitstempel-Tokens erzeugt werden. Wenn Zeitstempel aktiviert sind, erzeugt das Modell Zeitversatz-Tokens wie<|0.00|>und<|2.40|>die Text mit Audio synchronisieren.
Dieses einheitliche Token-Format bedeutet, dass ein einziges Modell Transkription, Übersetzung, Spracherkennung und Transkription mit Zeitstempeln ausführen kann — ganz ohne separate Modellköpfe oder Fine-Tuning. Die Aufgabe wird vollständig durch die Token-Sequenz bestimmt, die dem Decoder übergeben wird.
Trainingsdaten
Die ursprünglichen Whisper-Modelle (tiny bis large-v2) wurden auf 680.000 Stunden Audio mit zugehörigen Transkripten aus dem Internet trainiert. Dieser Datensatz ist nicht öffentlich verfügbar. Sein zentrales Merkmal ist, dass er weakly supervised ist — die Transkript-Labels wurden nicht von menschlichen Annotatoren handgeprüft. Stattdessen stammen sie aus Quellen wie Untertiteln, Closed Captions und anderem nutzergeneriertem Text, der mit Audio verknüpft ist.
Datenzusammensetzung
Laut der offiziellen Modellkarte teilt sich der 680.000-Stunden-Trainingsdatensatz wie folgt auf:
| Bereich | Stunden | Anteil | Beschreibung |
|---|---|---|---|
| Englische ASR | 438,000 | 65% | Englisches Audio mit englischen Transkripten |
| Übersetzung (X ins Englische) | 126,000 | 18% | Nicht-englisches Audio mit englischen Transkripten |
| Mehrsprachige ASR | 117,000 | 17% | Nicht-englisches Audio mit Transkripten in der Originalsprache (98 Sprachen) |
Der starke Englisch-Schwerpunkt (65 % der Trainingsdaten) erklärt, warum Whisper bei Englisch deutlich besser abschneidet als bei ressourcenärmeren Sprachen. Für das im November 2023 veröffentlichte Modell large-v3 erweiterte OpenAI den Trainingsdatensatz auf 1 Million Stunden schwach gelabeltes Audio plus weitere 4 Millionen Stunden pseudo-gelabeltes Audio, das durch Ausführen von Whisper large-v2 auf ungelabelten Daten erzeugt wurde — eine Form von Self-Training oder Knowledge Distillation.
Warum "Weakly Supervised" wichtig ist
Die meisten früheren ASR-Systeme wurden auf Datensätzen wie LibriSpeech (960 Stunden) oder Common Voice (einige Tausend Stunden pro Sprache) trainiert — sorgfältig kuratierte, von Menschen geprüfte Datensätze. Whisper tauschte Labelqualität gegen schiere Größenordnung: 680.000 Stunden statt der Hunderte oder wenigen Tausend Stunden, die konventionelle Systeme nutzten. Das Paper zeigte, dass sich dieser Kompromiss lohnte. Die Vielfalt der aus dem Internet stammenden Daten gab Whisper außergewöhnliche Robustheit unter realen Bedingungen: Hintergrundgeräusche, überlappende Sprache, Akzente, domänenspezifisches Vokabular und akustische Umgebungen, die Modelle herausfordern würden, die auf Studioqualität und vorgelesener Sprache trainiert wurden.
Die schwache Supervision bringt jedoch auch eine bekannte Einschränkung mit sich: Halluzination. Weil die Trainings-Transkripte unvollkommen sind, erzeugt das Modell manchmal plausibel klingenden Text, der tatsächlich nie gesprochen wurde — besonders bei Stille oder sehr leisen Passagen. Dieser Kompromiss ist dem Ansatz inhärent und bleibt ein aktives Verbesserungsfeld.
Modellgrößen
Whisper ist in mehreren Größen verfügbar, von 39 Millionen bis 1,55 Milliarden Parametern. Kleinere Modelle sind schneller, aber weniger genau; größere Modelle sind genauer, benötigen jedoch mehr Rechenleistung und Speicher. Die Varianten mit .en sind reine Englischmodelle, die bei Englisch tendenziell besser abschneiden, besonders in kleineren Größen. Für die großen Modelle gibt es keine reinen Englischvarianten.
| Modell | Parameter | Nur Englisch | VRAM | Relative Geschwindigkeit |
|---|---|---|---|---|
| tiny | 39 M | tiny.en | ~1 GB | ~10x |
| base | 74 M | base.en | ~1 GB | ~7x |
| small | 244 M | small.en | ~2 GB | ~4x |
| medium | 769 M | medium.en | ~5 GB | ~2x |
| large (v1, v2, v3) | 1,550 M | -- | ~10 GB | 1x |
| turbo (large-v3-turbo) | 809 M | -- | ~6 GB | ~8x |
Die Geschwindigkeit ist relativ zum large-Modell. Die VRAM-Anforderungen gelten für GPU-Inferenz mit fp16-Präzision über die ursprüngliche Python-Implementierung. whisper.cpp benötigt deutlich weniger Speicher (z. B. erfordert das large-Modell ~3,9 GB RAM statt ~10 GB VRAM).
Das Modell turbo (veröffentlicht im Oktober 2024) ist eine destillierte Version von large-v3 mit einem deutlich kleineren Decoder. Es behält den Großteil der Genauigkeit von large-v3 bei und läuft etwa 8x schneller — damit ist es eine starke Wahl, wenn Geschwindigkeit zählt. Beachte, dass turbo die Übersetzungsaufgabe nicht unterstützt.
Das large-Modell hat drei Iterationen durchlaufen: large-v1 (September 2022), large-v2 (Dezember 2022) und large-v3 (November 2023). Jede Version verbesserte die Genauigkeit; large-v3 führte 128 Mel-Frequenz-Bins ein (statt 80) und wurde auf einem deutlich größeren Datensatz trainiert. Eine detaillierte Aufschlüsselung jeder Größe und Entscheidungshilfe findest du in unserem Leitfaden zu Whisper-Modellgrößen.
Wie genau ist Whisper?
Die Genauigkeit von Whisper wird typischerweise mit der Word Error Rate (WER) gemessen — dem Prozentsatz der Wörter, die falsch transkribiert werden (Einfügungen, Auslassungen und Ersetzungen zusammen). Eine niedrigere WER ist besser.
Englische Benchmarks
Auf LibriSpeech test-clean — dem am weitesten verbreiteten englischen ASR-Benchmark mit sauber vorgelesener Sprache aus Hörbüchern — erreicht Whisper large-v2 eine WER von ungefähr 3,0 %[1][2]. Das ist konkurrenzfähig mit kommerziellen ASR-Systemen und speziell trainierten Modellen, auch wenn auf LibriSpeech feinabgestimmte Spezialmodelle bei genau diesem Benchmark niedrigere WER-Werte erreichen können. Whispers Stärke liegt nicht darin, enge Benchmarks zu schlagen, sondern in Robustheit — es arbeitet über viele reale Bedingungen hinweg konstant gut.
Verbesserungen in large-v3
Laut OpenAIs Evaluation zeigt Whisper large-v3 eine 10-20 % geringere Fehlerrate gegenüber large-v2 in Sprachen, in denen das Modell auf den Evaluationsdatensätzen Common Voice 15 und Fleurs unter 60 % Fehlerrate erreicht[2][3]. Besonders deutlich sind die Verbesserungen bei nicht-englischen Sprachen, wo die erweiterten Trainingsdaten (insgesamt 5 Millionen Stunden) den größten Unterschied machen.
Wie Whisper im Vergleich abschneidet (Februar 2026)
Seit der Veröffentlichung von Whisper haben neuere Open-Source-ASR-Modelle es bei Clean-Speech-Benchmarks übertroffen. NVIDIAs Parakeet TDT (0,6 Mrd. Parameter) erreicht 1,69 % WER, und das Canary-Modell kommt auf LibriSpeech test-clean auf 1,6 % WER — beides deutlich unter den ~2,7 % von Whisper large-v3. Trotzdem bleibt Whisper das am weitesten verbreitete Open-Source-ASR-Modell, weil sein Ökosystem ausgereift ist, es viele Sprachen abdeckt und optimierte Laufzeiten wie whisper.cpp verfügbar sind.
Wortfehlerrate: Whisper im Vergleich zu Open-Source-Konkurrenten
LibriSpeech test-clean (englische Leserede) – niedriger ist besser
Quellen: Hugging Face Modellkarten, NVIDIA Modellkarten, Open ASR Leaderboard (Feb 2026). Nur klare, englischsprachige Vorlesung – die tatsächliche Genauigkeit variiert je nach Audioqualität, Akzent und Domäne. Kommerzielle APIs wurden weggelassen, da sie keine LibriSpeech-Benchmarks veröffentlichen.
Hinweis: Kommerzielle Cloud-APIs (Deepgram Nova-3, Google Chirp, AssemblyAI Universal-2) veröffentlichen keine LibriSpeech-WER-Werte und können daher in dieser Grafik nicht direkt verglichen werden. Ihre Benchmarks nutzen proprietäre reale Testsets. OpenAI veröffentlichte im März 2025 außerdem GPT-4o-transcribe als reines API-Modell (nicht Open Source, nicht Whisper-basiert) mit Berichten zufolge niedrigeren Fehlerraten — es ist jedoch cloudbasiert und nicht für lokale Inferenz verfügbar.
Wo Whisper besonders stark ist
- +Robustheit gegenüber Akzenten und Dialekten — Trainiert auf vielfältigem Internet-Audio verarbeitet Whisper regionale Akzente besser als Systeme, die auf vorgelesene Sprache trainiert wurden.
- +Toleranz gegenüber Hintergrundgeräuschen — Das Modell hält eine brauchbare Genauigkeit auch bei Musik, anderen Sprechern oder Umgebungsgeräuschen.
- +Fachvokabular — Durch die Breite der Trainingsdaten verarbeitet Whisper domänenspezifische Begriffe (medizinisch, juristisch, technisch) besser als viele allgemeine ASR-Systeme.
- +Mehrsprachigkeit — Ein einziges Modell unterstützt 99 Sprachen, ohne dass Fine-Tuning pro Sprache erforderlich ist.
Wo Whisper Schwierigkeiten hat
- -Halluzination — Das am häufigsten genannte Problem. Bei Stille oder sehr leisen Passagen kann Whisper Text erzeugen, der nie gesprochen wurde. Das ist eine Folge des weakly supervised Trainingsansatzes.
- -Ressourcenarme Sprachen — Sprachen mit wenig Trainingsdaten (ein Großteil der 680K Stunden ist Englisch) haben deutlich höhere Fehlerraten.
- -Repetitive Texterzeugung — Der autoregressive Decoder kann in Schleifen "hängen bleiben" und dieselbe Phrase wiederholt ausgeben. Beam Search mit bestimmten Parametern kann das abschwächen, aber nicht vollständig beseitigen.
- -Standardmäßig nicht echtzeitfähig — Whisper verarbeitet 30-Sekunden-Blöcke, wodurch eine inhärente Latenz entsteht. Streaming-Lösungen (wie der Echtzeitmodus von whisper.cpp) umgehen das, erhöhen aber die Komplexität.
whisper.cpp und lokale Inferenz
Die ursprüngliche Whisper-Implementierung benötigt Python, PyTorch und für brauchbare Leistung eine CUDA-fähige GPU. Das macht sie für Desktop-Anwendungen, Mobilgeräte und Edge-Deployments unpraktisch. whisper.cpp, erstellt von Georgi Gerganov, löst dieses Problem.
whisper.cpp ist eine vollständige Neuimplementierung der Whisper-Inferenz in reinem C/C++ ohne Abhängigkeiten. Es liest dieselben Modellgewichte, läuft aber ohne Python, ohne PyTorch und ohne GPU (auch wenn es stark von einer profitiert). Zu den wichtigsten Funktionen gehören:
- Keine Speicherallokationen zur Laufzeit — Der gesamte Speicher wird vorab alloziert, wodurch die Leistung vorhersehbar und für eingebettete Systeme geeignet wird.
- Optimierung für Apple Silicon — Auf Macs mit M-Serie-Chips kann der Encoder über Core ML auf der Apple Neural Engine laufen und damit mehr als 3x schnellere Inferenz als reine CPU-Ausführung liefern. Metal-GPU-Beschleunigung wird ebenfalls für vollständige GPU-Inferenz unterstützt.
- Quantisierungsunterstützung — Modelle können auf 4-Bit-, 5-Bit- oder 8-Bit-Integer-Präzision quantisiert werden, was den Speicherbedarf stark senkt und die Geschwindigkeit bei minimalem Genauigkeitsverlust erhöht.
- GPU-Beschleunigung — Unterstützt NVIDIA CUDA (über cuBLAS), Vulkan (herstellerübergreifend), OpenVINO (Intel) und OpenBLAS für CPU-Beschleunigung.
- Sprachaktivitätserkennung (VAD) — Eingebaute VAD überspringt stille Abschnitte und verbessert damit sowohl Geschwindigkeit als auch Transkriptqualität.
Speicheranforderungen (whisper.cpp)
| Modell | Festplattengröße | Benötigter RAM |
|---|---|---|
| tiny | 75 MB | ~273 MB |
| base | 142 MB | ~388 MB |
| small | 466 MB | ~852 MB |
| medium | 1.5 GB | ~2.1 GB |
| large | 2.9 GB | ~3.9 GB |
whisper.cpp läuft auf macOS (Intel und Apple Silicon), Linux, Windows, iOS, Android, FreeBSD, Raspberry Pi und sogar im Browser über WebAssembly. Auf bescheidener Verbraucherhardware erreicht es Transkription schneller als Echtzeit — einschließlich so kleiner Geräte wie Raspberry Pi 4 und iPhone 13.
Diese Portabilität macht lokale, private Spracherkennung praktisch. Anwendungen wie OpenWhispr nutzen whisper.cpp unter der Haube, um Echtzeit-Push-to-Talk-Diktat bereitzustellen, das vollständig auf dem Gerät des Nutzers läuft — kein Audio verlässt jemals den Rechner.
Whisper vs. andere ASR-Systeme
Whisper existiert in einer breiteren Landschaft von Spracherkennungssystemen. So schneidet es im Vergleich zu den häufigsten Alternativen ab.
Google Cloud Speech-to-Text
Googles Cloud-ASR-Dienst. Sehr hohe Genauigkeit, besonders bei Englisch, mit Echtzeit-Streaming und Sprecher-Diarisierung. Die wichtigsten Unterschiede: proprietär, Audio muss an Googles Server gesendet werden, und die Abrechnung erfolgt pro verarbeiteter Audiominute. Whisper bietet für allgemeine Nutzung vergleichbare Genauigkeit, läuft lokal und ist kostenlos — bietet aber kein eingebautes Streaming und keine Diarisierung.
Amazon Transcribe (AWS)
Amazons Cloud-ASR, eng in das AWS-Ökosystem integriert. Bietet medizinische Transkription, Call Analytics und benutzerdefiniertes Vokabular. Ähnliche Kompromisse wie bei Google: Cloud-Abhängigkeit, minutengenaue Preise und proprietäre Technologie. Whisper passt besser zu Anwendungen, die Offline-Betrieb, Open-Source-Lizenzierung oder keine Anbieterbindung benötigen.
Mozilla DeepSpeech
Mozillas Open-Source-ASR-Engine auf Basis von Baidus Deep-Speech-Forschung. Sie war eines der ersten hochwertigen offenen ASR-Modelle, doch Mozilla stellte die aktive Entwicklung 2021 ein. Whisper hat DeepSpeech bei Genauigkeit, Mehrsprachigkeit und Community-Dynamik faktisch abgelöst. DeepSpeech bleibt als leichtgewichtige, gut verstandene Baseline nützlich, wird aber für neue Projekte nicht mehr empfohlen.
Vosk
Ein Open-Source-Toolkit für Offline-Spracherkennung, das 20+ Sprachen mit kleinen, schnellen Modellen unterstützt. Vosk eignet sich hervorragend für ressourcenbeschränkte Umgebungen — seine Modelle sind nur ein Bruchteil so groß wie Whisper und laufen gut auf stromsparender Hardware. Der Kompromiss ist Genauigkeit: Vosk ist merklich weniger genau als Whisper, besonders bei akzentuierter Sprache, verrauschtem Audio und Fachvokabular.
Faster Whisper (CTranslate2)
Eine Neuimplementierung von Whisper mit SYSTRANs CTranslate2-Inferenzengine. Sie führt dieselben Whisper-Modelle mit derselben Genauigkeit aus, ist aber bis zu 4x schneller als die ursprüngliche OpenAI-Implementierung und benötigt weniger Speicher. Faster Whisper basiert auf Python (anders als whisper.cpp mit C/C++) und ist eine starke Wahl für serverseitige Batch-Transkription. Es unterstützt CUDA-GPUs und CPU-Inferenz mit INT8-Quantisierung.
Praktische Anwendungen
Whispers Kombination aus Genauigkeit, Mehrsprachigkeit und Open-Source-Verfügbarkeit hat es zum Rückgrat vieler Anwendungen gemacht:
Desktop-Diktat
Apps wie OpenWhispr nutzen whisper.cpp, um systemweites Push-to-Talk-Diktat auf macOS, Windows und Linux bereitzustellen. Audio wird lokal verarbeitet — nichts wird an die Cloud gesendet.
Untertitelgenerierung
Whispers Zeitstempelvorhersage eignet sich gut zum Erzeugen von Untertiteln und Closed Captions. Werkzeuge wie stable-ts und auto-subtitle automatisieren diesen Workflow.
Podcast- und Meeting-Transkription
Whisper verarbeitet Langform-Audio gut, besonders mit dem blockweisen Verarbeitungsansatz. Viele Podcast-Editoren und Meeting-Notiztools nutzen Whisper (oder Faster Whisper) für Batch-Transkription von Aufnahmen.
Übersetzung und Lokalisierung
Whispers eingebaute Übersetzungsfähigkeit (jede Sprache ins Englische) wird für sprachübergreifenden Zugang zu Inhalten, Medienlokalisierung und Echtzeit-Übersetzungsprototypen genutzt.
Barrierefreiheit
Echtzeit-Untertitel für gehörlose und schwerhörige Nutzer, Sprachschnittstellen für Nutzer mit motorischen Einschränkungen und Transkription von Audiobeschreibungen sind aktive Einsatzfelder für Whisper.
Datenannotation und Forschung
Forschende nutzen Whisper, um pseudo-gelabelte Datensätze für das Training anderer Modelle zu erstellen — denselben Ansatz, den OpenAI für die Trainingsdaten von large-v3 nutzte. Es wird außerdem umfangreich in der linguistischen Forschung und beim Korpusaufbau eingesetzt.
Quellen und weiterführende Lektüre
- [Paper] Radford, A., Kim, J. W., Xu, T., Brockman, G., McLeavey, C., & Sutskever, I. (2022). Robust Speech Recognition via Large-Scale Weak Supervision. arXiv:2212.04356. arxiv.org/abs/2212.04356
- [Code] OpenAI-Whisper-Repository auf GitHub. github.com/openai/whisper
- [Code] whisper.cpp — C/C++-Portierung von Georgi Gerganov. github.com/ggml-org/whisper.cpp
- [Modellkarte] Whisper large-v2 auf Hugging Face (WER-Benchmark: ~3,0 % auf LibriSpeech test-clean). huggingface.co/openai/whisper-large-v2
- [Modellkarte] Whisper large-v3 auf Hugging Face (10-20 % Fehlerreduktion gegenüber v2). huggingface.co/openai/whisper-large-v3
- [Modellkarte] Whisper large-v3-turbo auf Hugging Face (latenzorientierte destillierte Variante). huggingface.co/openai/whisper-large-v3-turbo
- [Modellkarte] OpenAI-Whisper-Modellkarte (Aufschlüsselung der Trainingsdatenzusammensetzung). github.com/openai/whisper/blob/main/model-card.md
- [Versionshinweise] OpenAIs large-v3-Ankündigung und Evaluationshinweise. github.com/openai/whisper/discussions/1762
- [Versionshinweise] OpenAIs turbo-Release-Diskussion und geschwindigkeitsorientierte Kompromisse. github.com/openai/whisper/discussions/2363
- [Code] Faster Whisper — CTranslate2-basierte Neuimplementierung von SYSTRAN. github.com/SYSTRAN/faster-whisper
- [Produkt] OpenWhispr nutzt Whisper über whisper.cpp für lokale Diktier-Workflows. openwhispr.com
Whisper lokal mit OpenWhispr ausprobieren
OpenWhispr nutzt Whisper (über whisper.cpp) für lokales, privates Diktieren auf macOS, Windows und Linux. Push-to-talk, 99+ Sprachen, keine Cloud erforderlich. Kostenlos ausprobieren.
Kein Konto erforderlich · Funktioniert offline · Für immer Open Source