Vergleich

Parakeet vs. Whisper vs. Nemotron: Das beste lokale Speech-to-Text-System 2026

Drei offene Modelle können Sprache inzwischen vollständig auf dem eigenen Computer in Text umwandeln. So unterscheiden sie sich tatsächlich bei Genauigkeit, Geschwindigkeit, Sprachen und Streaming – mit belastbaren Zahlen aus Primärquellen.

OpenWhispr

OpenWhispr

Ingenieurwesen

18. Juli 2026
Inhaltsverzeichnis

Für Englisch und die wichtigsten europäischen Sprachen ist NVIDIA Parakeet TDT 0.6B v3 das beste lokale Speech-to-Text-Modell des Jahres 2026: Es schlägt Whisper large-v3 bei der gemessenen Genauigkeit, ist nur ein Viertel so groß und läuft auf einer normalen CPU erheblich schneller. Sollen Wörter schon während des Sprechens live erscheinen, sind NVIDIAs neue Nemotron-Streaming-Modelle die ersten lokalen Modelle, die genau dafür entwickelt wurden. Und für eine der vielen Sprachen, die NVIDIA nicht abdeckt, bleibt OpenAIs Whisper – mit 99 Sprachen – die richtige Wahl.

Die Überraschung des Jahres 2026: Whisper trägt nach drei Jahren nicht mehr die Genauigkeitskrone unter den offenen Modellen. Die Frage nach dem besten Modell hat sich jedoch zu einem echten Dreikampf entwickelt, weil jedes Modell etwas anderes besonders gut kann: Parakeet optimiert Genauigkeit pro Watt, Nemotron die Latenz und Whisper die Sprachvielfalt. Dieser Artikel vergleicht sie anhand der Zahlen aus ihren eigenen Modellkarten und dem öffentlichen Leaderboard – ohne Bauchgefühl und ohne die Unterschiede größer darzustellen, als sie sind.

Zuletzt aktualisiert am 18. Juli 2026. Wir entwickeln OpenWhispr, eine Open-Source-Diktier-App mit allen drei Modellfamilien. Deshalb testen und unterstützen wir jedes Modell im Produktiveinsatz. Das ist zugleich unser Blickwinkel: Wir verkaufen keines dieser Modelle, und die folgenden Abwägungen sind dieselben, die wir unseren eigenen Nutzern erklären.

Faktencheck auf einen Blick (Primärquellen)

Die drei Kandidaten

Alle drei sind kostenlose Modelle mit offenen Gewichten, die sich herunterladen und offline ausführen lassen. Ihre Architekturen unterscheiden sich – und erklären fast jeden praktischen Unterschied.

OpenAI Whisper (2022)

Das Modell, das offene Spracherkennung im Mainstream etablierte. Ein Encoder-Decoder-Transformer, trainiert mit 680,000 Audiostunden, in sechs Größen von 75MB (tiny) bis 3GB (large-v3) und für 99 Sprachen. Es erzeugt Text wie ein Sprachmodell Token für Token – und ist deshalb auch das langsamste der drei. MIT-Lizenz.

NVIDIA Parakeet (2024–2025)

Ein Transducer-Modell (TDT) mit 600M Parametern für Batch-Transkription. Statt Tokens autoregressiv zu erzeugen, gibt es den Text in einem einzigen Durchlauf durch das Audio aus – deutlich schneller und ohne erfundenen Text in Sprechpausen. Zwei Varianten sind wichtig: das mehrsprachige v3 (25 Sprachen, 680MB als INT8 ONNX) und das rein englische Unified-Modell (631MB), das derzeit die beste englische Genauigkeit erreicht. Lizenz CC-BY-4.0.

NVIDIA Nemotron ASR (2026)

Die neueste Familie wurde für Streaming entwickelt: Ein Cache-fähiger FastConformer-Transducer transkribiert das Audio beim Eintreffen, statt auf das Ende der Aufnahme zu warten. Das englische Modell erschien im Januar 2026, das mehrsprachige 3.5-Modell für 40 Sprachregionen folgte im Juni. Beide haben 600M Parameter (632–650MB als INT8 ONNX) und eine offene Lizenz (OpenMDW).

Genauigkeit: Parakeet gewinnt, aber knapper als gedacht

Sprachmodelle werden anhand der Wortfehlerrate (WER) gemessen – also dem Prozentsatz falsch erkannter Wörter. Weniger ist besser. Als Standardreferenz dient das Open ASR Leaderboard von Hugging Face. Es mittelt die WER über acht unterschiedliche englische Datensätze (Meetings, Quartalsberichte, TED Talks, Hörbücher und mehr), damit ein einzelner einfacher Datensatz kein Modell künstlich begünstigt.

Englischgenauigkeit: durchschnittliche Wortfehlerrate

Datensatzübergreifende Durchschnittswerte aus den Benchmarks des Open ASR Leaderboards von Hugging Face (niedriger ist besser). Nemotron wird in seiner Streaming-Konfiguration gezeigt.

Quellen: NVIDIA-Modellkarten auf Hugging Face und das Open ASR Leaderboard, Juli 2026. WER = Prozentsatz der falsch transkribierten Wörter.

Die Grafik sollte nüchtern gelesen werden: Jedes Modell hier ist produktionsreif, und die gesamte Spannweite beträgt nur etwa 1.5 Punkte. Beim täglichen Diktieren wirken 6.3% und 7.4% auf sauberem Audio ähnlich; sichtbar werden die Unterschiede bei schwierigem Audio mit Akzenten, Rauschen oder Fachbegriffen. Bemerkenswert an den NVIDIA-Werten ist ihr Preis: Parakeet erreicht seine Genauigkeit mit 600M Parametern gegenüber Whispers 1.55B, und Nemotron erzielt 6.93% während des Streamings, ohne den späteren Audioverlauf zu kennen.

Whispers bekannte Schwäche: Halluzinationen bei Stille

Weil Whispers Decoder wie ein Sprachmodell arbeitet, kann er bei Stille oder Rauschen flüssige, vollständig erfundene Sätze erzeugen – ein im gesamten Ökosystem dokumentiertes Fehlverhalten. Transducer-Modelle wie Parakeet und Nemotron sind strukturell dagegen geschützt: keine Audioevidenz, keine Tokens. Beim Diktieren, wo Aufnahmen mit Stille beginnen und enden, zählt das mehr als ein Benchmark-Punkt.

Geschwindigkeit und Effizienz: kein knappes Rennen

Auf der Hardware des Leaderboards transkribiert Parakeet TDT v3 mit 3,332× Echtzeit – eine Stunde Audio in etwa einer Sekunde. Whisper large-v3 erreicht deutlich weniger als ein Zehntel davon. Der Grund liegt in der Architektur: Whisper schreibt das Transkript Token für Token, wobei jeder Schritt auf den vorherigen wartet. Ein Transducer liest das Audio einmal und gibt den Text fortlaufend aus. Keine Schleife, keine Hin- und Rückwege pro Wort.

Auf einem Laptop sind die absoluten Zahlen kleiner, das Verhältnis bleibt jedoch bestehen: Ein diktierter Absatz, für den Whisper large mehrere Sekunden braucht, erscheint mit Parakeet nahezu sofort – auf der CPU und ohne GPU. Unabhängige Benchmarks berichten außerdem, dass NVIDIA-Transducer ungefähr 8–10× weniger Energie pro Audiostunde verbrauchen als Whisper bei vergleichbarer Qualität – relevant beim ganztägigen Diktieren im Akkubetrieb.

Whispers Antwort darauf ist turbo (1.6GB), eine destillierte large-v3-Variante, die etwas Genauigkeit gegen ungefähr 8× Whisper-large-Geschwindigkeit tauscht. Für Diktate ist sie die richtige Whisper-Version, verkleinert die Lücke aber nur. Den vollständigen Größenvergleich findest du in unserem Leitfaden zu Whisper-Modellgrößen.

Sprachabdeckung: Whispers dauerhafter Vorsprung

ModellSprachenHinweise
Whisper large-v399Größte Abdeckung aller offenen Modelle, einschließlich ressourcenarmer Sprachen
Nemotron 3.5 ASR40 SprachregionenAutomatische Spracherkennung; 15 sofort nutzbare Sprachen, darunter Japanisch, Koreanisch, Arabisch und Hindi
Parakeet TDT v325Europäische Sprachen sowie Englisch und Russisch; automatische Erkennung
Parakeet Unified / Nemotron EN1Nur Englisch, dafür die beste Genauigkeit ihrer Klasse

Die Faustregel ist einfach. Für Englisch oder eine wichtige europäische Sprache eignen sich alle drei; entscheide nach Geschwindigkeit. Japanisch, Koreanisch, Vietnamesisch, Arabisch und Hindi deckt Nemotron 3.5 nun per Streaming ab – eine echte Premiere für lokale Modelle. Für Mandarin, Thai, Indonesisch, Swahili oder häufige Sprachwechsel bleibt Whisper die einzige ernsthafte Option. Das dürfte sich nicht so bald ändern.

Streaming: der entscheidende Unterschied

Beim Streaming ist Nemotron nicht bloß schrittweise besser – es tut etwas, das die Architektur der beiden anderen nicht zulässt. Whisper verarbeitet Audio in 30-Sekunden-Fenstern und codiert alles Gesehene erneut. „Live“-Whisper ist daher in Wirklichkeit dasselbe Batch-Modell, das immer wieder über überlappendes Audio läuft – aufwendig, verzögert und an den Übergängen unruhig. Nemotrons Cache-fähige Architektur wurde für Streaming trainiert: Sie verarbeitet nur den neuesten Audioblock, übernimmt ihren internen Zustand und gibt Teiltexte mit einer konfigurierbaren Latenz von 80 Millisekunden bis 1.12 Sekunden aus.

Im großen Maßstab ist der Effizienzunterschied enorm – NVIDIA meldet 17× mehr gleichzeitige Streams als beim Streaming-Modell der vorherigen Generation auf derselben GPU. Auf dem Laptop ist der spürbare Vorteil einfacher: Der Text erscheint beim Sprechen, während das Modell auf der eigenen CPU läuft. Welche Entwicklungsarbeit dafür in einer Desktop-App nötig war, erklären wir in unserem technischen Überblick zu Streaming-ASR.

Wenn Live-Text unwichtig ist – diktieren, stoppen, fertiges Transkript erhalten –, bringt Streaming keinen Vorteil, und Parakeets Batch-Modelle sind die bessere Wahl. Streaming ist für Live-Untertitel, Sprachagenten und eine Diktiervorschau gedacht, die während des Sprechens erscheint.

Hardware: Alle drei laufen auf einem normalen Laptop

Keines dieser Modelle benötigt eine GPU. Die NVIDIA-Modelle werden als INT8-quantisierte ONNX-Dateien (631–680MB) ausgeliefert, die über sherpa-onnx – eine native Binärdatei ohne Python und PyTorch – auf jeder aktuellen CPU, ob Apple Silicon oder x86, problemlos laufen. Whisper läuft mit whisper.cpp überall; small und turbo eignen sich gut für CPUs, während large-v3 (3GB, ~10GB RAM) tatsächlich von Beschleunigung profitiert.

Ist eine GPU vorhanden, sollte sie für Whisper genutzt werden: Metal ist auf Apple Silicon integriert, und OpenWhispr bietet CUDA- (NVIDIA) und Vulkan-Laufzeiten (AMD und Intel) per Klick mit automatischem CPU-Rückfall, falls die GPU-Laufzeit scheitert. Die NVIDIA-Transducer sind auf der CPU bereits so schnell, dass GPU-Beschleunigung für Diktate kaum relevant ist.

Welches Modell passt zu dir?

Dein AnwendungsfallEmpfehlung
Englische Diktate, bestmögliche GenauigkeitParakeet Unified EN 0.6B
Europäische Sprachen, schnelle Batch-TranskriptionParakeet TDT 0.6B v3
Live-Text beim Sprechen (Englisch)Nemotron Speech Streaming EN
Live-Text auf Spanisch, Japanisch, Koreanisch, Arabisch, Hindi…Nemotron 3.5 ASR Streaming
Eine von NVIDIA nicht abgedeckte SpracheWhisper large-v3 oder turbo
Alte Hardware oder wenig RAM, kurze NotizenWhisper tiny oder base

Wenn Datenschutz der Grund für die lokale Ausführung ist, sind alle drei gleichwertig: Das Audio wird auf dem eigenen Rechner verarbeitet und nie hochgeladen. Mehr über diese Abwägung steht in unserem Vergleich lokaler und cloudbasierter Transkription.

Alle drei in zwei Minuten ausprobieren

Am ehrlichsten ist ein Test mit demselben diktierten Absatz in jedem Modell. OpenWhispr bietet alle Modelle dieses Artikels – sechs Whisper-Größen, beide Parakeet- und beide Nemotron-Modelle – kostenlos und quelloffen für macOS, Windows und Linux in einem einzigen Einstellungsmenü. Modell laden, Tastenkürzel drücken, sprechen. Unsere Modellseite führt alle Größen und Kompromisse auf.

Häufig gestellte Fragen

Welches ist 2026 das beste lokale Speech-to-Text-Modell?

Für Englisch und die wichtigsten europäischen Sprachen bietet NVIDIA Parakeet TDT 0.6B v3 das beste Gesamtpaket: Im Open ASR Leaderboard erreicht es eine durchschnittliche Wortfehlerrate von 6.34% – gegenüber etwa 7.4% bei Whisper large-v3 – und ist dabei nur ein Viertel so groß und auf der CPU erheblich schneller. Wenn Text schon während des Sprechens erscheinen soll, sind die Streaming-Modelle von NVIDIA Nemotron die beste Wahl. Für Sprachen, die von den NVIDIA-Modellen nicht abgedeckt werden, empfiehlt sich Whisper.

Ist Parakeet genauer als Whisper?

In den englischen Benchmarks des Open ASR Leaderboard ja: Parakeet TDT 0.6B v3 erreicht im Mittel 6.34% WER gegenüber rund 7.4% bei Whisper large-v3; das rein englische Parakeet-Unified-Modell kommt sogar auf 5.91%. Die ehrliche Einschränkung: Ein Unterschied von ~1 WER-Punkt fällt beim alltäglichen Diktieren kaum auf. Parakeets deutlichere Vorteile sind Geschwindigkeit, Effizienz und die Tatsache, dass es in Sprechpausen keinen Text halluziniert – eine bekannte Schwäche von Whisper.

Brauche ich eine GPU, um diese Modelle lokal auszuführen?

Nein. Alle drei laufen auf einer modernen CPU. Parakeet und Nemotron verwenden INT8-quantisierte ONNX-Modelle (etwa 630–680MB auf der Festplatte), die für CPU-Inferenz ausgelegt sind. Whisper läuft über whisper.cpp auf der CPU, wobei das große 3GB-Modell von GPU-Beschleunigung profitiert. OpenWhispr unterstützt Metal auf Apple Silicon, CUDA auf NVIDIA und Vulkan auf AMD-/Intel-GPUs sowie einen automatischen Rückfall auf die CPU.

Welche Sprachen unterstützt Nemotron ASR?

NVIDIAs Nemotron 3.5 ASR deckt 40 Sprachregionen in einem einzigen Modell mit 600M Parametern und automatischer Spracherkennung ab. In OpenWhispr sind die 15 transkriptionsbereiten Sprachen aktiviert: Englisch, Spanisch, Französisch, Italienisch, Portugiesisch, Niederländisch, Deutsch, Türkisch, Russisch, Arabisch, Hindi, Japanisch, Koreanisch, Vietnamesisch und Ukrainisch. Das rein englische Nemotron-Streaming-Modell ist ebenfalls verfügbar.

Ist Whisper jetzt veraltet?

Nein. Whisper deckt weiterhin 99 Sprachen ab – weit mehr als Parakeets 25 oder Nemotrons 40 Sprachregionen – und bleibt die sicherste Wahl für asiatische Sprachen außer Japanisch, Koreanisch und Vietnamesisch, für ressourcenarme Sprachen und für Audio mit starkem Sprachwechsel. Außerdem ist es das am gründlichsten erprobte Modell mit dem größten Ökosystem. Geändert hat sich, dass Whisper bei englischer Genauigkeit und Geschwindigkeit nicht mehr an der Spitze liegt.

Welche dieser Modelle unterstützt OpenWhispr?

Alle. OpenWhispr liefert sechs Whisper-Größen über whisper.cpp, beide Parakeet-Modelle und beide Nemotron-Streaming-Modelle über sherpa-onnx und ermöglicht den Wechsel in den Einstellungen. Alles läuft auf dem eigenen Gerät – das Audio verlässt den Rechner nie – und die App ist kostenlos und Open Source.