Whisper-Modellgrößen erklärt: Tiny vs. Base vs. Small vs. Medium vs. Large
Jedes Whisper-Modell im Vergleich. Parameter, Geschwindigkeit, Genauigkeit und welches du tatsächlich verwenden solltest.
OpenWhispr
Ingenieurwesen
Inhaltsverzeichnis
OpenAIs Whisper ist in 9 Modellvarianten über 5 Größenkategorien hinweg verfügbar: tiny (39 Mio. Parameter), base (74 Mio.), small (244 Mio.), medium (769 Mio.) und large (1,55 Mrd.). Jede Größe gibt es in einer mehrsprachigen Version und einer rein englischen Version (außer large und turbo, die ausschließlich mehrsprachig sind). Es gibt außerdem ein Turbo-Modell (809 Mio.) – eine destillierte Version von large-v3, die nahezu genauso präzise, aber dramatisch schneller ist. Größere Modelle sind genauer, aber langsamer und benötigen mehr Speicher.
Für das von den meisten lokalen Transkriptions-Apps verwendete quantisierte whisper.cpp-Format (GGML) reichen die Modelldateien von 75 MB (tiny) bis 2,9 GB (large). Der Speicherbedarf zur Laufzeit liegt zwischen etwa 273 MB für tiny und 3,9 GB für large. Das richtige Modell hängt von deiner Hardware, deiner Sprache und der benötigten Genauigkeit ab.
Zuletzt aktualisiert: 17. Februar 2026. Angaben zu Parametern, Speicher und Benchmarks werden gegen mindestens zwei Primärquellen abgeglichen.
Faktencheck im Überblick (Doppelte Quellen)
- Offizielle Modellfamilien und Parameterzahlen: tiny/base/small/medium/large sowie turbo sind von OpenAI dokumentiert. OpenAI Whisper README · Whisper Model Card
- Kontext zu GGML/GGUF-Festplatten- und Laufzeitspeicher: die Speicheranforderungen für lokale Bereitstellungen stammen aus der whisper.cpp-Konvertierungs-/Laufzeit-Dokumentation. whisper.cpp · whisper.cpp Speicher-Hinweise
- Benchmark-Vorbehalt: die WER schwankt stark je nach Datensatz und Sprache; LibriSpeech-Werte sind kein universeller Qualitätsmaßstab. Whisper-Paper · large-v2 Model Card
- Einordnung des Turbo-Modells: turbo ist eine geschwindigkeitsorientierte Variante mit Genauigkeitskompromissen, die in den Release Notes/Model Cards dokumentiert sind. turbo Model Card · turbo Release-Diskussion
- Nutzungskontext von OpenWhispr: OpenWhispr stellt mehrere Whisper-Größen bereit, sodass Nutzer Geschwindigkeit und Genauigkeit direkt auf dem Gerät abstimmen können. OpenWhispr · whisper.cpp Backend
Whisper Modellgrößen: Geschwindigkeit vs. Genauigkeit
Die Blasengröße spiegelt die relative Parameteranzahl wider
Wortfehlerrate: Whisper im Vergleich zu Open-Source-Konkurrenten
LibriSpeech test-clean (englische Leserede) – niedriger ist besser
Quellen: Hugging Face Modellkarten, NVIDIA Modellkarten, Open ASR Leaderboard (Feb 2026). Nur klare, englischsprachige Vorlesung – die tatsächliche Genauigkeit variiert je nach Audioqualität, Akzent und Domäne. Kommerzielle APIs wurden weggelassen, da sie keine LibriSpeech-Benchmarks veröffentlichen.
Der komplette Modellvergleich
Diese Tabelle deckt jedes offizielle Whisper-Modell ab. „Relative Geschwindigkeit“ ist relativ zu large (1x als Basiswert). Die VRAM-Werte gelten für PyTorch-Inferenz auf der GPU. Die GGML-Spalten zeigen Dateigrößen und RAM-Nutzung für whisper.cpp, das von den meisten Desktop-Apps verwendet wird.
| Modell | Parameter | Nur Englisch | VRAM (GPU) | GGML Festplatte | RAM (whisper.cpp) | Geschwindigkeit | Englische WER | Mehrsprachige WER |
|---|---|---|---|---|---|---|---|---|
| tiny | 39 M | tiny.en | ~1 GB | 75 MiB | ~273 MB | ~10x | ~7.6% | ~12% |
| base | 74 M | base.en | ~1 GB | 142 MiB | ~388 MB | ~7x | ~5.0% | ~10% |
| small | 244 M | small.en | ~2 GB | 466 MiB | ~852 MB | ~4x | ~3.4% | ~7% |
| medium | 769 M | medium.en | ~5 GB | 1.5 GiB | ~2.1 GB | ~2x | ~2.9% | ~5% |
| large-v2 | 1,550 M | k. A. | ~10 GB | 2.9 GiB | ~3.9 GB | 1x | ~2.7% | ~4% |
| large-v3 | 1,550 M | k. A. | ~10 GB | 2.9 GiB | ~3.9 GB | 1x | ~2.4% | ~3.5% |
| turbo | 809 M | k. A. | ~6 GB | 1.6 GiB | ~2.3 GB | ~8x | ~2.5% | ~3.7% |
Hinweise: Die WER-Werte (Word Error Rate, Wortfehlerrate) sind ungefähre Durchschnittswerte aus dem Whisper-Paper, den HuggingFace Model Cards (LibriSpeech-Testsets für Englisch) und den von OpenAI veröffentlichten Benchmarks. Die genaue WER variiert erheblich je nach Datensatz, Sprache, Audioqualität und Bewertungsmethodik. Niedriger ist besser. Die Geschwindigkeit ist relativ zu large (1x = am langsamsten).
Tiny (39 Mio. Parameter)
Das Tiny-Modell ist die kleinste und schnellste Whisper-Variante. Mit nur 39 Millionen Parametern und einer GGML-Dateigröße von 75 MB läuft es problemlos auf nahezu jeder Hardware – einschließlich Raspberry Pi, älterer Laptops und Mobilgeräte der Einstiegsklasse. Es transkribiert mit etwa 10-facher Echtzeitgeschwindigkeit im Vergleich zum Large-Modell und ist damit die beste Wahl, wenn Latenz wichtiger ist als perfekte Genauigkeit.
- GGML: 75 MiB auf der Festplatte
- RAM: ~273 MB zur Laufzeit
- VRAM: ~1 GB (GPU-Modus)
- ~10x schneller als large
- Nahezu sofort auf Apple Silicon
- Echtzeit auf den meisten CPUs
- Englische WER: ~7,6 %
- Mehrsprachige WER: ~12 %
- Schwierigkeiten bei Akzenten/Störgeräuschen
Bei der Variante tiny.en (nur Englisch) liegt die WER auf LibriSpeech test-clean bei etwa 5,6 % und steigt auf ~14,9 % bei test-other (verrauschtes/akzentuiertes Audio). Das mehrsprachige Tiny-Modell schneidet bei Englisch etwas schlechter ab, unterstützt aber alle 99 Whisper-Sprachen.
Tiny ist ideal für schnelle Notizen, Diktate mit geringem Anspruch, Prototypen für Live-Untertitelung sowie eingebettete oder Edge-Geräte mit begrenzter Rechenleistung. Es ist das standardmäßige Einstiegsmodell vieler whisper.cpp-basierter Tools, da es in Sekunden heruntergeladen ist und sofort läuft.
Base (74 Mio. Parameter)
Das Base-Modell verdoppelt die Parameterzahl von tiny (74 Mio. gegenüber 39 Mio.) und bleibt dabei sehr ressourcenschonend. Mit 142 MiB (GGML) und ~388 MB RAM zur Laufzeit passt es immer noch problemlos auf praktisch jedes moderne Gerät. Die Verbesserung der Genauigkeit gegenüber tiny ist spürbar – besonders bei verrauschtem Audio und akzentuierter Sprache.
- GGML: 142 MiB auf der Festplatte
- RAM: ~388 MB zur Laufzeit
- VRAM: ~1 GB (GPU-Modus)
- ~7x schneller als large
- Auf der CPU immer noch sehr schnell
- Unter einer Sekunde auf Apple Silicon
- Englische WER: ~5,0 %
- Mehrsprachige WER: ~10 %
- Besser bei verrauschtem Audio als tiny
Die Variante base.en erreicht etwa 4,3 % WER auf LibriSpeech test-clean und ~12,8 % auf test-other. Das ist eine deutliche Verbesserung gegenüber tiny.en (5,6 % bzw. 14,9 %), insbesondere bei anspruchsvollem Audio.
Base ist eine gute Wahl für energiesparsame Geräte, bei denen tiny nicht ganz genau genug ist. Es ist auch beliebt für Echtzeit-Transkriptions-Pipelines, in denen du ein ausgewogenes Verhältnis von Geschwindigkeit und Qualität willst, ohne über 500 MB RAM hinauszugehen.
Small (244 Mio. Parameter)
Bei Small beginnt Whisper, sich wirklich genau anzufühlen. Mit 244 Mio. Parametern stellt es einen 3,3-fachen Sprung gegenüber base dar und liefert eine deutliche Verbesserung der Genauigkeit – besonders bei nicht-englischen Sprachen und verrauschten Aufnahmen. Die GGML-Datei ist 466 MiB groß, und der RAM-Bedarf zur Laufzeit liegt bei etwa 852 MB. Es läuft mit rund 4-facher Geschwindigkeit von large.
- GGML: 466 MiB auf der Festplatte
- RAM: ~852 MB zur Laufzeit
- VRAM: ~2 GB (GPU-Modus)
- ~4x schneller als large
- Schnell auf modernen Laptops
- Echtzeit auf Apple Silicon
- Englische WER: ~3,4 %
- Mehrsprachige WER: ~7 %
- Bewältigt Akzente gut
Die Variante small.en erreicht etwa 3,0 % WER auf LibriSpeech test-clean – ein bemerkenswertes Ergebnis für ein Modell, das in unter 500 MB passt. Für viele rein englische Anwendungsfälle bietet small.en eine Genauigkeit, die nahe an medium herankommt, bei einem Bruchteil des Ressourcenbedarfs.
Small wird häufig als Standardmodell für die meisten Nutzer empfohlen. Es läuft gut auf jedem modernen Laptop (einschließlich MacBook Air M1 mit 8 GB RAM), liefert eine gute Genauigkeit über Sprachen hinweg und transkribiert schnell genug für Echtzeit-Diktat-Workflows.
Unsere Empfehlung: Wenn du dir nicht sicher bist, mit welchem Modell du beginnen sollst, starte mit small. Es bietet das beste Gleichgewicht aus Geschwindigkeit, Genauigkeit und Ressourcenbedarf für die meisten Hardware-Konfigurationen und Anwendungsfälle.
Medium (769 Mio. Parameter)
Bei Medium setzt der abnehmende Grenznutzen ein – doch die Genauigkeitsgewinne gegenüber small sind nach wie vor spürbar, besonders bei mehrsprachiger Transkription, Fachvokabular und anspruchsvollen Audiobedingungen. Mit 769 Mio. Parametern benötigt es 1,5 GiB Festplattenspeicher (GGML) und etwa 2,1 GB RAM zur Laufzeit.
- GGML: 1,5 GiB auf der Festplatte
- RAM: ~2,1 GB zur Laufzeit
- VRAM: ~5 GB (GPU-Modus)
- ~2x schneller als large
- Komfortabel auf Maschinen mit 8 GB+
- Benötigt anständige Hardware
- Englische WER: ~2,9 %
- Mehrsprachige WER: ~5 %
- Stark bei technischen Inhalten
Das Modell medium.en erreicht etwa 3,0 % WER auf LibriSpeech test-clean und ungefähr 7,5 % auf test-other. Über breitere Benchmarks hinweg – insbesondere solche mit vielfältigen Akzenten, Hintergrundgeräuschen und domänenspezifischem Vokabular – übertrifft medium small jedoch durchweg.
Medium ist eine starke Wahl für professionelle Transkriptions-Workflows, bei denen Genauigkeit zählt, du aber nicht über die Hardware (oder Geduld) für large verfügst. Es läuft gut auf Maschinen mit 8 GB RAM oder mehr und profitiert erheblich von GPU-Beschleunigung.
Large (1.550 Mio. Parameter)
Das Large-Modell ist die genaueste Whisper-Variante mit 1,55 Milliarden Parametern. Es gibt drei Versionen: large-v1 (die ursprüngliche Veröffentlichung), large-v2 (über 2,5x mehr Epochen mit zusätzlicher Regularisierung trainiert) und large-v3 (mit mehr Daten und 128 statt 80 Mel-Frequenzbändern trainiert). Large-v3 ist die aktuell empfohlene Version für maximale Genauigkeit.
- GGML: 2,9 GiB auf der Festplatte
- RAM: ~3,9 GB zur Laufzeit
- VRAM: ~10 GB (GPU-Modus)
- 1x (Basiswert – am langsamsten)
- GPU dringend empfohlen
- CPU: möglicherweise langsamer als Echtzeit
- Englische WER: ~2,4 % (v3)
- Mehrsprachige WER: ~3,5 % (v3)
- Am besten über alle Sprachen hinweg
large-v2 vs. large-v3
large-v2
- Über 2,5x mehr Epochen trainiert als large-v1
- Zusätzliche Regularisierung für bessere Generalisierung
- LibriSpeech test-clean WER: ~3,0 %
- Stabiler bei einigen Audiotypen
large-v3
- 128 Mel-Bänder (statt 80) – feinere Frequenzauflösung
- Trainiert mit 1 Mio. Stunden gelabeltem + 4 Mio. Stunden pseudo-gelabeltem Audio
- 10–20 % Fehlerreduktion gegenüber large-v2 über Sprachen hinweg
- Unterstützung für Kantonesisch hinzugefügt
Welches Large-Modell verwenden: Verwende für neue Projekte large-v3. Es ist im Durchschnitt über Sprachen hinweg klar besser als large-v2. Einige Nutzer haben jedoch berichtet, dass large-v2 in bestimmten Grenzfällen mit sehr leisen oder stillen Audioabschnitten weniger Halluzinationen erzeugt (also Text generiert, der im Audio nicht vorhanden ist). Wenn bei large-v3 Halluzinationsprobleme auftreten, probiere large-v2 als Ausweichlösung.
Turbo (809 Mio. Parameter)
Das Turbo-Modell ist eine destillierte Version von large-v3, die die Inferenzzeit dramatisch reduziert und dabei den Großteil der Genauigkeit beibehält. OpenAI erreichte dies durch das Beschneiden des Decoders von 32 auf nur 4 Schichten – wodurch die Parameterzahl von 1.550 Mio. auf 809 Mio. sank. Der Encoder (der die Hauptarbeit leistet) bleibt identisch mit large-v3.
- GGML: ~1,6 GiB auf der Festplatte
- RAM: ~2,3 GB zur Laufzeit
- VRAM: ~6 GB (GPU-Modus)
- ~8x schneller als large
- Nahezu large-Genauigkeit, nahezu tiny-Geschwindigkeit
- Großartig auf der GPU mit torch.compile
- Englische WER: ~2,5 %
- Mehrsprachige WER: ~3,7 %
- Geringfügiger Qualitätsverlust gegenüber large-v3
Turbo ist die beste Wahl, wenn du eine Genauigkeit nahe large-v3 willst, dir aber die Latenz des vollständigen Large-Modells nicht leisten kannst. Auf der GPU mit Optimierungen wie torch.compile kann turbo eine bis zu 4,5-fache Geschwindigkeitssteigerung gegenüber der Standard-Inferenz erreichen und ist damit extrem schnell.
Wichtige Einschränkung: Das Turbo-Modell wurde nicht für Übersetzungsaufgaben trainiert. Wenn du Sprache von einer Sprache ins Englische übersetzen musst, verwende stattdessen medium oder large-v3.
Rein englische vs. mehrsprachige Modelle
Für die Größen tiny, base, small und medium bietet Whisper zwei Varianten: ein mehrsprachiges Modell und ein rein englisches ( .en ) Modell. Die Modelle large und turbo sind ausschließlich mehrsprachig – es gibt keine rein englischen Versionen.
Wann .en (nur Englisch) verwenden
- Du transkribierst ausschließlich englisches Audio
- Bessere englische Genauigkeit bei den Größen tiny/base
- Etwas schneller – kein Overhead durch Spracherkennung
- Gleiche Dateigröße wie das mehrsprachige Pendant
Wann mehrsprachig verwenden
- Du transkribierst nicht-englisches Audio
- Dein Audio enthält gemischte Sprachen
- Du benötigst Sprachübersetzung (ins Englische)
- Erforderlich bei der Verwendung von large oder turbo (es existiert keine .en-Variante)
Der Leistungsunterschied zwischen .en- und mehrsprachigen Modellen ist bei kleineren Größen am deutlichsten. Bei tiny und base sind die .en-Varianten merklich besser bei Englisch. Bei small und medium verringert sich der Unterschied erheblich. Auf der large-Ebene gibt es nur ein mehrsprachiges Modell – und es schneidet bei Englisch unabhängig davon hervorragend ab.
Faustregel: Wenn du ausschließlich Englisch verwendest und dich für tiny oder base entscheidest, wähle die .en-Variante. Für small oder größer funktioniert die mehrsprachige Version hervorragend für Englisch und gibt dir Flexibilität für andere Sprachen.
Hardware-Anforderungen: Was läuft wo
Die benötigte Hardware hängt stark von der Modellgröße ab und davon, ob du whisper.cpp (CPU/Metal/CUDA) oder die PyTorch-Implementierung (GPU-fokussiert) verwendest. Hier ist, was du auf gängigen Hardware-Klassen erwarten kannst.
MacBook Air M1 (8 GB RAM)
- tiny/base: Sofort. Schneller als Echtzeit.
- small: Schnell. Echtzeit oder besser mit Metal.
- medium: Nutzbar. Auf der CPU möglicherweise etwas langsamer als Echtzeit. Metal hilft erheblich.
- large: Möglich, aber beim RAM knapp. Rechne damit, dass es langsamer als Echtzeit läuft.
- turbo: Gut geeignet. Nahezu Echtzeit mit Metal-Beschleunigung.
MacBook Pro M2/M3 (16–36 GB RAM)
- tiny/base/small: Sofort. Alle deutlich innerhalb der Hardware-Grenzen.
- medium: Schnell. Komfortabel mit Metal.
- large: Gut. Echtzeit oder nahe daran mit Metal.
- turbo: Hervorragend. Schnelle Echtzeit-Transkription.
Mittelklasse-Windows/Linux-Laptop (8 GB RAM, integrierte GPU)
- tiny/base: Schnell. Nur CPU ist in Ordnung.
- small: Gut. Komfortabel auf den meisten modernen CPUs.
- medium: Machbar. Auf der CPU möglicherweise 2–3x langsamer als Echtzeit.
- large: Anspruchsvoll. Nur mit CPU wird es langsam.
- turbo: Machbar. Profitiert von Vulkan, falls verfügbar.
Desktop mit NVIDIA-GPU (RTX 3060+, 8 GB+ VRAM)
- Alle Modelle: Schnell. Die GPU bewältigt alles problemlos.
- large: Benötigt 10 GB VRAM (RTX 3060 12GB oder besser).
- turbo: Schnellste Option mit CUDA. Deutlich schneller als large.
- Verwende das CUDA-Backend in whisper.cpp für beste Leistung.
whisper.cpp Beschleunigungs-Backends
whisper.cpp – die C/C++-Portierung, die die meisten Desktop-Apps verwenden – unterstützt mehrere Hardware-Beschleunigungs-Backends, die die Leistung dramatisch verbessern können:
Metal (Apple Silicon)
Vollständige GPU-Inferenz auf M1/M2/M3/M4-Macs. Führt das gesamte Modell auf der GPU aus, ganz ohne Speicherkopien. Dies ist das schnellste Backend für macOS-Nutzer und das, was OpenWhispr auf dem Mac verwendet.
Core ML (Apple)
Nutzt Apples Neural Engine für die Inferenz. Kann bei einigen Modellgrößen auf neueren Chips schneller als Metal und energieeffizienter sein. Erfordert zunächst die Konvertierung der Modelle in das Core ML-Format.
CUDA (NVIDIA)
GPU-Beschleunigung für NVIDIA-Karten. Schnellstes Backend für Nutzer mit dedizierten NVIDIA-GPUs. Erfordert das CUDA-Toolkit. Beste Wahl für large- und turbo-Modelle auf dem Desktop.
Vulkan (herstellerübergreifende GPU)
Funktioniert mit Intel-, AMD- und NVIDIA-GPUs. Gute Ausweichlösung für Nicht-NVIDIA-Systeme. Verfügbar unter Linux und Windows. Die Leistung variiert je nach GPU-Hersteller und Treiber.
Ungefähre Transkriptionsgeschwindigkeit
Echtzeitfaktor (RTF) für einen 60-sekündigen Audioclip. RTF < 1,0 bedeutet schneller als Echtzeit. Dies sind grobe Schätzungen – die tatsächliche Leistung hängt von Audioinhalt, Modellquantisierung und Systemauslastung ab.
| Modell | M1 MacBook Air | M3 Pro MacBook | Intel i7 (CPU) | RTX 3060 (CUDA) |
|---|---|---|---|---|
| tiny | ~0.05x | ~0.03x | ~0.1x | ~0.02x |
| base | ~0.08x | ~0.05x | ~0.15x | ~0.04x |
| small | ~0.2x | ~0.12x | ~0.4x | ~0.08x |
| medium | ~0.6x | ~0.3x | ~1.2x | ~0.15x |
| large-v3 | ~1.5x | ~0.7x | ~3.0x | ~0.3x |
| turbo | ~0.3x | ~0.15x | ~0.6x | ~0.08x |
So liest du die Tabelle: 0,1x bedeutet, dass die Transkription von 60 Sekunden Audio etwa 6 Sekunden dauert. 1,0x = Echtzeit. Werte über 1,0x bedeuten langsamer als Echtzeit. Alle Angaben verwenden whisper.cpp mit Standardeinstellungen und dem Metal- (Mac) bzw. CUDA-Backend (NVIDIA), wo zutreffend.
Welches Modell solltest du verwenden?
Hier sind konkrete Empfehlungen für gängige Szenarien. Im Zweifelsfall beginne mit small und arbeite dich je nach Erfahrung nach oben oder unten.
„Ich will die schnellstmögliche Variante“
Verwende tiny oder tiny.en . Transkribiert in Millisekunden auf moderner Hardware. Die Genauigkeit ist grob, aber für schnelle Notizen und Diktate mit geringem Anspruch brauchbar.
tiny / tiny.en„Ich will gute Genauigkeit auf einem Laptop“
Verwende small . Bestes Gleichgewicht aus Geschwindigkeit und Genauigkeit für moderne Laptops. Wenn deine Maschine 16 GB+ RAM hat, ist medium ebenfalls eine ausgezeichnete Wahl.
small oder medium„Ich will die beste Genauigkeit“
Verwende large-v3 . Es ist insgesamt das genaueste Whisper-Modell. Wenn auch die Geschwindigkeit zählt, turbo bietet dir 95 % der Genauigkeit bei 8-facher Geschwindigkeit.
large-v3 oder turbo„Ich verwende nur Englisch“
Verwende die .en Variante deiner gewählten Größe für die beste englische Genauigkeit. Bei tiny und base sind die .en-Modelle merklich besser. Ab small+ ist der Unterschied minimal.
small.en oder medium.en„Ich verwende mehrere Sprachen“
Verwende die mehrsprachige Variante. small oder medium für ausgewogene Leistung. large-v3 für beste mehrsprachige Genauigkeit.
small, medium oder large-v3„Ich habe sehr begrenzte Hardware“
Verwende tiny oder base . Beide laufen mit 1 GB RAM und funktionieren sogar auf Raspberry Pi und anderen Single-Board-Computern. Base bietet einen spürbaren Genauigkeitsschub gegenüber tiny bei minimalem Mehraufwand.
tiny oder baseWie OpenWhispr die Modellauswahl handhabt
OpenWhispr ist eine quelloffene Desktop-Diktier-App, die unter der Haube whisper.cpp verwendet. Du kannst damit jedes beliebige Whisper-Modell direkt aus den Einstellungen herunterladen und wechseln – ganz ohne Kommandozeile. Modelle werden einmal heruntergeladen und lokal gespeichert. Du kannst die Modelle jederzeit wechseln, um Geschwindigkeit und Genauigkeit für deine Hardware abzustimmen.
Jedes Modell herunterladen
Wähle in den Einstellungen von tiny bis large-v3. OpenWhispr lädt die GGML-Version automatisch herunter.
Sofort wechseln
Wechsle die Modelle jederzeit. Kein Neustart erforderlich. Teste verschiedene Größen, um herauszufinden, was auf deiner Hardware am besten funktioniert.
Hardware-optimiert
Verwendet Metal auf Apple Silicon, CUDA auf NVIDIA und optimierte CPU-Inferenz auf allen anderen Systemen. Alles lokal, alles privat.
Unser Vorschlag: Beginne mit small . Wenn es sich langsam anfühlt, wechsle hinunter zu base oder tiny. Wenn du eine bessere Genauigkeit willst und deine Hardware es bewältigen kann, wechsle hinauf zu medium oder large-v3. OpenWhispr macht das Experimentieren leicht.
Quellen
- Radford et al. „Robust Speech Recognition via Large-Scale Weak Supervision“ (2022) – Das ursprüngliche Whisper-Paper mit vollständigen Benchmark-Ergebnissen.
- OpenAI Whisper GitHub-Repository – Offizielle Modelltabelle, Parameterzahlen, VRAM-Anforderungen und relative Geschwindigkeitswerte.
- OpenAI Whisper Model Card – Offizielle Zusammensetzung der Trainingsdaten und Bewertungsvorbehalte.
- whisper.cpp GitHub-Repository – GGML-Modellgrößen, RAM-Nutzung und Details zur Hardware-Beschleunigung.
- Whisper large-v2 Model Card (HuggingFace) – LibriSpeech-Benchmark-Kontext, der in vielen WER-Vergleichen verwendet wird.
- Whisper large-v3 Model Card (HuggingFace) – Trainingsdetails, Architekturänderungen gegenüber large-v2 und Verbesserungen bei der Mehrsprachigkeit.
- Whisper large-v3-turbo Model Card (HuggingFace) – Details zur Turbo-Architektur, Besonderheiten des Decoder-Beschneidens und Leistungskompromisse.
- OpenAI Whisper Turbo Ankündigung (GitHub-Diskussion #2363) – Offizielle Turbo-Release-Notes und sprachübergreifende Leistungsvergleiche.
- OpenWhispr – Praxisnaher Kontext zur lokalen Bereitstellung für die Wahl der Modellgrößen.
Probiere verschiedene Whisper-Modelle in OpenWhispr aus
Quelloffenes, lokal-orientiertes Diktieren. Lade jedes beliebige Whisper-Modell herunter, wechsle mit einem Klick zwischen den Größen und finde das perfekte Gleichgewicht für deine Hardware.
Kein Konto erforderlich · Funktioniert offline · Für immer quelloffen