Blog

Whisper-Modellgrößen erklärt: Tiny vs. Base vs. Small vs. Medium vs. Large

Jedes Whisper-Modell im Vergleich. Parameter, Geschwindigkeit, Genauigkeit und welches du tatsächlich verwenden solltest.

OpenWhispr

OpenWhispr

Ingenieurwesen

5. Februar 2026
Inhaltsverzeichnis

OpenAIs Whisper ist in 9 Modellvarianten über 5 Größenkategorien hinweg verfügbar: tiny (39 Mio. Parameter), base (74 Mio.), small (244 Mio.), medium (769 Mio.) und large (1,55 Mrd.). Jede Größe gibt es in einer mehrsprachigen Version und einer rein englischen Version (außer large und turbo, die ausschließlich mehrsprachig sind). Es gibt außerdem ein Turbo-Modell (809 Mio.) – eine destillierte Version von large-v3, die nahezu genauso präzise, aber dramatisch schneller ist. Größere Modelle sind genauer, aber langsamer und benötigen mehr Speicher.

Für das von den meisten lokalen Transkriptions-Apps verwendete quantisierte whisper.cpp-Format (GGML) reichen die Modelldateien von 75 MB (tiny) bis 2,9 GB (large). Der Speicherbedarf zur Laufzeit liegt zwischen etwa 273 MB für tiny und 3,9 GB für large. Das richtige Modell hängt von deiner Hardware, deiner Sprache und der benötigten Genauigkeit ab.

Zuletzt aktualisiert: 17. Februar 2026. Angaben zu Parametern, Speicher und Benchmarks werden gegen mindestens zwei Primärquellen abgeglichen.

Faktencheck im Überblick (Doppelte Quellen)

  • Offizielle Modellfamilien und Parameterzahlen: tiny/base/small/medium/large sowie turbo sind von OpenAI dokumentiert. OpenAI Whisper README · Whisper Model Card
  • Kontext zu GGML/GGUF-Festplatten- und Laufzeitspeicher: die Speicheranforderungen für lokale Bereitstellungen stammen aus der whisper.cpp-Konvertierungs-/Laufzeit-Dokumentation. whisper.cpp · whisper.cpp Speicher-Hinweise
  • Benchmark-Vorbehalt: die WER schwankt stark je nach Datensatz und Sprache; LibriSpeech-Werte sind kein universeller Qualitätsmaßstab. Whisper-Paper · large-v2 Model Card
  • Einordnung des Turbo-Modells: turbo ist eine geschwindigkeitsorientierte Variante mit Genauigkeitskompromissen, die in den Release Notes/Model Cards dokumentiert sind. turbo Model Card · turbo Release-Diskussion
  • Nutzungskontext von OpenWhispr: OpenWhispr stellt mehrere Whisper-Größen bereit, sodass Nutzer Geschwindigkeit und Genauigkeit direkt auf dem Gerät abstimmen können. OpenWhispr · whisper.cpp Backend

Whisper Modellgrößen: Geschwindigkeit vs. Genauigkeit

Die Blasengröße spiegelt die relative Parameteranzahl wider

Schneller →Genauer →tinybasesmallmediumlargeturboEmpfehlung: Klein anfangen, je nach Hardware anpassen.

Wortfehlerrate: Whisper im Vergleich zu Open-Source-Konkurrenten

LibriSpeech test-clean (englische Leserede) – niedriger ist besser

NVIDIA
Andere Open Source
OpenAI Whisper

Quellen: Hugging Face Modellkarten, NVIDIA Modellkarten, Open ASR Leaderboard (Feb 2026). Nur klare, englischsprachige Vorlesung – die tatsächliche Genauigkeit variiert je nach Audioqualität, Akzent und Domäne. Kommerzielle APIs wurden weggelassen, da sie keine LibriSpeech-Benchmarks veröffentlichen.

Der komplette Modellvergleich

Diese Tabelle deckt jedes offizielle Whisper-Modell ab. „Relative Geschwindigkeit“ ist relativ zu large (1x als Basiswert). Die VRAM-Werte gelten für PyTorch-Inferenz auf der GPU. Die GGML-Spalten zeigen Dateigrößen und RAM-Nutzung für whisper.cpp, das von den meisten Desktop-Apps verwendet wird.

ModellParameterNur EnglischVRAM (GPU)GGML FestplatteRAM (whisper.cpp)GeschwindigkeitEnglische WERMehrsprachige WER
tiny39 Mtiny.en~1 GB75 MiB~273 MB~10x~7.6%~12%
base74 Mbase.en~1 GB142 MiB~388 MB~7x~5.0%~10%
small244 Msmall.en~2 GB466 MiB~852 MB~4x~3.4%~7%
medium769 Mmedium.en~5 GB1.5 GiB~2.1 GB~2x~2.9%~5%
large-v21,550 Mk. A.~10 GB2.9 GiB~3.9 GB1x~2.7%~4%
large-v31,550 Mk. A.~10 GB2.9 GiB~3.9 GB1x~2.4%~3.5%
turbo809 Mk. A.~6 GB1.6 GiB~2.3 GB~8x~2.5%~3.7%

Hinweise: Die WER-Werte (Word Error Rate, Wortfehlerrate) sind ungefähre Durchschnittswerte aus dem Whisper-Paper, den HuggingFace Model Cards (LibriSpeech-Testsets für Englisch) und den von OpenAI veröffentlichten Benchmarks. Die genaue WER variiert erheblich je nach Datensatz, Sprache, Audioqualität und Bewertungsmethodik. Niedriger ist besser. Die Geschwindigkeit ist relativ zu large (1x = am langsamsten).

Tiny (39 Mio. Parameter)

Das Tiny-Modell ist die kleinste und schnellste Whisper-Variante. Mit nur 39 Millionen Parametern und einer GGML-Dateigröße von 75 MB läuft es problemlos auf nahezu jeder Hardware – einschließlich Raspberry Pi, älterer Laptops und Mobilgeräte der Einstiegsklasse. Es transkribiert mit etwa 10-facher Echtzeitgeschwindigkeit im Vergleich zum Large-Modell und ist damit die beste Wahl, wenn Latenz wichtiger ist als perfekte Genauigkeit.

Ressourcen
  • GGML: 75 MiB auf der Festplatte
  • RAM: ~273 MB zur Laufzeit
  • VRAM: ~1 GB (GPU-Modus)
Geschwindigkeit
  • ~10x schneller als large
  • Nahezu sofort auf Apple Silicon
  • Echtzeit auf den meisten CPUs
Genauigkeit
  • Englische WER: ~7,6 %
  • Mehrsprachige WER: ~12 %
  • Schwierigkeiten bei Akzenten/Störgeräuschen

Bei der Variante tiny.en (nur Englisch) liegt die WER auf LibriSpeech test-clean bei etwa 5,6 % und steigt auf ~14,9 % bei test-other (verrauschtes/akzentuiertes Audio). Das mehrsprachige Tiny-Modell schneidet bei Englisch etwas schlechter ab, unterstützt aber alle 99 Whisper-Sprachen.

Tiny ist ideal für schnelle Notizen, Diktate mit geringem Anspruch, Prototypen für Live-Untertitelung sowie eingebettete oder Edge-Geräte mit begrenzter Rechenleistung. Es ist das standardmäßige Einstiegsmodell vieler whisper.cpp-basierter Tools, da es in Sekunden heruntergeladen ist und sofort läuft.

Am besten geeignet für: Schnellstmögliche Transkription, ressourcenschwache Hardware, Raspberry Pi, Echtzeitanwendungen

Base (74 Mio. Parameter)

Das Base-Modell verdoppelt die Parameterzahl von tiny (74 Mio. gegenüber 39 Mio.) und bleibt dabei sehr ressourcenschonend. Mit 142 MiB (GGML) und ~388 MB RAM zur Laufzeit passt es immer noch problemlos auf praktisch jedes moderne Gerät. Die Verbesserung der Genauigkeit gegenüber tiny ist spürbar – besonders bei verrauschtem Audio und akzentuierter Sprache.

Ressourcen
  • GGML: 142 MiB auf der Festplatte
  • RAM: ~388 MB zur Laufzeit
  • VRAM: ~1 GB (GPU-Modus)
Geschwindigkeit
  • ~7x schneller als large
  • Auf der CPU immer noch sehr schnell
  • Unter einer Sekunde auf Apple Silicon
Genauigkeit
  • Englische WER: ~5,0 %
  • Mehrsprachige WER: ~10 %
  • Besser bei verrauschtem Audio als tiny

Die Variante base.en erreicht etwa 4,3 % WER auf LibriSpeech test-clean und ~12,8 % auf test-other. Das ist eine deutliche Verbesserung gegenüber tiny.en (5,6 % bzw. 14,9 %), insbesondere bei anspruchsvollem Audio.

Base ist eine gute Wahl für energiesparsame Geräte, bei denen tiny nicht ganz genau genug ist. Es ist auch beliebt für Echtzeit-Transkriptions-Pipelines, in denen du ein ausgewogenes Verhältnis von Geschwindigkeit und Qualität willst, ohne über 500 MB RAM hinauszugehen.

Am besten geeignet für: Energiesparsame Geräte, die mehr Genauigkeit als tiny benötigen, Echtzeit-Streaming, preisgünstige Hardware

Small (244 Mio. Parameter)

Bei Small beginnt Whisper, sich wirklich genau anzufühlen. Mit 244 Mio. Parametern stellt es einen 3,3-fachen Sprung gegenüber base dar und liefert eine deutliche Verbesserung der Genauigkeit – besonders bei nicht-englischen Sprachen und verrauschten Aufnahmen. Die GGML-Datei ist 466 MiB groß, und der RAM-Bedarf zur Laufzeit liegt bei etwa 852 MB. Es läuft mit rund 4-facher Geschwindigkeit von large.

Ressourcen
  • GGML: 466 MiB auf der Festplatte
  • RAM: ~852 MB zur Laufzeit
  • VRAM: ~2 GB (GPU-Modus)
Geschwindigkeit
  • ~4x schneller als large
  • Schnell auf modernen Laptops
  • Echtzeit auf Apple Silicon
Genauigkeit
  • Englische WER: ~3,4 %
  • Mehrsprachige WER: ~7 %
  • Bewältigt Akzente gut

Die Variante small.en erreicht etwa 3,0 % WER auf LibriSpeech test-clean – ein bemerkenswertes Ergebnis für ein Modell, das in unter 500 MB passt. Für viele rein englische Anwendungsfälle bietet small.en eine Genauigkeit, die nahe an medium herankommt, bei einem Bruchteil des Ressourcenbedarfs.

Small wird häufig als Standardmodell für die meisten Nutzer empfohlen. Es läuft gut auf jedem modernen Laptop (einschließlich MacBook Air M1 mit 8 GB RAM), liefert eine gute Genauigkeit über Sprachen hinweg und transkribiert schnell genug für Echtzeit-Diktat-Workflows.

Unsere Empfehlung: Wenn du dir nicht sicher bist, mit welchem Modell du beginnen sollst, starte mit small. Es bietet das beste Gleichgewicht aus Geschwindigkeit, Genauigkeit und Ressourcenbedarf für die meisten Hardware-Konfigurationen und Anwendungsfälle.

Am besten geeignet für: Die meisten Nutzer auf modernen Laptops, empfohlenes Standardmodell, gute Mehrsprachigkeitsunterstützung

Medium (769 Mio. Parameter)

Bei Medium setzt der abnehmende Grenznutzen ein – doch die Genauigkeitsgewinne gegenüber small sind nach wie vor spürbar, besonders bei mehrsprachiger Transkription, Fachvokabular und anspruchsvollen Audiobedingungen. Mit 769 Mio. Parametern benötigt es 1,5 GiB Festplattenspeicher (GGML) und etwa 2,1 GB RAM zur Laufzeit.

Ressourcen
  • GGML: 1,5 GiB auf der Festplatte
  • RAM: ~2,1 GB zur Laufzeit
  • VRAM: ~5 GB (GPU-Modus)
Geschwindigkeit
  • ~2x schneller als large
  • Komfortabel auf Maschinen mit 8 GB+
  • Benötigt anständige Hardware
Genauigkeit
  • Englische WER: ~2,9 %
  • Mehrsprachige WER: ~5 %
  • Stark bei technischen Inhalten

Das Modell medium.en erreicht etwa 3,0 % WER auf LibriSpeech test-clean und ungefähr 7,5 % auf test-other. Über breitere Benchmarks hinweg – insbesondere solche mit vielfältigen Akzenten, Hintergrundgeräuschen und domänenspezifischem Vokabular – übertrifft medium small jedoch durchweg.

Medium ist eine starke Wahl für professionelle Transkriptions-Workflows, bei denen Genauigkeit zählt, du aber nicht über die Hardware (oder Geduld) für large verfügst. Es läuft gut auf Maschinen mit 8 GB RAM oder mehr und profitiert erheblich von GPU-Beschleunigung.

Am besten geeignet für: Professionelle Nutzung, mehrsprachige Transkription, technische Inhalte, Maschinen mit 8 GB+ RAM

Large (1.550 Mio. Parameter)

Das Large-Modell ist die genaueste Whisper-Variante mit 1,55 Milliarden Parametern. Es gibt drei Versionen: large-v1 (die ursprüngliche Veröffentlichung), large-v2 (über 2,5x mehr Epochen mit zusätzlicher Regularisierung trainiert) und large-v3 (mit mehr Daten und 128 statt 80 Mel-Frequenzbändern trainiert). Large-v3 ist die aktuell empfohlene Version für maximale Genauigkeit.

Ressourcen
  • GGML: 2,9 GiB auf der Festplatte
  • RAM: ~3,9 GB zur Laufzeit
  • VRAM: ~10 GB (GPU-Modus)
Geschwindigkeit
  • 1x (Basiswert – am langsamsten)
  • GPU dringend empfohlen
  • CPU: möglicherweise langsamer als Echtzeit
Genauigkeit
  • Englische WER: ~2,4 % (v3)
  • Mehrsprachige WER: ~3,5 % (v3)
  • Am besten über alle Sprachen hinweg

large-v2 vs. large-v3

large-v2

  • Über 2,5x mehr Epochen trainiert als large-v1
  • Zusätzliche Regularisierung für bessere Generalisierung
  • LibriSpeech test-clean WER: ~3,0 %
  • Stabiler bei einigen Audiotypen

large-v3

  • 128 Mel-Bänder (statt 80) – feinere Frequenzauflösung
  • Trainiert mit 1 Mio. Stunden gelabeltem + 4 Mio. Stunden pseudo-gelabeltem Audio
  • 10–20 % Fehlerreduktion gegenüber large-v2 über Sprachen hinweg
  • Unterstützung für Kantonesisch hinzugefügt

Welches Large-Modell verwenden: Verwende für neue Projekte large-v3. Es ist im Durchschnitt über Sprachen hinweg klar besser als large-v2. Einige Nutzer haben jedoch berichtet, dass large-v2 in bestimmten Grenzfällen mit sehr leisen oder stillen Audioabschnitten weniger Halluzinationen erzeugt (also Text generiert, der im Audio nicht vorhanden ist). Wenn bei large-v3 Halluzinationsprobleme auftreten, probiere large-v2 als Ausweichlösung.

Am besten geeignet für: Maximale Genauigkeit, professionelle/medizinische/juristische Transkription, ressourcenarme Sprachen, Stapelverarbeitung

Turbo (809 Mio. Parameter)

Das Turbo-Modell ist eine destillierte Version von large-v3, die die Inferenzzeit dramatisch reduziert und dabei den Großteil der Genauigkeit beibehält. OpenAI erreichte dies durch das Beschneiden des Decoders von 32 auf nur 4 Schichten – wodurch die Parameterzahl von 1.550 Mio. auf 809 Mio. sank. Der Encoder (der die Hauptarbeit leistet) bleibt identisch mit large-v3.

Ressourcen
  • GGML: ~1,6 GiB auf der Festplatte
  • RAM: ~2,3 GB zur Laufzeit
  • VRAM: ~6 GB (GPU-Modus)
Geschwindigkeit
  • ~8x schneller als large
  • Nahezu large-Genauigkeit, nahezu tiny-Geschwindigkeit
  • Großartig auf der GPU mit torch.compile
Genauigkeit
  • Englische WER: ~2,5 %
  • Mehrsprachige WER: ~3,7 %
  • Geringfügiger Qualitätsverlust gegenüber large-v3

Turbo ist die beste Wahl, wenn du eine Genauigkeit nahe large-v3 willst, dir aber die Latenz des vollständigen Large-Modells nicht leisten kannst. Auf der GPU mit Optimierungen wie torch.compile kann turbo eine bis zu 4,5-fache Geschwindigkeitssteigerung gegenüber der Standard-Inferenz erreichen und ist damit extrem schnell.

Wichtige Einschränkung: Das Turbo-Modell wurde nicht für Übersetzungsaufgaben trainiert. Wenn du Sprache von einer Sprache ins Englische übersetzen musst, verwende stattdessen medium oder large-v3.

Am besten geeignet für: Hochpräzise Echtzeit-Transkription, latenzsensible Apps, wenn large-v3 zu langsam ist

Rein englische vs. mehrsprachige Modelle

Für die Größen tiny, base, small und medium bietet Whisper zwei Varianten: ein mehrsprachiges Modell und ein rein englisches ( .en ) Modell. Die Modelle large und turbo sind ausschließlich mehrsprachig – es gibt keine rein englischen Versionen.

Wann .en (nur Englisch) verwenden

  • Du transkribierst ausschließlich englisches Audio
  • Bessere englische Genauigkeit bei den Größen tiny/base
  • Etwas schneller – kein Overhead durch Spracherkennung
  • Gleiche Dateigröße wie das mehrsprachige Pendant

Wann mehrsprachig verwenden

  • Du transkribierst nicht-englisches Audio
  • Dein Audio enthält gemischte Sprachen
  • Du benötigst Sprachübersetzung (ins Englische)
  • Erforderlich bei der Verwendung von large oder turbo (es existiert keine .en-Variante)

Der Leistungsunterschied zwischen .en- und mehrsprachigen Modellen ist bei kleineren Größen am deutlichsten. Bei tiny und base sind die .en-Varianten merklich besser bei Englisch. Bei small und medium verringert sich der Unterschied erheblich. Auf der large-Ebene gibt es nur ein mehrsprachiges Modell – und es schneidet bei Englisch unabhängig davon hervorragend ab.

Faustregel: Wenn du ausschließlich Englisch verwendest und dich für tiny oder base entscheidest, wähle die .en-Variante. Für small oder größer funktioniert die mehrsprachige Version hervorragend für Englisch und gibt dir Flexibilität für andere Sprachen.

Hardware-Anforderungen: Was läuft wo

Die benötigte Hardware hängt stark von der Modellgröße ab und davon, ob du whisper.cpp (CPU/Metal/CUDA) oder die PyTorch-Implementierung (GPU-fokussiert) verwendest. Hier ist, was du auf gängigen Hardware-Klassen erwarten kannst.

MacBook Air M1 (8 GB RAM)

  • tiny/base: Sofort. Schneller als Echtzeit.
  • small: Schnell. Echtzeit oder besser mit Metal.
  • medium: Nutzbar. Auf der CPU möglicherweise etwas langsamer als Echtzeit. Metal hilft erheblich.
  • large: Möglich, aber beim RAM knapp. Rechne damit, dass es langsamer als Echtzeit läuft.
  • turbo: Gut geeignet. Nahezu Echtzeit mit Metal-Beschleunigung.

MacBook Pro M2/M3 (16–36 GB RAM)

  • tiny/base/small: Sofort. Alle deutlich innerhalb der Hardware-Grenzen.
  • medium: Schnell. Komfortabel mit Metal.
  • large: Gut. Echtzeit oder nahe daran mit Metal.
  • turbo: Hervorragend. Schnelle Echtzeit-Transkription.

Mittelklasse-Windows/Linux-Laptop (8 GB RAM, integrierte GPU)

  • tiny/base: Schnell. Nur CPU ist in Ordnung.
  • small: Gut. Komfortabel auf den meisten modernen CPUs.
  • medium: Machbar. Auf der CPU möglicherweise 2–3x langsamer als Echtzeit.
  • large: Anspruchsvoll. Nur mit CPU wird es langsam.
  • turbo: Machbar. Profitiert von Vulkan, falls verfügbar.

Desktop mit NVIDIA-GPU (RTX 3060+, 8 GB+ VRAM)

  • Alle Modelle: Schnell. Die GPU bewältigt alles problemlos.
  • large: Benötigt 10 GB VRAM (RTX 3060 12GB oder besser).
  • turbo: Schnellste Option mit CUDA. Deutlich schneller als large.
  • Verwende das CUDA-Backend in whisper.cpp für beste Leistung.

whisper.cpp Beschleunigungs-Backends

whisper.cpp – die C/C++-Portierung, die die meisten Desktop-Apps verwenden – unterstützt mehrere Hardware-Beschleunigungs-Backends, die die Leistung dramatisch verbessern können:

Metal (Apple Silicon)

Vollständige GPU-Inferenz auf M1/M2/M3/M4-Macs. Führt das gesamte Modell auf der GPU aus, ganz ohne Speicherkopien. Dies ist das schnellste Backend für macOS-Nutzer und das, was OpenWhispr auf dem Mac verwendet.

Core ML (Apple)

Nutzt Apples Neural Engine für die Inferenz. Kann bei einigen Modellgrößen auf neueren Chips schneller als Metal und energieeffizienter sein. Erfordert zunächst die Konvertierung der Modelle in das Core ML-Format.

CUDA (NVIDIA)

GPU-Beschleunigung für NVIDIA-Karten. Schnellstes Backend für Nutzer mit dedizierten NVIDIA-GPUs. Erfordert das CUDA-Toolkit. Beste Wahl für large- und turbo-Modelle auf dem Desktop.

Vulkan (herstellerübergreifende GPU)

Funktioniert mit Intel-, AMD- und NVIDIA-GPUs. Gute Ausweichlösung für Nicht-NVIDIA-Systeme. Verfügbar unter Linux und Windows. Die Leistung variiert je nach GPU-Hersteller und Treiber.

Ungefähre Transkriptionsgeschwindigkeit

Echtzeitfaktor (RTF) für einen 60-sekündigen Audioclip. RTF < 1,0 bedeutet schneller als Echtzeit. Dies sind grobe Schätzungen – die tatsächliche Leistung hängt von Audioinhalt, Modellquantisierung und Systemauslastung ab.

ModellM1 MacBook AirM3 Pro MacBookIntel i7 (CPU)RTX 3060 (CUDA)
tiny~0.05x~0.03x~0.1x~0.02x
base~0.08x~0.05x~0.15x~0.04x
small~0.2x~0.12x~0.4x~0.08x
medium~0.6x~0.3x~1.2x~0.15x
large-v3~1.5x~0.7x~3.0x~0.3x
turbo~0.3x~0.15x~0.6x~0.08x

So liest du die Tabelle: 0,1x bedeutet, dass die Transkription von 60 Sekunden Audio etwa 6 Sekunden dauert. 1,0x = Echtzeit. Werte über 1,0x bedeuten langsamer als Echtzeit. Alle Angaben verwenden whisper.cpp mit Standardeinstellungen und dem Metal- (Mac) bzw. CUDA-Backend (NVIDIA), wo zutreffend.

Welches Modell solltest du verwenden?

Hier sind konkrete Empfehlungen für gängige Szenarien. Im Zweifelsfall beginne mit small und arbeite dich je nach Erfahrung nach oben oder unten.

„Ich will die schnellstmögliche Variante“

Verwende tiny oder tiny.en . Transkribiert in Millisekunden auf moderner Hardware. Die Genauigkeit ist grob, aber für schnelle Notizen und Diktate mit geringem Anspruch brauchbar.

tiny / tiny.en

„Ich will gute Genauigkeit auf einem Laptop“

Verwende small . Bestes Gleichgewicht aus Geschwindigkeit und Genauigkeit für moderne Laptops. Wenn deine Maschine 16 GB+ RAM hat, ist medium ebenfalls eine ausgezeichnete Wahl.

small oder medium

„Ich will die beste Genauigkeit“

Verwende large-v3 . Es ist insgesamt das genaueste Whisper-Modell. Wenn auch die Geschwindigkeit zählt, turbo bietet dir 95 % der Genauigkeit bei 8-facher Geschwindigkeit.

large-v3 oder turbo

„Ich verwende nur Englisch“

Verwende die .en Variante deiner gewählten Größe für die beste englische Genauigkeit. Bei tiny und base sind die .en-Modelle merklich besser. Ab small+ ist der Unterschied minimal.

small.en oder medium.en

„Ich verwende mehrere Sprachen“

Verwende die mehrsprachige Variante. small oder medium für ausgewogene Leistung. large-v3 für beste mehrsprachige Genauigkeit.

small, medium oder large-v3

„Ich habe sehr begrenzte Hardware“

Verwende tiny oder base . Beide laufen mit 1 GB RAM und funktionieren sogar auf Raspberry Pi und anderen Single-Board-Computern. Base bietet einen spürbaren Genauigkeitsschub gegenüber tiny bei minimalem Mehraufwand.

tiny oder base

Wie OpenWhispr die Modellauswahl handhabt

OpenWhispr ist eine quelloffene Desktop-Diktier-App, die unter der Haube whisper.cpp verwendet. Du kannst damit jedes beliebige Whisper-Modell direkt aus den Einstellungen herunterladen und wechseln – ganz ohne Kommandozeile. Modelle werden einmal heruntergeladen und lokal gespeichert. Du kannst die Modelle jederzeit wechseln, um Geschwindigkeit und Genauigkeit für deine Hardware abzustimmen.

Jedes Modell herunterladen

Wähle in den Einstellungen von tiny bis large-v3. OpenWhispr lädt die GGML-Version automatisch herunter.

Sofort wechseln

Wechsle die Modelle jederzeit. Kein Neustart erforderlich. Teste verschiedene Größen, um herauszufinden, was auf deiner Hardware am besten funktioniert.

Hardware-optimiert

Verwendet Metal auf Apple Silicon, CUDA auf NVIDIA und optimierte CPU-Inferenz auf allen anderen Systemen. Alles lokal, alles privat.

Unser Vorschlag: Beginne mit small . Wenn es sich langsam anfühlt, wechsle hinunter zu base oder tiny. Wenn du eine bessere Genauigkeit willst und deine Hardware es bewältigen kann, wechsle hinauf zu medium oder large-v3. OpenWhispr macht das Experimentieren leicht.

Quellen

Probiere verschiedene Whisper-Modelle in OpenWhispr aus

Quelloffenes, lokal-orientiertes Diktieren. Lade jedes beliebige Whisper-Modell herunter, wechsle mit einem Klick zwischen den Größen und finde das perfekte Gleichgewicht für deine Hardware.

Kein Konto erforderlich · Funktioniert offline · Für immer quelloffen