Die besten Diktiertools für Linux 2026
Linux-Nutzer wurden bei Diktiersoftware jahrelang vernachlässigt. Das ändert sich endlich. Hier sind alle praktikablen Optionen im Jahr 2026, ehrlich verglichen.
OpenWhispr
Ingenieurwesen
Inhaltsverzeichnis
Welches Diktiertool 2026 das beste für Linux ist, hängt davon ab, was du brauchst. Für die meisten Nutzer, die ein ausgereiftes, sofort einsatzbereites Erlebnis mit KI-gestützter Textaufbereitung wollen, bietet OpenWhispr das vollständigste Gesamtpaket: Push-to-Talk-Diktat auf Basis von whisper.cpp, systemweite Hotkey-Unterstützung, mehr als 99 Sprachen und optionale KI-Formatierung – alles Open Source. Für CLI-orientierte Nutzer, die minimale Abhängigkeiten wollen, ist Nerd Dictation hervorragend. KDE- und Qt-Nutzer sollten sich Speech Note ansehen. Entwickler, die Audio gerne über das Terminal durchschleusen, können whisper.cpp direkt verwenden. Und wenn du eine vollständige, freihändige Computersteuerung jenseits des reinen Diktierens brauchst, spielt Talon Voice in einer eigenen Liga.
Zuletzt aktualisiert: Februar 2026. Verfügbarkeit der Tools und Funktionsangaben werden bei jeder wichtigen Aussage mit mindestens zwei Quellen abgeglichen.
Faktencheck-Überblick (zwei Quellen)
- OpenWhispr führt lokales Whisper über whisper.cpp aus: Funktionsumfang und lokale Laufzeit sind öffentlich dokumentiert. openwhispr.com · whisper.cpp
- Linux-Optionen reichen von ausgereiften GUIs bis zu CLI-Skripten: Projekt-Repos und Distributionsseiten bestätigen Umfang und Wartungsstatus. Nerd Dictation · Speech Note (Flathub)
- Cloud-orientierte Tools tauschen Komfort gegen Datenschutz: Spracheingabe im Browser ist bequem, leitet das Audio aber durch die Infrastruktur des Anbieters. Hilfe zur Chrome-Spracheingabe · Google-STT-Datenprotokollierung
- Ältere Linux-Sprachprojekte existieren, sind aber möglicherweise veraltet: Repo-Aktivität und historische Release-Zeitlinien sind vor dem Einsatz entscheidend. Simon-Repo · KDE-Archiv für nicht gepflegte Projekte
- Einordnung von OpenWhispr: OpenWhispr ist hier enthalten, weil es lokale ASR, systemweite Erfassung und optionale Nachbearbeitung in einer Linux-fähigen App vereint. OpenWhispr · Whisper (Upstream)
Linux Diktierlandschaft (2026)
1. OpenWhispr
OpenWhispr ist eine quelloffene, plattformübergreifende Desktop-Diktier-App auf Basis von Electron und whisper.cpp. Sie bietet Push-to-Talk-Sprache-zu-Text, das systemweit funktioniert – Hotkey halten, sprechen, loslassen, und dein transkribierter Text erscheint dort, wo dein Cursor steht. Sie enthält außerdem einen KI-Agentenmodus, der deinen diktierten Text mithilfe von LLMs (OpenAI, Anthropic, Google Gemini oder lokale Modelle) bereinigen, formatieren und umstrukturieren kann.
Vorteile
- Ausgereifte GUI mit systemweitem Push-to-Talk-Hotkey
- KI-Agentenmodus zur automatischen Textbereinigung und -formatierung
- Mehr als 99 Sprachen über Whisper-Modelle (von tiny bis large)
- Vollständig Open Source – selbst kompilieren oder vorgefertigte Binärdateien nutzen
Nachteile
- Auf Electron basierend – ressourcenhungriger als native Apps
- KI-Bereinigungsfunktionen erfordern API-Schlüssel oder ein Pro-Abonnement
- Größere Whisper-Modelle benötigen für Echtzeit-Leistung anständige Hardware
2. Nerd Dictation
Nerd Dictation ist ein einzelnes Python-Skript, das offline Sprache zu Text über die VOSK-API bietet. Es richtet sich an Linux-Power-User, die sich mit der Kommandozeile auskennen. Du startest und stoppst es manuell per CLI-Befehl, und es tippt mithilfe von xdotool in das gerade aktive Fenster. Die Konfiguration erfolgt als Python-Skript und ist damit endlos anpassbar.
Vorteile
- Extrem leichtgewichtig – eine einzelne Python-Datei, minimale Abhängigkeiten
- Vollständig offline mit kleinen VOSK-Sprachmodellen (unter 50 MB)
- Unbegrenzt anpassbar über Python-Konfigurationsskripte
- Keine Hintergrundprozesse – startet und stoppt auf Abruf
Nachteile
- Keine GUI – komplett CLI-gesteuert, nicht anfängerfreundlich
- Die VOSK-Genauigkeit liegt merklich unter Whisper-basierten Tools
- Erfordert xdotool (nur X11 – eingeschränkte Wayland-Unterstützung)
3. Speech Note (Dsnote)
Speech Note ist eine Qt-basierte Linux-Anwendung zum Notieren, Vorlesen und Übersetzen mit offline arbeitendem Sprache-zu-Text, Text-zu-Sprache und maschineller Übersetzung. Sie unterstützt mehrere STT-Engines, darunter Whisper (über whisper.cpp und Faster Whisper), und ist als Flatpak auf Flathub verfügbar. Die neuesten Versionen unterstützen GPU-Beschleunigung über Vulkan für Intel-, AMD- und NVIDIA-Karten.
Vorteile
- Vollständige GUI mit integriertem Notizen, TTS und Übersetzung
- Unterstützt mehrere STT-Engines, darunter Whisper-Modelle
- GPU-Beschleunigung (Vulkan) für schnellere Transkription
- Einfache Installation über Flatpak auf den meisten Distributionen
Nachteile
- Als Notiz-App konzipiert, nicht als systemweites Diktiertool
- Globale Tastenkürzel gibt es, sie sind aber weniger nahtlos als Push-to-Talk
- Die Qt-Oberfläche wirkt auf GNOME-basierten Desktops womöglich weniger ausgereift
4. Simon (KDE)
Simon ist ein quelloffenes Spracherkennungssystem, das ursprünglich als Teil des KDE-Projekts entwickelt wurde. Es verfolgt einen einzigartigen Do-it-yourself-Ansatz, bei dem Nutzer eigene Sprach- und Akustikmodelle von Grund auf erstellen, anstatt sich auf vortrainierte Modelle zu verlassen. Es ist jedoch wichtig, offen zu sein: Simon wird faktisch nicht mehr gepflegt. Das letzte bedeutende Release stammt aus dem Jahr 2013, und trotz eines kurzen Wiederbelebungsversuchs 2017 gab es in den letzten Jahren keine aktive Entwicklung mehr.
Vorteile
- Eigene Akustikmodelle lassen sich für spezielles Vokabular trainieren
- Vollständig Open Source mit grafischer Oberfläche
- Läuft komplett offline
Nachteile
- Faktisch aufgegeben – keine nennenswerten Updates seit 2013
- Nie auf KDE Frameworks 5 oder Qt5/Qt6 portiert
- Erkennungsgenauigkeit weit unter modernen Whisper-basierten Tools
Ehrliche Einschätzung: Simon war ein Wegbereiter der quelloffenen Spracherkennung unter Linux, doch moderne Tools wie whisper.cpp haben seinen Ansatz überholt. Wir führen es hier der Vollständigkeit halber auf, würden es neuen Nutzern aber nicht empfehlen.
5. Google Chrome Spracheingabe
Googles integrierte Spracheingabe ist für Linux-Nutzer über Chrome oder Google Docs zugänglich (Tools > Spracheingabe). Sie nutzt Googles cloudbasierte Spracherkennung und unterstützt zahlreiche Sprachen. Sie erfordert außer Chrome keine Installation – was sie zur Option mit der geringsten Hürde macht, aber auch zur eingeschränktesten.
Vorteile
- Keine Einrichtung – einfach Chrome öffnen und losreden
- Gute Genauigkeit dank Googles Sprachmodellen
- Unterstützt mehr als 100 Sprachen
Nachteile
- Funktioniert nur innerhalb von Chrome/Google Docs – nicht systemweit
- Das gesamte Audio wird an Googles Server gesendet – kein Offline-Modus
- Nicht Open Source, proprietärer Closed-Source-Dienst
6. Whisper.cpp CLI
Whisper.cpp ist eine C/C++-Portierung von OpenAIs Spracherkennungsmodell Whisper, optimiert für die CPU-Inferenz. Es ist an sich keine Diktier-App – es ist ein Kommandozeilen-Tool zum Transkribieren von Audiodateien. Viele Linux-Nutzer bauen jedoch Diktier-Workflows darum herum, indem sie die Mikrofoneingabe durch Skripte schleusen. Projekte wie whisper-dictation und whispertux verpacken whisper.cpp genau zu diesem Zweck in Push-to-Talk-Oberflächen.
Vorteile
- Whisper-Genauigkeit auf neuestem Stand, läuft lokal
- Hochoptimiertes C++ – schnell selbst auf reinen CPU-Maschinen
- Mehr als 99 Sprachen über alle Whisper-Modellgrößen unterstützt
- Vollständig Open Source, sehr aktiv gepflegt
Nachteile
- Keine GUI, kein Push-to-Talk – reine Transkriptions-Engine
- Erfordert Skripting, um einen Echtzeit-Diktier-Workflow aufzubauen
- Für die Transkription von Dateien konzipiert, nicht für Live-Streaming-Diktat
7. Talon Voice
Talon Voice ist ein umfassendes freihändiges Eingabesystem, das weit über das Diktieren hinausgeht. Es lässt dich deinen gesamten Computer steuern – Fenstermanagement, Programmieren, App-Wechsel, Dateinavigation – komplett per Stimme, mit optionalem Eye-Tracking über Tobii-Geräte. Talon unterstützt Linux unter X11 (Ubuntu 18.04+ und die meisten modernen Distributionen). Wayland wird jedoch nicht unterstützt und ist zum Zeitpunkt der Erstellung auch nicht geplant.
Vorteile
- Vollständige freihändige Computersteuerung, nicht nur Diktieren
- Eigens entwickeltes Voice-Coding mit sprachspezifischen Befehlen
- Eye-Tracking-Integration als Mausersatz
- Unbezahlbar für Barrierefreiheit – bei RSI buchstäblich lebensverändernd
Nachteile
- Steile Lernkurve – erfordert das Auswendiglernen von Befehlen und eines Buchstabieralphabets
- Die Kern-Engine ist proprietär (Community-Skripte sind Open Source)
- Linux-Unterstützung auf X11 beschränkt – keine Wayland-Unterstützung
Direkter Vergleich
| Tool | Quelloffen | Offline | Sprachen | KI-Bereinigung | Systemweit | Preis |
|---|---|---|---|---|---|---|
| OpenWhispr | 99+ | Kostenlos (Pro 8 $/Monat) | ||||
| Nerd Dictation | Variiert je nach VOSK-Modell | Kostenlos | ||||
| Speech Note | Variiert je nach Backend/Modell | Kostenlos | ||||
| Simon | Benutzerdefiniert | Kostenlos | ||||
| Chrome Voice Typing | Viele vom Browser unterstützte Sprachen | Kostenlos | ||||
| Whisper.cpp CLI | 99+ | Kostenlos | ||||
| Talon Voice | Englisch | Kostenloser Kern / kostenpflichtige Patreon-Stufen |
Unsere Empfehlungen
Es gibt nicht das eine „beste" Diktiertool für Linux – es hängt davon ab, worauf du Wert legst. So würden wir es aufschlüsseln:
Für die meisten Nutzer
OpenWhispr bietet das vollständigste Erlebnis: eine echte GUI, systemweites Push-to-Talk, KI-Bereinigung, Whisper-Genauigkeit, und es ist Open Source. Es ist das, was unter Linux einer Erfahrung am nächsten kommt, die macOS- und Windows-Nutzer als selbstverständlich ansehen.
Für CLI-Puristen
Nerd Dictation besticht durch seine Einfachheit. Eine einzelne Python-Datei, von VOSK angetrieben, endlos anpassbar. Wenn du deine Tools lieber über Skripte konfigurierst und keine Whisper-Genauigkeit brauchst, ist es kaum zu schlagen.
Für KDE/Qt-Nutzer
Speech Note integriert sich gut in Qt-basierte Desktops und bietet neben der Spracherkennung auch Übersetzung und TTS. Eine starke Wahl, wenn du ein All-in-One-Notiz-Tool willst.
Für Entwickler
Whisper.cpp CLI ist die Engine, die viele dieser Tools antreibt. Wenn du maximale Kontrolle willst und dir den Aufbau deiner eigenen Pipeline zutraust, geh direkt zur Quelle.
Für Barrierefreiheit und freihändiges Arbeiten
Talon Voice spielt in einer ganz anderen Kategorie. Wenn du Tastatur und Maus ersetzen musst – nicht nur durch Diktieren ergänzen – ist Talon das Tool, das du lernen solltest. Der Zeitaufwand ist erheblich, aber der Gewinn ist transformativ.
Quellen und weiterführende Lektüre
Lust, OpenWhispr auszuprobieren?
Open-Source-Diktat für Linux, macOS und Windows. Push-to-Talk, whisper.cpp, KI-Bereinigung und mehr als 99 Sprachen – für immer kostenlos.
Kein Konto erforderlich · Funktioniert offline · Für immer Open Source