Blog

Die besten Diktiertools für Linux 2026

Linux-Nutzer wurden bei Diktiersoftware jahrelang vernachlässigt. Das ändert sich endlich. Hier sind alle praktikablen Optionen im Jahr 2026, ehrlich verglichen.

OpenWhispr

OpenWhispr

Ingenieurwesen

14. Februar 2026
Inhaltsverzeichnis

Welches Diktiertool 2026 das beste für Linux ist, hängt davon ab, was du brauchst. Für die meisten Nutzer, die ein ausgereiftes, sofort einsatzbereites Erlebnis mit KI-gestützter Textaufbereitung wollen, bietet OpenWhispr das vollständigste Gesamtpaket: Push-to-Talk-Diktat auf Basis von whisper.cpp, systemweite Hotkey-Unterstützung, mehr als 99 Sprachen und optionale KI-Formatierung – alles Open Source. Für CLI-orientierte Nutzer, die minimale Abhängigkeiten wollen, ist Nerd Dictation hervorragend. KDE- und Qt-Nutzer sollten sich Speech Note ansehen. Entwickler, die Audio gerne über das Terminal durchschleusen, können whisper.cpp direkt verwenden. Und wenn du eine vollständige, freihändige Computersteuerung jenseits des reinen Diktierens brauchst, spielt Talon Voice in einer eigenen Liga.

Zuletzt aktualisiert: Februar 2026. Verfügbarkeit der Tools und Funktionsangaben werden bei jeder wichtigen Aussage mit mindestens zwei Quellen abgeglichen.

Faktencheck-Überblick (zwei Quellen)

Linux Diktierlandschaft (2026)

Polierte UX
DIY-Steuerung
OpenWhispr
Speech Note
Chrome Voice
Nerd Dictation
whisper.cpp
Talon

1. OpenWhispr

OpenWhispr ist eine quelloffene, plattformübergreifende Desktop-Diktier-App auf Basis von Electron und whisper.cpp. Sie bietet Push-to-Talk-Sprache-zu-Text, das systemweit funktioniert – Hotkey halten, sprechen, loslassen, und dein transkribierter Text erscheint dort, wo dein Cursor steht. Sie enthält außerdem einen KI-Agentenmodus, der deinen diktierten Text mithilfe von LLMs (OpenAI, Anthropic, Google Gemini oder lokale Modelle) bereinigen, formatieren und umstrukturieren kann.

Vorteile

  • Ausgereifte GUI mit systemweitem Push-to-Talk-Hotkey
  • KI-Agentenmodus zur automatischen Textbereinigung und -formatierung
  • Mehr als 99 Sprachen über Whisper-Modelle (von tiny bis large)
  • Vollständig Open Source – selbst kompilieren oder vorgefertigte Binärdateien nutzen

Nachteile

  • Auf Electron basierend – ressourcenhungriger als native Apps
  • KI-Bereinigungsfunktionen erfordern API-Schlüssel oder ein Pro-Abonnement
  • Größere Whisper-Modelle benötigen für Echtzeit-Leistung anständige Hardware
Preis: Kostenlose Kernfunktionen, optional Pro für 8 $/Monat
Am besten geeignet für: Nutzer, die ein vollständiges, ausgereiftes Diktiererlebnis mit KI-Textbereinigung wollen

2. Nerd Dictation

Nerd Dictation ist ein einzelnes Python-Skript, das offline Sprache zu Text über die VOSK-API bietet. Es richtet sich an Linux-Power-User, die sich mit der Kommandozeile auskennen. Du startest und stoppst es manuell per CLI-Befehl, und es tippt mithilfe von xdotool in das gerade aktive Fenster. Die Konfiguration erfolgt als Python-Skript und ist damit endlos anpassbar.

Vorteile

  • Extrem leichtgewichtig – eine einzelne Python-Datei, minimale Abhängigkeiten
  • Vollständig offline mit kleinen VOSK-Sprachmodellen (unter 50 MB)
  • Unbegrenzt anpassbar über Python-Konfigurationsskripte
  • Keine Hintergrundprozesse – startet und stoppt auf Abruf

Nachteile

  • Keine GUI – komplett CLI-gesteuert, nicht anfängerfreundlich
  • Die VOSK-Genauigkeit liegt merklich unter Whisper-basierten Tools
  • Erfordert xdotool (nur X11 – eingeschränkte Wayland-Unterstützung)
Preis: Kostenlos und Open Source
Am besten geeignet für: CLI-versierte Linux-Nutzer, die ein leichtgewichtiges, anpassbares, vollständig offline arbeitendes Diktierskript wollen

3. Speech Note (Dsnote)

Speech Note ist eine Qt-basierte Linux-Anwendung zum Notieren, Vorlesen und Übersetzen mit offline arbeitendem Sprache-zu-Text, Text-zu-Sprache und maschineller Übersetzung. Sie unterstützt mehrere STT-Engines, darunter Whisper (über whisper.cpp und Faster Whisper), und ist als Flatpak auf Flathub verfügbar. Die neuesten Versionen unterstützen GPU-Beschleunigung über Vulkan für Intel-, AMD- und NVIDIA-Karten.

Vorteile

  • Vollständige GUI mit integriertem Notizen, TTS und Übersetzung
  • Unterstützt mehrere STT-Engines, darunter Whisper-Modelle
  • GPU-Beschleunigung (Vulkan) für schnellere Transkription
  • Einfache Installation über Flatpak auf den meisten Distributionen

Nachteile

  • Als Notiz-App konzipiert, nicht als systemweites Diktiertool
  • Globale Tastenkürzel gibt es, sie sind aber weniger nahtlos als Push-to-Talk
  • Die Qt-Oberfläche wirkt auf GNOME-basierten Desktops womöglich weniger ausgereift
Preis: Kostenlos und Open Source
Am besten geeignet für: Nutzer, die eine All-in-One-Notiz-App mit integrierter Spracherkennung und Übersetzung wollen

4. Simon (KDE)

Simon ist ein quelloffenes Spracherkennungssystem, das ursprünglich als Teil des KDE-Projekts entwickelt wurde. Es verfolgt einen einzigartigen Do-it-yourself-Ansatz, bei dem Nutzer eigene Sprach- und Akustikmodelle von Grund auf erstellen, anstatt sich auf vortrainierte Modelle zu verlassen. Es ist jedoch wichtig, offen zu sein: Simon wird faktisch nicht mehr gepflegt. Das letzte bedeutende Release stammt aus dem Jahr 2013, und trotz eines kurzen Wiederbelebungsversuchs 2017 gab es in den letzten Jahren keine aktive Entwicklung mehr.

Vorteile

  • Eigene Akustikmodelle lassen sich für spezielles Vokabular trainieren
  • Vollständig Open Source mit grafischer Oberfläche
  • Läuft komplett offline

Nachteile

  • Faktisch aufgegeben – keine nennenswerten Updates seit 2013
  • Nie auf KDE Frameworks 5 oder Qt5/Qt6 portiert
  • Erkennungsgenauigkeit weit unter modernen Whisper-basierten Tools
Preis: Kostenlos und Open Source
Am besten geeignet für: Nur von historischem Interesse – für den praktischen Einsatz 2026 nicht empfehlenswert

Ehrliche Einschätzung: Simon war ein Wegbereiter der quelloffenen Spracherkennung unter Linux, doch moderne Tools wie whisper.cpp haben seinen Ansatz überholt. Wir führen es hier der Vollständigkeit halber auf, würden es neuen Nutzern aber nicht empfehlen.

5. Google Chrome Spracheingabe

Googles integrierte Spracheingabe ist für Linux-Nutzer über Chrome oder Google Docs zugänglich (Tools > Spracheingabe). Sie nutzt Googles cloudbasierte Spracherkennung und unterstützt zahlreiche Sprachen. Sie erfordert außer Chrome keine Installation – was sie zur Option mit der geringsten Hürde macht, aber auch zur eingeschränktesten.

Vorteile

  • Keine Einrichtung – einfach Chrome öffnen und losreden
  • Gute Genauigkeit dank Googles Sprachmodellen
  • Unterstützt mehr als 100 Sprachen

Nachteile

  • Funktioniert nur innerhalb von Chrome/Google Docs – nicht systemweit
  • Das gesamte Audio wird an Googles Server gesendet – kein Offline-Modus
  • Nicht Open Source, proprietärer Closed-Source-Dienst
Preis: Kostenlos
Am besten geeignet für: Schnelles Diktieren in Google Docs, wenn du keine systemweite Eingabe oder Datenschutz brauchst

6. Whisper.cpp CLI

Whisper.cpp ist eine C/C++-Portierung von OpenAIs Spracherkennungsmodell Whisper, optimiert für die CPU-Inferenz. Es ist an sich keine Diktier-App – es ist ein Kommandozeilen-Tool zum Transkribieren von Audiodateien. Viele Linux-Nutzer bauen jedoch Diktier-Workflows darum herum, indem sie die Mikrofoneingabe durch Skripte schleusen. Projekte wie whisper-dictation und whispertux verpacken whisper.cpp genau zu diesem Zweck in Push-to-Talk-Oberflächen.

Vorteile

  • Whisper-Genauigkeit auf neuestem Stand, läuft lokal
  • Hochoptimiertes C++ – schnell selbst auf reinen CPU-Maschinen
  • Mehr als 99 Sprachen über alle Whisper-Modellgrößen unterstützt
  • Vollständig Open Source, sehr aktiv gepflegt

Nachteile

  • Keine GUI, kein Push-to-Talk – reine Transkriptions-Engine
  • Erfordert Skripting, um einen Echtzeit-Diktier-Workflow aufzubauen
  • Für die Transkription von Dateien konzipiert, nicht für Live-Streaming-Diktat
Preis: Kostenlos und Open Source
Am besten geeignet für: Entwickler, die eigene Diktier-Pipelines oder Transkriptions-Workflows aufbauen wollen

7. Talon Voice

Talon Voice ist ein umfassendes freihändiges Eingabesystem, das weit über das Diktieren hinausgeht. Es lässt dich deinen gesamten Computer steuern – Fenstermanagement, Programmieren, App-Wechsel, Dateinavigation – komplett per Stimme, mit optionalem Eye-Tracking über Tobii-Geräte. Talon unterstützt Linux unter X11 (Ubuntu 18.04+ und die meisten modernen Distributionen). Wayland wird jedoch nicht unterstützt und ist zum Zeitpunkt der Erstellung auch nicht geplant.

Vorteile

  • Vollständige freihändige Computersteuerung, nicht nur Diktieren
  • Eigens entwickeltes Voice-Coding mit sprachspezifischen Befehlen
  • Eye-Tracking-Integration als Mausersatz
  • Unbezahlbar für Barrierefreiheit – bei RSI buchstäblich lebensverändernd

Nachteile

  • Steile Lernkurve – erfordert das Auswendiglernen von Befehlen und eines Buchstabieralphabets
  • Die Kern-Engine ist proprietär (Community-Skripte sind Open Source)
  • Linux-Unterstützung auf X11 beschränkt – keine Wayland-Unterstützung
Preis: Kostenlose öffentliche Version, 25 $/Monat Beta über Patreon
Am besten geeignet für: Nutzer, die vollständig freihändiges Arbeiten, Voice-Coding oder barrierefreie Eingabe brauchen

Direkter Vergleich

ToolQuelloffenOfflineSprachenKI-BereinigungSystemweitPreis
OpenWhispr
99+
Kostenlos (Pro 8 $/Monat)
Nerd Dictation
Variiert je nach VOSK-Modell
Kostenlos
Speech Note
Variiert je nach Backend/Modell
Kostenlos
Simon
Benutzerdefiniert
Kostenlos
Chrome Voice Typing
Viele vom Browser unterstützte Sprachen
Kostenlos
Whisper.cpp CLI
99+
Kostenlos
Talon Voice
Englisch
Kostenloser Kern / kostenpflichtige Patreon-Stufen

Unsere Empfehlungen

Es gibt nicht das eine „beste" Diktiertool für Linux – es hängt davon ab, worauf du Wert legst. So würden wir es aufschlüsseln:

Für die meisten Nutzer

OpenWhispr bietet das vollständigste Erlebnis: eine echte GUI, systemweites Push-to-Talk, KI-Bereinigung, Whisper-Genauigkeit, und es ist Open Source. Es ist das, was unter Linux einer Erfahrung am nächsten kommt, die macOS- und Windows-Nutzer als selbstverständlich ansehen.

Für CLI-Puristen

Nerd Dictation besticht durch seine Einfachheit. Eine einzelne Python-Datei, von VOSK angetrieben, endlos anpassbar. Wenn du deine Tools lieber über Skripte konfigurierst und keine Whisper-Genauigkeit brauchst, ist es kaum zu schlagen.

Für KDE/Qt-Nutzer

Speech Note integriert sich gut in Qt-basierte Desktops und bietet neben der Spracherkennung auch Übersetzung und TTS. Eine starke Wahl, wenn du ein All-in-One-Notiz-Tool willst.

Für Entwickler

Whisper.cpp CLI ist die Engine, die viele dieser Tools antreibt. Wenn du maximale Kontrolle willst und dir den Aufbau deiner eigenen Pipeline zutraust, geh direkt zur Quelle.

Für Barrierefreiheit und freihändiges Arbeiten

Talon Voice spielt in einer ganz anderen Kategorie. Wenn du Tastatur und Maus ersetzen musst – nicht nur durch Diktieren ergänzen – ist Talon das Tool, das du lernen solltest. Der Zeitaufwand ist erheblich, aber der Gewinn ist transformativ.

Lust, OpenWhispr auszuprobieren?

Open-Source-Diktat für Linux, macOS und Windows. Push-to-Talk, whisper.cpp, KI-Bereinigung und mehr als 99 Sprachen – für immer kostenlos.

Kein Konto erforderlich · Funktioniert offline · Für immer Open Source