博客

2026 年 Linux 上最好用的听写工具

多年来,Linux 用户在听写软件上一直缺乏优质选择。如今这一局面终于开始改变。以下是 2026 年所有可行的方案,我们做了诚实的对比。

OpenWhispr

OpenWhispr

工程

2026 年 2 月 14 日
目录

2026 年 Linux 上最好用的听写工具,取决于你的具体需求。 对于大多数希望获得精致、开箱即用体验并带有 AI 文本润色的用户来说, OpenWhispr 提供了最完整的一揽子方案:由 whisper.cpp 驱动的按键说话听写、全系统快捷键支持、99+ 种语言,以及可选的 AI 排版——而且全部开源。对于偏好命令行、追求最少依赖的用户,Nerd Dictation 非常出色。KDE 与 Qt 用户则应关注 Speech Note。习惯在终端中处理音频管道的开发者,可以直接使用 whisper.cpp。而如果你需要超越单纯听写、实现完全免手操控电脑的能力,Talon Voice 则自成一档。

最后更新:2026 年 2 月。工具可用性与功能说明均针对每项重要论断交叉核对了至少两个来源。

事实核查速览(双来源)

  • OpenWhispr 通过 whisper.cpp 在本地运行 Whisper: 其功能集与本地运行时均有公开文档记载。 openwhispr.com · whisper.cpp
  • Linux 上的选择从精致的图形界面到命令行脚本不一而足: 项目仓库与发行版页面证实了其适用范围与维护状态。 Nerd Dictation · Speech Note (Flathub)
  • 以云端为先的工具以隐私换取便利: 浏览器语音输入虽然方便,却会将音频经由服务商基础设施传输。 Chrome 语音输入帮助 · Google STT 数据记录
  • 老牌 Linux 语音项目仍然存在,但可能已停滞: 在采用前,仓库活跃度与历史发布时间线都值得关注。 Simon 仓库 · KDE 停止维护归档
  • OpenWhispr 的定位: 将 OpenWhispr 纳入此处,是因为它在一款支持 Linux 的应用中集成了本地 ASR、全系统采集以及可选的后处理。 OpenWhispr · Whisper 上游

Linux 听写景观 (2026)

精致的用户体验
DIY控制
OpenWhispr
Speech Note
Chrome Voice
Nerd Dictation
whisper.cpp
Talon

1. OpenWhispr

OpenWhispr 是一款开源、跨平台的桌面听写应用,基于 Electron 与 whisper.cpp 构建。它提供全系统可用的按键说话语音转文字——按住快捷键、开口说话、松手,转写出的文字便会出现在光标所在之处。它还包含一个 AI 智能体模式,可借助大语言模型(OpenAI、Anthropic、Google Gemini 或本地模型)清理、排版并重组你口述的文本。

优点

  • 精致的图形界面,配有全系统按键说话快捷键
  • AI 智能体模式可自动清理并排版文本
  • 通过 Whisper 模型(从 tiny 到 large)支持 99+ 种语言
  • 完全开源——可从源码构建,也可使用预编译二进制文件

缺点

  • 基于 Electron——比原生应用更占用资源
  • AI 清理功能需要 API 密钥或 Pro 订阅
  • 较大的 Whisper 模型需要不错的硬件才能实现实时性能
价格: 核心功能免费,可选 Pro 每月 $8
最适合: 希望获得完整、精致听写体验并带有 AI 文本清理的用户

2. Nerd Dictation

Nerd Dictation 是一个单文件 Python 脚本,借助 VOSK API 提供离线语音转文字。它专为习惯命令行的 Linux 高级用户设计。你通过 CLI 命令手动启动和停止它,它会使用 xdotool 将文字输入到当前获得焦点的窗口中。用户配置就是一个 Python 脚本,因此可以无限折腾。

优点

  • 极其轻量——单个 Python 文件,依赖极少
  • 可完全离线,搭配小巧的 VOSK 语言模型(不到 50 MB)
  • 通过 Python 配置脚本可无限定制
  • 无后台进程——按需启动和停止

缺点

  • 没有图形界面——完全靠命令行驱动,对新手不友好
  • VOSK 的准确度明显低于基于 Whisper 的工具
  • 需要 xdotool(仅限 X11——对 Wayland 支持有限)
价格: 免费且开源
最适合: 精通命令行、想要一款轻量、可折腾、完全离线听写脚本的 Linux 用户

3. Speech Note (Dsnote)

Speech Note 是一款基于 Qt 的 Linux 应用,可借助离线语音转文字、文字转语音和机器翻译来进行笔记、阅读和翻译。它支持多种 STT 引擎,包括 Whisper(通过 whisper.cpp 和 Faster Whisper),并以 Flatpak 形式在 Flathub 上提供。最新版本支持通过 Vulkan 为 Intel、AMD 和 NVIDIA 显卡提供 GPU 加速。

优点

  • 完整的图形界面,内置笔记、TTS 和翻译功能
  • 支持包括 Whisper 模型在内的多种 STT 引擎
  • GPU 加速(Vulkan),转写更快
  • 在大多数发行版上可通过 Flatpak 轻松安装

缺点

  • 设计定位是笔记应用,而非全系统听写工具
  • 虽有全局键盘快捷键,但不如按键说话那样顺畅
  • 在基于 GNOME 的桌面上,Qt 界面可能显得不够精致
价格: 免费且开源
最适合: 希望拥有一款内置语音识别与翻译的一体化笔记应用的用户

4. Simon (KDE)

Simon 是一套开源语音识别系统,最初作为 KDE 项目的一部分开发。它采用了独特的自己动手思路,允许用户从零开始创建自定义语言模型和声学模型,而非依赖预训练模型。然而必须直说:Simon 实际上已无人维护。最后一次重要发布是在 2013 年,尽管 2017 年曾有过短暂的复兴尝试,近年来却再无活跃开发。

优点

  • 可针对特定词汇训练自定义声学模型
  • 完全开源,带有图形界面
  • 完全离线运行

缺点

  • 实际上已被弃置——自 2013 年起再无实质更新
  • 从未迁移到 KDE Frameworks 5 或 Qt5/Qt6
  • 识别准确度远低于现代基于 Whisper 的工具
价格: 免费且开源
最适合: 仅供历史研究——不推荐在 2026 年用于实际用途

诚实评价: Simon 开创了 Linux 上的开源语音识别,但 whisper.cpp 等现代工具已让它的思路过时。我们在此列出它只是为了内容完整,并不会推荐新用户使用。

5. Google Chrome 语音输入

Google 内置的语音输入功能可供 Linux 用户通过 Chrome 或 Google 文档使用(工具 > 语音输入)。它使用 Google 的云端语音识别,支持多种语言。除了拥有 Chrome 之外无需任何安装——这使它成为门槛最低的选择,但也是最受限的一个。

优点

  • 零配置——打开 Chrome 即可开始说话
  • 由 Google 语音模型驱动,准确度不错
  • 支持 100+ 种语言

缺点

  • 仅在 Chrome/Google 文档内可用——并非全系统
  • 所有音频都会发送到 Google 的服务器——没有离线模式
  • 非开源,是闭源的专有服务
价格: 免费
最适合: 在不需要全系统输入或隐私时,在 Google 文档内快速听写

6. Whisper.cpp CLI

Whisper.cpp 是 OpenAI 的 Whisper 语音识别模型的 C/C++ 移植版本,针对 CPU 推理做了优化。严格来说它并不是一款听写应用——而是一个用于转写音频文件的命令行工具。不过,许多 Linux 用户会围绕它构建听写工作流,通过脚本将麦克风输入管道化处理。whisper-dictation 和 whispertux 等项目正是将 whisper.cpp 包装进按键说话界面,用于这一目的。

优点

  • 顶尖的 Whisper 准确度,本地运行
  • 高度优化的 C++——即便在纯 CPU 机器上也很快
  • 在所有 Whisper 模型尺寸下均支持 99+ 种语言
  • 完全开源,维护非常活跃

缺点

  • 没有图形界面,没有按键说话——纯粹是转写引擎
  • 需要编写脚本才能搭建实时听写工作流
  • 为文件转写而设计,而非实时流式听写
价格: 免费且开源
最适合: 想要构建自定义听写流水线或转写工作流的开发者

7. Talon Voice

Talon Voice 是一套全面的免手输入系统,其功能远超听写。它让你完全用语音控制整台电脑——窗口管理、写代码、切换应用、浏览文件,并可通过 Tobii 设备选配眼动追踪。Talon 在 X11 上支持 Linux(Ubuntu 18.04+ 及大多数现代发行版)。不过,目前并不支持 Wayland,写作本文时也无相关计划。

优点

  • 完全免手操控电脑,不只是听写
  • 专为语音编程打造,配有针对各编程语言的命令
  • 集成眼动追踪以替代鼠标
  • 对无障碍辅助意义非凡——对 RSI 患者来说堪称改变人生

缺点

  • 学习曲线陡峭——需要记忆命令和一套语音字母表
  • 核心引擎为专有(社区脚本是开源的)
  • Linux 支持仅限 X11——不支持 Wayland
价格: 公开版免费,通过 Patreon 提供每月 $25 的测试版
最适合: 需要完全免手操控电脑、语音编程或以无障碍为驱动的输入方式的用户

逐项对比

工具开源离线语言AI 清理全系统价格
OpenWhispr
99+
免费(Pro 每月 $8)
Nerd Dictation
因 VOSK 模型而异
免费
Speech Note
因后端/模型而异
免费
Simon
自定义
免费
Chrome Voice Typing
众多浏览器支持的语言
免费
Whisper.cpp CLI
99+
免费
Talon Voice
英语
核心免费 / Patreon 付费档位

我们的推荐

Linux 上并不存在唯一的“最佳”听写工具——这取决于你看重什么。以下是我们的分类建议:

对大多数用户

OpenWhispr 提供了最完整的体验:真正的图形界面、全系统按键说话、AI 清理、Whisper 级准确度,而且开源。它最接近 macOS 和 Windows 用户习以为常的那种体验。

对命令行纯粹主义者

Nerd Dictation 以其简洁而出色。单个 Python 文件、由 VOSK 驱动、可无限折腾。如果你偏好通过脚本来配置工具,又不需要 Whisper 级别的准确度,它几乎无可匹敌。

对 KDE/Qt 用户

Speech Note 与基于 Qt 的桌面集成良好,除语音识别外还提供翻译和 TTS。如果你想要一款一体化的笔记工具,它是个有力的选择。

对开发者

Whisper.cpp CLI 是驱动这些工具中许多款的引擎。如果你想要最大程度的掌控,又乐于搭建自己的流水线,那就直接从源头入手。

对无障碍辅助与免手操控电脑

Talon Voice 完全是另一个层次。如果你需要彻底替代键盘和鼠标——而不只是用听写来辅助——那么 Talon 就是值得学习的工具。投入的时间相当可观,但回报是革命性的。

想试试 OpenWhispr 吗?

面向 Linux、macOS 和 Windows 的开源听写工具。按键说话、whisper.cpp、AI 清理,以及 99+ 种语言——永久免费。

无需账户 · 离线可用 · 永久开源