对比

Parakeet、Whisper 与 Nemotron:2026 年最佳本地语音转文字方案

如今,三款开放模型都能完全在您的电脑上将语音转成文字。本文依据一手资料中的可靠数据,比较它们在准确率、速度、语言覆盖和流式识别方面的真实表现。

OpenWhispr

OpenWhispr

工程

2026 年 7 月 18 日
目录

对于英语和主要欧洲语言,NVIDIA Parakeet TDT 0.6B v3 是 2026 年最佳本地语音转文字模型:其实测准确率优于 Whisper large-v3,体积仅为后者四分之一,在普通 CPU 上也快得多。如果希望文字在说话时实时出现,NVIDIA 新推出的 Nemotron 流式模型是首批专门为此设计的本地模型。如果您使用的是 NVIDIA 模型尚未覆盖的众多语言之一,那么支持 99 种语言的 OpenAI Whisper 仍是正确选择。

2026 年最出人意料的变化是,Whisper 失去了保持三年的开放模型准确率桂冠。不过,“哪款模型最好”已经真正变成三方竞争,因为它们各有所长:Parakeet 优化单位功耗下的准确率,Nemotron 优化延迟,Whisper 则优化语言广度。本文使用模型卡和公开 Leaderboard 的数据进行比较,不凭感觉,也不夸大差异。

最后更新于 2026 年 7 月 18 日。我们开发 OpenWhispr,这是一款同时提供三大模型系列的开源听写应用,因此我们会在生产环境中测试并支持每一种模型。这也说明了我们的立场:我们不销售其中任何模型,下面所述的实际取舍与我们向用户解释的完全相同。

关键事实速览(一手资料)

三个候选模型

三者都是可免费下载、离线运行的开放权重模型。架构上的不同,几乎解释了实际使用中的所有差异。

OpenAI Whisper (2022)

让开放语音识别进入主流的模型。它是一个编码器—解码器 Transformer,使用 680,000 小时音频训练,提供从 75MB(tiny)到 3GB(large-v3)的六种大小,覆盖 99 种语言。它像语言模型一样逐个 token 生成文字,因此也是三者中最慢的。MIT 许可证。

NVIDIA Parakeet (2024–2025)

为批量转录设计的 600M 参数转导器(TDT)模型。它不采用自回归方式生成 token,而是在一次读取音频的过程中输出文字,速度快得多,也不会在静音时编造文字。两款重要版本是多语言 v3(25 种语言,INT8 ONNX 为 680MB)和仅支持英语的 Unified(631MB);后者目前拥有领先的英语准确率。CC-BY-4.0 许可证。

NVIDIA Nemotron ASR (2026)

面向流式识别的最新系列:具有缓存感知能力的 FastConformer 转导器会随音频到达而转录,无需等待录音结束。英语模型于 2026 年 1 月推出,覆盖 40 个语言区域的多语言 3.5 模型于 6 月跟进。两者均为 600M 参数(INT8 ONNX 为 632–650MB),采用开放的 OpenMDW 许可证。

准确率:Parakeet 胜出,但差距没有看起来那么大

语音模型通常使用 词错误率(WER)衡量,即模型识别错误的单词比例,越低越好。标准参考是 Hugging Face Open ASR Leaderboard,它对八个不同的英语数据集(会议、财报电话会、TED Talks、有声书等)的 WER 取平均值,避免单个简单数据集人为抬高模型成绩。

英语准确率:平均词错误率

Hugging Face Open ASR Leaderboard 基准测试中多个数据集的平均值(越低越好)。Nemotron 以流式配置展示。

来源:Hugging Face 上的 NVIDIA 模型卡和 Open ASR Leaderboard,2026 年 7 月。WER = 转写错误的词所占百分比。

应当客观看待图表:这里的每款模型都已达到生产级别,总差距仅约 1.5 个百分点。在日常听写的清晰音频上,6.3% 与 7.4% 的体验接近;差别会在口音、噪声和专业术语等困难音频中显现。NVIDIA 数据值得关注的是取得成绩所需的成本:Parakeet 仅用 600M 参数便达到该准确率,而 Whisper 需要 1.55B;Nemotron 更是在完全看不到后续音频的流式条件下取得 6.93%。

Whisper 的已知弱点:在静音中产生幻觉

Whisper 的解码器像语言模型一样工作,因此在静音或噪声中可能生成流畅但完全虚构的句子;整个生态都记录过这种故障。Parakeet 和 Nemotron 等转导器在结构上更能抵抗它:没有音频依据,就没有 token。对于开头和结尾常有静音的听写来说,这比基准中的一个百分点更重要。

速度与效率:完全不是一个级别

在 Leaderboard 使用的硬件上,Parakeet TDT v3 的转录速度为实时的 3,332×,约一秒即可处理一小时音频。Whisper large-v3 的速度远不到它的十分之一。原因在于架构:Whisper 逐个 token 写出文本,每一步都要等待上一步;转导器只读取一次音频,并随进度输出文字。没有循环,也没有逐词往返处理。

在笔记本电脑上,绝对数字会下降,但比例依然成立:Whisper large 需要数秒处理的一段听写,Parakeet 用 CPU、无需 GPU 就能近乎瞬间完成。独立基准还显示,在质量相当时,NVIDIA 转导器每小时音频大约少用 8–10× 的能耗 ;如果经常用电池长时间听写,这一点很实际。

Whisper 的应对方案是 turbo(1.6GB),它是 large-v3 的蒸馏版本,以少量准确率换取约 8× Whisper-large 的速度。它是适合听写的 Whisper,但只能缩小差距,无法追平。完整的型号大小对比请参阅 Whisper 模型大小指南

语言覆盖:Whisper 的护城河

模型语言说明
Whisper large-v399开放模型中覆盖最广,包括低资源语言
Nemotron 3.5 ASR40 个语言区域自动语言检测;15 种语言可直接转录,包括日语、韩语、阿拉伯语和印地语
Parakeet TDT v325欧洲语言以及英语和俄语;自动检测
Parakeet Unified / Nemotron EN1仅支持英语,以换取同类最佳准确率

经验法则很简单。英语或主要欧洲语言:三者都可用,按速度选择。日语、韩语、越南语、阿拉伯语和印地语:Nemotron 3.5 如今可提供流式识别,这是本地模型真正的首次突破。普通话、泰语、印度尼西亚语、斯瓦希里语或大量语言切换:Whisper 仍是唯一严肃的选择,短期内不太可能改变。

流式识别:真正的分水岭

在流式识别方面,Nemotron 不只是小幅领先,而是在完成另外两者受架构限制无法完成的事。 Whisper 以 30 秒窗口处理音频,并重新编码看到的全部内容。因此所谓“实时”Whisper,其实是把同一个批处理模型反复运行在相互重叠的音频上,成本高、延迟大,接缝处也不稳定。Nemotron 的缓存感知架构专为流式场景训练:它只处理最新音频块,延续内部状态,并在可配置的 80 毫秒至 1.12 秒延迟范围内输出部分文字。

在大规模部署中,效率差异非常显著:NVIDIA 报告同一 GPU 上可实现比上一代流式模型 多 17× 的并发流 。而在笔记本电脑上,您感受到的优势更直观:模型在本机 CPU 上运行,文字随说话出现。我们在 流式 ASR 技术深入解析中详细介绍了将其用于桌面应用所需的工程工作。

如果不在乎实时文字,只是说完后获取最终转录,那么流式识别没有额外价值,Parakeet 批处理模型更合适。流式识别适用于实时字幕、语音智能体以及边说边显示的听写预览。

硬件:三者都能在普通笔记本上运行

这些模型都不需要 GPU。NVIDIA 模型以 INT8 量化 ONNX 文件(631–680MB)提供,通过无需 Python 和 PyTorch 的原生二进制运行时 sherpa-onnx,可在任何较新的 CPU(Apple Silicon 或 x86)上流畅运行。Whisper 通过 whisper.cpp 可在各平台运行;small 和 turbo 适合 CPU,large-v3(3GB、~10GB RAM)则确实能从加速中获益。

如果有 GPU,建议用于 Whisper:Apple Silicon 内置 Metal,OpenWhispr 一键提供 CUDA(NVIDIA)和 Vulkan(AMD 与 Intel)运行时,并在 GPU 运行失败时自动回退到 CPU。NVIDIA 转导器在 CPU 上已经足够快,对听写而言 GPU 加速意义不大。

应该选哪一个?

您的需求建议使用
英语听写,追求最高准确率Parakeet Unified EN 0.6B
欧洲语言,快速批量转录Parakeet TDT 0.6B v3
说英语时实时显示文字Nemotron Speech Streaming EN
以西班牙语、日语、韩语、阿拉伯语、印地语等实时显示文字Nemotron 3.5 ASR Streaming
NVIDIA 模型未覆盖的语言Whisper large-v3 或 turbo
旧设备或内存较少,记录简短笔记Whisper tiny 或 base

如果隐私是您选择本地方案的原因,三者同样合格:音频在本机处理,绝不上传。我们在 本地转录与云端转录对比中进一步讨论了这种取舍。

两分钟试完三个模型

最客观的选择方法,是用每个模型听写同一段话。OpenWhispr 在 macOS、Windows 和 Linux 上免费开源,并通过一个设置下拉菜单提供本文全部模型:六种大小的 Whisper、两款 Parakeet 和两款 Nemotron。下载模型,按下快捷键,然后说话。我们的 模型页面 列出了全部模型的大小和取舍。

常见问题

2026 年最佳本地语音转文字模型是什么?

对于英语和主要欧洲语言,NVIDIA Parakeet TDT 0.6B v3 的综合表现最佳:它在 Open ASR Leaderboard 上的平均词错误率为 6.34%,优于 Whisper large-v3 约 7.4% 的成绩,体积仅为后者的四分之一,CPU 吞吐量也高得多。如果需要边说边显示文字,NVIDIA Nemotron 流式模型是最佳选择。如果所需语言不在 NVIDIA 模型的覆盖范围内,请使用 Whisper。

Parakeet 比 Whisper 更准确吗?

在 Open ASR Leaderboard 的英语基准中,是的。Parakeet TDT 0.6B v3 的平均 WER 为 6.34%,Whisper large-v3 约为 7.4%,仅支持英语的 Parakeet Unified 更达到 5.91%。但需要说明的是,日常听写中约 ~1 个 WER 百分点的差距很难察觉。Parakeet 更明显的优势在于速度、效率,以及不会在静音时生成幻觉文本;后者是 Whisper 的已知问题。

在本地运行这些模型需要 GPU 吗?

不需要。三者都能在现代 CPU 上运行。Parakeet 和 Nemotron 使用针对 CPU 推理设计的 INT8 量化 ONNX 模型(磁盘占用约 630–680MB)。Whisper 通过 whisper.cpp 在 CPU 上运行,不过其 3GB 大模型能从 GPU 加速中受益。OpenWhispr 支持 Apple Silicon 上的 Metal、NVIDIA 上的 CUDA 以及 AMD/Intel GPU 上的 Vulkan,并可自动回退至 CPU。

Nemotron ASR 支持哪些语言?

NVIDIA Nemotron 3.5 ASR 在单个 600M 参数模型中覆盖 40 个语言区域,并支持自动语言检测。OpenWhispr 已启用其中 15 种可直接转录的语言:英语、西班牙语、法语、意大利语、葡萄牙语、荷兰语、德语、土耳其语、俄语、阿拉伯语、印地语、日语、韩语、越南语和乌克兰语。另有仅支持英语的 Nemotron 流式模型。

Whisper 已经过时了吗?

没有。Whisper 仍支持 99 种语言,远多于 Parakeet 的 25 种或 Nemotron 的 40 个语言区域。对于日语、韩语和越南语之外的亚洲语言、低资源语言以及频繁切换语言的音频,它仍是最稳妥的选择。它也是经过最多实际检验、生态最成熟的模型。变化只在于 Whisper 已不再占据英语准确率和速度的首位。

OpenWhispr 支持其中哪些模型?

全部支持。OpenWhispr 通过 whisper.cpp 提供六种大小的 Whisper,通过 sherpa-onnx 提供两款 Parakeet 和两款 Nemotron 流式模型,并可在设置中切换。所有处理均在设备上完成,音频绝不会离开您的电脑;应用免费且开源。