比較

Parakeet、Whisper 與 Nemotron:2026 年最佳本機語音轉文字方案

如今,三款開放模型都能完全在您的電腦上把語音轉成文字。本文依據第一手資料中的可靠數據,比較它們在準確率、速度、語言涵蓋與串流辨識方面的真實表現。

OpenWhispr

OpenWhispr

工程

2026 年 7 月 18 日
目錄

對英語與主要歐洲語言而言,NVIDIA Parakeet TDT 0.6B v3 是 2026 年最佳本機語音轉文字模型:實測準確率優於 Whisper large-v3,體積僅為後者四分之一,在一般 CPU 上也快得多。若希望文字在說話時即時出現,NVIDIA 新推出的 Nemotron 串流模型是首批專為此目的設計的本機模型。若您使用的是 NVIDIA 模型尚未涵蓋的許多語言之一,支援 99 種語言的 OpenAI Whisper 仍是正確選擇。

2026 年最令人意外的變化,是 Whisper 失去維持三年的開放模型準確率冠軍。不過,「哪款模型最好」如今確實是三方競爭,因為它們各有所長:Parakeet 最佳化每瓦準確率,Nemotron 最佳化延遲,Whisper 則最佳化語言廣度。本文以模型卡與公開 Leaderboard 的數據比較,不憑感覺,也不誇大差異。

最後更新於 2026 年 7 月 18 日。我們開發 OpenWhispr,這是一款同時提供三大模型系列的開源聽寫應用程式,因此我們會在正式環境中測試並支援每一款模型。這也說明了我們的立場:我們不銷售其中任何模型,以下的實際取捨與我們向使用者說明的完全相同。

關鍵事實速覽(第一手資料)

三個候選模型

三者都是可免費下載、離線執行的開放權重模型。架構上的差異,幾乎解釋了實際使用中的所有不同。

OpenAI Whisper (2022)

讓開放語音辨識進入主流的模型。它是以 680,000 小時音訊訓練的編碼器—解碼器 Transformer,提供從 75MB(tiny)到 3GB(large-v3)的六種大小,涵蓋 99 種語言。它像語言模型一樣逐一產生 token,因此也是三者中最慢的。MIT 授權。

NVIDIA Parakeet (2024–2025)

為批次轉錄設計的 600M 參數轉導器(TDT)模型。它不以自迴歸方式產生 token,而是在一次讀取音訊的過程中輸出文字,速度快得多,也不會在靜音時捏造文字。兩款重要版本是多語言 v3(25 種語言,INT8 ONNX 為 680MB)與僅支援英語的 Unified(631MB);後者目前擁有領先的英語準確率。CC-BY-4.0 授權。

NVIDIA Nemotron ASR (2026)

面向串流辨識的最新系列:具備快取感知能力的 FastConformer 轉導器會隨音訊到達而轉錄,無須等待錄音結束。英語模型於 2026 年 1 月推出,涵蓋 40 個語言地區的多語言 3.5 模型於 6 月跟進。兩者均為 600M 參數(INT8 ONNX 為 632–650MB),採用開放的 OpenMDW 授權。

準確率:Parakeet 勝出,但差距沒看起來那麼大

語音模型通常使用 詞錯誤率(WER)衡量,也就是模型辨識錯誤的詞彙比例,越低越好。標準參考是 Hugging Face Open ASR Leaderboard,它對八個不同的英語資料集(會議、財報電話會議、TED Talks、有聲書等)的 WER 取平均值,避免單一簡單資料集人為美化模型成績。

英語準確度:平均詞錯誤率

Hugging Face Open ASR Leaderboard 基準測試中多個資料集的平均值(越低越好)。Nemotron 以串流設定呈現。

來源:Hugging Face 上的 NVIDIA 模型卡和 Open ASR Leaderboard,2026 年 7 月。WER = 轉寫錯誤的詞所占百分比。

應客觀看待圖表:這裡的每款模型都已達正式使用等級,總差距僅約 1.5 個百分點。在日常聽寫的清晰音訊上,6.3% 與 7.4% 的感受接近;差異會在口音、雜訊與專業術語等困難音訊中顯現。NVIDIA 數據值得注意的是取得成績所需的成本:Parakeet 只用 600M 參數便達到此準確率,而 Whisper 需要 1.55B;Nemotron 更在完全看不到後續音訊的串流條件下取得 6.93%。

Whisper 的已知弱點:在靜音中產生幻覺

Whisper 的解碼器如同語言模型,因此在靜音或雜訊中可能產生流暢但完全虛構的句子;整個生態系都記錄過這種故障。Parakeet 與 Nemotron 等轉導器在結構上更能抵抗它:沒有音訊依據,就沒有 token。對開頭與結尾常有靜音的聽寫而言,這比基準中的一個百分點更重要。

速度與效率:完全不同等級

在 Leaderboard 使用的硬體上,Parakeet TDT v3 的轉錄速度為即時的 3,332×,約一秒即可處理一小時音訊。Whisper large-v3 的速度遠不到它的十分之一。原因在架構:Whisper 逐一寫出 token,每一步都要等待上一步;轉導器只讀取一次音訊,並隨進度輸出文字。沒有迴圈,也沒有逐詞往返處理。

在筆記型電腦上,絕對數字會下降,但比例仍然成立:Whisper large 需數秒處理的一段聽寫,Parakeet 使用 CPU、無須 GPU 就能近乎瞬間完成。獨立基準還顯示,在品質相當時,NVIDIA 轉導器每小時音訊約少用 8–10× 的能源 ;若經常以電池長時間聽寫,這點很實際。

Whisper 的因應方案是 turbo(1.6GB),它是 large-v3 的蒸餾版本,以少量準確率換取約 8× Whisper-large 的速度。它是適合聽寫的 Whisper,但只能縮小差距,無法追平。完整的型號大小比較請參閱 Whisper 模型大小指南

語言涵蓋:Whisper 的護城河

模型語言說明
Whisper large-v399開放模型中涵蓋最廣,包括低資源語言
Nemotron 3.5 ASR40 個語言地區自動語言偵測;15 種語言可直接轉錄,包括日語、韓語、阿拉伯語與印地語
Parakeet TDT v325歐洲語言以及英語與俄語;自動偵測
Parakeet Unified / Nemotron EN1僅支援英語,以換取同類最佳準確率

經驗法則很簡單。英語或主要歐洲語言:三者都能用,依速度選擇。日語、韓語、越南語、阿拉伯語與印地語:Nemotron 3.5 現已提供串流辨識,這是本機模型真正的首次突破。華語、泰語、印尼語、斯瓦希里語或大量語言切換:Whisper 仍是唯一成熟的選擇,短期內不太可能改變。

串流辨識:真正的分水嶺

在串流辨識方面,Nemotron 不只是小幅領先,而是在完成另外兩者受架構限制無法完成的事。 Whisper 以 30 秒視窗處理音訊,並重新編碼看到的全部內容。因此所謂「即時」Whisper,其實是把同一批次模型反覆執行在重疊音訊上,成本高、延遲大,接縫也不穩定。Nemotron 的快取感知架構專為串流情境訓練:只處理最新音訊區塊,延續內部狀態,並在可設定的 80 毫秒至 1.12 秒延遲內輸出部分文字。

在大規模部署中,效率差異非常顯著:NVIDIA 表示同一 GPU 上可達到比上一代串流模型 多 17× 的並行串流 。在筆記型電腦上,實際優勢更直觀:模型在本機 CPU 上執行,文字隨說話出現。我們在 串流 ASR 技術深入解析中詳細介紹了將其用於桌面應用程式所需的工程工作。

若不在意即時文字,只是在說完後取得最終轉錄,串流辨識不會帶來額外價值,Parakeet 批次模型更合適。串流辨識適用於即時字幕、語音代理,以及邊說邊顯示的聽寫預覽。

硬體:三者都能在一般筆電上執行

這些模型都不需要 GPU。NVIDIA 模型以 INT8 量化 ONNX 檔案(631–680MB)提供,透過不需要 Python 與 PyTorch 的原生執行階段 sherpa-onnx,可在任何較新的 CPU(Apple Silicon 或 x86)上順暢執行。Whisper 透過 whisper.cpp 可跨平台運作;small 與 turbo 適合 CPU,large-v3(3GB、~10GB RAM)則確實能受益於加速。

若有 GPU,建議用於 Whisper:Apple Silicon 內建 Metal,OpenWhispr 一鍵提供 CUDA(NVIDIA)與 Vulkan(AMD、Intel)執行階段,並在 GPU 執行失敗時自動退回 CPU。NVIDIA 轉導器在 CPU 上已足夠快速,對聽寫而言 GPU 加速意義不大。

該選哪一款?

您的需求建議使用
英語聽寫,追求最高準確率Parakeet Unified EN 0.6B
歐洲語言,快速批次轉錄Parakeet TDT 0.6B v3
說英語時即時顯示文字Nemotron Speech Streaming EN
以西班牙語、日語、韓語、阿拉伯語、印地語等即時顯示文字Nemotron 3.5 ASR Streaming
NVIDIA 模型未支援的語言Whisper large-v3 或 turbo
舊裝置或記憶體較少,記錄簡短筆記Whisper tiny 或 base

若隱私是您選擇本機方案的原因,三者同樣合格:音訊在本機處理,絕不上傳。我們在 本機轉錄與雲端轉錄比較中進一步討論這項取捨。

兩分鐘試完三款模型

最客觀的選擇方式,是用每款模型聽寫同一段話。OpenWhispr 在 macOS、Windows 與 Linux 上免費開源,並透過單一設定選單提供本文所有模型:六種大小的 Whisper、兩款 Parakeet 與兩款 Nemotron。下載模型、按下快捷鍵,然後說話。我們的 模型頁面 列出所有模型的大小與取捨。

常見問題

2026 年最佳本機語音轉文字模型是哪一款?

對英語與主要歐洲語言而言,NVIDIA Parakeet TDT 0.6B v3 的整體表現最佳:它在 Open ASR Leaderboard 的平均詞錯誤率為 6.34%,優於 Whisper large-v3 約 7.4% 的成績,體積僅為後者四分之一,CPU 吞吐量也高出許多。若需要邊說邊顯示文字,NVIDIA Nemotron 串流模型是最佳選擇。若所需語言不在 NVIDIA 模型的支援範圍內,請使用 Whisper。

Parakeet 比 Whisper 更準確嗎?

在 Open ASR Leaderboard 的英語基準中,是的。Parakeet TDT 0.6B v3 的平均 WER 為 6.34%,Whisper large-v3 約為 7.4%,僅支援英語的 Parakeet Unified 更達到 5.91%。不過,日常聽寫時約 ~1 個 WER 百分點的差距很難察覺。Parakeet 更明顯的優勢是速度、效率,以及不會在靜音時產生幻覺文字;後者是 Whisper 的已知問題。

在本機執行這些模型需要 GPU 嗎?

不需要。三款模型都能在現代 CPU 上執行。Parakeet 與 Nemotron 使用針對 CPU 推論設計的 INT8 量化 ONNX 模型(硬碟占用約 630–680MB)。Whisper 透過 whisper.cpp 在 CPU 上執行,不過其 3GB 大型模型能受益於 GPU 加速。OpenWhispr 支援 Apple Silicon 的 Metal、NVIDIA 的 CUDA 與 AMD/Intel GPU 的 Vulkan,並能自動退回 CPU。

Nemotron ASR 支援哪些語言?

NVIDIA Nemotron 3.5 ASR 在單一 600M 參數模型中涵蓋 40 個語言地區,並支援自動語言偵測。OpenWhispr 已啟用其中 15 種可直接轉錄的語言:英語、西班牙語、法語、義大利語、葡萄牙語、荷蘭語、德語、土耳其語、俄語、阿拉伯語、印地語、日語、韓語、越南語與烏克蘭語。另有僅支援英語的 Nemotron 串流模型。

Whisper 已經過時了嗎?

沒有。Whisper 仍支援 99 種語言,遠多於 Parakeet 的 25 種或 Nemotron 的 40 個語言地區。對日語、韓語與越南語以外的亞洲語言、低資源語言,以及頻繁切換語言的音訊,它仍是最穩妥的選擇。它也是經過最多實際驗證、擁有最大生態系的模型。改變的只是 Whisper 已不再居於英語準確率與速度之首。

OpenWhispr 支援其中哪些模型?

全部支援。OpenWhispr 透過 whisper.cpp 提供六種大小的 Whisper,透過 sherpa-onnx 提供兩款 Parakeet 與兩款 Nemotron 串流模型,並可在設定中切換。所有處理都在裝置上完成,音訊絕不會離開您的電腦;應用程式免費且開源。