Parakeet、Whisper 與 Nemotron:2026 年最佳本機語音轉文字方案
如今,三款開放模型都能完全在您的電腦上把語音轉成文字。本文依據第一手資料中的可靠數據,比較它們在準確率、速度、語言涵蓋與串流辨識方面的真實表現。
OpenWhispr
工程
目錄
對英語與主要歐洲語言而言,NVIDIA Parakeet TDT 0.6B v3 是 2026 年最佳本機語音轉文字模型:實測準確率優於 Whisper large-v3,體積僅為後者四分之一,在一般 CPU 上也快得多。若希望文字在說話時即時出現,NVIDIA 新推出的 Nemotron 串流模型是首批專為此目的設計的本機模型。若您使用的是 NVIDIA 模型尚未涵蓋的許多語言之一,支援 99 種語言的 OpenAI Whisper 仍是正確選擇。
2026 年最令人意外的變化,是 Whisper 失去維持三年的開放模型準確率冠軍。不過,「哪款模型最好」如今確實是三方競爭,因為它們各有所長:Parakeet 最佳化每瓦準確率,Nemotron 最佳化延遲,Whisper 則最佳化語言廣度。本文以模型卡與公開 Leaderboard 的數據比較,不憑感覺,也不誇大差異。
最後更新於 2026 年 7 月 18 日。我們開發 OpenWhispr,這是一款同時提供三大模型系列的開源聽寫應用程式,因此我們會在正式環境中測試並支援每一款模型。這也說明了我們的立場:我們不銷售其中任何模型,以下的實際取捨與我們向使用者說明的完全相同。
關鍵事實速覽(第一手資料)
- Parakeet TDT 0.6B v3 在 Open ASR Leaderboard 的八項基準中,平均詞錯誤率為 6.34%,吞吐速度達即時的 3,332×。 600M 參數、25 種語言、CC-BY-4.0 授權。 Parakeet TDT v3 模型卡 · Open ASR Leaderboard
- Whisper large-v3 在同一榜單約為 7.4%,並支援 99 種語言 具備 1.55B 參數,採用 MIT 授權。 OpenAI Whisper 程式碼儲存庫 · Whisper large-v3 模型卡
- Nemotron Speech Streaming EN 0.6B 進行串流辨識時的平均 WER 為 6.93% (1.12 秒音訊區塊),在 LibriSpeech test-clean 達到 2.32%,訓練資料包含 530,000 小時音訊。 Nemotron Streaming EN 模型卡
- Nemotron 3.5 ASR 以單一 600M 串流模型涵蓋 40 個語言地區 支援自動語言偵測,於 2026 年 6 月 4 日以 OpenMDW 授權發布。 Nemotron 3.5 ASR 模型卡
- 下文提到的所有硬碟大小與應用程式內行為都可核實 可在 OpenWhispr 的開源模型登錄檔中查證。 GitHub 上的 OpenWhispr · OpenWhispr 模型頁面
三個候選模型
三者都是可免費下載、離線執行的開放權重模型。架構上的差異,幾乎解釋了實際使用中的所有不同。
OpenAI Whisper (2022)
讓開放語音辨識進入主流的模型。它是以 680,000 小時音訊訓練的編碼器—解碼器 Transformer,提供從 75MB(tiny)到 3GB(large-v3)的六種大小,涵蓋 99 種語言。它像語言模型一樣逐一產生 token,因此也是三者中最慢的。MIT 授權。
NVIDIA Parakeet (2024–2025)
為批次轉錄設計的 600M 參數轉導器(TDT)模型。它不以自迴歸方式產生 token,而是在一次讀取音訊的過程中輸出文字,速度快得多,也不會在靜音時捏造文字。兩款重要版本是多語言 v3(25 種語言,INT8 ONNX 為 680MB)與僅支援英語的 Unified(631MB);後者目前擁有領先的英語準確率。CC-BY-4.0 授權。
NVIDIA Nemotron ASR (2026)
面向串流辨識的最新系列:具備快取感知能力的 FastConformer 轉導器會隨音訊到達而轉錄,無須等待錄音結束。英語模型於 2026 年 1 月推出,涵蓋 40 個語言地區的多語言 3.5 模型於 6 月跟進。兩者均為 600M 參數(INT8 ONNX 為 632–650MB),採用開放的 OpenMDW 授權。
準確率:Parakeet 勝出,但差距沒看起來那麼大
語音模型通常使用 詞錯誤率(WER)衡量,也就是模型辨識錯誤的詞彙比例,越低越好。標準參考是 Hugging Face Open ASR Leaderboard,它對八個不同的英語資料集(會議、財報電話會議、TED Talks、有聲書等)的 WER 取平均值,避免單一簡單資料集人為美化模型成績。
英語準確度:平均詞錯誤率
Hugging Face Open ASR Leaderboard 基準測試中多個資料集的平均值(越低越好)。Nemotron 以串流設定呈現。
來源:Hugging Face 上的 NVIDIA 模型卡和 Open ASR Leaderboard,2026 年 7 月。WER = 轉寫錯誤的詞所占百分比。
應客觀看待圖表:這裡的每款模型都已達正式使用等級,總差距僅約 1.5 個百分點。在日常聽寫的清晰音訊上,6.3% 與 7.4% 的感受接近;差異會在口音、雜訊與專業術語等困難音訊中顯現。NVIDIA 數據值得注意的是取得成績所需的成本:Parakeet 只用 600M 參數便達到此準確率,而 Whisper 需要 1.55B;Nemotron 更在完全看不到後續音訊的串流條件下取得 6.93%。
Whisper 的已知弱點:在靜音中產生幻覺
Whisper 的解碼器如同語言模型,因此在靜音或雜訊中可能產生流暢但完全虛構的句子;整個生態系都記錄過這種故障。Parakeet 與 Nemotron 等轉導器在結構上更能抵抗它:沒有音訊依據,就沒有 token。對開頭與結尾常有靜音的聽寫而言,這比基準中的一個百分點更重要。
速度與效率:完全不同等級
在 Leaderboard 使用的硬體上,Parakeet TDT v3 的轉錄速度為即時的 3,332×,約一秒即可處理一小時音訊。Whisper large-v3 的速度遠不到它的十分之一。原因在架構:Whisper 逐一寫出 token,每一步都要等待上一步;轉導器只讀取一次音訊,並隨進度輸出文字。沒有迴圈,也沒有逐詞往返處理。
在筆記型電腦上,絕對數字會下降,但比例仍然成立:Whisper large 需數秒處理的一段聽寫,Parakeet 使用 CPU、無須 GPU 就能近乎瞬間完成。獨立基準還顯示,在品質相當時,NVIDIA 轉導器每小時音訊約少用 8–10× 的能源 ;若經常以電池長時間聽寫,這點很實際。
Whisper 的因應方案是 turbo(1.6GB),它是 large-v3 的蒸餾版本,以少量準確率換取約 8× Whisper-large 的速度。它是適合聽寫的 Whisper,但只能縮小差距,無法追平。完整的型號大小比較請參閱 Whisper 模型大小指南。
語言涵蓋:Whisper 的護城河
| 模型 | 語言 | 說明 |
|---|---|---|
| Whisper large-v3 | 99 | 開放模型中涵蓋最廣,包括低資源語言 |
| Nemotron 3.5 ASR | 40 個語言地區 | 自動語言偵測;15 種語言可直接轉錄,包括日語、韓語、阿拉伯語與印地語 |
| Parakeet TDT v3 | 25 | 歐洲語言以及英語與俄語;自動偵測 |
| Parakeet Unified / Nemotron EN | 1 | 僅支援英語,以換取同類最佳準確率 |
經驗法則很簡單。英語或主要歐洲語言:三者都能用,依速度選擇。日語、韓語、越南語、阿拉伯語與印地語:Nemotron 3.5 現已提供串流辨識,這是本機模型真正的首次突破。華語、泰語、印尼語、斯瓦希里語或大量語言切換:Whisper 仍是唯一成熟的選擇,短期內不太可能改變。
串流辨識:真正的分水嶺
在串流辨識方面,Nemotron 不只是小幅領先,而是在完成另外兩者受架構限制無法完成的事。 Whisper 以 30 秒視窗處理音訊,並重新編碼看到的全部內容。因此所謂「即時」Whisper,其實是把同一批次模型反覆執行在重疊音訊上,成本高、延遲大,接縫也不穩定。Nemotron 的快取感知架構專為串流情境訓練:只處理最新音訊區塊,延續內部狀態,並在可設定的 80 毫秒至 1.12 秒延遲內輸出部分文字。
在大規模部署中,效率差異非常顯著:NVIDIA 表示同一 GPU 上可達到比上一代串流模型 多 17× 的並行串流 。在筆記型電腦上,實際優勢更直觀:模型在本機 CPU 上執行,文字隨說話出現。我們在 串流 ASR 技術深入解析中詳細介紹了將其用於桌面應用程式所需的工程工作。
若不在意即時文字,只是在說完後取得最終轉錄,串流辨識不會帶來額外價值,Parakeet 批次模型更合適。串流辨識適用於即時字幕、語音代理,以及邊說邊顯示的聽寫預覽。
硬體:三者都能在一般筆電上執行
這些模型都不需要 GPU。NVIDIA 模型以 INT8 量化 ONNX 檔案(631–680MB)提供,透過不需要 Python 與 PyTorch 的原生執行階段 sherpa-onnx,可在任何較新的 CPU(Apple Silicon 或 x86)上順暢執行。Whisper 透過 whisper.cpp 可跨平台運作;small 與 turbo 適合 CPU,large-v3(3GB、~10GB RAM)則確實能受益於加速。
若有 GPU,建議用於 Whisper:Apple Silicon 內建 Metal,OpenWhispr 一鍵提供 CUDA(NVIDIA)與 Vulkan(AMD、Intel)執行階段,並在 GPU 執行失敗時自動退回 CPU。NVIDIA 轉導器在 CPU 上已足夠快速,對聽寫而言 GPU 加速意義不大。
該選哪一款?
| 您的需求 | 建議使用 |
|---|---|
| 英語聽寫,追求最高準確率 | Parakeet Unified EN 0.6B |
| 歐洲語言,快速批次轉錄 | Parakeet TDT 0.6B v3 |
| 說英語時即時顯示文字 | Nemotron Speech Streaming EN |
| 以西班牙語、日語、韓語、阿拉伯語、印地語等即時顯示文字 | Nemotron 3.5 ASR Streaming |
| NVIDIA 模型未支援的語言 | Whisper large-v3 或 turbo |
| 舊裝置或記憶體較少,記錄簡短筆記 | Whisper tiny 或 base |
若隱私是您選擇本機方案的原因,三者同樣合格:音訊在本機處理,絕不上傳。我們在 本機轉錄與雲端轉錄比較中進一步討論這項取捨。
兩分鐘試完三款模型
最客觀的選擇方式,是用每款模型聽寫同一段話。OpenWhispr 在 macOS、Windows 與 Linux 上免費開源,並透過單一設定選單提供本文所有模型:六種大小的 Whisper、兩款 Parakeet 與兩款 Nemotron。下載模型、按下快捷鍵,然後說話。我們的 模型頁面 列出所有模型的大小與取捨。
常見問題
2026 年最佳本機語音轉文字模型是哪一款?
對英語與主要歐洲語言而言,NVIDIA Parakeet TDT 0.6B v3 的整體表現最佳:它在 Open ASR Leaderboard 的平均詞錯誤率為 6.34%,優於 Whisper large-v3 約 7.4% 的成績,體積僅為後者四分之一,CPU 吞吐量也高出許多。若需要邊說邊顯示文字,NVIDIA Nemotron 串流模型是最佳選擇。若所需語言不在 NVIDIA 模型的支援範圍內,請使用 Whisper。
Parakeet 比 Whisper 更準確嗎?
在 Open ASR Leaderboard 的英語基準中,是的。Parakeet TDT 0.6B v3 的平均 WER 為 6.34%,Whisper large-v3 約為 7.4%,僅支援英語的 Parakeet Unified 更達到 5.91%。不過,日常聽寫時約 ~1 個 WER 百分點的差距很難察覺。Parakeet 更明顯的優勢是速度、效率,以及不會在靜音時產生幻覺文字;後者是 Whisper 的已知問題。
在本機執行這些模型需要 GPU 嗎?
不需要。三款模型都能在現代 CPU 上執行。Parakeet 與 Nemotron 使用針對 CPU 推論設計的 INT8 量化 ONNX 模型(硬碟占用約 630–680MB)。Whisper 透過 whisper.cpp 在 CPU 上執行,不過其 3GB 大型模型能受益於 GPU 加速。OpenWhispr 支援 Apple Silicon 的 Metal、NVIDIA 的 CUDA 與 AMD/Intel GPU 的 Vulkan,並能自動退回 CPU。
Nemotron ASR 支援哪些語言?
NVIDIA Nemotron 3.5 ASR 在單一 600M 參數模型中涵蓋 40 個語言地區,並支援自動語言偵測。OpenWhispr 已啟用其中 15 種可直接轉錄的語言:英語、西班牙語、法語、義大利語、葡萄牙語、荷蘭語、德語、土耳其語、俄語、阿拉伯語、印地語、日語、韓語、越南語與烏克蘭語。另有僅支援英語的 Nemotron 串流模型。
Whisper 已經過時了嗎?
沒有。Whisper 仍支援 99 種語言,遠多於 Parakeet 的 25 種或 Nemotron 的 40 個語言地區。對日語、韓語與越南語以外的亞洲語言、低資源語言,以及頻繁切換語言的音訊,它仍是最穩妥的選擇。它也是經過最多實際驗證、擁有最大生態系的模型。改變的只是 Whisper 已不再居於英語準確率與速度之首。
OpenWhispr 支援其中哪些模型?
全部支援。OpenWhispr 透過 whisper.cpp 提供六種大小的 Whisper,透過 sherpa-onnx 提供兩款 Parakeet 與兩款 Nemotron 串流模型,並可在設定中切換。所有處理都在裝置上完成,音訊絕不會離開您的電腦;應用程式免費且開源。