Whisper 模型大小完整解析:Tiny vs Base vs Small vs Medium vs Large
完整比較每一個 Whisper 模型。參數量、速度、準確度,以及你真正該選哪一個。
OpenWhispr
工程
目錄
OpenAI 的 Whisper 共有 5 種大小類別、9 個模型版本: tiny(3,900 萬參數)、base(7,400 萬)、small(2.44 億)、medium(7.69 億)以及 large(15.5 億)。每種大小都有多語言版本與純英文版本(large 與 turbo 除外,這兩者僅有多語言版)。此外還有 turbo 模型(8.09 億)——它是 large-v3 的蒸餾版本,準確度幾乎不相上下,但速度大幅提升。模型愈大愈準確,但速度愈慢,也需要更多記憶體。
以多數本機轉錄應用所採用的 whisper.cpp 量化(GGML)格式來說,模型檔案大小從 75 MB(tiny)到 2.9 GB(large)不等。執行階段的記憶體用量則從 tiny 約 273 MB 到 large 約 3.9 GB。最適合的模型取決於你的硬體、語言,以及你需要的準確度。
最後更新:2026 年 2 月 17 日。參數量、記憶體與基準測試數據皆已對照至少兩個主要來源交叉查核。
事實查核速覽(雙重來源)
- 官方模型系列與參數量: tiny/base/small/medium/large 以及 turbo 皆有 OpenAI 官方文件記載。 OpenAI Whisper README · Whisper 模型卡
- GGML/GGUF 磁碟與執行階段記憶體說明: 本機部署的佔用量取自 whisper.cpp 轉換/執行階段文件。 whisper.cpp · whisper.cpp 記憶體說明
- 基準測試注意事項: WER 會因資料集與語言不同而大幅變動;LibriSpeech 的數據並非通用的品質分數。 Whisper 論文 · large-v2 模型卡
- Turbo 模型定位: turbo 是以速度為導向的版本,其準確度取捨記載於發行說明/模型卡中。 turbo 模型卡 · turbo 發行討論串
- OpenWhispr 使用情境: OpenWhispr 提供多種 Whisper 大小,讓使用者能在裝置端調校速度與準確度。 OpenWhispr · whisper.cpp 後端
Whisper 模型大小:速度與準確性
氣泡大小反映了相對參數數量
詞錯誤率:Whisper 與開源競爭對手
LibriSpeech test-clean(英文朗讀演講)-越低越好
來源:Hugging Face 模型卡、NVIDIA 模型卡、Open ASR Leaderboard (Feb 2026)。僅限純英語朗讀語音 - 現實世界的準確性因音訊品質、口音和領域而異。商業 API 被省略,因為它們不會發布 LibriSpeech 基準。
完整模型比較
此表涵蓋每一個官方 Whisper 模型。「相對速度」是以 large(1 倍基準)為參照。VRAM 數據為 GPU 上 PyTorch 推論的數值。GGML 欄位顯示 whisper.cpp 的檔案大小與 RAM 用量,而這正是多數桌面應用所使用的格式。
| 模型 | 參數量 | 純英文 | VRAM(GPU) | GGML 磁碟 | RAM(whisper.cpp) | 速度 | 英文 WER | 多語言 WER |
|---|---|---|---|---|---|---|---|---|
| tiny | 39 M | tiny.en | ~1 GB | 75 MiB | ~273 MB | ~10x | ~7.6% | ~12% |
| base | 74 M | base.en | ~1 GB | 142 MiB | ~388 MB | ~7x | ~5.0% | ~10% |
| small | 244 M | small.en | ~2 GB | 466 MiB | ~852 MB | ~4x | ~3.4% | ~7% |
| medium | 769 M | medium.en | ~5 GB | 1.5 GiB | ~2.1 GB | ~2x | ~2.9% | ~5% |
| large-v2 | 1,550 M | 不適用 | ~10 GB | 2.9 GiB | ~3.9 GB | 1x | ~2.7% | ~4% |
| large-v3 | 1,550 M | 不適用 | ~10 GB | 2.9 GiB | ~3.9 GB | 1x | ~2.4% | ~3.5% |
| turbo | 809 M | 不適用 | ~6 GB | 1.6 GiB | ~2.3 GB | ~8x | ~2.5% | ~3.7% |
備註: WER(字詞錯誤率)數據為取自 Whisper 論文、HuggingFace 模型卡(英文採用 LibriSpeech 測試集)以及 OpenAI 公開基準測試的概略平均值。實際 WER 會因資料集、語言、音訊品質與評估方法而有顯著差異。數值愈低愈好。速度以 large 為參照(1 倍 = 最慢)。
Tiny(3,900 萬參數)
tiny 是體積最小、速度最快的 Whisper 版本。它僅有 3,900 萬個參數、GGML 檔案大小為 75 MB,幾乎可在任何硬體上順暢執行——包括 Raspberry Pi、舊型筆電與低階行動裝置。相對於 large 模型,它能以約 10 倍即時速度進行轉錄,是延遲比完美準確度更重要時的最佳選擇。
- GGML:磁碟佔用 75 MiB
- RAM:執行階段約 273 MB
- VRAM:約 1 GB(GPU 模式)
- 比 large 快約 10 倍
- 在 Apple Silicon 上近乎即時
- 在多數 CPU 上達到即時
- 英文 WER:約 7.6%
- 多語言 WER:約 12%
- 應對口音/雜訊較吃力
在 tiny.en 版本(純英文)上,LibriSpeech test-clean 的 WER 約為 5.6%,在 test-other(含雜訊/口音的音訊)上則升至約 14.9%。多語言版 tiny 模型在英文上的表現略遜一籌,但支援全部 99 種 Whisper 語言。
tiny 非常適合快速筆記、低風險的口述輸入、即時字幕原型,以及運算資源有限的嵌入式或邊緣裝置。它是許多以 whisper.cpp 為基礎的工具預設的起始模型,因為它能在數秒內下載完成並立即執行。
Base(7,400 萬參數)
base 模型的參數量是 tiny 的兩倍(7,400 萬 vs 3,900 萬),同時仍十分輕量。它的 GGML 檔案為 142 MiB、執行階段 RAM 約 388 MB,依然能在幾乎任何現代裝置上順暢執行。相較於 tiny,準確度的提升相當明顯——尤其是在含雜訊的音訊與帶口音的語音上。
- GGML:磁碟佔用 142 MiB
- RAM:執行階段約 388 MB
- VRAM:約 1 GB(GPU 模式)
- 比 large 快約 7 倍
- 在 CPU 上仍然非常快
- 在 Apple Silicon 上不到一秒
- 英文 WER:約 5.0%
- 多語言 WER:約 10%
- 含雜訊音訊的表現優於 tiny
base.en 版本在 LibriSpeech test-clean 上達到約 4.3% 的 WER,在 test-other 上約為 12.8%。相較於 tiny.en(分別為 5.6% 與 14.9%),這是相當有意義的進步,在高難度音訊上尤其明顯。
當 tiny 的準確度略嫌不足時,base 是低功耗裝置的好選擇。它在即時轉錄流程中也很受歡迎,適合想在不超過 500 MB RAM 的前提下兼顧速度與品質的情境。
Small(2.44 億參數)
從 small 開始,Whisper 才真正開始展現出色的準確度。它擁有 2.44 億參數,相較 base 是 3.3 倍的躍升,帶來顯著的準確度提升——尤其是在非英文語言與含雜訊的錄音上。GGML 檔案為 466 MiB,執行階段 RAM 用量約 852 MB。它的執行速度約為 large 的 4 倍。
- GGML:磁碟佔用 466 MiB
- RAM:執行階段約 852 MB
- VRAM:約 2 GB(GPU 模式)
- 比 large 快約 4 倍
- 在現代筆電上速度很快
- 在 Apple Silicon 上達到即時
- 英文 WER:約 3.4%
- 多語言 WER:約 7%
- 能良好應對口音
small.en 版本在 LibriSpeech test-clean 上達到約 3.0% 的 WER——對一個佔用不到 500 MB 的模型而言,這是相當亮眼的成績。在許多純英文的使用情境中,small.en 能以一小部分的資源成本提供接近 medium 的準確度。
small 經常被推薦為多數使用者的預設模型。它在任何現代筆電上都能順暢執行(包括搭載 8 GB RAM 的 MacBook Air M1),在各語言間提供良好的準確度,轉錄速度也足以支援即時口述輸入流程。
我們的建議: 如果你不確定該從哪個模型開始,就從 small 開始。對於絕大多數的硬體與使用情境,它在速度、準確度與資源用量之間取得了最佳平衡。
Medium(7.69 億參數)
從 medium 開始,邊際效益逐漸遞減——但相較 small 的準確度提升仍然有意義,尤其是在多語言轉錄、技術詞彙與高難度音訊條件下。它擁有 7.69 億參數,需要 1.5 GiB 的磁碟空間(GGML),執行階段約需 2.1 GB 的 RAM。
- GGML:磁碟佔用 1.5 GiB
- RAM:執行階段約 2.1 GB
- VRAM:約 5 GB(GPU 模式)
- 比 large 快約 2 倍
- 在 8 GB 以上的機器上游刃有餘
- 需要不錯的硬體
- 英文 WER:約 2.9%
- 多語言 WER:約 5%
- 在技術內容上表現出色
medium.en 模型在 LibriSpeech test-clean 上達到約 3.0% 的 WER,在 test-other 上約為 7.5%。然而,在更廣泛的基準測試中——尤其是那些涵蓋多元口音、背景雜訊與特定領域詞彙的測試——medium 始終優於 small。
對於重視準確度、但又沒有硬體(或耐心)跑 large 的專業轉錄流程來說,medium 是強而有力的選擇。它在配備 8 GB 以上 RAM 的機器上執行順暢,並能從 GPU 加速中獲得顯著效益。
Large(15.5 億參數)
large 模型是準確度最高的 Whisper 版本,擁有 15.5 億個參數。它共有三個版本: large-v1 (最初發行版本)、 large-v2 (以 2.5 倍 epoch 訓練並加入正規化)以及 large-v3 (以更多資料訓練,並採用 128 個梅爾頻率區間而非 80 個)。large-v3 是目前追求最高準確度時的推薦版本。
- GGML:磁碟佔用 2.9 GiB
- RAM:執行階段約 3.9 GB
- VRAM:約 10 GB(GPU 模式)
- 1 倍(基準——最慢)
- 強烈建議使用 GPU
- CPU:可能比即時速度更慢
- 英文 WER:約 2.4%(v3)
- 多語言 WER:約 3.5%(v3)
- 在所有語言上表現最佳
large-v2 vs large-v3
large-v2
- 訓練的 epoch 數為 large-v1 的 2.5 倍
- 加入正規化以提升泛化能力
- LibriSpeech test-clean WER:約 3.0%
- 在某些音訊類型上更穩定
large-v3
- 128 個梅爾區間(相較 80 個)——更精細的頻率解析度
- 以 100 萬小時標註音訊 + 400 萬小時偽標註音訊訓練
- 跨語言相較 large-v2 降低 10–20% 的錯誤
- 新增粵語語言支援
該選哪個 large 模型: 新專案請使用 large-v3。平均而言,它在各語言上都嚴格優於 large-v2。不過,有些使用者回報,在極安靜或無聲的音訊片段等特定邊緣情況下,large-v2 產生的幻覺(生成音訊中不存在的文字)較少。如果你在 large-v3 上遇到幻覺問題,可改用 large-v2 作為備用方案。
Turbo(8.09 億參數)
turbo 模型是 large-v3 的蒸餾版本,能大幅縮短推論時間,同時保留大部分準確度。OpenAI 透過將解碼器從 32 層精簡至僅 4 層達成這一點——把參數量從 15.5 億縮減至 8.09 億。而負責主要運算的編碼器,則與 large-v3 完全相同。
- GGML:磁碟佔用約 1.6 GiB
- RAM:執行階段約 2.3 GB
- VRAM:約 6 GB(GPU 模式)
- 比 large 快約 8 倍
- 接近 large 的準確度、接近 tiny 的速度
- 搭配 torch.compile 在 GPU 上表現出色
- 英文 WER:約 2.5%
- 多語言 WER:約 3.7%
- 相較 large-v3 僅有輕微品質損失
當你想要接近 large-v3 的準確度、卻無法承受完整 large 模型的延遲時,turbo 是最佳選擇。在 GPU 上搭配 torch.compile 等最佳化,turbo 相較標準推論可達到最高 4.5 倍的速度提升,使其極為快速。
重要限制: turbo 模型並未針對翻譯任務訓練。如果你需要將某語言的語音翻譯成英文,請改用 medium 或 large-v3。
純英文版 vs 多語言版模型
在 tiny、base、small 與 medium 這幾種大小上,Whisper 都提供兩種版本:多語言模型與純英文( .en )模型。large 與 turbo 模型則僅有多語言版——並沒有純英文版本。
何時該用 .en(純英文)
- 你只轉錄英文音訊
- 在 tiny/base 等較小尺寸上有更佳的英文準確度
- 速度略快——沒有語言偵測的額外負擔
- 檔案大小與多語言版本相同
何時該用多語言版
- 你轉錄非英文音訊
- 你的音訊包含混合語言
- 你需要語音翻譯(譯成英文)
- 使用 large 或 turbo 時為必選(不存在 .en 版本)
.en 與多語言模型之間的效能差距,在較小尺寸上最為顯著。在 tiny 與 base 上,.en 版本在英文上明顯較佳。等到 small 與 medium 時,差距已大幅縮小。到了 large 等級則只有多語言模型——而且無論如何,它在英文上的表現都極為出色。
經驗法則: 如果你只使用英文,而且正在 tiny 或 base 之間選擇,請挑 .en 版本。若是 small 以上,多語言版本在英文上表現極佳,還能讓你保有處理其他語言的彈性。
硬體需求:哪種硬體能跑哪個模型
你所需的硬體很大程度取決於模型大小,以及你使用的是 whisper.cpp(CPU/Metal/CUDA)還是 PyTorch 實作(以 GPU 為主)。以下是在常見硬體類別上可預期的表現。
MacBook Air M1(8 GB RAM)
- tiny/base: 瞬間完成。比即時速度更快。
- small: 快速。搭配 Metal 可達即時或更佳。
- medium: 可用。在 CPU 上可能略慢於即時速度。Metal 能帶來顯著幫助。
- large: 可行,但 RAM 較吃緊。預期會慢於即時速度。
- turbo: 很適合。搭配 Metal 加速可達近乎即時。
MacBook Pro M2/M3(16–36 GB RAM)
- tiny/base/small: 瞬間完成。全都遠在硬體上限之內。
- medium: 快速。搭配 Metal 游刃有餘。
- large: 表現良好。搭配 Metal 可達即時或接近即時。
- turbo: 非常出色。快速的即時轉錄。
中階 Windows/Linux 筆電(8 GB RAM,內顯)
- tiny/base: 快速。純 CPU 即可勝任。
- small: 表現良好。在多數現代 CPU 上游刃有餘。
- medium: 可運作。在 CPU 上可能比即時速度慢 2–3 倍。
- large: 有挑戰性。純 CPU 會很慢。
- turbo: 可運作。若有 Vulkan 可受益其中。
搭載 NVIDIA GPU 的桌機(RTX 3060 以上,8 GB 以上 VRAM)
- 所有模型: 快速。GPU 能輕鬆應對一切。
- large: 需要 10 GB VRAM(RTX 3060 12GB 或更佳)。
- turbo: 搭配 CUDA 是最快的選擇。明顯快於 large。
- 在 whisper.cpp 中使用 CUDA 後端以獲得最佳效能。
whisper.cpp 加速後端
whisper.cpp——多數桌面應用所使用的 C/C++ 移植版——支援數種能大幅提升效能的硬體加速後端:
Metal(Apple Silicon)
在 M1/M2/M3/M4 Mac 上進行完整的 GPU 推論。整個模型都在 GPU 上執行,零記憶體複製。這是 macOS 使用者最快的後端,也是 OpenWhispr 在 Mac 上採用的方案。
Core ML(Apple)
運用 Apple 的神經網路引擎進行推論。在較新晶片上,某些模型大小可能比 Metal 更快,且更省電。需先將模型轉換為 Core ML 格式。
CUDA(NVIDIA)
針對 NVIDIA 顯示卡的 GPU 加速。對於擁有獨立 NVIDIA GPU 的使用者而言是最快的後端。需要 CUDA 工具組。是桌機上執行 large 與 turbo 模型的最佳選擇。
Vulkan(跨廠商 GPU)
可搭配 Intel、AMD 與 NVIDIA GPU 使用。是非 NVIDIA 系統的好備用方案。在 Linux 與 Windows 上皆可使用。效能會因 GPU 廠商與驅動程式而有所不同。
概略轉錄速度
以 60 秒音訊片段計算的即時係數(RTF)。RTF < 1.0 代表比即時速度更快。這些僅為粗略估計——實際效能取決於音訊內容、模型量化方式與系統負載。
| 模型 | M1 MacBook Air | M3 Pro MacBook | Intel i7(CPU) | RTX 3060(CUDA) |
|---|---|---|---|---|
| tiny | ~0.05x | ~0.03x | ~0.1x | ~0.02x |
| base | ~0.08x | ~0.05x | ~0.15x | ~0.04x |
| small | ~0.2x | ~0.12x | ~0.4x | ~0.08x |
| medium | ~0.6x | ~0.3x | ~1.2x | ~0.15x |
| large-v3 | ~1.5x | ~0.7x | ~3.0x | ~0.3x |
| turbo | ~0.3x | ~0.15x | ~0.6x | ~0.08x |
如何解讀此表: 0.1x 代表轉錄 60 秒的音訊約需 6 秒。1.0x = 即時速度。高於 1.0x 的數值代表慢於即時速度。所有數據皆使用 whisper.cpp 的預設設定,並在適用時採用 Metal(Mac)或 CUDA(NVIDIA)後端。
你該使用哪個模型?
以下是根據常見情境提出的具體建議。拿不定主意時,就從 small 開始,再依你的實際體驗往上或往下調整。
「我想要最快的速度」
使用 tiny 或 tiny.en 。在現代硬體上能於數毫秒內完成轉錄。準確度較為粗略,但對快速筆記與低風險口述輸入而言堪用。
tiny / tiny.en「我想在筆電上有不錯的準確度」
使用 small 。在現代筆電上兼顧速度與準確度的最佳平衡。若你的機器有 16 GB 以上 RAM, medium 也是極佳的選擇。
small 或 medium「我想要最佳的準確度」
使用 large-v3 。它是整體上準確度最高的 Whisper 模型。若速度也很重要, turbo 能以 8 倍的速度達到 95% 的準確度。
large-v3 或 turbo「我只使用英文」
使用所選大小的 .en 版本,以獲得最佳英文準確度。在 tiny 與 base 上,.en 模型明顯較佳。在 small 以上,差距則微乎其微。
small.en 或 medium.en「我使用多種語言」
使用多語言版本。 small 或 medium 可獲得均衡的表現。 large-v3 則有最佳的多語言準確度。
small、medium 或 large-v3「我的硬體非常有限」
使用 tiny 或 base 。兩者都能在 1 GB RAM 上執行,甚至可在 Raspberry Pi 與其他單板電腦上運作。base 相較 tiny 帶來有意義的準確度提升,額外成本卻極小。
tiny 或 baseOpenWhispr 如何處理模型選擇
OpenWhispr 是一款底層採用 whisper.cpp 的開源桌面口述應用。它讓你直接在設定中下載並切換任何 Whisper 模型——完全不需要命令列。模型下載一次後便儲存在本機。你可隨時更換模型,為你的硬體在速度與準確度之間取得平衡。
下載任何模型
在設定中從 tiny 到 large-v3 任你挑選。OpenWhispr 會自動下載 GGML 版本。
即時切換
隨時更換模型,無需重新啟動。試用不同大小,找出最適合你硬體的選擇。
針對硬體最佳化
在 Apple Silicon 上使用 Metal、在 NVIDIA 上使用 CUDA,其餘則採用最佳化的 CPU 推論。全部在本機執行,全部保有隱私。
我們的建議: 從 small 開始。如果覺得慢,就往下調到 base 或 tiny。如果想要更佳的準確度,且硬體能負擔,就往上調到 medium 或 large-v3。OpenWhispr 讓嘗試各種選擇變得輕而易舉。
資料來源
- Radford 等人,〈Robust Speech Recognition via Large-Scale Weak Supervision〉(2022) ——附有完整基準測試結果的原始 Whisper 論文。
- OpenAI Whisper GitHub 儲存庫 ——官方模型表、參數量、VRAM 需求與相對速度數據。
- OpenAI Whisper 模型卡 ——官方訓練資料組成與評估注意事項。
- whisper.cpp GitHub 儲存庫 ——GGML 模型大小、RAM 用量與硬體加速細節。
- Whisper large-v2 模型卡(HuggingFace) ——許多 WER 比較所引用的 LibriSpeech 基準測試背景。
- Whisper large-v3 模型卡(HuggingFace) ——訓練細節、相較 large-v2 的架構變更,以及多語言改進。
- Whisper large-v3-turbo 模型卡(HuggingFace) ——Turbo 架構細節、解碼器精簡的具體做法,以及效能取捨。
- OpenAI Whisper Turbo 公告(GitHub 討論串 #2363) ——官方 turbo 發行說明與跨語言效能比較。
- OpenWhispr ——挑選模型大小時的實用本機部署參考。
在 OpenWhispr 中試用不同的 Whisper 模型
開源、本機優先的口述工具。下載任何 Whisper 模型,一鍵切換各種大小,為你的硬體找到最完美的平衡。
無需帳號 · 可離線運作 · 永久開源