部落格

Whisper 模型大小完整解析:Tiny vs Base vs Small vs Medium vs Large

完整比較每一個 Whisper 模型。參數量、速度、準確度,以及你真正該選哪一個。

OpenWhispr

OpenWhispr

工程

2026 年 2 月 5 日
目錄

OpenAI 的 Whisper 共有 5 種大小類別、9 個模型版本: tiny(3,900 萬參數)、base(7,400 萬)、small(2.44 億)、medium(7.69 億)以及 large(15.5 億)。每種大小都有多語言版本與純英文版本(large 與 turbo 除外,這兩者僅有多語言版)。此外還有 turbo 模型(8.09 億)——它是 large-v3 的蒸餾版本,準確度幾乎不相上下,但速度大幅提升。模型愈大愈準確,但速度愈慢,也需要更多記憶體。

以多數本機轉錄應用所採用的 whisper.cpp 量化(GGML)格式來說,模型檔案大小從 75 MB(tiny)到 2.9 GB(large)不等。執行階段的記憶體用量則從 tiny 約 273 MB 到 large 約 3.9 GB。最適合的模型取決於你的硬體、語言,以及你需要的準確度。

最後更新:2026 年 2 月 17 日。參數量、記憶體與基準測試數據皆已對照至少兩個主要來源交叉查核。

事實查核速覽(雙重來源)

Whisper 模型大小:速度與準確性

氣泡大小反映了相對參數數量

更快 →更準確 →tinybasesmallmediumlargeturbo建議:從小處開始,依照硬體進行調整。

詞錯誤率:Whisper 與開源競爭對手

LibriSpeech test-clean(英文朗讀演講)-越低越好

NVIDIA
其他開源
OpenAI Whisper

來源:Hugging Face 模型卡、NVIDIA 模型卡、Open ASR Leaderboard (Feb 2026)。僅限純英語朗讀語音 - 現實世界的準確性因音訊品質、口音和領域而異。商業 API 被省略,因為它們不會發布 LibriSpeech 基準。

完整模型比較

此表涵蓋每一個官方 Whisper 模型。「相對速度」是以 large(1 倍基準)為參照。VRAM 數據為 GPU 上 PyTorch 推論的數值。GGML 欄位顯示 whisper.cpp 的檔案大小與 RAM 用量,而這正是多數桌面應用所使用的格式。

模型參數量純英文VRAM(GPU)GGML 磁碟RAM(whisper.cpp)速度英文 WER多語言 WER
tiny39 Mtiny.en~1 GB75 MiB~273 MB~10x~7.6%~12%
base74 Mbase.en~1 GB142 MiB~388 MB~7x~5.0%~10%
small244 Msmall.en~2 GB466 MiB~852 MB~4x~3.4%~7%
medium769 Mmedium.en~5 GB1.5 GiB~2.1 GB~2x~2.9%~5%
large-v21,550 M不適用~10 GB2.9 GiB~3.9 GB1x~2.7%~4%
large-v31,550 M不適用~10 GB2.9 GiB~3.9 GB1x~2.4%~3.5%
turbo809 M不適用~6 GB1.6 GiB~2.3 GB~8x~2.5%~3.7%

備註: WER(字詞錯誤率)數據為取自 Whisper 論文、HuggingFace 模型卡(英文採用 LibriSpeech 測試集)以及 OpenAI 公開基準測試的概略平均值。實際 WER 會因資料集、語言、音訊品質與評估方法而有顯著差異。數值愈低愈好。速度以 large 為參照(1 倍 = 最慢)。

Tiny(3,900 萬參數)

tiny 是體積最小、速度最快的 Whisper 版本。它僅有 3,900 萬個參數、GGML 檔案大小為 75 MB,幾乎可在任何硬體上順暢執行——包括 Raspberry Pi、舊型筆電與低階行動裝置。相對於 large 模型,它能以約 10 倍即時速度進行轉錄,是延遲比完美準確度更重要時的最佳選擇。

資源用量
  • GGML:磁碟佔用 75 MiB
  • RAM:執行階段約 273 MB
  • VRAM:約 1 GB(GPU 模式)
速度
  • 比 large 快約 10 倍
  • 在 Apple Silicon 上近乎即時
  • 在多數 CPU 上達到即時
準確度
  • 英文 WER:約 7.6%
  • 多語言 WER:約 12%
  • 應對口音/雜訊較吃力

在 tiny.en 版本(純英文)上,LibriSpeech test-clean 的 WER 約為 5.6%,在 test-other(含雜訊/口音的音訊)上則升至約 14.9%。多語言版 tiny 模型在英文上的表現略遜一籌,但支援全部 99 種 Whisper 語言。

tiny 非常適合快速筆記、低風險的口述輸入、即時字幕原型,以及運算資源有限的嵌入式或邊緣裝置。它是許多以 whisper.cpp 為基礎的工具預設的起始模型,因為它能在數秒內下載完成並立即執行。

最適合: 追求最快轉錄速度、低資源硬體、Raspberry Pi、即時應用

Base(7,400 萬參數)

base 模型的參數量是 tiny 的兩倍(7,400 萬 vs 3,900 萬),同時仍十分輕量。它的 GGML 檔案為 142 MiB、執行階段 RAM 約 388 MB,依然能在幾乎任何現代裝置上順暢執行。相較於 tiny,準確度的提升相當明顯——尤其是在含雜訊的音訊與帶口音的語音上。

資源用量
  • GGML:磁碟佔用 142 MiB
  • RAM:執行階段約 388 MB
  • VRAM:約 1 GB(GPU 模式)
速度
  • 比 large 快約 7 倍
  • 在 CPU 上仍然非常快
  • 在 Apple Silicon 上不到一秒
準確度
  • 英文 WER:約 5.0%
  • 多語言 WER:約 10%
  • 含雜訊音訊的表現優於 tiny

base.en 版本在 LibriSpeech test-clean 上達到約 4.3% 的 WER,在 test-other 上約為 12.8%。相較於 tiny.en(分別為 5.6% 與 14.9%),這是相當有意義的進步,在高難度音訊上尤其明顯。

當 tiny 的準確度略嫌不足時,base 是低功耗裝置的好選擇。它在即時轉錄流程中也很受歡迎,適合想在不超過 500 MB RAM 的前提下兼顧速度與品質的情境。

最適合: 需要比 tiny 更佳準確度的低功耗裝置、即時串流、預算型硬體

Small(2.44 億參數)

從 small 開始,Whisper 才真正開始展現出色的準確度。它擁有 2.44 億參數,相較 base 是 3.3 倍的躍升,帶來顯著的準確度提升——尤其是在非英文語言與含雜訊的錄音上。GGML 檔案為 466 MiB,執行階段 RAM 用量約 852 MB。它的執行速度約為 large 的 4 倍。

資源用量
  • GGML:磁碟佔用 466 MiB
  • RAM:執行階段約 852 MB
  • VRAM:約 2 GB(GPU 模式)
速度
  • 比 large 快約 4 倍
  • 在現代筆電上速度很快
  • 在 Apple Silicon 上達到即時
準確度
  • 英文 WER:約 3.4%
  • 多語言 WER:約 7%
  • 能良好應對口音

small.en 版本在 LibriSpeech test-clean 上達到約 3.0% 的 WER——對一個佔用不到 500 MB 的模型而言,這是相當亮眼的成績。在許多純英文的使用情境中,small.en 能以一小部分的資源成本提供接近 medium 的準確度。

small 經常被推薦為多數使用者的預設模型。它在任何現代筆電上都能順暢執行(包括搭載 8 GB RAM 的 MacBook Air M1),在各語言間提供良好的準確度,轉錄速度也足以支援即時口述輸入流程。

我們的建議: 如果你不確定該從哪個模型開始,就從 small 開始。對於絕大多數的硬體與使用情境,它在速度、準確度與資源用量之間取得了最佳平衡。

最適合: 使用現代筆電的多數使用者、預設推薦模型、良好的多語言支援

Medium(7.69 億參數)

從 medium 開始,邊際效益逐漸遞減——但相較 small 的準確度提升仍然有意義,尤其是在多語言轉錄、技術詞彙與高難度音訊條件下。它擁有 7.69 億參數,需要 1.5 GiB 的磁碟空間(GGML),執行階段約需 2.1 GB 的 RAM。

資源用量
  • GGML:磁碟佔用 1.5 GiB
  • RAM:執行階段約 2.1 GB
  • VRAM:約 5 GB(GPU 模式)
速度
  • 比 large 快約 2 倍
  • 在 8 GB 以上的機器上游刃有餘
  • 需要不錯的硬體
準確度
  • 英文 WER:約 2.9%
  • 多語言 WER:約 5%
  • 在技術內容上表現出色

medium.en 模型在 LibriSpeech test-clean 上達到約 3.0% 的 WER,在 test-other 上約為 7.5%。然而,在更廣泛的基準測試中——尤其是那些涵蓋多元口音、背景雜訊與特定領域詞彙的測試——medium 始終優於 small。

對於重視準確度、但又沒有硬體(或耐心)跑 large 的專業轉錄流程來說,medium 是強而有力的選擇。它在配備 8 GB 以上 RAM 的機器上執行順暢,並能從 GPU 加速中獲得顯著效益。

最適合: 專業用途、多語言轉錄、技術內容、配備 8 GB 以上 RAM 的機器

Large(15.5 億參數)

large 模型是準確度最高的 Whisper 版本,擁有 15.5 億個參數。它共有三個版本: large-v1 (最初發行版本)、 large-v2 (以 2.5 倍 epoch 訓練並加入正規化)以及 large-v3 (以更多資料訓練,並採用 128 個梅爾頻率區間而非 80 個)。large-v3 是目前追求最高準確度時的推薦版本。

資源用量
  • GGML:磁碟佔用 2.9 GiB
  • RAM:執行階段約 3.9 GB
  • VRAM:約 10 GB(GPU 模式)
速度
  • 1 倍(基準——最慢)
  • 強烈建議使用 GPU
  • CPU:可能比即時速度更慢
準確度
  • 英文 WER:約 2.4%(v3)
  • 多語言 WER:約 3.5%(v3)
  • 在所有語言上表現最佳

large-v2 vs large-v3

large-v2

  • 訓練的 epoch 數為 large-v1 的 2.5 倍
  • 加入正規化以提升泛化能力
  • LibriSpeech test-clean WER:約 3.0%
  • 在某些音訊類型上更穩定

large-v3

  • 128 個梅爾區間(相較 80 個)——更精細的頻率解析度
  • 以 100 萬小時標註音訊 + 400 萬小時偽標註音訊訓練
  • 跨語言相較 large-v2 降低 10–20% 的錯誤
  • 新增粵語語言支援

該選哪個 large 模型: 新專案請使用 large-v3。平均而言,它在各語言上都嚴格優於 large-v2。不過,有些使用者回報,在極安靜或無聲的音訊片段等特定邊緣情況下,large-v2 產生的幻覺(生成音訊中不存在的文字)較少。如果你在 large-v3 上遇到幻覺問題,可改用 large-v2 作為備用方案。

最適合: 追求最高準確度、專業/醫療/法律轉錄、低資源語言、批次處理

Turbo(8.09 億參數)

turbo 模型是 large-v3 的蒸餾版本,能大幅縮短推論時間,同時保留大部分準確度。OpenAI 透過將解碼器從 32 層精簡至僅 4 層達成這一點——把參數量從 15.5 億縮減至 8.09 億。而負責主要運算的編碼器,則與 large-v3 完全相同。

資源用量
  • GGML:磁碟佔用約 1.6 GiB
  • RAM:執行階段約 2.3 GB
  • VRAM:約 6 GB(GPU 模式)
速度
  • 比 large 快約 8 倍
  • 接近 large 的準確度、接近 tiny 的速度
  • 搭配 torch.compile 在 GPU 上表現出色
準確度
  • 英文 WER:約 2.5%
  • 多語言 WER:約 3.7%
  • 相較 large-v3 僅有輕微品質損失

當你想要接近 large-v3 的準確度、卻無法承受完整 large 模型的延遲時,turbo 是最佳選擇。在 GPU 上搭配 torch.compile 等最佳化,turbo 相較標準推論可達到最高 4.5 倍的速度提升,使其極為快速。

重要限制: turbo 模型並未針對翻譯任務訓練。如果你需要將某語言的語音翻譯成英文,請改用 medium 或 large-v3。

最適合: 高準確度的即時轉錄、對延遲敏感的應用、當 large-v3 太慢時

純英文版 vs 多語言版模型

在 tiny、base、small 與 medium 這幾種大小上,Whisper 都提供兩種版本:多語言模型與純英文( .en )模型。large 與 turbo 模型則僅有多語言版——並沒有純英文版本。

何時該用 .en(純英文)

  • 你只轉錄英文音訊
  • 在 tiny/base 等較小尺寸上有更佳的英文準確度
  • 速度略快——沒有語言偵測的額外負擔
  • 檔案大小與多語言版本相同

何時該用多語言版

  • 你轉錄非英文音訊
  • 你的音訊包含混合語言
  • 你需要語音翻譯(譯成英文)
  • 使用 large 或 turbo 時為必選(不存在 .en 版本)

.en 與多語言模型之間的效能差距,在較小尺寸上最為顯著。在 tiny 與 base 上,.en 版本在英文上明顯較佳。等到 small 與 medium 時,差距已大幅縮小。到了 large 等級則只有多語言模型——而且無論如何,它在英文上的表現都極為出色。

經驗法則: 如果你只使用英文,而且正在 tiny 或 base 之間選擇,請挑 .en 版本。若是 small 以上,多語言版本在英文上表現極佳,還能讓你保有處理其他語言的彈性。

硬體需求:哪種硬體能跑哪個模型

你所需的硬體很大程度取決於模型大小,以及你使用的是 whisper.cpp(CPU/Metal/CUDA)還是 PyTorch 實作(以 GPU 為主)。以下是在常見硬體類別上可預期的表現。

MacBook Air M1(8 GB RAM)

  • tiny/base: 瞬間完成。比即時速度更快。
  • small: 快速。搭配 Metal 可達即時或更佳。
  • medium: 可用。在 CPU 上可能略慢於即時速度。Metal 能帶來顯著幫助。
  • large: 可行,但 RAM 較吃緊。預期會慢於即時速度。
  • turbo: 很適合。搭配 Metal 加速可達近乎即時。

MacBook Pro M2/M3(16–36 GB RAM)

  • tiny/base/small: 瞬間完成。全都遠在硬體上限之內。
  • medium: 快速。搭配 Metal 游刃有餘。
  • large: 表現良好。搭配 Metal 可達即時或接近即時。
  • turbo: 非常出色。快速的即時轉錄。

中階 Windows/Linux 筆電(8 GB RAM,內顯)

  • tiny/base: 快速。純 CPU 即可勝任。
  • small: 表現良好。在多數現代 CPU 上游刃有餘。
  • medium: 可運作。在 CPU 上可能比即時速度慢 2–3 倍。
  • large: 有挑戰性。純 CPU 會很慢。
  • turbo: 可運作。若有 Vulkan 可受益其中。

搭載 NVIDIA GPU 的桌機(RTX 3060 以上,8 GB 以上 VRAM)

  • 所有模型: 快速。GPU 能輕鬆應對一切。
  • large: 需要 10 GB VRAM(RTX 3060 12GB 或更佳)。
  • turbo: 搭配 CUDA 是最快的選擇。明顯快於 large。
  • 在 whisper.cpp 中使用 CUDA 後端以獲得最佳效能。

whisper.cpp 加速後端

whisper.cpp——多數桌面應用所使用的 C/C++ 移植版——支援數種能大幅提升效能的硬體加速後端:

Metal(Apple Silicon)

在 M1/M2/M3/M4 Mac 上進行完整的 GPU 推論。整個模型都在 GPU 上執行,零記憶體複製。這是 macOS 使用者最快的後端,也是 OpenWhispr 在 Mac 上採用的方案。

Core ML(Apple)

運用 Apple 的神經網路引擎進行推論。在較新晶片上,某些模型大小可能比 Metal 更快,且更省電。需先將模型轉換為 Core ML 格式。

CUDA(NVIDIA)

針對 NVIDIA 顯示卡的 GPU 加速。對於擁有獨立 NVIDIA GPU 的使用者而言是最快的後端。需要 CUDA 工具組。是桌機上執行 large 與 turbo 模型的最佳選擇。

Vulkan(跨廠商 GPU)

可搭配 Intel、AMD 與 NVIDIA GPU 使用。是非 NVIDIA 系統的好備用方案。在 Linux 與 Windows 上皆可使用。效能會因 GPU 廠商與驅動程式而有所不同。

概略轉錄速度

以 60 秒音訊片段計算的即時係數(RTF)。RTF < 1.0 代表比即時速度更快。這些僅為粗略估計——實際效能取決於音訊內容、模型量化方式與系統負載。

模型M1 MacBook AirM3 Pro MacBookIntel i7(CPU)RTX 3060(CUDA)
tiny~0.05x~0.03x~0.1x~0.02x
base~0.08x~0.05x~0.15x~0.04x
small~0.2x~0.12x~0.4x~0.08x
medium~0.6x~0.3x~1.2x~0.15x
large-v3~1.5x~0.7x~3.0x~0.3x
turbo~0.3x~0.15x~0.6x~0.08x

如何解讀此表: 0.1x 代表轉錄 60 秒的音訊約需 6 秒。1.0x = 即時速度。高於 1.0x 的數值代表慢於即時速度。所有數據皆使用 whisper.cpp 的預設設定,並在適用時採用 Metal(Mac)或 CUDA(NVIDIA)後端。

你該使用哪個模型?

以下是根據常見情境提出的具體建議。拿不定主意時,就從 small 開始,再依你的實際體驗往上或往下調整。

「我想要最快的速度」

使用 tiny tiny.en 。在現代硬體上能於數毫秒內完成轉錄。準確度較為粗略,但對快速筆記與低風險口述輸入而言堪用。

tiny / tiny.en

「我想在筆電上有不錯的準確度」

使用 small 。在現代筆電上兼顧速度與準確度的最佳平衡。若你的機器有 16 GB 以上 RAM, medium 也是極佳的選擇。

small 或 medium

「我想要最佳的準確度」

使用 large-v3 。它是整體上準確度最高的 Whisper 模型。若速度也很重要, turbo 能以 8 倍的速度達到 95% 的準確度。

large-v3 或 turbo

「我只使用英文」

使用所選大小的 .en 版本,以獲得最佳英文準確度。在 tiny 與 base 上,.en 模型明顯較佳。在 small 以上,差距則微乎其微。

small.en 或 medium.en

「我使用多種語言」

使用多語言版本。 small medium 可獲得均衡的表現。 large-v3 則有最佳的多語言準確度。

small、medium 或 large-v3

「我的硬體非常有限」

使用 tiny base 。兩者都能在 1 GB RAM 上執行,甚至可在 Raspberry Pi 與其他單板電腦上運作。base 相較 tiny 帶來有意義的準確度提升,額外成本卻極小。

tiny 或 base

OpenWhispr 如何處理模型選擇

OpenWhispr 是一款底層採用 whisper.cpp 的開源桌面口述應用。它讓你直接在設定中下載並切換任何 Whisper 模型——完全不需要命令列。模型下載一次後便儲存在本機。你可隨時更換模型,為你的硬體在速度與準確度之間取得平衡。

下載任何模型

在設定中從 tiny 到 large-v3 任你挑選。OpenWhispr 會自動下載 GGML 版本。

即時切換

隨時更換模型,無需重新啟動。試用不同大小,找出最適合你硬體的選擇。

針對硬體最佳化

在 Apple Silicon 上使用 Metal、在 NVIDIA 上使用 CUDA,其餘則採用最佳化的 CPU 推論。全部在本機執行,全部保有隱私。

我們的建議: small 開始。如果覺得慢,就往下調到 base 或 tiny。如果想要更佳的準確度,且硬體能負擔,就往上調到 medium 或 large-v3。OpenWhispr 讓嘗試各種選擇變得輕而易舉。

資料來源

在 OpenWhispr 中試用不同的 Whisper 模型

開源、本機優先的口述工具。下載任何 Whisper 模型,一鍵切換各種大小,為你的硬體找到最完美的平衡。

無需帳號 · 可離線運作 · 永久開源