博客

Whisper 模型尺寸详解:Tiny、Base、Small、Medium 与 Large 对比

全面对比每个 Whisper 模型。参数量、速度、准确率,以及你究竟该用哪一个。

OpenWhispr

OpenWhispr

工程

2026 年 2 月 5 日
目录

OpenAI 的 Whisper 提供 9 个模型版本,分为 5 个尺寸类别: tiny(3900 万参数)、base(7400 万)、small(2.44 亿)、medium(7.69 亿)和 large(15.5 亿)。每个尺寸都有多语言版本和英语专用版本(large 和 turbo 除外,二者仅有多语言版)。此外还有一个 turbo 模型(8.09 亿)——它是 large-v3 的蒸馏版本,准确率几乎不相上下,但速度大幅提升。模型越大越准确,但速度越慢,占用的内存也越多。

大多数本地转录应用使用的是 whisper.cpp 量化(GGML)格式,其模型文件大小从 75 MB(tiny)到 2.9 GB(large)不等。运行时内存占用从 tiny 的约 273 MB 到 large 的 3.9 GB 不等。合适的模型取决于你的硬件、语言以及你对准确率的要求。

最近更新:2026 年 2 月 17 日。参数、内存和基准测试数据均已与至少两个权威来源交叉核对。

事实核查速览(双重来源)

Whisper 模型大小:速度与准确性

气泡大小反映了相对参数数量

更快 →更准确 →tinybasesmallmediumlargeturbo建议:从小处开始,根据硬件进行调整。

词错误率:Whisper 与开源竞争对手

LibriSpeech test-clean(英语朗读演讲)——越低越好

NVIDIA
其他开源
OpenAI Whisper

来源:Hugging Face 模型卡、NVIDIA 模型卡、Open ASR Leaderboard (Feb 2026)。仅限纯英语朗读语音 - 现实世界的准确性因音频质量、口音和领域而异。商业 API 被省略,因为它们不发布 LibriSpeech 基准。

完整模型对比

本表涵盖了每一个官方 Whisper 模型。「相对速度」以 large 为基准(1 倍)。VRAM 数据针对 GPU 上的 PyTorch 推理。GGML 列显示的是 whisper.cpp 的文件大小和内存占用,而大多数桌面应用使用的正是 whisper.cpp。

模型参数量英语专用VRAM(GPU)GGML 磁盘内存(whisper.cpp)速度英语 WER多语言 WER
tiny39 Mtiny.en~1 GB75 MiB~273 MB~10x~7.6%~12%
base74 Mbase.en~1 GB142 MiB~388 MB~7x~5.0%~10%
small244 Msmall.en~2 GB466 MiB~852 MB~4x~3.4%~7%
medium769 Mmedium.en~5 GB1.5 GiB~2.1 GB~2x~2.9%~5%
large-v21,550 M不适用~10 GB2.9 GiB~3.9 GB1x~2.7%~4%
large-v31,550 M不适用~10 GB2.9 GiB~3.9 GB1x~2.4%~3.5%
turbo809 M不适用~6 GB1.6 GiB~2.3 GB~8x~2.5%~3.7%

说明: WER(词错误率)数据是来自 Whisper 论文、HuggingFace 模型卡(英语用 LibriSpeech 测试集)以及 OpenAI 公开基准测试的近似平均值。确切的 WER 会因数据集、语言、音频质量和评测方法的不同而显著变化。数值越低越好。速度以 large 为基准(1 倍 = 最慢)。

Tiny(3900 万参数)

tiny 模型是 Whisper 中最小、最快的版本。仅有 3900 万参数,GGML 文件大小为 75 MB,几乎可以在任何硬件上轻松运行——包括 Raspberry Pi、老旧笔记本电脑和低端移动设备。相对于 large 模型,它的转录速度约为实时速度的 10 倍,因此在延迟比完美准确率更重要时,它是最佳选择。

资源占用
  • GGML:磁盘占用 75 MiB
  • 内存:运行时约 273 MB
  • VRAM:约 1 GB(GPU 模式)
速度
  • 比 large 快约 10 倍
  • 在 Apple Silicon 上近乎瞬时
  • 在大多数 CPU 上可实时运行
准确率
  • 英语 WER:约 7.6%
  • 多语言 WER:约 12%
  • 难以应对口音/噪声

在 tiny.en 版本(英语专用)上,LibriSpeech test-clean 的 WER 约为 5.6%,在 test-other(嘈杂/带口音音频)上升至约 14.9%。多语言版 tiny 模型在英语上表现稍逊,但支持全部 99 种 Whisper 语言。

tiny 非常适合快速记笔记、低风险口述、实时字幕原型,以及算力有限的嵌入式或边缘设备。它是许多基于 whisper.cpp 工具的默认起步模型,因为它几秒钟即可下载完成并即刻运行。

最适合: 追求极致转录速度、低资源硬件、Raspberry Pi、实时应用

Base(7400 万参数)

base 模型的参数量是 tiny 的两倍(7400 万对 3900 万),但仍然非常轻量。GGML 文件 142 MiB,运行时内存约 388 MB,依然能在几乎任何现代设备上轻松运行。相比 tiny,准确率的提升十分明显——尤其是在嘈杂音频和带口音的语音上。

资源占用
  • GGML:磁盘占用 142 MiB
  • 内存:运行时约 388 MB
  • VRAM:约 1 GB(GPU 模式)
速度
  • 比 large 快约 7 倍
  • 在 CPU 上依然很快
  • 在 Apple Silicon 上低于一秒
准确率
  • 英语 WER:约 5.0%
  • 多语言 WER:约 10%
  • 在嘈杂音频上优于 tiny

base.en 版本在 LibriSpeech test-clean 上的 WER 约为 4.3%,在 test-other 上约为 12.8%。相比 tiny.en(分别为 5.6% 和 14.9%),这是一次有意义的提升,尤其是在高难度音频上。

对于 tiny 准确率尚不够用的低功耗设备,base 是个不错的选择。它在实时转录流水线中也很受欢迎——你想要速度与质量的平衡,又不希望内存占用超过 500 MB 时,它正合适。

最适合: 需要比 tiny 更高准确率的低功耗设备、实时流式转录、入门级硬件

Small(2.44 亿参数)

从 small 开始,Whisper 才真正让人感觉准确。凭借 2.44 亿参数,它相比 base 实现了 3.3 倍的飞跃,准确率显著提升——尤其是在非英语语言和嘈杂录音上。GGML 文件为 466 MiB,运行时内存占用约 852 MB。它的运行速度约为 large 的 4 倍。

资源占用
  • GGML:磁盘占用 466 MiB
  • 内存:运行时约 852 MB
  • VRAM:约 2 GB(GPU 模式)
速度
  • 比 large 快约 4 倍
  • 在现代笔记本上很快
  • 在 Apple Silicon 上可实时运行
准确率
  • 英语 WER:约 3.4%
  • 多语言 WER:约 7%
  • 能很好地处理口音

small.en 版本在 LibriSpeech test-clean 上的 WER 约为 3.0%——对于一个不到 500 MB 的模型来说,这是相当出色的成绩。在许多仅需英语的场景中,small.en 能以一小部分资源成本提供接近 medium 的准确率。

small 常被推荐为大多数用户的默认模型。它在任何现代笔记本上都运行良好(包括配备 8 GB 内存的 MacBook Air M1),在各种语言上都有不错的准确率,且转录速度足够支撑实时口述工作流。

我们的建议: 如果你不确定从哪个模型入手,就从 small 开始。对于绝大多数硬件和使用场景,它在速度、准确率和资源占用之间取得了最佳平衡。

最适合: 使用现代笔记本的大多数用户、默认推荐模型、良好的多语言支持

Medium(7.69 亿参数)

从 medium 开始,边际收益逐渐递减——但相比 small,准确率的提升仍然有意义,尤其是在多语言转录、专业词汇和高难度音频条件下。凭借 7.69 亿参数,它需要 1.5 GiB 磁盘空间(GGML),运行时内存约 2.1 GB。

资源占用
  • GGML:磁盘占用 1.5 GiB
  • 内存:运行时约 2.1 GB
  • VRAM:约 5 GB(GPU 模式)
速度
  • 比 large 快约 2 倍
  • 在 8 GB 及以上机器上从容运行
  • 需要不错的硬件
准确率
  • 英语 WER:约 2.9%
  • 多语言 WER:约 5%
  • 在专业内容上表现强劲

medium.en 模型在 LibriSpeech test-clean 上的 WER 约为 3.0%,在 test-other 上约为 7.5%。然而在更广泛的基准测试中——尤其是涉及多样口音、背景噪声和特定领域词汇的测试——medium 始终优于 small。

对于看重准确率、但又没有硬件(或耐心)去跑 large 的专业转录工作流来说,medium 是个有力的选择。它在配备 8 GB 及以上内存的机器上运行良好,并能从 GPU 加速中获得显著收益。

最适合: 专业用途、多语言转录、专业内容、配备 8 GB 及以上内存的机器

Large(15.5 亿参数)

large 模型是最准确的 Whisper 版本,拥有 15.5 亿参数。它有三个版本: large-v1 (最初的发布版), large-v2 (训练轮数增加 2.5 倍并加入正则化),以及 large-v3 (在更多数据上训练,并采用 128 个梅尔频率分箱而非 80 个)。large-v3 是目前追求最高准确率的推荐版本。

资源占用
  • GGML:磁盘占用 2.9 GiB
  • 内存:运行时约 3.9 GB
  • VRAM:约 10 GB(GPU 模式)
速度
  • 1 倍(基准——最慢)
  • 强烈推荐使用 GPU
  • CPU:可能慢于实时速度
准确率
  • 英语 WER:约 2.4%(v3)
  • 多语言 WER:约 3.5%(v3)
  • 在所有语言上都最佳

large-v2 与 large-v3 对比

large-v2

  • 训练轮数比 large-v1 多 2.5 倍
  • 加入正则化以获得更好的泛化能力
  • LibriSpeech test-clean WER:约 3.0%
  • 在某些音频类型上更稳定

large-v3

  • 128 个梅尔分箱(对比 80 个)——更精细的频率分辨率
  • 在 100 万小时标注音频 + 400 万小时伪标注音频上训练
  • 跨语言相比 large-v2 降低 10-20% 的错误率
  • 新增粤语支持

该用哪个 large 模型: 对于新项目,请使用 large-v3。在各语言的平均表现上,它都严格优于 large-v2。不过,一些用户反映,在音频片段非常安静或静音的特定边缘情况下,large-v2 产生的幻觉(生成音频中并不存在的文本)更少。如果你在使用 large-v3 时遇到幻觉问题,可以尝试退回 large-v2 作为备选。

最适合: 追求最高准确率、专业/医疗/法律转录、低资源语言、批量处理

Turbo(8.09 亿参数)

turbo 模型是 large-v3 的蒸馏版本,它在保留大部分准确率的同时大幅缩短了推理时间。OpenAI 通过将解码器从 32 层精简至仅 4 层实现了这一点——参数量从 15.5 亿减少到 8.09 亿。而负责繁重工作的编码器与 large-v3 保持完全一致。

资源占用
  • GGML:磁盘占用约 1.6 GiB
  • 内存:运行时约 2.3 GB
  • VRAM:约 6 GB(GPU 模式)
速度
  • 比 large 快约 8 倍
  • 准确率接近 large,速度接近 tiny
  • 配合 torch.compile 在 GPU 上表现出色
准确率
  • 英语 WER:约 2.5%
  • 多语言 WER:约 3.7%
  • 相比 large-v3 质量略有损失

当你想要接近 large-v3 的准确率、却无法承受完整 large 模型的延迟时,turbo 是最佳选择。在 GPU 上配合 torch.compile 等优化,turbo 相比标准推理可实现最高 4.5 倍的速度提升,因而极为快速。

重要限制: turbo 模型未针对翻译任务进行训练。如果你需要把一种语言的语音翻译成英语,请改用 medium 或 large-v3。

最适合: 高准确率实时转录、对延迟敏感的应用、large-v3 太慢的场景

英语专用版与多语言版模型

对于 tiny、base、small 和 medium 尺寸,Whisper 提供两个版本:多语言模型和英语专用( .en )模型。large 和 turbo 模型仅有多语言版——没有英语专用版本。

何时使用 .en(英语专用)

  • 你只转录英语音频
  • 在 tiny/base 尺寸级别上英语准确率更高
  • 稍快一些——无需语言检测开销
  • 文件大小与多语言版相同

何时使用多语言版

  • 你需要转录非英语音频
  • 你的音频包含多种混合语言
  • 你需要语音翻译(译为英语)
  • 使用 large 或 turbo 时必须用它(不存在 .en 版本)

.en 版与多语言版模型之间的性能差距在较小尺寸上最为明显。对于 tiny 和 base,.en 版本在英语上明显更好。等到了 small 和 medium,差距就大幅缩小了。在 large 级别只有多语言模型——而它在英语上的表现同样出色。

经验法则: 如果你只用英语,并且在 tiny 或 base 中选择,那就选 .en 版本。对于 small 及以上,多语言版用于英语效果很好,还能让你灵活应对其他语言。

硬件要求:哪些模型能在哪里运行

你需要的硬件在很大程度上取决于模型尺寸,以及你使用的是 whisper.cpp(CPU/Metal/CUDA)还是 PyTorch 实现(侧重 GPU)。以下是常见硬件类别上的预期表现。

MacBook Air M1(8 GB 内存)

  • tiny/base: 瞬时完成。快于实时速度。
  • small: 很快。借助 Metal 可达实时或更优。
  • medium: 可用。在 CPU 上可能略慢于实时速度。Metal 能带来显著帮助。
  • large: 可行但内存吃紧。预计会慢于实时速度。
  • turbo: 很合适。借助 Metal 加速可接近实时速度。

MacBook Pro M2/M3(16-36 GB 内存)

  • tiny/base/small: 瞬时完成。全部远在硬件上限之内。
  • medium: 很快。借助 Metal 从容运行。
  • large: 良好。借助 Metal 可达实时或接近实时。
  • turbo: 出色。快速实时转录。

中端 Windows/Linux 笔记本(8 GB 内存,集成显卡)

  • tiny/base: 很快。仅用 CPU 即可。
  • small: 良好。在大多数现代 CPU 上从容运行。
  • medium: 可行。在 CPU 上可能比实时速度慢 2-3 倍。
  • large: 有挑战。仅用 CPU 会很慢。
  • turbo: 可行。若有 Vulkan 可从中受益。

配备 NVIDIA 显卡的台式机(RTX 3060 及以上,8 GB 及以上 VRAM)

  • 所有模型: 很快。GPU 能从容应对一切。
  • large: 需要 10 GB VRAM(RTX 3060 12GB 或更高)。
  • turbo: 配合 CUDA 是最快的选择。明显快于 large。
  • 在 whisper.cpp 中使用 CUDA 后端可获得最佳性能。

whisper.cpp 加速后端

whisper.cpp——大多数桌面应用使用的 C/C++ 移植版本——支持多种硬件加速后端,可大幅提升性能:

Metal(Apple Silicon)

在 M1/M2/M3/M4 Mac 上进行完整的 GPU 推理。整个模型在 GPU 上运行,零内存拷贝。这是 macOS 用户最快的后端,也是 OpenWhispr 在 Mac 上所采用的方案。

Core ML(Apple)

使用 Apple 的神经网络引擎进行推理。在较新芯片上,某些模型尺寸的速度可能快于 Metal,且更省电。需要先将模型转换为 Core ML 格式。

CUDA(NVIDIA)

为 NVIDIA 显卡提供 GPU 加速。对于拥有独立 NVIDIA 显卡的用户,这是最快的后端。需要 CUDA 工具包。是台式机上运行 large 和 turbo 模型的最佳选择。

Vulkan(跨厂商 GPU)

可与 Intel、AMD 和 NVIDIA 显卡配合使用。对于非 NVIDIA 系统是不错的备选方案。在 Linux 和 Windows 上均可用。性能因 GPU 厂商和驱动而异。

近似转录速度

针对一段 60 秒音频的实时系数(RTF)。RTF < 1.0 表示快于实时速度。这些只是粗略估计——实际性能取决于音频内容、模型量化和系统负载。

模型M1 MacBook AirM3 Pro MacBookIntel i7(CPU)RTX 3060(CUDA)
tiny~0.05x~0.03x~0.1x~0.02x
base~0.08x~0.05x~0.15x~0.04x
small~0.2x~0.12x~0.4x~0.08x
medium~0.6x~0.3x~1.2x~0.15x
large-v3~1.5x~0.7x~3.0x~0.3x
turbo~0.3x~0.15x~0.6x~0.08x

如何读懂此表: 0.1x 表示转录 60 秒音频约需 6 秒。1.0x = 实时速度。高于 1.0x 的数值表示慢于实时速度。所有数据均使用默认设置的 whisper.cpp,并在适用时采用 Metal(Mac)或 CUDA(NVIDIA)后端。

你该使用哪个模型?

以下是基于常见场景的具体建议。拿不定主意时,就从 small 开始,再根据使用体验向上或向下调整。

「我想要尽可能快」

使用 tiny tiny.en 。在现代硬件上以毫秒级完成转录。准确率较粗糙,但用于快速记笔记和低风险口述足够了。

tiny / tiny.en

「我想在笔记本上获得不错的准确率」

使用 small 。对于现代笔记本,它在速度和准确率之间取得了最佳平衡。如果你的机器有 16 GB 及以上内存, medium 也是个绝佳选择。

small 或 medium

「我想要最高的准确率」

使用 large-v3 。它是整体上最准确的 Whisper 模型。如果速度也重要, turbo 能以 8 倍速度提供 95% 的准确率。

large-v3 或 turbo

「我只用英语」

使用你所选尺寸的 .en 版本,以获得最佳英语准确率。对于 tiny 和 base,.en 模型明显更好。对于 small 及以上,差异很小。

small.en 或 medium.en

「我使用多种语言」

使用多语言版本。 small medium 可获得均衡的表现。 large-v3 可获得最佳的多语言准确率。

small、medium 或 large-v3

「我的硬件非常有限」

使用 tiny base 。两者都能在 1 GB 内存下运行,甚至可在 Raspberry Pi 和其他单板计算机上工作。base 相比 tiny 准确率有明显提升,而额外成本极小。

tiny 或 base

OpenWhispr 如何处理模型选择

OpenWhispr 是一款开源的桌面口述应用,底层使用 whisper.cpp。它让你直接在设置中下载并切换任意 Whisper 模型——无需命令行。模型只需下载一次,即可本地存储。你可以随时更换模型,为你的硬件平衡速度与准确率。

下载任意模型

在设置中从 tiny 到 large-v3 任选。OpenWhispr 会自动下载 GGML 版本。

即时切换

随时更换模型。无需重启。试用不同尺寸,找到最适合你硬件的那一个。

针对硬件优化

在 Apple Silicon 上使用 Metal,在 NVIDIA 上使用 CUDA,在其他平台上使用优化过的 CPU 推理。全程本地,全程私密。

我们的建议: small 开始。如果觉得慢,就降到 base 或 tiny。如果你想要更高的准确率且硬件能够胜任,就升到 medium 或 large-v3。OpenWhispr 让尝试变得轻松。

参考来源

在 OpenWhispr 中试用不同的 Whisper 模型

开源、本地优先的口述工具。下载任意 Whisper 模型,一键切换尺寸,为你的硬件找到最完美的平衡。

无需账户 · 离线可用 · 永久开源