Whisper 模型尺寸详解:Tiny、Base、Small、Medium 与 Large 对比
全面对比每个 Whisper 模型。参数量、速度、准确率,以及你究竟该用哪一个。
OpenWhispr
工程
目录
OpenAI 的 Whisper 提供 9 个模型版本,分为 5 个尺寸类别: tiny(3900 万参数)、base(7400 万)、small(2.44 亿)、medium(7.69 亿)和 large(15.5 亿)。每个尺寸都有多语言版本和英语专用版本(large 和 turbo 除外,二者仅有多语言版)。此外还有一个 turbo 模型(8.09 亿)——它是 large-v3 的蒸馏版本,准确率几乎不相上下,但速度大幅提升。模型越大越准确,但速度越慢,占用的内存也越多。
大多数本地转录应用使用的是 whisper.cpp 量化(GGML)格式,其模型文件大小从 75 MB(tiny)到 2.9 GB(large)不等。运行时内存占用从 tiny 的约 273 MB 到 large 的 3.9 GB 不等。合适的模型取决于你的硬件、语言以及你对准确率的要求。
最近更新:2026 年 2 月 17 日。参数、内存和基准测试数据均已与至少两个权威来源交叉核对。
事实核查速览(双重来源)
- 官方模型系列与参数量: tiny/base/small/medium/large 以及 turbo 均由 OpenAI 官方记录。 OpenAI Whisper README · Whisper 模型卡
- GGML/GGUF 磁盘与运行时内存背景: 本地部署占用数据来自 whisper.cpp 的转换/运行时文档。 whisper.cpp · whisper.cpp 内存说明
- 基准测试注意事项: WER 因数据集和语言不同而差异巨大;LibriSpeech 的数据并非通用的质量评分。 Whisper 论文 · large-v2 模型卡
- Turbo 模型定位: turbo 是一个侧重速度的版本,其准确率上的取舍在发布说明/模型卡中均有记录。 turbo 模型卡 · turbo 发布讨论
- OpenWhispr 使用场景: OpenWhispr 提供多个 Whisper 尺寸,让用户能在设备本地调节速度与准确率。 OpenWhispr · whisper.cpp 后端
Whisper 模型大小:速度与准确性
气泡大小反映了相对参数数量
词错误率:Whisper 与开源竞争对手
LibriSpeech test-clean(英语朗读演讲)——越低越好
来源:Hugging Face 模型卡、NVIDIA 模型卡、Open ASR Leaderboard (Feb 2026)。仅限纯英语朗读语音 - 现实世界的准确性因音频质量、口音和领域而异。商业 API 被省略,因为它们不发布 LibriSpeech 基准。
完整模型对比
本表涵盖了每一个官方 Whisper 模型。「相对速度」以 large 为基准(1 倍)。VRAM 数据针对 GPU 上的 PyTorch 推理。GGML 列显示的是 whisper.cpp 的文件大小和内存占用,而大多数桌面应用使用的正是 whisper.cpp。
| 模型 | 参数量 | 英语专用 | VRAM(GPU) | GGML 磁盘 | 内存(whisper.cpp) | 速度 | 英语 WER | 多语言 WER |
|---|---|---|---|---|---|---|---|---|
| tiny | 39 M | tiny.en | ~1 GB | 75 MiB | ~273 MB | ~10x | ~7.6% | ~12% |
| base | 74 M | base.en | ~1 GB | 142 MiB | ~388 MB | ~7x | ~5.0% | ~10% |
| small | 244 M | small.en | ~2 GB | 466 MiB | ~852 MB | ~4x | ~3.4% | ~7% |
| medium | 769 M | medium.en | ~5 GB | 1.5 GiB | ~2.1 GB | ~2x | ~2.9% | ~5% |
| large-v2 | 1,550 M | 不适用 | ~10 GB | 2.9 GiB | ~3.9 GB | 1x | ~2.7% | ~4% |
| large-v3 | 1,550 M | 不适用 | ~10 GB | 2.9 GiB | ~3.9 GB | 1x | ~2.4% | ~3.5% |
| turbo | 809 M | 不适用 | ~6 GB | 1.6 GiB | ~2.3 GB | ~8x | ~2.5% | ~3.7% |
说明: WER(词错误率)数据是来自 Whisper 论文、HuggingFace 模型卡(英语用 LibriSpeech 测试集)以及 OpenAI 公开基准测试的近似平均值。确切的 WER 会因数据集、语言、音频质量和评测方法的不同而显著变化。数值越低越好。速度以 large 为基准(1 倍 = 最慢)。
Tiny(3900 万参数)
tiny 模型是 Whisper 中最小、最快的版本。仅有 3900 万参数,GGML 文件大小为 75 MB,几乎可以在任何硬件上轻松运行——包括 Raspberry Pi、老旧笔记本电脑和低端移动设备。相对于 large 模型,它的转录速度约为实时速度的 10 倍,因此在延迟比完美准确率更重要时,它是最佳选择。
- GGML:磁盘占用 75 MiB
- 内存:运行时约 273 MB
- VRAM:约 1 GB(GPU 模式)
- 比 large 快约 10 倍
- 在 Apple Silicon 上近乎瞬时
- 在大多数 CPU 上可实时运行
- 英语 WER:约 7.6%
- 多语言 WER:约 12%
- 难以应对口音/噪声
在 tiny.en 版本(英语专用)上,LibriSpeech test-clean 的 WER 约为 5.6%,在 test-other(嘈杂/带口音音频)上升至约 14.9%。多语言版 tiny 模型在英语上表现稍逊,但支持全部 99 种 Whisper 语言。
tiny 非常适合快速记笔记、低风险口述、实时字幕原型,以及算力有限的嵌入式或边缘设备。它是许多基于 whisper.cpp 工具的默认起步模型,因为它几秒钟即可下载完成并即刻运行。
Base(7400 万参数)
base 模型的参数量是 tiny 的两倍(7400 万对 3900 万),但仍然非常轻量。GGML 文件 142 MiB,运行时内存约 388 MB,依然能在几乎任何现代设备上轻松运行。相比 tiny,准确率的提升十分明显——尤其是在嘈杂音频和带口音的语音上。
- GGML:磁盘占用 142 MiB
- 内存:运行时约 388 MB
- VRAM:约 1 GB(GPU 模式)
- 比 large 快约 7 倍
- 在 CPU 上依然很快
- 在 Apple Silicon 上低于一秒
- 英语 WER:约 5.0%
- 多语言 WER:约 10%
- 在嘈杂音频上优于 tiny
base.en 版本在 LibriSpeech test-clean 上的 WER 约为 4.3%,在 test-other 上约为 12.8%。相比 tiny.en(分别为 5.6% 和 14.9%),这是一次有意义的提升,尤其是在高难度音频上。
对于 tiny 准确率尚不够用的低功耗设备,base 是个不错的选择。它在实时转录流水线中也很受欢迎——你想要速度与质量的平衡,又不希望内存占用超过 500 MB 时,它正合适。
Small(2.44 亿参数)
从 small 开始,Whisper 才真正让人感觉准确。凭借 2.44 亿参数,它相比 base 实现了 3.3 倍的飞跃,准确率显著提升——尤其是在非英语语言和嘈杂录音上。GGML 文件为 466 MiB,运行时内存占用约 852 MB。它的运行速度约为 large 的 4 倍。
- GGML:磁盘占用 466 MiB
- 内存:运行时约 852 MB
- VRAM:约 2 GB(GPU 模式)
- 比 large 快约 4 倍
- 在现代笔记本上很快
- 在 Apple Silicon 上可实时运行
- 英语 WER:约 3.4%
- 多语言 WER:约 7%
- 能很好地处理口音
small.en 版本在 LibriSpeech test-clean 上的 WER 约为 3.0%——对于一个不到 500 MB 的模型来说,这是相当出色的成绩。在许多仅需英语的场景中,small.en 能以一小部分资源成本提供接近 medium 的准确率。
small 常被推荐为大多数用户的默认模型。它在任何现代笔记本上都运行良好(包括配备 8 GB 内存的 MacBook Air M1),在各种语言上都有不错的准确率,且转录速度足够支撑实时口述工作流。
我们的建议: 如果你不确定从哪个模型入手,就从 small 开始。对于绝大多数硬件和使用场景,它在速度、准确率和资源占用之间取得了最佳平衡。
Medium(7.69 亿参数)
从 medium 开始,边际收益逐渐递减——但相比 small,准确率的提升仍然有意义,尤其是在多语言转录、专业词汇和高难度音频条件下。凭借 7.69 亿参数,它需要 1.5 GiB 磁盘空间(GGML),运行时内存约 2.1 GB。
- GGML:磁盘占用 1.5 GiB
- 内存:运行时约 2.1 GB
- VRAM:约 5 GB(GPU 模式)
- 比 large 快约 2 倍
- 在 8 GB 及以上机器上从容运行
- 需要不错的硬件
- 英语 WER:约 2.9%
- 多语言 WER:约 5%
- 在专业内容上表现强劲
medium.en 模型在 LibriSpeech test-clean 上的 WER 约为 3.0%,在 test-other 上约为 7.5%。然而在更广泛的基准测试中——尤其是涉及多样口音、背景噪声和特定领域词汇的测试——medium 始终优于 small。
对于看重准确率、但又没有硬件(或耐心)去跑 large 的专业转录工作流来说,medium 是个有力的选择。它在配备 8 GB 及以上内存的机器上运行良好,并能从 GPU 加速中获得显著收益。
Large(15.5 亿参数)
large 模型是最准确的 Whisper 版本,拥有 15.5 亿参数。它有三个版本: large-v1 (最初的发布版), large-v2 (训练轮数增加 2.5 倍并加入正则化),以及 large-v3 (在更多数据上训练,并采用 128 个梅尔频率分箱而非 80 个)。large-v3 是目前追求最高准确率的推荐版本。
- GGML:磁盘占用 2.9 GiB
- 内存:运行时约 3.9 GB
- VRAM:约 10 GB(GPU 模式)
- 1 倍(基准——最慢)
- 强烈推荐使用 GPU
- CPU:可能慢于实时速度
- 英语 WER:约 2.4%(v3)
- 多语言 WER:约 3.5%(v3)
- 在所有语言上都最佳
large-v2 与 large-v3 对比
large-v2
- 训练轮数比 large-v1 多 2.5 倍
- 加入正则化以获得更好的泛化能力
- LibriSpeech test-clean WER:约 3.0%
- 在某些音频类型上更稳定
large-v3
- 128 个梅尔分箱(对比 80 个)——更精细的频率分辨率
- 在 100 万小时标注音频 + 400 万小时伪标注音频上训练
- 跨语言相比 large-v2 降低 10-20% 的错误率
- 新增粤语支持
该用哪个 large 模型: 对于新项目,请使用 large-v3。在各语言的平均表现上,它都严格优于 large-v2。不过,一些用户反映,在音频片段非常安静或静音的特定边缘情况下,large-v2 产生的幻觉(生成音频中并不存在的文本)更少。如果你在使用 large-v3 时遇到幻觉问题,可以尝试退回 large-v2 作为备选。
Turbo(8.09 亿参数)
turbo 模型是 large-v3 的蒸馏版本,它在保留大部分准确率的同时大幅缩短了推理时间。OpenAI 通过将解码器从 32 层精简至仅 4 层实现了这一点——参数量从 15.5 亿减少到 8.09 亿。而负责繁重工作的编码器与 large-v3 保持完全一致。
- GGML:磁盘占用约 1.6 GiB
- 内存:运行时约 2.3 GB
- VRAM:约 6 GB(GPU 模式)
- 比 large 快约 8 倍
- 准确率接近 large,速度接近 tiny
- 配合 torch.compile 在 GPU 上表现出色
- 英语 WER:约 2.5%
- 多语言 WER:约 3.7%
- 相比 large-v3 质量略有损失
当你想要接近 large-v3 的准确率、却无法承受完整 large 模型的延迟时,turbo 是最佳选择。在 GPU 上配合 torch.compile 等优化,turbo 相比标准推理可实现最高 4.5 倍的速度提升,因而极为快速。
重要限制: turbo 模型未针对翻译任务进行训练。如果你需要把一种语言的语音翻译成英语,请改用 medium 或 large-v3。
英语专用版与多语言版模型
对于 tiny、base、small 和 medium 尺寸,Whisper 提供两个版本:多语言模型和英语专用( .en )模型。large 和 turbo 模型仅有多语言版——没有英语专用版本。
何时使用 .en(英语专用)
- 你只转录英语音频
- 在 tiny/base 尺寸级别上英语准确率更高
- 稍快一些——无需语言检测开销
- 文件大小与多语言版相同
何时使用多语言版
- 你需要转录非英语音频
- 你的音频包含多种混合语言
- 你需要语音翻译(译为英语)
- 使用 large 或 turbo 时必须用它(不存在 .en 版本)
.en 版与多语言版模型之间的性能差距在较小尺寸上最为明显。对于 tiny 和 base,.en 版本在英语上明显更好。等到了 small 和 medium,差距就大幅缩小了。在 large 级别只有多语言模型——而它在英语上的表现同样出色。
经验法则: 如果你只用英语,并且在 tiny 或 base 中选择,那就选 .en 版本。对于 small 及以上,多语言版用于英语效果很好,还能让你灵活应对其他语言。
硬件要求:哪些模型能在哪里运行
你需要的硬件在很大程度上取决于模型尺寸,以及你使用的是 whisper.cpp(CPU/Metal/CUDA)还是 PyTorch 实现(侧重 GPU)。以下是常见硬件类别上的预期表现。
MacBook Air M1(8 GB 内存)
- tiny/base: 瞬时完成。快于实时速度。
- small: 很快。借助 Metal 可达实时或更优。
- medium: 可用。在 CPU 上可能略慢于实时速度。Metal 能带来显著帮助。
- large: 可行但内存吃紧。预计会慢于实时速度。
- turbo: 很合适。借助 Metal 加速可接近实时速度。
MacBook Pro M2/M3(16-36 GB 内存)
- tiny/base/small: 瞬时完成。全部远在硬件上限之内。
- medium: 很快。借助 Metal 从容运行。
- large: 良好。借助 Metal 可达实时或接近实时。
- turbo: 出色。快速实时转录。
中端 Windows/Linux 笔记本(8 GB 内存,集成显卡)
- tiny/base: 很快。仅用 CPU 即可。
- small: 良好。在大多数现代 CPU 上从容运行。
- medium: 可行。在 CPU 上可能比实时速度慢 2-3 倍。
- large: 有挑战。仅用 CPU 会很慢。
- turbo: 可行。若有 Vulkan 可从中受益。
配备 NVIDIA 显卡的台式机(RTX 3060 及以上,8 GB 及以上 VRAM)
- 所有模型: 很快。GPU 能从容应对一切。
- large: 需要 10 GB VRAM(RTX 3060 12GB 或更高)。
- turbo: 配合 CUDA 是最快的选择。明显快于 large。
- 在 whisper.cpp 中使用 CUDA 后端可获得最佳性能。
whisper.cpp 加速后端
whisper.cpp——大多数桌面应用使用的 C/C++ 移植版本——支持多种硬件加速后端,可大幅提升性能:
Metal(Apple Silicon)
在 M1/M2/M3/M4 Mac 上进行完整的 GPU 推理。整个模型在 GPU 上运行,零内存拷贝。这是 macOS 用户最快的后端,也是 OpenWhispr 在 Mac 上所采用的方案。
Core ML(Apple)
使用 Apple 的神经网络引擎进行推理。在较新芯片上,某些模型尺寸的速度可能快于 Metal,且更省电。需要先将模型转换为 Core ML 格式。
CUDA(NVIDIA)
为 NVIDIA 显卡提供 GPU 加速。对于拥有独立 NVIDIA 显卡的用户,这是最快的后端。需要 CUDA 工具包。是台式机上运行 large 和 turbo 模型的最佳选择。
Vulkan(跨厂商 GPU)
可与 Intel、AMD 和 NVIDIA 显卡配合使用。对于非 NVIDIA 系统是不错的备选方案。在 Linux 和 Windows 上均可用。性能因 GPU 厂商和驱动而异。
近似转录速度
针对一段 60 秒音频的实时系数(RTF)。RTF < 1.0 表示快于实时速度。这些只是粗略估计——实际性能取决于音频内容、模型量化和系统负载。
| 模型 | M1 MacBook Air | M3 Pro MacBook | Intel i7(CPU) | RTX 3060(CUDA) |
|---|---|---|---|---|
| tiny | ~0.05x | ~0.03x | ~0.1x | ~0.02x |
| base | ~0.08x | ~0.05x | ~0.15x | ~0.04x |
| small | ~0.2x | ~0.12x | ~0.4x | ~0.08x |
| medium | ~0.6x | ~0.3x | ~1.2x | ~0.15x |
| large-v3 | ~1.5x | ~0.7x | ~3.0x | ~0.3x |
| turbo | ~0.3x | ~0.15x | ~0.6x | ~0.08x |
如何读懂此表: 0.1x 表示转录 60 秒音频约需 6 秒。1.0x = 实时速度。高于 1.0x 的数值表示慢于实时速度。所有数据均使用默认设置的 whisper.cpp,并在适用时采用 Metal(Mac)或 CUDA(NVIDIA)后端。
你该使用哪个模型?
以下是基于常见场景的具体建议。拿不定主意时,就从 small 开始,再根据使用体验向上或向下调整。
「我想要尽可能快」
使用 tiny 或 tiny.en 。在现代硬件上以毫秒级完成转录。准确率较粗糙,但用于快速记笔记和低风险口述足够了。
tiny / tiny.en「我想在笔记本上获得不错的准确率」
使用 small 。对于现代笔记本,它在速度和准确率之间取得了最佳平衡。如果你的机器有 16 GB 及以上内存, medium 也是个绝佳选择。
small 或 medium「我想要最高的准确率」
使用 large-v3 。它是整体上最准确的 Whisper 模型。如果速度也重要, turbo 能以 8 倍速度提供 95% 的准确率。
large-v3 或 turbo「我只用英语」
使用你所选尺寸的 .en 版本,以获得最佳英语准确率。对于 tiny 和 base,.en 模型明显更好。对于 small 及以上,差异很小。
small.en 或 medium.en「我使用多种语言」
使用多语言版本。 small 或 medium 可获得均衡的表现。 large-v3 可获得最佳的多语言准确率。
small、medium 或 large-v3「我的硬件非常有限」
使用 tiny 或 base 。两者都能在 1 GB 内存下运行,甚至可在 Raspberry Pi 和其他单板计算机上工作。base 相比 tiny 准确率有明显提升,而额外成本极小。
tiny 或 baseOpenWhispr 如何处理模型选择
OpenWhispr 是一款开源的桌面口述应用,底层使用 whisper.cpp。它让你直接在设置中下载并切换任意 Whisper 模型——无需命令行。模型只需下载一次,即可本地存储。你可以随时更换模型,为你的硬件平衡速度与准确率。
下载任意模型
在设置中从 tiny 到 large-v3 任选。OpenWhispr 会自动下载 GGML 版本。
即时切换
随时更换模型。无需重启。试用不同尺寸,找到最适合你硬件的那一个。
针对硬件优化
在 Apple Silicon 上使用 Metal,在 NVIDIA 上使用 CUDA,在其他平台上使用优化过的 CPU 推理。全程本地,全程私密。
我们的建议: 从 small 开始。如果觉得慢,就降到 base 或 tiny。如果你想要更高的准确率且硬件能够胜任,就升到 medium 或 large-v3。OpenWhispr 让尝试变得轻松。
参考来源
- Radford 等人《Robust Speech Recognition via Large-Scale Weak Supervision》(2022) ——附有完整基准测试结果的 Whisper 原始论文。
- OpenAI Whisper GitHub 仓库 ——官方模型表、参数量、VRAM 要求和相对速度数据。
- OpenAI Whisper 模型卡 ——官方训练数据构成与评测注意事项。
- whisper.cpp GitHub 仓库 ——GGML 模型尺寸、内存占用和硬件加速详情。
- Whisper large-v2 模型卡(HuggingFace) ——众多 WER 对比所采用的 LibriSpeech 基准背景。
- Whisper large-v3 模型卡(HuggingFace) ——训练细节、相对 large-v2 的架构变化和多语言改进。
- Whisper large-v3-turbo 模型卡(HuggingFace) ——Turbo 架构细节、解码器精简的具体做法和性能取舍。
- OpenAI Whisper Turbo 发布公告(GitHub Discussion #2363) ——官方 turbo 发布说明和跨语言性能对比。
- OpenWhispr ——选择模型尺寸的实用本地部署背景。
在 OpenWhispr 中试用不同的 Whisper 模型
开源、本地优先的口述工具。下载任意 Whisper 模型,一键切换尺寸,为你的硬件找到最完美的平衡。
无需账户 · 离线可用 · 永久开源