本地 vs 云端转录:隐私、速度与准确性全面对比
你的语音数据很有价值。它的去向,取决于你在哪里处理它。
OpenWhispr
工程
目录
本地转录会在你的设备上完整处理音频 使用 OpenAI Whisper 和 NVIDIA Parakeet 等模型,通过 whisper.cpp 等优化运行时来运行。音频从不离开你的机器。 云端转录会将你的音频发送到远程服务器 由 Google、AWS、Microsoft、Deepgram 或 AssemblyAI 等服务商运营,在大型 GPU 集群上处理后返回文本转录结果。两种方案之间的关键权衡可归结为五个因素:隐私、延迟、准确性、成本和离线能力。本文将结合真实数据和真实政策逐一剖析,帮你做出明智的决定。
最后更新:2026 年 2 月 17 日。文中所有量化数据和政策表述均已与至少两个一手来源交叉核对。
事实核查速览(双重来源)
- 开源本地模型已具备生产级能力: Whisper 和 Parakeet 拥有公开的模型卡和开源实现,适用于设备端推理。 OpenAI Whisper · NVIDIA Parakeet
- 云端 STT 按用量计费: 主流服务商按音频时长和模型档位计量。 Google 定价 · AWS 定价
- 各服务商的数据处理方式不同: 日志记录/数据保留设置和退出选项因服务而异,须自行配置。 Google 数据日志 · AWS AI 退出政策
- 监管背景至关重要: 生物识别和敏感数据相关义务因司法辖区和使用场景而异。 GDPR 官方文本 · 《欧盟 AI 法案》官方文本
- OpenWhispr 的部署模式: OpenWhispr 默认采用本地处理,并在用户需要时支持 BYOK 云端路由。 OpenWhispr · whisper.cpp 运行时
本地与云:关键权衡
本地(OpenWhispr)
- 隐私: 音频保留在设备上
- 延迟: 无网络往返
- 成本: 没有按分钟 API 计费
- 离线: 无需互联网即可工作
- 控制: 确定性局部行为
云 APIs
- 隐私: 策略+配置依赖
- 延迟: 网络和区域敏感
- 成本: 基于使用情况的计费
- 离线: 不可用
- 规模: 轻松应对大批量工作负载
最佳实用模式:本地优先,仅在需要时将边缘情况路由到云。
云端转录的工作原理
当你使用云端语音转文字服务时,你的音频会经历一段多步骤的旅程。首先,你的设备从麦克风采集原始音频,并压缩成适合传输的格式——通常是 Opus、FLAC 或线性 PCM。随后,这段压缩后的音频会通过互联网发送到服务商的 API 端点,通常经由 HTTPS 或用于实时流式传输的 WebSocket 连接。
在服务器端,服务商会让你的音频通过托管在 GPU 集群上的大型神经网络模型进行处理。这些模型通常基于数十万小时的标注语音数据训练而成,远远超出任何个人所能收集的规模。生成的转录结果随后被发送回你的设备。
主流的云端转录服务商包括:
- Google Cloud Speech-to-Text ——语言覆盖广泛,提供批量和实时流式两种选项。
- AWS Transcribe ——亚马逊的产品,支持自动语言识别、自定义词汇和 PII 脱敏。
- Microsoft Azure Speech ——与 Microsoft 生态深度集成,支持自定义语音模型和实时转录。
- Deepgram ——以速度和开发者体验著称,其 Nova-3 模型在具竞争力的价格下提供出色的准确性。
- AssemblyAI ——专注于准确性和开发者工具,内置说话人分离和内容审核。
云端延迟是可变的,因为它涵盖了音频采集、上传、服务器端推理和结果返回。在网络良好的环境中,它可能感觉很快;而不稳定的网络或高延迟地区则会让体验明显变慢。批量转录可能耗时数秒到数分钟不等,具体取决于文件长度和排队情况。
本地转录的工作原理
本地转录直接在你的设备上运行语音识别模型。整个过程不涉及网络——音频从麦克风直接进入运行在 CPU 或 GPU 上的模型,文本从另一端输出。整个过程都在你机器的内存中完成。
让高质量本地转录变得切实可行的突破,是 OpenAI 于 2022 年 9 月发布的 Whisper——一个基于 68 万小时多语言音频训练的开源模型。最近,NVIDIA 发布了其 Parakeet 系列 ASR 模型,在英语基准测试中达到了业界领先的准确性,并以开源许可证提供。不久之后,Georgi Gerganov 打造了 whisper.cpp,一个针对 CPU 推理优化的 C/C++ 重新实现,让 Whisper 的准确性在无需独立 GPU 的情况下也能在日常硬件上发挥。
Whisper 提供多种模型规格,各自在准确性与速度之间做出取舍:
| 模型 | 参数量 | 显存 | 相对速度 |
|---|---|---|---|
| Tiny | 39M | ~1 GB | ~10x |
| Base | 74M | ~1 GB | ~7x |
| Small | 244M | ~2 GB | ~4x |
| Medium | 769M | ~5 GB | ~2x |
| Large-v3 | 1550M | ~10 GB | 1x(基准) |
| Turbo | 809M | ~6 GB | ~8x |
在 Apple Silicon(M1 至 M4)上,whisper.cpp 通过 Metal 在 GPU 上完整运行推理,即便使用 medium 模型也能达到实时甚至超实时的速度。Turbo 模型——large-v3 的优化变体,准确性损失极小——在现代 MacBook 上能以高吞吐量运行,这也是它常被用于低延迟本地听写工作流的原因。
其他本地转录引擎还包括 Vosk (轻量级,准确性较低)和 Sherpa-ONNX (支持 ONNX 运行时的新一代 Kaldi)。不过,通过 whisper.cpp 运行的 OpenAI Whisper 和 NVIDIA Parakeet 仍是本地转录质量的黄金标准。
隐私:核心权衡
隐私是本地转录与云端转录之间最大的区别所在。采用本地处理时,"我的音频数据会怎样?"这个问题有一个简单的答案:什么都不会发生。它留在你的设备上、内存里,转录完成后即被丢弃。没有需要信任的第三方,没有需要阅读的政策,也无需担心数据泄露。
云端转录则需要你信任你的服务商。以下是主流服务商关于如何处理你音频的真实说法:
Google Cloud Speech-to-Text
Google 的语音转文字数据日志默认是关闭的。在关闭状态下,Google 表示音频数据会在内存中处理,仅用于返回转录结果,不会存储在服务器上。但如果你选择开启数据日志(或使用某些需要它的功能),你的音频和转录内容可能会被存储并用于改进 Google 的模型。Google 的 数据日志文档 详细说明了这些区别。
数据处理位置可按地区指定,这对 GDPR 合规至关重要。
AWS Transcribe
默认情况下,AWS 可能会使用由 Amazon Transcribe 处理的内容来开发和改进 AWS 的 AI/ML 服务。不过,你可以通过 AWS AI 服务退出政策来选择退出。在退出后,AWS 表示你的内容不会被存储或用于服务改进。音频数据在传输中和静态存储时均经过加密。
重要提示:退出并非默认设置。你必须主动进行配置。
Microsoft Azure Speech
Azure 默认不会使用客户数据来改进其基础模型。其 数据隐私文档 指出,发送到语音服务的音频会被处理并立即从其服务器删除。如果你创建自定义模型,你提供的训练数据会存储在与该资源相同的地区,直到你明确删除为止。
Azure 提供断网容器部署,可实现完全本地化的处理。
监管考量
GDPR: 根据欧盟法律,语音录音被视为生物识别数据。即便采用标准合同条款(SCC)或欧盟-美国数据隐私框架,将音频发送到位于美国的云端服务商仍会引发 GDPR 下的数据跨境传输问题。本地处理通过将生物识别数据保留在数据主体自己的设备上,从根本上规避了这一问题。
HIPAA: 使用云端转录的医疗机构必须确保其服务商提供商业伙伴协议(BAA)。Google、AWS 和 Azure 均提供 BAA,但配置要求十分严格。本地转录则绕开了 HIPAA 的数据处理规则,因为受保护的健康信息从不脱离涵盖实体的控制范围。
本地的优势
采用本地转录,没有需要研读的隐私政策,没有需要信任的数据保留期限,也没有需要寻找的退出开关。你的音频在内存中处理,从不写入磁盘(除非你选择保存录音)。这是一种根本不同的信任模式——你无需信任任何人,因为数据从不离开你的机器。
准确性:本地能有多接近?
说句实话:在某些使用场景下,顶级云端服务商在原始准确性上仍占有优势。它们基于海量专有数据集训练,提供实时模型更新,还能利用上下文相关的自定义词汇。对于难度较高的音频——浓重口音、嘈杂环境、领域专业术语——像 Google 的 Chirp 2 或 Deepgram 的 Nova-3 这类云端服务往往表现出色。
话虽如此,差距已经大幅缩小。基于 68 万小时多语言音频训练的 OpenAI Whisper large-v3,在大多数常见语言上都实现了具竞争力的词错率(WER)。NVIDIA 的 Parakeet 模型更进一步,在标准英语基准测试中取得了一些最低的 WER。独立基准测试一再表明,对于英语,这些开源模型的表现与商用云端服务相差仅几个百分点,在某些长尾语种上甚至超过它们。
Turbo 模型——large-v3 的蒸馏变体,参数量为 8.09 亿而非 15.5 亿——保留了大部分准确性,同时运行速度快约 8 倍。对于对着像样麦克风清晰口述的实时听写而言,对大多数用户来说,Turbo 与云端 API 之间的差异微乎其微。
云端在准确性上的优势
- 自定义词汇与领域自适应
- 服务器端的持续模型改进
- 更出色的说话人分离(谁说了什么)
- 针对各语言调优的自动标点与格式化
本地在准确性上的优势
- 无网络传输带来的音频压缩失真
- 稳定、可复现的性能——不受服务器波动影响
- 完整无压缩的 16kHz 音频直接喂给模型
- Whisper large-v3 和 Parakeet 在清晰语音听写上可媲美云端
结论:如果你在安静环境中用像样的麦克风口述,本地运行的 Whisper Turbo、Whisper large-v3 或 Parakeet 等模型在大多数实际用途上能给出与云端服务难以区分的结果。而在嘈杂的多说话人场景、小众语言和领域专业词汇方面,云端则更胜一筹。
速度与延迟
延迟对实时听写最为关键——你希望话音刚落,文字就立刻出现。在这方面,本地转录与云端转录有着根本不同的延迟特征。
云端延迟构成
- 音频采集 + 编码
- 网络上传与下载 (因线路质量而异)
- 服务器端排队 + 推理 (因服务商负载而异)
- 用户感知到的延迟可能因网络和地区而显著不同。
本地延迟(Apple Silicon)
- Tiny/base: 响应最快,质量上限较低
- Small: 速度与质量兼顾
- Turbo: 高质量实时听写的理想之选
- 大型模型: 质量最高,算力开销更大
- 无网络依赖。无论连接状况如何都保持稳定。
对于实时流式传输,在连接良好时,云端服务商能快速返回部分识别假设。但这仍需要稳定的低延迟连接。在飞机上、拥挤的公共 Wi-Fi 中,或受限的 VPN 线路之后,感知延迟可能迅速恶化。
传统意义上,使用 whisper.cpp 的本地转录并非实时流式。大多数本地实现采用"按住说话"的模式:你说话,音频被缓冲,然后模型处理完整的语音片段。在搭载 Apple M 系列芯片上使用 Turbo 模型时,这一处理步骤足够快,对于听写来说延迟几乎可以忽略——短句通常在一秒以内完成。
对于预先录制文件的长篇转录,云端服务能在 GPU 集群间并行处理,往往能快速完成大批量任务。本地吞吐量受限于你的机器和模型选择,因此处理超长录音时运行时间可能更慢。
成本:免费 vs. 按分钟付费
本地转录除了你已拥有的硬件之外,不需要任何额外花费。没有 API 密钥,没有计费面板,没有按分钟收费。你下载一个模型文件(从 Tiny 的 75MB 到 Large-v3 的 3GB 不等),然后就大功告成了。永远如此。
云端服务商按用量收费(按分钟或按小时,视厂商和模型而定)。套餐和折扣经常变动,因此在做预算前请先核实当前费率:
| 服务商 | 批量 / 预录 | 流式 / 实时 | 免费额度 |
|---|---|---|---|
| Google Speech-to-Text | 按用量计费(按模型分档) | 按用量计费(按模型分档) | 试用/免费配额因账户而异 |
| AWS Transcribe | 按用量计费 | 按用量计费 | 入门免费额度(限时) |
| Azure Speech | 因地区/模型而异 | 因地区/模型而异 | 有限免费配额 |
| Deepgram | 按模型档位计费 | 按模型档位计费 | 基于额度的试用 |
| AssemblyAI | 按模型档位计费 | 按模型档位计费 | 基于额度的试用 |
| 本地(Whisper / Parakeet) | 免费 | 免费 | 无限量,永久 |
如何估算你的云端开销
使用这个简单的公式: 年度音频分钟数 x 厂商费率. 如果你的团队大量使用听写,总成本会随用量和席位数线性增长。
本地推理(Whisper/Parakeet)避免了持续的 API 费用,这正是许多团队将本地作为默认方案、只在特殊情况下才路由到云端的原因。
注意:云端定价通常会对说话人分离、PII 脱敏或自定义词汇等功能收取额外费用。上述基础价格仅适用于标准转录。
离线能力:本地的绝对胜场
这一点是非此即彼的:云端转录需要联网,本地转录则不需要。对许多人来说,这是决定性因素。
离线能力不可或缺的场景:
出行与远程办公
航班、火车、乡村地区、发展中地区——任何 Wi-Fi 时有时无或根本没有的地方。本地转录在 3.5 万英尺高空的表现,与在你办公桌前完全一样。
物理隔离环境
政府机构、国防承包商、安全研究实验室和金融机构通常运行在物理隔离网络上,对外网络访问被完全屏蔽。本地转录是唯一选择。
野外作业
冲突地区的记者、偏远野外站点的研究人员、乡村诊所的医护人员——这些专业人士需要在蜂窝信号可能不稳定或不可用的环境中获得可靠的转录。
可靠性
即便在网络良好的办公室里,云端服务也会出现宕机。AWS、Google Cloud 和 Azure 都曾发生过波及语音 API 的数小时事故。本地转录没有任何可能宕机的外部依赖。
逐项对比
| 因素 | 本地 | 云端 |
|---|---|---|
| 隐私 | ||
| 准确性(英语) | ||
| 准确性(多语言) | ||
| 延迟 | ||
| 成本 | ||
| 离线使用 | ||
| 配置便利性 | ||
| 说话人分离 | ||
| 可扩展性 |
何时选择哪种方案
两种方案都没有绝对的优劣。正确的选择取决于你看重什么。
如果满足以下情况,请选择本地……
- 隐私不容妥协(医疗、法律、个人日记)
- 你需要离线或物理隔离运行
- 你希望转录没有任何持续成本
- 你的主要用途是听写(单说话人、清晰音频)
- 你受 GDPR、HIPAA 或类似法规约束
如果满足以下情况,请选择云端……
- 你需要为多人会议进行说话人分离
- 在困难音频条件下追求最高准确性
- 你正在构建一个需要扩展到大量用户的应用
- 你需要实时流式转录
- 你的硬件有限,无法运行大型模型
混合方案
你不必只能二选一。一些应用——包括 OpenWhispr——同时支持两种模式:默认使用 Whisper 和 Parakeet 等本地模型以兼顾隐私与零成本,并可在需要云端提供的额外准确性或功能时,选择自带云端 API 密钥(OpenAI、Deepgram 等)。这种"BYOK"(自带密钥)模式让你兼得两者之长,而不会被任何一种方案所锁定。
参考来源与延伸阅读
- OpenAI Whisper ——原始模型仓库,包含模型规格、基准测试和文档。
- whisper.cpp ——Whisper 的 C/C++ 移植版,针对 CPU 和 Apple Silicon GPU 推理优化。
- NVIDIA Parakeet RNNT 模型卡 ——开源 ASR 模型指标与使用指南。
- Google Cloud Speech-to-Text 定价 ——Google 语音 API 的当前定价档位。
- AWS Transcribe 定价 ——亚马逊批量与流式的当前按用量定价。
- Azure Speech Services 定价 ——Microsoft 实时与批量语音转文字的定价。
- Deepgram 定价 ——Deepgram 各模型档位的定价详情。
- AssemblyAI 定价 ——AssemblyAI 用量与模型档位的定价详情。
- Google Speech-to-Text 数据日志 ——Google 关于音频数据如何处理和存储的文档。
- AWS AI 服务退出政策 ——如何阻止 AWS 使用你的内容改进其 AI 服务。
- Azure Speech 数据隐私 ——Microsoft 关于语音服务的数据隐私与安全文档。
- 通过大规模弱监督实现稳健语音识别 ——Radford 等人(2022)的原始 Whisper 论文,详述了训练方法与 WER 基准。
- GDPR(欧盟官方文本) ——个人/生物识别数据处理的法律基准。
- 《欧盟 AI 法案》(欧盟官方文本) ——与生物识别及高风险系统相关的 AI 风险分级义务。
- OpenWhispr ——在单一应用中实现本地优先 + 可选 BYOK 云端工作流的范例。
在一个应用中体验两种方案
OpenWhispr 同时支持本地模型(OpenAI Whisper 和 NVIDIA Parakeet)以兼顾隐私与零成本,并在你需要最高准确性时支持自带云端 API 密钥。开源,永久免费。
无需账户 · 可离线使用 · 永久开源