本機 vs 雲端轉錄:隱私、速度與準確度全面比較
你的語音資料很有價值。以下說明它在不同處理位置會經歷什麼。
OpenWhispr
工程
目錄
本機轉錄完全在你的裝置上處理音訊 使用如 OpenAI Whisper 與 NVIDIA Parakeet 等模型,透過 whisper.cpp 之類經最佳化的執行環境運行。音訊永遠不會離開你的電腦。 雲端轉錄會將你的音訊傳送到遠端伺服器 由 Google、AWS、Microsoft、Deepgram 或 AssemblyAI 等供應商營運,在大型 GPU 叢集上處理後回傳文字轉錄結果。這兩種做法之間的關鍵取捨可歸結為五項因素:隱私、延遲、準確度、成本與離線能力。本文以真實數據與真實政策逐項檢視,讓你能做出明智的決定。
最後更新:2026 年 2 月 17 日。量化與政策主張皆對照至少兩個原始來源交叉查核。
事實查核快照(雙重來源)
- 開放的本機模型已具生產級水準: Whisper 與 Parakeet 都有公開的模型卡與開放實作,適合裝置端推論。 OpenAI Whisper · NVIDIA Parakeet
- 雲端 STT 按用量計費: 主要供應商依音訊量與模型層級計量。 Google 定價 · AWS 定價
- 各供應商的資料處理方式不同: 記錄/保留設定與選擇退出機制因服務而異,且須自行設定。 Google 資料記錄 · AWS AI 選擇退出政策
- 法規背景至關重要: 生物特徵與敏感資料的義務因司法管轄區與使用情境而異。 GDPR 官方條文 · 歐盟 AI 法案官方條文
- OpenWhispr 部署模式: OpenWhispr 預設採用本機處理,並在使用者有需要時支援 BYOK 雲端路由。 OpenWhispr · whisper.cpp 執行環境
本地與雲端:關鍵權衡
本地(OpenWhispr)
- 隱私: 音訊保留在設備上
- 延遲: 無網路往返
- 成本: 沒有按分鐘 API 計費
- 離線: 無需互聯網即可運作
- 控制: 確定性局部行為
雲 APIs
- 隱私: 策略+配置依賴
- 延遲: 網路和區域敏感
- 成本: 基於使用情況的計費
- 離線: 不可用
- 規模: 輕鬆應對大批量工作負載
最佳實用模式:本地優先,僅在需要時將邊緣情況路由到雲端。
雲端轉錄如何運作
當你使用雲端語音轉文字服務時,你的音訊會經歷多個步驟。首先,你的裝置從麥克風擷取原始音訊,並壓縮成適合傳輸的格式——通常是 Opus、FLAC 或線性 PCM。接著,這段壓縮後的音訊會透過網際網路傳送到供應商的 API 端點,通常經由 HTTPS,或使用 WebSocket 連線進行即時串流。
在伺服器端,供應商會讓你的音訊通過託管於 GPU 叢集上的大型神經網路模型。這些模型通常以數十萬小時的標註語音資料訓練而成,遠超過任何個人所能蒐集的規模。處理後的轉錄結果再回傳到你的裝置。
主要的雲端轉錄供應商包括:
- Google Cloud Speech-to-Text ——涵蓋廣泛語言,提供批次與即時串流選項。
- AWS Transcribe ——Amazon 的方案,具備自動語言辨識、自訂詞彙支援與 PII 遮蔽。
- Microsoft Azure Speech ——與 Microsoft 生態系深度整合,提供自訂語音模型與即時轉錄。
- Deepgram ——以速度與開發者體驗著稱,其 Nova-3 模型在具競爭力的價格下提供強勁的準確度。
- AssemblyAI ——專注於準確度與開發者工具,內建語者分離與內容審核功能。
雲端延遲會有所變動,因為它涵蓋擷取、上傳、伺服器端推論與回應傳遞。在連線良好的環境中可能感覺很快,但不穩定的網路或高延遲地區會讓體驗明顯變慢。批次轉錄則可能依檔案長度與排隊狀況耗時數秒到數分鐘不等。
本機轉錄如何運作
本機轉錄直接在你的裝置上運行語音辨識模型。過程中完全不涉及網路——音訊從麥克風直接進入在 CPU 或 GPU 上運行的模型,文字隨即從另一端輸出。整個過程都在你電腦的記憶體中完成。
讓高品質本機轉錄成為可能的突破,是 OpenAI 於 2022 年 9 月發布的 Whisper——一個以 68 萬小時多語音訊訓練的開源模型。近期,NVIDIA 發布了其 Parakeet 系列 ASR 模型,在英語基準測試上達到最先進的準確度,並以開放授權釋出。不久之後,Georgi Gerganov 打造了 whisper.cpp,這是一個針對 CPU 推論最佳化的 C/C++ 重新實作,讓 Whisper 的準確度得以在一般硬體上實現,而無需專用 GPU。
Whisper 提供多種模型尺寸,各自在準確度與速度之間取捨:
| 模型 | 參數量 | VRAM | 相對速度 |
|---|---|---|---|
| Tiny | 39M | ~1 GB | ~10x |
| Base | 74M | ~1 GB | ~7x |
| Small | 244M | ~2 GB | ~4x |
| Medium | 769M | ~5 GB | ~2x |
| Large-v3 | 1550M | ~10 GB | 1x(基準) |
| Turbo | 809M | ~6 GB | ~8x |
在 Apple Silicon(M1 至 M4)上,whisper.cpp 透過 Metal 完全在 GPU 上執行推論,即使使用 medium 模型也能達到即時或超即時的速度。Turbo 模型——large-v3 的最佳化變體,準確度損失極小——在現代 MacBook 上以高吞吐量運行,這也是它常用於低延遲本機聽寫工作流程的原因。
其他本機轉錄引擎還包括 Vosk (輕量但準確度較低)與 Sherpa-ONNX (新一代 Kaldi,支援 ONNX 執行環境)。不過,透過 whisper.cpp 運行的 OpenAI Whisper 與 NVIDIA Parakeet 仍是本機轉錄品質的黃金標準。
隱私:核心取捨
隱私是本機與雲端轉錄之間最大的區別。採用本機處理時,「我的音訊資料會發生什麼事?」這個問題有個簡單的答案:什麼都不會發生。它留在你的裝置上、你的 RAM 裡,並在轉錄後被丟棄。沒有第三方需要信任、沒有政策需要閱讀、也沒有資料外洩需要擔心。
雲端轉錄要求你信任你的供應商。以下是主要供應商對於如何處理你的音訊實際所言:
Google Cloud Speech-to-Text
Google 語音轉文字的資料記錄功能預設為關閉。停用時,Google 表示音訊資料會在記憶體中處理、僅用於回傳轉錄結果,且不會儲存在伺服器上。然而,若你選擇開啟資料記錄(或使用某些需要它的功能),你的音訊與轉錄內容可能會被儲存,並用於改善 Google 的模型。Google 的 資料記錄文件 詳述了這些差異。
資料處理位置可依地區指定,這對 GDPR 合規很重要。
AWS Transcribe
預設情況下,AWS 可能使用 Amazon Transcribe 處理的內容來開發與改善 AWS AI/ML 服務。不過,你可以透過 AWS AI 服務選擇退出政策來退出。選擇退出後,AWS 表示你的內容不會被儲存或用於服務改善。音訊資料在傳輸中與靜態儲存時皆經加密。
重要提醒:選擇退出並非預設值。你必須主動設定。
Microsoft Azure Speech
Azure 預設不會使用客戶資料來改善其基礎模型。其 資料隱私文件 指出,傳送至 Speech 服務的音訊會被處理並立即從其伺服器上刪除。若你建立自訂模型,你提供的訓練資料會儲存在與資源相同的地區,直到你明確刪除為止。
Azure 提供離線容器部署,可實現完全的本地端處理。
法規考量
GDPR: 在歐盟法律下,語音錄音被視為生物特徵資料。即便有標準合約條款(SCC)或歐盟-美國資料隱私框架,將音訊傳送至美國境內的雲端供應商仍會引發 GDPR 下的資料跨境傳輸疑慮。本機處理將生物特徵資料保留在資料主體自己的裝置內,從根本上避免了這個問題。
HIPAA: 使用雲端轉錄的醫療服務提供者,必須確保其供應商提供業務夥伴協議(BAA)。Google、AWS 與 Azure 都提供 BAA,但設定要求十分嚴格。本機轉錄則因受保護的健康資訊永不離開受規範實體的掌控,而得以避開 HIPAA 的資料處理規範。
本機的優勢
使用本機轉錄時,沒有隱私政策需要解讀、沒有資料保留排程需要信任,也沒有選擇退出開關需要尋找。你的音訊在 RAM 中處理,永不寫入硬碟(除非你選擇儲存錄音)。這是一種根本不同的信任模式——你不需要信任任何人,因為資料從未離開你的電腦。
準確度:本機究竟有多接近?
我們坦白說:在某些使用情境下,頂尖的雲端供應商在原始準確度上仍占有優勢。它們以龐大的專有資料集訓練、提供即時模型更新,並能運用情境特定的自訂詞彙。對於困難的音訊——濃重口音、嘈雜環境、領域特定術語——Google 的 Chirp 2 或 Deepgram 的 Nova-3 等雲端服務往往表現出色。
話雖如此,差距已大幅縮小。以 68 萬小時多語音訊訓練的 OpenAI Whisper large-v3,在多數常見語言上達到具競爭力的字詞錯誤率(WER)。NVIDIA 的 Parakeet 模型更進一步推高了標準,在標準英語基準測試上達到最低的 WER 之一。獨立基準測試持續顯示,這些開放模型在英語上的表現與商業雲端服務僅相差幾個百分點,在長尾的特定語言上有時甚至更勝一籌。
Turbo 模型——large-v3 的蒸餾變體,參數量為 809M 而非 1.55B——保留了大部分準確度,同時運行速度約快 8 倍。對於對著一支不錯的麥克風清楚口述的即時聽寫,對多數使用者而言,Turbo 與雲端 API 之間的差異微乎其微。
雲端準確度優勢
- 自訂詞彙與領域適應
- 伺服器端的持續模型改善
- 更佳的語者分離(誰說了什麼)
- 依語言調校的自動標點與格式化
本機準確度優勢
- 沒有網路傳輸造成的音訊壓縮失真
- 穩定、可重現的表現——沒有伺服器端變數
- 完整未壓縮的 16kHz 音訊直接餵入模型
- Whisper large-v3 與 Parakeet 在清晰語音聽寫上媲美雲端
結論:若你在安靜環境中使用不錯的麥克風口述,於本機運行的 Whisper Turbo、Whisper large-v3 或 Parakeet 等模型,在多數實際用途上能給你與雲端服務難以區分的結果。雲端則在嘈雜的多語者情境、小眾語言與領域特定詞彙上更勝一籌。
速度與延遲
延遲對即時聽寫最為關鍵——你會希望說完話後,文字能立刻出現。在這一點上,本機與雲端轉錄有著根本不同的延遲特性。
雲端延遲剖析
- 音訊擷取+編碼
- 網路上傳與下載 (依路由品質而變動)
- 伺服器端排隊+推論 (依供應商負載而變動)
- 使用者感受到的延遲會因網路與地區而有顯著差異。
本機延遲(Apple Silicon)
- Tiny/base: 反應最快,品質上限較低
- Small: 速度與品質兼顧
- Turbo: 高品質即時聽寫的理想選擇
- 大型模型: 品質最高,但更耗運算資源
- 不依賴網路。無論連線狀況如何都保持穩定。
對於即時串流,雲端供應商在連線穩定時能快速回傳部分推測結果。但這仍需要穩定的低延遲連線。在飛機上、壅塞的公共 Wi-Fi 中,或受限的 VPN 路由後方,感受到的延遲可能迅速惡化。
使用 whisper.cpp 的本機轉錄並非傳統意義上的即時串流。多數本機實作採用「按住說話」模式:你說話、音訊被緩衝,接著模型處理完整的語段。在 Apple M 系列晶片上使用 Turbo 模型時,這個處理步驟夠快,對聽寫而言延遲感覺微不足道——短語通常在一秒內完成。
對於預錄檔案的長篇轉錄,雲端服務可在 GPU 叢集間平行處理,往往能快速完成大量批次。本機吞吐量則受限於你的機器與模型選擇,因此處理非常長的錄音時可能較慢。
成本:免費 vs. 按分鐘付費
本機轉錄除了你已擁有的硬體外不需任何額外成本。沒有 API 金鑰、沒有計費儀表板、沒有按分鐘計費。你下載一個模型檔案(從 Tiny 的 75MB 到 Large-v3 的 3GB 不等),就完成了。永遠免費。
雲端供應商按用量收費(依廠商與模型,按分鐘或按小時計)。方案與折扣經常變動,因此在編列預算前請先核實當前費率:
| 供應商 | 批次/預錄 | 串流/即時 | 免費額度 |
|---|---|---|---|
| Google Speech-to-Text | 按用量計費(依模型分層) | 按用量計費(依模型分層) | 試用/免費額度依帳戶而異 |
| AWS Transcribe | 按用量計費 | 按用量計費 | 入門免費額度(有時間限制) |
| Azure Speech | 依地區/模型而異 | 依地區/模型而異 | 有限免費額度 |
| Deepgram | 按模型層級用量計費 | 按模型層級用量計費 | 額度制試用 |
| AssemblyAI | 按模型層級用量計費 | 按模型層級用量計費 | 額度制試用 |
| 本機(Whisper/Parakeet) | 免費 | 免費 | 無限量,永久免費 |
如何估算你的雲端支出
使用這個簡單公式: 每年音訊分鐘數 x 廠商費率. 若你的團隊大量使用聽寫,總成本會隨用量與席位數線性成長。
本機推論(Whisper/Parakeet)可避免持續性的 API 費用,這也是許多團隊將本機設為預設、僅在特殊情況下才導向雲端的原因。
註:雲端定價通常會針對語者分離、PII 遮蔽或自訂詞彙等功能加收額外費用。上述基本價格僅適用於標準轉錄。
離線能力:本機決定性勝出之處
這一點是二元的:雲端轉錄需要網路,本機轉錄則不需要。對許多人而言,這是決定性的因素。
離線能力不可或缺的情境:
出差與遠端工作
航班、火車、偏鄉地區、開發中地區——任何 Wi-Fi 訊號斷斷續續或根本不存在的地方。本機轉錄在 35,000 英尺高空的運作方式,與在你的辦公桌前完全相同。
氣隙隔離環境
政府機構、國防承包商、安全研究實驗室與金融機構通常運行於氣隙隔離網路,對外網路存取被完全封鎖。本機轉錄是唯一的選擇。
現場作業
衝突地區的記者、偏遠野外站的研究人員、鄉村診所的醫護人員——這些專業人士需要在行動網路可能不穩或無法使用的環境中,仍有可靠的轉錄能力。
可靠性
即使在連線良好的辦公室,雲端服務也會發生中斷。AWS、Google Cloud 與 Azure 都曾發生影響語音 API 的數小時事故。本機轉錄沒有任何可能當機的外部依賴。
並排比較
| 因素 | 本機 | 雲端 |
|---|---|---|
| 隱私 | ||
| 準確度(英語) | ||
| 準確度(多語) | ||
| 延遲 | ||
| 成本 | ||
| 離線使用 | ||
| 設定難易度 | ||
| 語者分離 | ||
| 可擴展性 |
何時該選擇何者
沒有一種做法是放諸四海皆準的。正確的選擇取決於你最看重什麼。
選擇本機,如果……
- 隱私不容妥協(醫療、法律、個人日記)
- 你需要離線或氣隙隔離的運作
- 你希望轉錄完全沒有持續成本
- 你的主要使用情境是聽寫(單一語者、清晰音訊)
- 你受 GDPR、HIPAA 或類似法規規範
選擇雲端,如果……
- 你需要為多人會議進行語者分離
- 在困難的音訊條件下追求最高準確度
- 你正在打造需要擴展到大量使用者的應用程式
- 你需要即時串流轉錄
- 你的硬體有限,無法運行大型模型
混合式做法
你不必只擇其一。有些應用程式——包括 OpenWhispr——同時支援兩種模式:預設使用 Whisper 與 Parakeet 等本機模型以兼顧隱私與零成本,並在需要雲端所提供的額外準確度或功能時,選擇性地帶入你自己的雲端 API 金鑰(OpenAI、Deepgram 等)。這種「BYOK」(自帶金鑰)模式讓你兼得兩者之長,而不會被任一種做法綁住。
資料來源與延伸閱讀
- OpenAI Whisper ——原始模型儲存庫,含模型尺寸、基準測試與文件。
- whisper.cpp ——Whisper 的 C/C++ 移植版,針對 CPU 與 Apple Silicon GPU 推論最佳化。
- NVIDIA Parakeet RNNT 模型卡 ——開放 ASR 模型指標與使用指南。
- Google Cloud Speech-to-Text 定價 ——Google 語音 API 的當前定價層級。
- AWS Transcribe 定價 ——Amazon 批次與串流的當前按用量定價。
- Azure Speech Services 定價 ——Microsoft 即時與批次語音轉文字的定價。
- Deepgram 定價 ——Deepgram 模型層級定價詳情。
- AssemblyAI 定價 ——AssemblyAI 用量與模型層級定價詳情。
- Google Speech-to-Text 資料記錄 ——Google 關於如何處理與儲存音訊資料的文件。
- AWS AI 服務選擇退出政策 ——如何防止 AWS 使用你的內容來改善其 AI 服務。
- Azure Speech 資料隱私 ——Microsoft 針對 Speech Services 的資料隱私與安全文件。
- Robust Speech Recognition via Large-Scale Weak Supervision ——Radford 等人於 2022 年發表的原始 Whisper 論文,詳述訓練方法與 WER 基準。
- GDPR(歐盟官方條文) ——個人/生物特徵資料處理的法律基準。
- 歐盟 AI 法案(歐盟官方條文) ——與生物特徵及高風險系統相關的 AI 風險分級義務。
- OpenWhispr ——將本機優先+選擇性 BYOK 雲端工作流程整合於單一應用程式的範例。
在同一個應用程式中體驗兩種做法
OpenWhispr 同時支援本機模型(OpenAI Whisper 與 NVIDIA Parakeet)以兼顧隱私與零成本,並在你需要最高準確度時自帶雲端 API 金鑰。開源、永久免費。
無需帳號 · 可離線使用 · 永久開源