比較

本機 vs 雲端轉錄:隱私、速度與準確度全面比較

你的語音資料很有價值。以下說明它在不同處理位置會經歷什麼。

OpenWhispr

OpenWhispr

工程

2026 年 2 月 8 日
目錄

本機轉錄完全在你的裝置上處理音訊 使用如 OpenAI Whisper 與 NVIDIA Parakeet 等模型,透過 whisper.cpp 之類經最佳化的執行環境運行。音訊永遠不會離開你的電腦。 雲端轉錄會將你的音訊傳送到遠端伺服器 由 Google、AWS、Microsoft、Deepgram 或 AssemblyAI 等供應商營運,在大型 GPU 叢集上處理後回傳文字轉錄結果。這兩種做法之間的關鍵取捨可歸結為五項因素:隱私、延遲、準確度、成本與離線能力。本文以真實數據與真實政策逐項檢視,讓你能做出明智的決定。

最後更新:2026 年 2 月 17 日。量化與政策主張皆對照至少兩個原始來源交叉查核。

事實查核快照(雙重來源)

本地與雲端:關鍵權衡

本地(OpenWhispr)
  • 隱私: 音訊保留在設備上
  • 延遲: 無網路往返
  • 成本: 沒有按分鐘 API 計費
  • 離線: 無需互聯網即可運作
  • 控制: 確定性局部行為
雲 APIs
  • 隱私: 策略+配置依賴
  • 延遲: 網路和區域敏感
  • 成本: 基於使用情況的計費
  • 離線: 不可用
  • 規模: 輕鬆應對大批量工作負載

最佳實用模式:本地優先,僅在需要時將邊緣情況路由到雲端。

雲端轉錄如何運作

當你使用雲端語音轉文字服務時,你的音訊會經歷多個步驟。首先,你的裝置從麥克風擷取原始音訊,並壓縮成適合傳輸的格式——通常是 Opus、FLAC 或線性 PCM。接著,這段壓縮後的音訊會透過網際網路傳送到供應商的 API 端點,通常經由 HTTPS,或使用 WebSocket 連線進行即時串流。

在伺服器端,供應商會讓你的音訊通過託管於 GPU 叢集上的大型神經網路模型。這些模型通常以數十萬小時的標註語音資料訓練而成,遠超過任何個人所能蒐集的規模。處理後的轉錄結果再回傳到你的裝置。

主要的雲端轉錄供應商包括:

  • Google Cloud Speech-to-Text ——涵蓋廣泛語言,提供批次與即時串流選項。
  • AWS Transcribe ——Amazon 的方案,具備自動語言辨識、自訂詞彙支援與 PII 遮蔽。
  • Microsoft Azure Speech ——與 Microsoft 生態系深度整合,提供自訂語音模型與即時轉錄。
  • Deepgram ——以速度與開發者體驗著稱,其 Nova-3 模型在具競爭力的價格下提供強勁的準確度。
  • AssemblyAI ——專注於準確度與開發者工具,內建語者分離與內容審核功能。

雲端延遲會有所變動,因為它涵蓋擷取、上傳、伺服器端推論與回應傳遞。在連線良好的環境中可能感覺很快,但不穩定的網路或高延遲地區會讓體驗明顯變慢。批次轉錄則可能依檔案長度與排隊狀況耗時數秒到數分鐘不等。

本機轉錄如何運作

本機轉錄直接在你的裝置上運行語音辨識模型。過程中完全不涉及網路——音訊從麥克風直接進入在 CPU 或 GPU 上運行的模型,文字隨即從另一端輸出。整個過程都在你電腦的記憶體中完成。

讓高品質本機轉錄成為可能的突破,是 OpenAI 於 2022 年 9 月發布的 Whisper——一個以 68 萬小時多語音訊訓練的開源模型。近期,NVIDIA 發布了其 Parakeet 系列 ASR 模型,在英語基準測試上達到最先進的準確度,並以開放授權釋出。不久之後,Georgi Gerganov 打造了 whisper.cpp,這是一個針對 CPU 推論最佳化的 C/C++ 重新實作,讓 Whisper 的準確度得以在一般硬體上實現,而無需專用 GPU。

Whisper 提供多種模型尺寸,各自在準確度與速度之間取捨:

模型參數量VRAM相對速度
Tiny39M~1 GB~10x
Base74M~1 GB~7x
Small244M~2 GB~4x
Medium769M~5 GB~2x
Large-v31550M~10 GB1x(基準)
Turbo809M~6 GB~8x

在 Apple Silicon(M1 至 M4)上,whisper.cpp 透過 Metal 完全在 GPU 上執行推論,即使使用 medium 模型也能達到即時或超即時的速度。Turbo 模型——large-v3 的最佳化變體,準確度損失極小——在現代 MacBook 上以高吞吐量運行,這也是它常用於低延遲本機聽寫工作流程的原因。

其他本機轉錄引擎還包括 Vosk (輕量但準確度較低)與 Sherpa-ONNX (新一代 Kaldi,支援 ONNX 執行環境)。不過,透過 whisper.cpp 運行的 OpenAI Whisper 與 NVIDIA Parakeet 仍是本機轉錄品質的黃金標準。

隱私:核心取捨

隱私是本機與雲端轉錄之間最大的區別。採用本機處理時,「我的音訊資料會發生什麼事?」這個問題有個簡單的答案:什麼都不會發生。它留在你的裝置上、你的 RAM 裡,並在轉錄後被丟棄。沒有第三方需要信任、沒有政策需要閱讀、也沒有資料外洩需要擔心。

雲端轉錄要求你信任你的供應商。以下是主要供應商對於如何處理你的音訊實際所言:

Google Cloud Speech-to-Text

Google 語音轉文字的資料記錄功能預設為關閉。停用時,Google 表示音訊資料會在記憶體中處理、僅用於回傳轉錄結果,且不會儲存在伺服器上。然而,若你選擇開啟資料記錄(或使用某些需要它的功能),你的音訊與轉錄內容可能會被儲存,並用於改善 Google 的模型。Google 的 資料記錄文件 詳述了這些差異。

資料處理位置可依地區指定,這對 GDPR 合規很重要。

AWS Transcribe

預設情況下,AWS 可能使用 Amazon Transcribe 處理的內容來開發與改善 AWS AI/ML 服務。不過,你可以透過 AWS AI 服務選擇退出政策來退出。選擇退出後,AWS 表示你的內容不會被儲存或用於服務改善。音訊資料在傳輸中與靜態儲存時皆經加密。

重要提醒:選擇退出並非預設值。你必須主動設定。

Microsoft Azure Speech

Azure 預設不會使用客戶資料來改善其基礎模型。其 資料隱私文件 指出,傳送至 Speech 服務的音訊會被處理並立即從其伺服器上刪除。若你建立自訂模型,你提供的訓練資料會儲存在與資源相同的地區,直到你明確刪除為止。

Azure 提供離線容器部署,可實現完全的本地端處理。

法規考量

GDPR: 在歐盟法律下,語音錄音被視為生物特徵資料。即便有標準合約條款(SCC)或歐盟-美國資料隱私框架,將音訊傳送至美國境內的雲端供應商仍會引發 GDPR 下的資料跨境傳輸疑慮。本機處理將生物特徵資料保留在資料主體自己的裝置內,從根本上避免了這個問題。

HIPAA: 使用雲端轉錄的醫療服務提供者,必須確保其供應商提供業務夥伴協議(BAA)。Google、AWS 與 Azure 都提供 BAA,但設定要求十分嚴格。本機轉錄則因受保護的健康資訊永不離開受規範實體的掌控,而得以避開 HIPAA 的資料處理規範。

本機的優勢

使用本機轉錄時,沒有隱私政策需要解讀、沒有資料保留排程需要信任,也沒有選擇退出開關需要尋找。你的音訊在 RAM 中處理,永不寫入硬碟(除非你選擇儲存錄音)。這是一種根本不同的信任模式——你不需要信任任何人,因為資料從未離開你的電腦。

準確度:本機究竟有多接近?

我們坦白說:在某些使用情境下,頂尖的雲端供應商在原始準確度上仍占有優勢。它們以龐大的專有資料集訓練、提供即時模型更新,並能運用情境特定的自訂詞彙。對於困難的音訊——濃重口音、嘈雜環境、領域特定術語——Google 的 Chirp 2 或 Deepgram 的 Nova-3 等雲端服務往往表現出色。

話雖如此,差距已大幅縮小。以 68 萬小時多語音訊訓練的 OpenAI Whisper large-v3,在多數常見語言上達到具競爭力的字詞錯誤率(WER)。NVIDIA 的 Parakeet 模型更進一步推高了標準,在標準英語基準測試上達到最低的 WER 之一。獨立基準測試持續顯示,這些開放模型在英語上的表現與商業雲端服務僅相差幾個百分點,在長尾的特定語言上有時甚至更勝一籌。

Turbo 模型——large-v3 的蒸餾變體,參數量為 809M 而非 1.55B——保留了大部分準確度,同時運行速度約快 8 倍。對於對著一支不錯的麥克風清楚口述的即時聽寫,對多數使用者而言,Turbo 與雲端 API 之間的差異微乎其微。

雲端準確度優勢

  • 自訂詞彙與領域適應
  • 伺服器端的持續模型改善
  • 更佳的語者分離(誰說了什麼)
  • 依語言調校的自動標點與格式化

本機準確度優勢

  • 沒有網路傳輸造成的音訊壓縮失真
  • 穩定、可重現的表現——沒有伺服器端變數
  • 完整未壓縮的 16kHz 音訊直接餵入模型
  • Whisper large-v3 與 Parakeet 在清晰語音聽寫上媲美雲端

結論:若你在安靜環境中使用不錯的麥克風口述,於本機運行的 Whisper Turbo、Whisper large-v3 或 Parakeet 等模型,在多數實際用途上能給你與雲端服務難以區分的結果。雲端則在嘈雜的多語者情境、小眾語言與領域特定詞彙上更勝一籌。

速度與延遲

延遲對即時聽寫最為關鍵——你會希望說完話後,文字能立刻出現。在這一點上,本機與雲端轉錄有著根本不同的延遲特性。

雲端延遲剖析

  • 音訊擷取+編碼
  • 網路上傳與下載 (依路由品質而變動)
  • 伺服器端排隊+推論 (依供應商負載而變動)
  • 使用者感受到的延遲會因網路與地區而有顯著差異。

本機延遲(Apple Silicon)

  • Tiny/base: 反應最快,品質上限較低
  • Small: 速度與品質兼顧
  • Turbo: 高品質即時聽寫的理想選擇
  • 大型模型: 品質最高,但更耗運算資源
  • 不依賴網路。無論連線狀況如何都保持穩定。

對於即時串流,雲端供應商在連線穩定時能快速回傳部分推測結果。但這仍需要穩定的低延遲連線。在飛機上、壅塞的公共 Wi-Fi 中,或受限的 VPN 路由後方,感受到的延遲可能迅速惡化。

使用 whisper.cpp 的本機轉錄並非傳統意義上的即時串流。多數本機實作採用「按住說話」模式:你說話、音訊被緩衝,接著模型處理完整的語段。在 Apple M 系列晶片上使用 Turbo 模型時,這個處理步驟夠快,對聽寫而言延遲感覺微不足道——短語通常在一秒內完成。

對於預錄檔案的長篇轉錄,雲端服務可在 GPU 叢集間平行處理,往往能快速完成大量批次。本機吞吐量則受限於你的機器與模型選擇,因此處理非常長的錄音時可能較慢。

成本:免費 vs. 按分鐘付費

本機轉錄除了你已擁有的硬體外不需任何額外成本。沒有 API 金鑰、沒有計費儀表板、沒有按分鐘計費。你下載一個模型檔案(從 Tiny 的 75MB 到 Large-v3 的 3GB 不等),就完成了。永遠免費。

雲端供應商按用量收費(依廠商與模型,按分鐘或按小時計)。方案與折扣經常變動,因此在編列預算前請先核實當前費率:

供應商批次/預錄串流/即時免費額度
Google Speech-to-Text按用量計費(依模型分層)按用量計費(依模型分層)試用/免費額度依帳戶而異
AWS Transcribe按用量計費按用量計費入門免費額度(有時間限制)
Azure Speech依地區/模型而異依地區/模型而異有限免費額度
Deepgram按模型層級用量計費按模型層級用量計費額度制試用
AssemblyAI按模型層級用量計費按模型層級用量計費額度制試用
本機(Whisper/Parakeet)免費免費無限量,永久免費

如何估算你的雲端支出

使用這個簡單公式: 每年音訊分鐘數 x 廠商費率. 若你的團隊大量使用聽寫,總成本會隨用量與席位數線性成長。

本機推論(Whisper/Parakeet)可避免持續性的 API 費用,這也是許多團隊將本機設為預設、僅在特殊情況下才導向雲端的原因。

註:雲端定價通常會針對語者分離、PII 遮蔽或自訂詞彙等功能加收額外費用。上述基本價格僅適用於標準轉錄。

離線能力:本機決定性勝出之處

這一點是二元的:雲端轉錄需要網路,本機轉錄則不需要。對許多人而言,這是決定性的因素。

離線能力不可或缺的情境:

出差與遠端工作

航班、火車、偏鄉地區、開發中地區——任何 Wi-Fi 訊號斷斷續續或根本不存在的地方。本機轉錄在 35,000 英尺高空的運作方式,與在你的辦公桌前完全相同。

氣隙隔離環境

政府機構、國防承包商、安全研究實驗室與金融機構通常運行於氣隙隔離網路,對外網路存取被完全封鎖。本機轉錄是唯一的選擇。

現場作業

衝突地區的記者、偏遠野外站的研究人員、鄉村診所的醫護人員——這些專業人士需要在行動網路可能不穩或無法使用的環境中,仍有可靠的轉錄能力。

可靠性

即使在連線良好的辦公室,雲端服務也會發生中斷。AWS、Google Cloud 與 Azure 都曾發生影響語音 API 的數小時事故。本機轉錄沒有任何可能當機的外部依賴。

並排比較

因素本機雲端
隱私
準確度(英語)
準確度(多語)
延遲
成本
離線使用
設定難易度
語者分離
可擴展性

何時該選擇何者

沒有一種做法是放諸四海皆準的。正確的選擇取決於你最看重什麼。

選擇本機,如果……

  • 隱私不容妥協(醫療、法律、個人日記)
  • 你需要離線或氣隙隔離的運作
  • 你希望轉錄完全沒有持續成本
  • 你的主要使用情境是聽寫(單一語者、清晰音訊)
  • 你受 GDPR、HIPAA 或類似法規規範

選擇雲端,如果……

  • 你需要為多人會議進行語者分離
  • 在困難的音訊條件下追求最高準確度
  • 你正在打造需要擴展到大量使用者的應用程式
  • 你需要即時串流轉錄
  • 你的硬體有限,無法運行大型模型

混合式做法

你不必只擇其一。有些應用程式——包括 OpenWhispr——同時支援兩種模式:預設使用 Whisper 與 Parakeet 等本機模型以兼顧隱私與零成本,並在需要雲端所提供的額外準確度或功能時,選擇性地帶入你自己的雲端 API 金鑰(OpenAI、Deepgram 等)。這種「BYOK」(自帶金鑰)模式讓你兼得兩者之長,而不會被任一種做法綁住。

資料來源與延伸閱讀

在同一個應用程式中體驗兩種做法

OpenWhispr 同時支援本機模型(OpenAI Whisper 與 NVIDIA Parakeet)以兼顧隱私與零成本,並在你需要最高準確度時自帶雲端 API 金鑰。開源、永久免費。

無需帳號 · 可離線使用 · 永久開源