2026年版 Windows向けベスト音声入力ツール
Windowsの音声入力の選択肢はかつてないほど豊富です。標準搭載のWin+Hから、話すそばからAIが書き直してくれるツールまで。2026年に検討する価値のある選択肢を、正直に比較します。
OpenWhispr
エンジニアリング
目次
2026年にWindowsで最適な音声入力ツールは、何を求めるかによって変わります。 洗練された使い心地とプライバシー重視、そしてAIによるテキスト整形を求める大半のユーザーには、 OpenWhispr が最も充実したパッケージを提供します。whisper.cppを基盤としたプッシュトゥトーク式の音声入力、システム全体で使えるホットキー、99以上の言語、そしてオプションのAI整形機能。これらすべてがオープンソースで無料です。インストール不要ですぐ始めたいなら、Windows Voice Typing(Win+H)が標準で組み込まれています。予算を気にせず、英語で最高水準の学習済み精度が必要なら、Dragon Professionalが$500〜$669の従来からの定番として健在です。AIによる自動編集を求めるクラウド重視のユーザーには、Wispr FlowやTypelessが選択肢になります。そして完全ハンズフリーのコンピューティングが必要な開発者には、Talon Voiceが他に類を見ない存在です。
最終更新:2026年3月。ツールの提供状況や機能に関する記述は、主要な主張ごとに最低2つの情報源と照合しています。
ファクトチェック概要(複数ソース)
- OpenWhisprはwhisper.cpp経由でローカルWhisperを実行: 機能セットとローカル実行環境は公開ドキュメントで確認できます。 openwhispr.com · whisper.cpp
- Windows Voice Typingはインターネット接続が必須: 文字起こしはAzure Speech Services経由のクラウド処理です。Copilot+ PCではローカルAIによる文法補正(「Fluid Dictation」)が追加されますが、コアとなる文字起こしは依然としてクラウド処理です。 Microsoft サポート · Windows Central
- Dragon Professionalは販売継続中だが保守モード: Microsoftは2022年3月にNuanceの$19.7B(197億ドル)規模の買収を完了し、Nuanceの技術をDragonではなくAzureおよびMicrosoft 365に注力させています。 Nuance Dragon · Wikipedia
- クラウド重視のツールは利便性とプライバシーを引き換えにする: Wispr Flow、Typeless、Aqua Voiceは、処理のために音声をクラウドサーバーへ送信します。 Wispr Flow · Typeless · Aqua Voice
- OpenWhisprの位置づけ: OpenWhisprは、AI整形機能を備え、オープンソースでオフライン対応かつシステム全体で使える音声入力ツールとして、Windowsで利用できる唯一の存在です。 OpenWhispr · Whisper 上流リポジトリ
Windows ディクテーション風景 (2026)
1. OpenWhispr
OpenWhisprは、Electronとwhisper.cppを基盤に構築された、オープンソースのクロスプラットフォーム対応デスクトップ音声入力アプリです。システム全体で動作するプッシュトゥトーク式の音声テキスト変換を提供します。ホットキーを押しながら話し、離すと、文字起こしされたテキストがカーソルのある場所にそのまま入力されます。さらに、LLM(OpenAI、Anthropic、Google Gemini、またはローカルモデル)を使って、口述したテキストを整理・整形・再構成できるAIエージェントモードも搭載しています。WindowsではNSISインストーラー付きの標準的な.exeとしてインストールされ、x64ハードウェア上でネイティブに動作します。
長所
- システム全体で使えるプッシュトゥトーク式ホットキーと洗練されたGUI
- テキストの自動整形・整理を行うAIエージェントモード
- WhisperおよびNVIDIA Parakeetモデルによる99以上の言語対応
- 完全オープンソース。ソースからのビルドもビルド済みバイナリの利用も可能
- ローカルモデルで完全オフライン動作。音声が端末の外に出ることはありません
短所
- Electronベースのため、ネイティブアプリよりリソース消費が多め
- AI整形機能の利用にはAPIキーまたはProサブスクリプションが必要
- 大きなWhisperモデルでリアルタイム性能を出すには相応のハードウェアが必要
2. Windows Voice Typing(Win+H)
Windows Voice Typingは、Win+Hを押すだけでシステム全体で使える、Microsoft標準搭載の音声入力機能です。文字起こしにはクラウドベースのAzure Speech Servicesを使用し、自動句読点機能も備えています。Copilot+ PCでは、「Fluid Dictation」がローカルAIによる文法補正とフィラー語の除去を追加します。従来のWindows Speech Recognition機能は、音声入力と完全ハンズフリーのPC操作の両方を提供するVoice Accessに置き換えられました。
長所
- 費用ゼロ、セットアップ不要。すべてのWindows 10/11 PCに標準搭載
- システム全体対応。OS内のあらゆるテキスト欄で動作
- 自動句読点と44言語に対応
- Copilot+ PCのFluid Dictationが文法とフィラー語を補正
短所
- インターネット接続が必須。すべての音声がMicrosoftのクラウドに送信されます
- 明瞭な英語音声で報告される精度は一般に85〜90%
- AIによるテキスト再整形や整理機能はなし(Copilot+ PCを除く)
- オープンソースではない。独自のクラウドサービス
3. Dragon Professional v16
Dragon Professionalは、Windows音声入力における従来からの重鎮です。もとはDragon NaturallySpeakingとしてNuanceが開発しました(2022年3月に完了した$19.7B(197億ドル)の取引でMicrosoftが買収)。バージョン16が最新リリースで、完全オフラインで動作し、学習させたユーザープロファイルにより英語で99%以上の精度に到達できます。ただしDragonは事実上の保守モードにあります。Microsoftは新バージョンを発表しておらず、Nuanceの技術をDragonではなくAzureおよびMicrosoft 365に注力させています。
長所
- Nuanceは学習済み英語プロファイルで最大99%の精度を謳う
- 完全オフライン。認識処理はすべて端末上で実行
- ワークフロー向けの高度な音声コマンドカスタマイズ
- 法務・医療の専門家向けの業界標準
短所
- 非常に高価。販売店により$500〜$669
- 事実上の保守モード。新規開発はなし
- 対応はわずか6言語(英語、ドイツ語、フランス語、スペイン語、オランダ語、イタリア語)
- Windows専用。MacやLinuxには非対応
率直な評価: Dragonは数十年にわたり定番でしたが、その将来は不透明です。MicrosoftはNuance買収以降、Dragonへの投資を行っていません。$500〜$669という価格は、有意義なアップデートを受けられない可能性のあるソフトウェアへの大きな投資です。現代のWhisperベースのツールは、多くの用途においてDragonの精度に並ぶか上回る性能を、はるかに低コストで実現しています。
4. Wispr Flow
Wispr Flowは、Windows、macOS、iOS、Androidで使えるクラウドベースのAI音声入力ツールです。AIによる後処理に優れ、フィラー語の自動除去、文法補正、入力先のアプリに合わせたトーン調整(Slackではよりカジュアルに、メールクライアントではより丁寧に)を行います。自動検出付きで100以上の言語に対応し、音声で呼び出せるショートカットのスニペットライブラリも備えています。
長所
- アプリごとのトーン調整を備えた優れたAI自動編集
- 自動検出付きの100以上の言語対応
- クロスプラットフォーム(Windows、macOS、iOS、Android)
- 全プランでHIPAA対応可能
短所
- オフラインモードなし。インターネットがないと一切使えません
- すべての音声が処理のためクラウドサーバーへ送信されます
- $15/月(年払いで$12/月)と高価
- 無料プランは週2,000語までに制限
5. Typeless
Typelessは、Windows、macOS、iOS、Androidで使えるクラウドベースの音声入力ツールです。スマートなテキスト変換に重点を置き、フィラー語の除去、重複の排除、リストや要点の自動整形を行い、時間をかけてユーザー個人の文体に適応していきます。言語間のリアルタイム翻訳にも対応し、Notion、Slack、Gmail、VS Code、Obsidianを含む60以上のアプリで動作します。
長所
- 寛大な無料プラン。週4,000語(月約16,000語)
- 個人の文体に適応する優れたAI自動編集
- 100以上の言語間のリアルタイム翻訳
- システム全体で60以上のアプリに対応
短所
- オフラインモードなし。すべての文字起こしにインターネットが必要
- すべての音声がクラウド処理のため端末の外に出ます
- 年払いでない場合、Proプランは$30/月
- オープンソースではない。独自のクラウドサービス
6. Aqua Voice
Aqua Voiceは、開発者やテクニカルライター向けに特化して作られたクラウドベースの音声入力ツールです。独自のAvalon文字起こしモデルは、変数名、略語、API名、分野特有の専門用語といった技術用語を、汎用の音声エンジンよりも的確に扱えるよう学習されています。49言語に対応し、WindowsとmacOSの両方でシステム全体で動作し、50ms未満で起動します。
長所
- 技術語彙(コード、略語、専門用語)の扱いに優れる
- コンテキストを認識した整形で、出力を入力先アプリに合わせる
- 非常に高速な起動。レイテンシは50ms未満
- 手頃なProプラン。$8/月
短所
- オフラインモードなし。完全にクラウドベース
- 対応言語が競合より少ない(49言語)
- 比較的新しい製品で、ユーザーベースが小さい
- 無料プランは1,000語までに制限
7. Microsoft 365 Dictation
Microsoft 365 Dictationは、デスクトップ版・Web版の両方で、Word、Excel、Outlook、PowerPoint、OneNoteに組み込まれています。Microsoftのクラウドベース音声認識を使用し、自動句読点機能を備え、約55言語に対応します(15言語が完全サポート、約40言語がプレビュー)。音声整形コマンド(「太字にして」「改行」「最後の文を削除」)により、Officeアプリ内で基本的なハンズフリー編集ができます。利用にはアクティブなインターネット接続が必要です。デスクトップアプリにはMicrosoft 365サブスクリプションが必要ですが、Office のWeb版では音声入力を無料で利用できます。
長所
- Microsoft 365を契約済みなら追加費用なしで利用可能
- 自動句読点と音声整形コマンド
- 約55言語対応(15言語が完全サポート、約40言語がプレビュー)
- Officeのデスクトップ版・Web版の両方で動作
短所
- Microsoft 365アプリ内でのみ動作。システム全体では使えません
- インターネットが必須。クラウドベースの文字起こしのみ
- デスクトップアプリにはMicrosoft 365サブスクリプション($9.99〜/月)が必要
- AIによるテキスト整理やフィラー語除去はなし
8. Talon Voice
Talon Voiceは、音声入力をはるかに超える総合的なハンズフリー入力システムです。ウィンドウ管理、コーディング、アプリの切り替え、ファイルの閲覧まで、コンピューター全体を音声だけで操作でき、Tobii製デバイスによるアイトラッキングもオプションで利用できます。Talonは独自のConformer音声エンジンを内蔵し、代替エンジンとしてDragon Professional(Windowsのみ)にも対応します。文章の口述よりもコマンド中心の操作を主体とするため、キーボードとマウスを完全に置き換える必要がある開発者やアクセシビリティ利用者に最適です。
長所
- 単なる音声入力ではなく、完全ハンズフリーのコンピューター操作
- 言語固有のコマンドを備えた、音声コーディングに特化した設計
- マウスを代替するアイトラッキング連携
- アクセシビリティに不可欠。RSI(反復性ストレス障害)には文字通り人生を変える存在
短所
- 学習コストが高い。コマンドとフォネティックコードの暗記が必要
- コアエンジンは独自仕様(コミュニティ製スクリプトはオープンソース)
- 主に英語向け。多言語サポートは限定的
- 長文の文章口述向けには設計されていない
9. Google Docs Voice Typing
Googleの標準搭載音声入力は、Chrome、Edge、SafariでGoogle Docs(ツール > 音声入力)から利用できます。Googleのクラウドベース音声認識を使用し、文字起こしは100以上の言語に対応しますが、整形用の音声コマンドは英語でのみ機能します。ブラウザ以外のインストールは不要で、最も手軽な選択肢です。ただしGoogle Docsの外では使えないため、最も制約が多い選択肢でもあります。
長所
- セットアップ不要。ブラウザを開いて話し始めるだけ
- Googleの音声モデルによる良好な精度
- 文字起こしは100以上の言語に対応
- Googleアカウントがあれば完全無料
短所
- Google Docs内(Chrome、Edge、Safari)でのみ動作。システム全体では使えません
- すべての音声がGoogleのサーバーへ送信されます。オフラインモードなし
- AI整理機能なし。句読点は自分で口に出す必要があります
- オープンソースではない。独自のGoogleサービス
一覧比較
| ツール | オープンソース | オフライン | 対応言語 | AI整形 | システム全体 | 料金 |
|---|---|---|---|---|---|---|
| OpenWhispr | 99以上 | 無料(Pro $8/月) | ||||
| Windows Voice Typing | 44 | 無料(Windows標準搭載) | ||||
| Dragon Professional | 6 | $500〜$669 買い切り | ||||
| Wispr Flow | 100以上 | 無料プラン / $15/月 | ||||
| Typeless | 100以上 | 無料プラン / $12/月 | ||||
| Aqua Voice | 49 | 無料プラン / $8/月 | ||||
| Microsoft 365 Dictation | 約55 | M365に含まれる | ||||
| Talon Voice | 英語 | 無料 / $25/月 Patreon | ||||
| Google Docs Voice Typing | 100以上 | 無料 |
おすすめ
Windows向けに唯一の「ベスト」音声入力ツールというものは存在しません。何を重視するかによって変わります。以下に整理してみます:
大半のユーザーには
OpenWhispr が最も充実したパッケージを提供します。洗練されたGUI、システム全体で使えるプッシュトゥトーク、AI整形、Whisperの精度、そして完全オープンソース。標準でオフライン動作し、ここで紹介する中で音声が一切端末の外に出ない唯一のツールです。
インストール不要の手軽さなら
Windows Voice Typing(Win+H) はすでにあなたのPCに入っています。ホットキーを押して話し始めるだけ。専用ツールの精度や機能には及びませんが、標準搭載されている手軽さには勝てません。
最高のAI自動編集なら
Wispr Flow と Typeless がAI後処理で先行しています。フィラー語の除去、文法補正、トーン調整など。トレードオフは、すべての音声がクラウドに送られる点です。Typelessはより寛大な無料プランを備え、Wispr Flowはアプリごとのトーン調整を備えています。
開発者には
Aqua Voice が技術語彙に特化して作られています。コードのコメント、APIドキュメント、技術仕様などを口述するなら、そのAvalonモデルは汎用エンジンよりも的確に専門用語を扱います。
オフラインで英語の最高精度なら
Dragon Professional が依然として英語で最高水準の学習済み精度を提供しますが、$500〜$669という価格で将来は不透明です。専門語彙のプロファイルが必要で、従来製品でも問題ないという場合にのみ検討してください。
アクセシビリティとハンズフリーのコンピューティングなら
Talon Voice はまったく別の次元の存在です。音声入力で補うだけでなく、キーボードとマウスそのものを置き換える必要があるなら、習得する価値のあるツールです。時間の投資は大きいものの、その見返りは劇的です。
参考資料・関連リンク
OpenWhisprを試してみませんか?
Windows、macOS、Linux向けのオープンソース音声入力。プッシュトゥトーク、whisper.cpp、AI整形、99以上の言語に対応。ずっと無料です。
アカウント不要 · オフライン動作 · 永久にオープンソース