Parakeet, Whisper или Nemotron: лучшее локальное распознавание речи в 2026 году
Три открытые модели уже способны целиком преобразовывать речь в текст на вашем компьютере. Разбираемся, как они на самом деле различаются по точности, скорости, языкам и потоковой обработке, опираясь на первичные источники.
OpenWhispr
Инженерное дело
Оглавление
Для английского и основных европейских языков лучшая локальная модель распознавания речи 2026 года — NVIDIA Parakeet TDT 0.6B v3: по измеренной точности она превосходит Whisper large-v3, занимает вчетверо меньше места и значительно быстрее работает на обычном CPU. Если текст должен появляться прямо во время речи, новые потоковые модели NVIDIA Nemotron — первые локальные модели, специально созданные для этой задачи. А для одного из множества языков, которых нет у NVIDIA, по-прежнему стоит выбрать Whisper от OpenAI с поддержкой 99 языков.
Главная неожиданность 2026 года: после трёх лет лидерства Whisper утратила первое место по точности среди открытых моделей. Но вопрос о лучшей модели теперь действительно имеет три ответа, поскольку каждая сильна в своём: Parakeet оптимизирует точность на ватт, Nemotron — задержку, а Whisper — широту языкового охвата. Мы сравниваем их по данным собственных карточек моделей и открытого рейтинга — без субъективных впечатлений и преувеличения разницы.
Последнее обновление: 18 июля 2026 г. Мы разрабатываем OpenWhispr — приложение для диктовки с открытым кодом, в которое входят все три семейства моделей, поэтому мы тестируем и поддерживаем каждое из них в рабочей среде. В этом и состоит наша позиция: мы не продаём ни одну из моделей, а ниже приводим те же честные компромиссы, которые объясняем своим пользователям.
Краткая проверка фактов (первичные источники)
- Средний WER Parakeet TDT 0.6B v3 в восьми тестах Open ASR Leaderboard составляет 6.34% при пропускной способности 3,332× реального времени. 600M параметров, 25 языков, лицензия CC-BY-4.0. Карточка Parakeet TDT v3 · Open ASR Leaderboard
- Whisper large-v3 получает около 7.4% в том же рейтинге и поддерживает 99 языков при 1.55B параметров и лицензии MIT. Репозиторий OpenAI Whisper · Карточка Whisper large-v3
- Средний WER Nemotron Speech Streaming EN 0.6B при потоковой обработке составляет 6.93% (блоки по 1.12 секунды); модель достигает 2.32% на LibriSpeech test-clean и обучена на 530,000 часах аудио. Карточка Nemotron Streaming EN
- Nemotron 3.5 ASR охватывает 40 языковых локалей в одной потоковой модели 600M с автоматическим определением языка; выпуск состоялся 4 июня 2026 года по лицензии OpenMDW. Карточка Nemotron 3.5 ASR
- Все указанные ниже размеры файлов и особенности работы приложения можно проверить в открытом реестре моделей OpenWhispr. OpenWhispr на GitHub · Страница моделей OpenWhispr
Три претендента
Все три — бесплатные модели с открытыми весами, которые можно скачать и запускать без интернета. Различия в архитектуре объясняют почти всё, что заметно на практике.
OpenAI Whisper (2022)
Модель, сделавшая открытое распознавание речи массовым. Это трансформер с энкодером и декодером, обученный на 680,000 часах аудио, доступный в шести размерах от 75MB (tiny) до 3GB (large-v3) и охватывающий 99 языков. Он генерирует текст по одному токену, как языковая модель, и потому работает медленнее остальных. Лицензия MIT.
NVIDIA Parakeet (2024–2025)
Трансдьюсерная модель (TDT) с 600M параметров для пакетной транскрипции. Вместо авторегрессионной генерации токенов она выдаёт текст за один проход по аудио — гораздо быстрее и без выдуманного текста в тишине. Важны две версии: многоязычная v3 (25 языков, 680MB в INT8 ONNX) и англоязычная Unified (631MB), которая сейчас показывает передовую точность на английском. Лицензия CC-BY-4.0.
NVIDIA Nemotron ASR (2026)
Новейшее семейство для потоковой обработки: трансдьюсер FastConformer с кэшем расшифровывает звук по мере поступления, не ожидая конца записи. Английская модель вышла в январе 2026 года, а многоязычная 3.5 для 40 локалей — в июне. Обе содержат 600M параметров (632–650MB в INT8 ONNX) и имеют открытую лицензию OpenMDW.
Точность: Parakeet побеждает, но отрыв невелик
Для оценки речевых моделей используют коэффициент ошибок в словах (WER) — долю слов, распознанных неверно. Чем ниже значение, тем лучше. Стандартный ориентир — Open ASR Leaderboard от Hugging Face, где WER усредняется по восьми разнородным английским наборам данных (совещания, отчётные звонки, TED Talks, аудиокниги и другие), поэтому один простой набор не может искусственно улучшить результат модели.
Точность для английского языка: средняя частота ошибок в словах
Средние значения по нескольким наборам данных из тестов Open ASR Leaderboard на Hugging Face (чем ниже, тем лучше). Nemotron показан в конфигурации потоковой обработки.
Источники: карточки моделей NVIDIA на Hugging Face и Open ASR Leaderboard, июль 2026 г. WER = процент слов, распознанных неверно.
График важно оценивать трезво: все модели пригодны для промышленного использования, а общий разброс — около 1.5 пункта. При обычной диктовке 6.3% и 7.4% воспринимаются похоже на чистом аудио; разница проявляется в сложных условиях — при акцентах, шуме и терминологии. В показателях NVIDIA примечательна цена результата: Parakeet достигает этой точности с 600M параметров против 1.55B у Whisper, а Nemotron получает 6.93% в потоке, не имея доступа к будущему аудио.
Известная слабость Whisper: галлюцинации в тишине
Декодер Whisper работает подобно языковой модели, поэтому во время тишины или шума может создавать гладкие, но полностью выдуманные фразы — этот сбой хорошо известен. Трансдьюсерные модели Parakeet и Nemotron устойчивы к нему по своей структуре: нет звукового сигнала — нет токенов. Для диктовки, где запись начинается и заканчивается тишиной, это важнее одного пункта в тесте.
Скорость и эффективность: разрыв огромен
На оборудовании рейтинга Parakeet TDT v3 транскрибирует со скоростью 3,332× реального времени — примерно час аудио за секунду. Whisper large-v3 не достигает и десятой части этого результата. Причина в архитектуре: Whisper пишет текст по одному токену, каждый шаг ждёт предыдущего, а трансдьюсер один раз читает аудио и сразу выдаёт текст. Без цикла и повторных проходов для каждого слова.
На ноутбуке абсолютные цифры ниже, но соотношение сохраняется: абзац, который Whisper large обрабатывает несколько секунд, с Parakeet появляется почти мгновенно на CPU без GPU. Независимые тесты также показывают, что трансдьюсеры NVIDIA расходуют примерно в 8–10× меньше энергии на час аудио чем Whisper при сопоставимом качестве, что важно при долгой работе от аккумулятора.
Ответ Whisper — turbo (1.6GB), облегчённая версия large-v3, которая немного уступает в точности, но примерно в 8× быстрее Whisper-large. Для диктовки это подходящий вариант Whisper, однако он лишь сокращает разрыв. Подробное сравнение размеров смотрите в нашем руководстве по размерам моделей Whisper.
Поддержка языков: главное преимущество Whisper
| Модель | Языки | Примечания |
|---|---|---|
| Whisper large-v3 | 99 | Самый широкий охват среди открытых моделей, включая языки с малым объёмом данных |
| Nemotron 3.5 ASR | 40 локалей | Автоопределение языка; 15 готовых языков, включая японский, корейский, арабский и хинди |
| Parakeet TDT v3 | 25 | Европейские языки, английский и русский; автоопределение |
| Parakeet Unified / Nemotron EN | 1 | Только английский, зато лучшая точность в своём классе |
Правило простое. Для английского или крупного европейского языка подойдёт любая из трёх моделей — выбирайте по скорости. Японский, корейский, вьетнамский, арабский и хинди теперь доступны в потоковом режиме Nemotron 3.5 — впервые среди локальных моделей. Для мандаринского, тайского, индонезийского, суахили или частого переключения языков Whisper остаётся единственным серьёзным вариантом, и скоро это вряд ли изменится.
Потоковая обработка: главное отличие
В потоковом режиме Nemotron не просто немного лучше — она делает то, чего архитектура двух других моделей не позволяет. Whisper обрабатывает аудио 30-секундными окнами и каждый раз заново кодирует всё содержимое. Поэтому «живая» Whisper — это та же пакетная модель, многократно запущенная на перекрывающихся фрагментах: дорого, с задержкой и нестабильными стыками. Архитектура Nemotron с кэшем обучена для потока: она обрабатывает только новый блок, переносит внутреннее состояние и выдаёт промежуточный текст с настраиваемой задержкой от 80 миллисекунд до 1.12 секунды.
В большом масштабе разница в эффективности огромна: NVIDIA сообщает о 17× большем числе одновременных потоков по сравнению с потоковой моделью прошлого поколения на той же GPU. На ноутбуке преимущество проще: текст появляется во время речи, а модель работает на вашем CPU. Инженерные подробности реализации в настольном приложении описаны в нашем разборе потокового ASR.
Если живой текст не нужен — вы диктуете, останавливаетесь и ждёте итоговую расшифровку, — потоковая обработка ничего не даёт, и пакетные модели Parakeet лучше. Поток нужен для субтитров в реальном времени, голосовых агентов и предпросмотра диктовки по мере речи.
Оборудование: все три работают на обычном ноутбуке
Ни одной модели не нужна GPU. Модели NVIDIA поставляются как квантованные в INT8 файлы ONNX (631–680MB), которые уверенно работают на любом современном CPU — Apple Silicon или x86 — через sherpa-onnx, нативный бинарный файл без Python и PyTorch. Whisper запускается везде через whisper.cpp; размеры small и turbo подходят для CPU, а large-v3 (3GB, ~10GB RAM) действительно выигрывает от ускорения.
Если GPU есть, используйте её для Whisper: Metal встроен в Apple Silicon, а OpenWhispr предлагает в один клик среды CUDA (NVIDIA) и Vulkan (AMD и Intel) с автоматическим переходом на CPU при сбое GPU. Трансдьюсеры NVIDIA настолько быстры на CPU, что для диктовки ускорять их на GPU почти бессмысленно.
Какую модель выбрать?
| Ваша задача | Рекомендация |
|---|---|
| Диктовка на английском, максимальная точность | Parakeet Unified EN 0.6B |
| Европейские языки, быстрая пакетная обработка | Parakeet TDT 0.6B v3 |
| Живой текст во время речи (английский) | Nemotron Speech Streaming EN |
| Живой текст на испанском, японском, корейском, арабском, хинди… | Nemotron 3.5 ASR Streaming |
| Язык, не поддерживаемый NVIDIA | Whisper large-v3 или turbo |
| Старое устройство или мало RAM, короткие заметки | Whisper tiny или base |
Если вы выбираете локальную модель ради конфиденциальности, все три равноценны: аудио обрабатывается на компьютере и никуда не отправляется. Подробнее об этом компромиссе читайте в материале о локальной и облачной транскрипции.
Попробуйте все три за две минуты
Самый честный способ выбрать — продиктовать один абзац каждой модели. OpenWhispr включает все модели из статьи — шесть размеров Whisper, обе Parakeet и обе Nemotron — в одном меню настроек, бесплатно и с открытым кодом для macOS, Windows и Linux. Загрузите модель, нажмите горячую клавишу и говорите. На нашей странице моделей указаны их размеры и компромиссы.
Часто задаваемые вопросы
Какая локальная модель распознавания речи лучшая в 2026 году?
Для английского и основных европейских языков лучший общий баланс предлагает NVIDIA Parakeet TDT 0.6B v3: средний WER в тестах Open ASR Leaderboard составляет 6.34% против примерно 7.4% у Whisper large-v3, при этом модель вчетверо компактнее и значительно быстрее работает на CPU. Если текст должен появляться прямо во время речи, лучше выбрать потоковые модели NVIDIA Nemotron. Для языка, которого нет в моделях NVIDIA, используйте Whisper.
Parakeet точнее Whisper?
В англоязычных тестах Open ASR Leaderboard — да: средний WER Parakeet TDT 0.6B v3 равен 6.34% против примерно 7.4% у Whisper large-v3, а англоязычная Parakeet Unified достигает 5.91%. Важная оговорка: разницу около ~1 пункта WER трудно заметить в обычной диктовке. Более очевидные преимущества Parakeet — скорость, эффективность и отсутствие выдуманного текста во время тишины, что является известной проблемой Whisper.
Нужна ли GPU для локального запуска этих моделей?
Нет. Все три работают на современном CPU. Parakeet и Nemotron используют квантованные в INT8 модели ONNX (примерно 630–680MB на диске), рассчитанные на инференс на CPU. Whisper работает на CPU через whisper.cpp, хотя крупной модели 3GB полезно ускорение на GPU. OpenWhispr поддерживает Metal на Apple Silicon, CUDA на NVIDIA и Vulkan на GPU AMD/Intel с автоматическим переходом на CPU.
Какие языки поддерживает Nemotron ASR?
NVIDIA Nemotron 3.5 ASR охватывает 40 языковых локалей в единой модели с 600M параметров и автоматическим определением языка. В OpenWhispr включены 15 готовых к транскрипции языков: английский, испанский, французский, итальянский, португальский, нидерландский, немецкий, турецкий, русский, арабский, хинди, японский, корейский, вьетнамский и украинский. Также доступна потоковая Nemotron только для английского.
Whisper теперь устарела?
Нет. Whisper по-прежнему охватывает 99 языков — намного больше, чем 25 у Parakeet или 40 локалей у Nemotron, — и остаётся самым надёжным выбором для азиатских языков, кроме японского, корейского и вьетнамского, для языков с малым объёмом данных и аудио с частым переключением языков. Это также самая проверенная модель с крупнейшей экосистемой. Изменилось лишь то, что по точности и скорости на английском Whisper больше не лидирует.
Какие из этих моделей поддерживает OpenWhispr?
Все. OpenWhispr предлагает шесть размеров Whisper через whisper.cpp, обе модели Parakeet и обе потоковые Nemotron через sherpa-onnx, а переключаться между ними можно в настройках. Всё работает на вашем устройстве — аудио никогда не покидает компьютер, — а приложение бесплатно и имеет открытый исходный код.