Размеры моделей Whisper: tiny, base, small, medium и large — в чём разница
Все модели Whisper в сравнении. Параметры, скорость, точность — и какую из них стоит выбрать именно вам.
OpenWhispr
Инженерное дело
Оглавление
Whisper от OpenAI представлен в 9 вариантах модели по 5 категориям размеров: tiny (39 млн параметров), base (74M), small (244M), medium (769M) и large (1.55B). У каждого размера есть многоязычная версия и версия только для английского (кроме large и turbo, которые доступны лишь в многоязычном варианте). Также есть модель turbo (809M) — дистиллированная версия large-v3, почти такая же точная, но кардинально более быстрая. Чем крупнее модель, тем она точнее, но медленнее и требовательнее к памяти.
В квантованном формате whisper.cpp (GGML), который используют большинство локальных приложений для транскрипции, файлы моделей весят от 75 МБ (tiny) до 2,9 ГБ (large). Потребление памяти во время работы — от примерно 273 МБ для tiny до 3,9 ГБ для large. Подходящая модель зависит от вашего железа, языка и того, какая точность вам нужна.
Последнее обновление: 17 февраля 2026 г. Данные по параметрам, памяти и бенчмаркам перепроверены по как минимум двум первоисточникам.
Сводка проверки фактов (двойные источники)
- Официальные семейства моделей и число параметров: tiny/base/small/medium/large, а также turbo задокументированы OpenAI. README Whisper от OpenAI · Карточка модели Whisper
- Дисковый объём GGML/GGUF и контекст по памяти во время работы: оценки локального развёртывания взяты из документации whisper.cpp по конвертации и работе. whisper.cpp · Заметки whisper.cpp о памяти
- Оговорка по бенчмаркам: WER сильно зависит от набора данных и языка; цифры по LibriSpeech не являются универсальной оценкой качества. Статья о Whisper · Карточка модели large-v2
- Позиционирование модели turbo: turbo — это вариант с упором на скорость и компромиссами по точности, описанными в примечаниях к релизу и карточках моделей. Карточка модели turbo · Обсуждение релиза turbo
- Контекст использования OpenWhispr: OpenWhispr предоставляет несколько размеров Whisper, чтобы пользователи могли настроить баланс скорости и точности прямо на устройстве. OpenWhispr · Бэкенд whisper.cpp
Whisper Размеры модели: скорость и точность
Размер пузырька отражает относительное количество параметров.
Частота ошибок в словах: Whisper против конкурентов с открытым исходным кодом
LibriSpeech test-clean (чтение речи на английском языке) — чем меньше, тем лучше
Источники: карты модели Hugging Face, карты модели NVIDIA, Open ASR Leaderboard (Feb 2026). Только чистая речь для чтения на английском языке — реальная точность зависит от качества звука, акцента и домена. Коммерческие API опущены, поскольку они не публикуют тесты LibriSpeech.
Полное сравнение моделей
Эта таблица охватывает все официальные модели Whisper. «Относительная скорость» указана относительно large (базовый показатель 1x). Значения VRAM приведены для инференса PyTorch на GPU. Столбцы GGML показывают размеры файлов и потребление ОЗУ для whisper.cpp — именно его использует большинство десктопных приложений.
| Модель | Параметры | Только английский | VRAM (GPU) | GGML на диске | ОЗУ (whisper.cpp) | Скорость | WER на английском | WER многоязычный |
|---|---|---|---|---|---|---|---|---|
| tiny | 39 M | tiny.en | ~1 GB | 75 MiB | ~273 MB | ~10x | ~7.6% | ~12% |
| base | 74 M | base.en | ~1 GB | 142 MiB | ~388 MB | ~7x | ~5.0% | ~10% |
| small | 244 M | small.en | ~2 GB | 466 MiB | ~852 MB | ~4x | ~3.4% | ~7% |
| medium | 769 M | medium.en | ~5 GB | 1.5 GiB | ~2.1 GB | ~2x | ~2.9% | ~5% |
| large-v2 | 1,550 M | — | ~10 GB | 2.9 GiB | ~3.9 GB | 1x | ~2.7% | ~4% |
| large-v3 | 1,550 M | — | ~10 GB | 2.9 GiB | ~3.9 GB | 1x | ~2.4% | ~3.5% |
| turbo | 809 M | — | ~6 GB | 1.6 GiB | ~2.3 GB | ~8x | ~2.5% | ~3.7% |
Примечания: Цифры WER (Word Error Rate, доля ошибок в словах) — это приблизительные средние значения из статьи о Whisper, карточек моделей HuggingFace (тестовые наборы LibriSpeech для английского) и опубликованных бенчмарков OpenAI. Точное значение WER существенно зависит от набора данных, языка, качества аудио и методики оценки. Чем ниже, тем лучше. Скорость указана относительно large (1x = самая медленная).
Tiny (39 млн параметров)
Модель tiny — самый маленький и быстрый вариант Whisper. Всего 39 миллионов параметров и размер файла GGML в 75 МБ позволяют ей комфортно работать почти на любом железе — включая Raspberry Pi, старые ноутбуки и бюджетные мобильные устройства. Она транскрибирует примерно в 10 раз быстрее реального времени относительно модели large, что делает её лучшим выбором, когда задержка важнее идеальной точности.
- GGML: 75 МиБ на диске
- ОЗУ: ~273 МБ во время работы
- VRAM: ~1 ГБ (режим GPU)
- ~в 10 раз быстрее large
- Почти мгновенно на Apple Silicon
- В реальном времени на большинстве CPU
- WER на английском: ~7,6%
- Многоязычный WER: ~12%
- Плохо справляется с акцентами и шумом
У варианта tiny.en (только английский) WER на LibriSpeech test-clean составляет около 5,6%, поднимаясь до ~14,9% на test-other (шумное аудио с акцентами). Многоязычная модель tiny чуть хуже на английском, но поддерживает все 99 языков Whisper.
Tiny идеальна для быстрых заметок, малозначимой диктовки, прототипов живых субтитров, а также встраиваемых и периферийных устройств с ограниченными вычислительными ресурсами. Это стартовая модель по умолчанию для многих инструментов на базе whisper.cpp, потому что она скачивается за секунды и запускается мгновенно.
Base (74 млн параметров)
Модель base удваивает число параметров tiny (74M против 39M), оставаясь при этом очень лёгкой. При 142 МиБ (GGML) и ~388 МБ ОЗУ во время работы она по-прежнему комфортно помещается практически на любом современном устройстве. Прирост точности по сравнению с tiny заметен — особенно на шумном аудио и речи с акцентом.
- GGML: 142 МиБ на диске
- ОЗУ: ~388 МБ во время работы
- VRAM: ~1 ГБ (режим GPU)
- ~в 7 раз быстрее large
- По-прежнему очень быстро на CPU
- Менее секунды на Apple Silicon
- WER на английском: ~5,0%
- Многоязычный WER: ~10%
- Лучше на шумном аудио, чем tiny
Вариант base.en достигает около 4,3% WER на LibriSpeech test-clean и ~12,8% на test-other. Это ощутимый прогресс по сравнению с tiny.en (5,6% и 14,9% соответственно), особенно на сложном аудио.
Base — хороший выбор для маломощных устройств, где tiny оказывается недостаточно точной. Она также популярна в конвейерах транскрипции реального времени, где нужен баланс скорости и качества без выхода за 500 МБ ОЗУ.
Small (244 млн параметров)
Small — это уровень, на котором Whisper начинает ощущаться по-настоящему точным. При 244M параметров она в 3,3 раза крупнее base и даёт значительный прирост точности — особенно для неанглийских языков и шумных записей. Файл GGML весит 466 МиБ, а потребление ОЗУ во время работы — около 852 МБ. Она работает примерно в 4 раза быстрее large.
- GGML: 466 МиБ на диске
- ОЗУ: ~852 МБ во время работы
- VRAM: ~2 ГБ (режим GPU)
- ~в 4 раза быстрее large
- Быстро на современных ноутбуках
- В реальном времени на Apple Silicon
- WER на английском: ~3,4%
- Многоязычный WER: ~7%
- Хорошо справляется с акцентами
Вариант small.en достигает около 3,0% WER на LibriSpeech test-clean — выдающийся результат для модели, помещающейся менее чем в 500 МБ. Для многих сценариев только с английским small.en обеспечивает точность, близкую к medium, при доле затрат ресурсов.
Small часто рекомендуют как модель по умолчанию для большинства пользователей. Она хорошо работает на любом современном ноутбуке (включая MacBook Air M1 с 8 ГБ ОЗУ), даёт хорошую точность на разных языках и транскрибирует достаточно быстро для диктовки в реальном времени.
Наша рекомендация: Если вы не уверены, с какой модели начать, начните со small. Это лучший баланс скорости, точности и потребления ресурсов для большинства конфигураций железа и сценариев.
Medium (769 млн параметров)
Medium — это уровень, где начинает работать закон убывающей отдачи, но прирост точности по сравнению со small всё ещё ощутим, особенно для многоязычной транскрипции, технической лексики и сложных условий записи. При 769M параметров ей требуется 1,5 ГиБ дискового пространства (GGML) и около 2,1 ГБ ОЗУ во время работы.
- GGML: 1,5 ГиБ на диске
- ОЗУ: ~2,1 ГБ во время работы
- VRAM: ~5 ГБ (режим GPU)
- ~в 2 раза быстрее large
- Комфортно на машинах с 8 ГБ и более
- Нужно приличное железо
- WER на английском: ~2,9%
- Многоязычный WER: ~5%
- Сильна на техническом контенте
Модель medium.en достигает около 3,0% WER на LibriSpeech test-clean и примерно 7,5% на test-other. Однако на более широких бенчмарках — особенно с разнообразными акцентами, фоновым шумом и узкоспециальной лексикой — medium стабильно превосходит small.
Medium — сильный выбор для профессиональных рабочих процессов транскрипции, где важна точность, но нет железа (или терпения) для large. Она хорошо работает на машинах с 8 ГБ ОЗУ и больше и значительно выигрывает от ускорения на GPU.
Large (1550 млн параметров)
Модель large — самый точный вариант Whisper, с 1,55 миллиарда параметров. Существуют три версии: large-v1 (оригинальный релиз), large-v2 (обучена в 2,5 раза больше эпох с добавленной регуляризацией) и large-v3 (обучена на большем объёме данных со 128 мел-частотными полосами вместо 80). Large-v3 — текущая рекомендуемая версия для максимальной точности.
- GGML: 2,9 ГиБ на диске
- ОЗУ: ~3,9 ГБ во время работы
- VRAM: ~10 ГБ (режим GPU)
- 1x (базовый уровень — самая медленная)
- Настоятельно рекомендуется GPU
- CPU: может быть медленнее реального времени
- WER на английском: ~2,4% (v3)
- Многоязычный WER: ~3,5% (v3)
- Лучшая на всех языках
large-v2 vs large-v3
large-v2
- Обучена в 2,5 раза больше эпох, чем large-v1
- Добавлена регуляризация для лучшей обобщающей способности
- WER на LibriSpeech test-clean: ~3,0%
- Стабильнее на некоторых типах аудио
large-v3
- 128 мел-полос (против 80) — более тонкое частотное разрешение
- Обучена на 1 млн часов размеченного и 4 млн часов псевдоразмеченного аудио
- Снижение ошибок на 10–20% по сравнению с large-v2 по всем языкам
- Добавлена поддержка кантонского языка
Какую модель large выбрать: Для новых проектов используйте large-v3. В среднем она строго лучше large-v2 на всех языках. Тем не менее некоторые пользователи отмечают, что large-v2 даёт меньше галлюцинаций (генерации текста, которого нет в аудио) в отдельных пограничных случаях с очень тихими или беззвучными фрагментами. Если вы столкнётесь с галлюцинациями на large-v3, попробуйте large-v2 как запасной вариант.
Turbo (809 млн параметров)
Модель turbo — дистиллированная версия large-v3, которая кардинально сокращает время инференса, сохраняя при этом почти всю точность. OpenAI добилась этого, урезав декодер с 32 слоёв всего до 4 — сократив число параметров с 1550M до 809M. Энкодер (на который приходится основная нагрузка) остался идентичным large-v3.
- GGML: ~1,6 ГиБ на диске
- ОЗУ: ~2,3 ГБ во время работы
- VRAM: ~6 ГБ (режим GPU)
- ~в 8 раз быстрее large
- Точность почти как у large, скорость почти как у tiny
- Отлична на GPU с torch.compile
- WER на английском: ~2,5%
- Многоязычный WER: ~3,7%
- Незначительная потеря качества против large-v3
Turbo — лучший выбор, когда нужна точность почти на уровне large-v3, но недопустима задержка полноценной модели large. На GPU с такими оптимизациями, как torch.compile, turbo может дать ускорение до 4,5 раза по сравнению со стандартным инференсом, что делает её чрезвычайно быстрой.
Важное ограничение: Модель turbo не обучалась для задач перевода. Если вам нужно перевести речь с одного языка на английский, используйте вместо неё medium или large-v3.
Только английский vs многоязычные модели
Для размеров tiny, base, small и medium Whisper предлагает два варианта: многоязычную модель и модель только для английского ( .en ). Модели large и turbo доступны лишь в многоязычном варианте — версий только для английского у них нет.
Когда использовать .en (только английский)
- Вы транскрибируете только английское аудио
- Выше точность на английском в размерах tiny/base
- Чуть быстрее — нет накладных расходов на определение языка
- Тот же размер файла, что и у многоязычного аналога
Когда использовать многоязычную
- Вы транскрибируете неанглийское аудио
- Ваше аудио содержит несколько языков
- Вам нужен перевод речи (на английский)
- Обязательна при использовании large или turbo (варианта .en не существует)
Разрыв в качестве между .en и многоязычными моделями наиболее значителен на меньших размерах. Для tiny и base варианты .en заметно лучше на английском. К моменту, когда вы доходите до small и medium, разница существенно сокращается. На уровне large есть только многоязычная модель — и она отлично работает на английском в любом случае.
Правило большого пальца: Если вы используете исключительно английский и выбираете tiny или base, берите вариант .en. Для small и крупнее многоязычная версия отлично работает с английским и даёт гибкость для других языков.
Требования к железу: что и где работает
Необходимое железо сильно зависит от размера модели и от того, используете ли вы whisper.cpp (CPU/Metal/CUDA) или реализацию PyTorch (с упором на GPU). Вот чего ожидать на распространённых классах оборудования.
MacBook Air M1 (8 ГБ ОЗУ)
- tiny/base: Мгновенно. Быстрее реального времени.
- small: Быстро. В реальном времени или лучше с Metal.
- medium: Пригодна к использованию. На CPU может быть чуть медленнее реального времени. Metal значительно помогает.
- large: Возможна, но впритык по ОЗУ. Ожидайте скорость ниже реального времени.
- turbo: Хорошо подходит. Почти в реальном времени с ускорением Metal.
MacBook Pro M2/M3 (16–36 ГБ ОЗУ)
- tiny/base/small: Мгновенно. Всё в пределах возможностей железа.
- medium: Быстро. Комфортно с Metal.
- large: Хорошо. В реальном времени или близко к нему с Metal.
- turbo: Отлично. Быстрая транскрипция в реальном времени.
Среднебюджетный ноутбук Windows/Linux (8 ГБ ОЗУ, встроенный GPU)
- tiny/base: Быстро. Достаточно только CPU.
- small: Хорошо. Комфортно на большинстве современных CPU.
- medium: Рабочий вариант. На CPU может быть в 2–3 раза медленнее реального времени.
- large: Проблематично. Только на CPU будет медленно.
- turbo: Рабочий вариант. Выигрывает от Vulkan, если он доступен.
Десктоп с GPU NVIDIA (RTX 3060+, 8 ГБ+ VRAM)
- Все модели: Быстро. GPU комфортно справляется со всем.
- large: Нужно 10 ГБ VRAM (RTX 3060 12GB или лучше).
- turbo: Самый быстрый вариант с CUDA. Значительно быстрее large.
- Для лучшей производительности используйте бэкенд CUDA в whisper.cpp.
Бэкенды ускорения whisper.cpp
whisper.cpp — порт на C/C++, который используют большинство десктопных приложений, — поддерживает несколько бэкендов аппаратного ускорения, способных кардинально повысить производительность:
Metal (Apple Silicon)
Полноценный инференс на GPU для Mac с M1/M2/M3/M4. Запускает всю модель на GPU без копирования памяти. Это самый быстрый бэкенд для пользователей macOS — и именно его OpenWhispr использует на Mac.
Core ML (Apple)
Использует для инференса нейронный движок Apple. Для некоторых размеров моделей на новых чипах может быть быстрее Metal и энергоэффективнее. Сначала требуется конвертировать модели в формат Core ML.
CUDA (NVIDIA)
Ускорение на GPU для карт NVIDIA. Самый быстрый бэкенд для пользователей с выделенными GPU NVIDIA. Требует CUDA toolkit. Лучший выбор для моделей large и turbo на десктопе.
Vulkan (кроссвендорный GPU)
Работает с GPU Intel, AMD и NVIDIA. Хороший запасной вариант для систем без NVIDIA. Доступен на Linux и Windows. Производительность зависит от вендора GPU и драйвера.
Приблизительная скорость транскрипции
Коэффициент реального времени (RTF) для 60-секундного аудиофрагмента. RTF < 1,0 означает быстрее реального времени. Это грубые оценки — реальная производительность зависит от содержания аудио, квантования модели и нагрузки на систему.
| Модель | M1 MacBook Air | M3 Pro MacBook | Intel i7 (CPU) | RTX 3060 (CUDA) |
|---|---|---|---|---|
| tiny | ~0.05x | ~0.03x | ~0.1x | ~0.02x |
| base | ~0.08x | ~0.05x | ~0.15x | ~0.04x |
| small | ~0.2x | ~0.12x | ~0.4x | ~0.08x |
| medium | ~0.6x | ~0.3x | ~1.2x | ~0.15x |
| large-v3 | ~1.5x | ~0.7x | ~3.0x | ~0.3x |
| turbo | ~0.3x | ~0.15x | ~0.6x | ~0.08x |
Как читать таблицу: 0,1x означает, что транскрипция 60 секунд аудио занимает около 6 секунд. 1,0x = реальное время. Значения выше 1,0x означают медленнее реального времени. Все цифры получены на whisper.cpp с настройками по умолчанию и бэкендом Metal (Mac) или CUDA (NVIDIA), где применимо.
Какую модель выбрать?
Вот конкретные рекомендации для распространённых сценариев. Если сомневаетесь, начните со small и переходите выше или ниже по мере опыта.
«Хочу максимально быстро»
Используйте tiny или tiny.en . Транскрибирует за миллисекунды на современном железе. Точность грубовата, но пригодна для быстрых заметок и малозначимой диктовки.
tiny / tiny.en«Хочу хорошую точность на ноутбуке»
Используйте small . Лучший баланс скорости и точности для современных ноутбуков. Если у вашей машины 16 ГБ ОЗУ и больше, medium тоже отличный выбор.
small или medium«Хочу лучшую точность»
Используйте large-v3 . Это самая точная модель Whisper в целом. Если важна и скорость, turbo даёт 95% точности при восьмикратной скорости.
large-v3 или turbo«Я использую только английский»
Используйте вариант .en для выбранного размера ради лучшей точности на английском. Для tiny и base модели .en заметно лучше. Для small и выше разница минимальна.
small.en или medium.en«Я использую несколько языков»
Используйте многоязычный вариант. small или medium для сбалансированной производительности. large-v3 для лучшей многоязычной точности.
small, medium или large-v3«У меня очень ограниченное железо»
Используйте tiny или base . Обе работают на 1 ГБ ОЗУ и даже на Raspberry Pi и других одноплатных компьютерах. Base даёт ощутимый прирост точности над tiny при минимальных дополнительных затратах.
tiny или baseКак OpenWhispr управляет выбором модели
OpenWhispr — это десктопное приложение для диктовки с открытым исходным кодом, которое под капотом использует whisper.cpp. Оно позволяет скачивать и переключаться между любыми моделями Whisper прямо из настроек — без командной строки. Модели скачиваются один раз и хранятся локально. Вы можете менять модели в любой момент, балансируя скорость и точность под своё железо.
Скачайте любую модель
Выбирайте от tiny до large-v3 в настройках. OpenWhispr автоматически скачивает версию GGML.
Переключайтесь мгновенно
Меняйте модели в любой момент. Перезапуск не нужен. Пробуйте разные размеры, чтобы найти то, что работает лучше всего на вашем железе.
Оптимизировано под железо
Использует Metal на Apple Silicon, CUDA на NVIDIA и оптимизированный инференс на CPU в остальных случаях. Всё локально, всё конфиденциально.
Наш совет: Начните со small . Если кажется медленным, спуститесь до base или tiny. Если хотите больше точности и ваше железо потянет, поднимитесь до medium или large-v3. OpenWhispr делает эксперименты лёгкими.
Источники
- Radford et al. «Robust Speech Recognition via Large-Scale Weak Supervision» (2022) — Оригинальная статья о Whisper с полными результатами бенчмарков.
- Репозиторий OpenAI Whisper на GitHub — Официальная таблица моделей, число параметров, требования к VRAM и показатели относительной скорости.
- Карточка модели OpenAI Whisper — Официальный состав обучающих данных и оговорки по оценке.
- Репозиторий whisper.cpp на GitHub — Размеры моделей GGML, потребление ОЗУ и подробности об аппаратном ускорении.
- Карточка модели Whisper large-v2 (HuggingFace) — Контекст бенчмарка LibriSpeech, используемый во многих сравнениях WER.
- Карточка модели Whisper large-v3 (HuggingFace) — Детали обучения, изменения архитектуры по сравнению с large-v2 и многоязычные улучшения.
- Карточка модели Whisper large-v3-turbo (HuggingFace) — Детали архитектуры turbo, особенности урезания декодера и компромиссы по производительности.
- Анонс OpenAI Whisper Turbo (обсуждение на GitHub #2363) — Официальные примечания к релизу turbo и кроссязыковые сравнения производительности.
- OpenWhispr — Практический контекст локального развёртывания для выбора размеров моделей.
Попробуйте разные модели Whisper в OpenWhispr
Диктовка с открытым исходным кодом, работающая локально. Скачайте любую модель Whisper, переключайтесь между размерами в один клик и находите идеальный баланс под своё железо.
Аккаунт не нужен · Работает офлайн · Открытый код навсегда