Tamaños de modelo de Whisper explicados: Tiny vs Base vs Small vs Medium vs Large
Todos los modelos de Whisper, comparados. Parámetros, velocidad, precisión y cuál deberías usar realmente.
OpenWhispr
Ingeniería
Tabla de contenidos
Whisper de OpenAI viene en 9 variantes de modelo distribuidas en 5 categorías de tamaño: tiny (39M de parámetros), base (74M), small (244M), medium (769M) y large (1.55B). Cada tamaño tiene una versión multilingüe y una versión solo en inglés (excepto large y turbo, que son únicamente multilingües). También existe un modelo turbo (809M) — una versión destilada de large-v3 que es casi igual de precisa pero drásticamente más rápida. Los modelos más grandes son más precisos pero más lentos y requieren más memoria.
Para el formato cuantizado (GGML) de whisper.cpp que usan la mayoría de las apps de transcripción local, los archivos de modelo van desde 75 MB (tiny) hasta 2.9 GB (large). El uso de memoria en tiempo de ejecución va desde alrededor de 273 MB para tiny hasta 3.9 GB para large. El modelo adecuado depende de tu hardware, tu idioma y cuánta precisión necesites.
Última actualización: 17 de febrero de 2026. Las afirmaciones sobre parámetros, memoria y benchmarks se contrastan con al menos dos fuentes primarias.
Resumen de verificación de datos (fuentes duales)
- Familias de modelos oficiales y recuentos de parámetros: tiny/base/small/medium/large más turbo están documentados por OpenAI. README de OpenAI Whisper · Ficha del modelo Whisper
- Contexto de disco y memoria en tiempo de ejecución de GGML/GGUF: las huellas de implementación local provienen de la documentación de conversión/ejecución de whisper.cpp. whisper.cpp · Notas de memoria de whisper.cpp
- Advertencia sobre los benchmarks: el WER varía mucho según el conjunto de datos y el idioma; las cifras de LibriSpeech no son una puntuación universal de calidad. Artículo de Whisper · Ficha del modelo large-v2
- Posicionamiento del modelo turbo: turbo es una variante enfocada en la velocidad con compromisos de precisión documentados en las notas de versión/fichas de modelo. Ficha del modelo turbo · Discusión sobre el lanzamiento de turbo
- Contexto de uso en OpenWhispr: OpenWhispr expone varios tamaños de Whisper para que los usuarios ajusten velocidad/precisión en el dispositivo. OpenWhispr · Backend de whisper.cpp
Whisper Tamaños de modelo: velocidad frente a precisión
El tamaño de la burbuja refleja el recuento relativo de parámetros
Tasa de error de palabras: Whisper frente a competidores de código abierto
LibriSpeech test-clean (leer voz en inglés): cuanto más bajo, mejor
Fuentes: tarjetas modelo Hugging Face, tarjetas modelo NVIDIA, Open ASR Leaderboard (Feb 2026). Solo lectura clara en inglés: la precisión en el mundo real varía según la calidad del audio, el acento y el dominio. Se omiten los API comerciales porque no publican puntos de referencia de LibriSpeech.
La comparación completa de modelos
Esta tabla cubre todos los modelos oficiales de Whisper. La "Velocidad relativa" es relativa a large (línea base de 1x). Las cifras de VRAM corresponden a inferencia con PyTorch en GPU. Las columnas de GGML muestran los tamaños de archivo y el uso de RAM para whisper.cpp, que es lo que usan la mayoría de las apps de escritorio.
| Modelo | Parámetros | Solo inglés | VRAM (GPU) | Disco GGML | RAM (whisper.cpp) | Velocidad | WER en inglés | WER multilingüe |
|---|---|---|---|---|---|---|---|---|
| tiny | 39 M | tiny.en | ~1 GB | 75 MiB | ~273 MB | ~10x | ~7.6% | ~12% |
| base | 74 M | base.en | ~1 GB | 142 MiB | ~388 MB | ~7x | ~5.0% | ~10% |
| small | 244 M | small.en | ~2 GB | 466 MiB | ~852 MB | ~4x | ~3.4% | ~7% |
| medium | 769 M | medium.en | ~5 GB | 1.5 GiB | ~2.1 GB | ~2x | ~2.9% | ~5% |
| large-v2 | 1,550 M | N/D | ~10 GB | 2.9 GiB | ~3.9 GB | 1x | ~2.7% | ~4% |
| large-v3 | 1,550 M | N/D | ~10 GB | 2.9 GiB | ~3.9 GB | 1x | ~2.4% | ~3.5% |
| turbo | 809 M | N/D | ~6 GB | 1.6 GiB | ~2.3 GB | ~8x | ~2.5% | ~3.7% |
Notas: Las cifras de WER (tasa de error por palabra) son promedios aproximados extraídos del artículo de Whisper, las fichas de modelo de HuggingFace (conjuntos de prueba de LibriSpeech para inglés) y los benchmarks publicados por OpenAI. El WER exacto varía significativamente según el conjunto de datos, el idioma, la calidad del audio y la metodología de evaluación. Menos es mejor. La velocidad es relativa a large (1x = el más lento).
Tiny (39M de parámetros)
El modelo tiny es la variante más pequeña y rápida de Whisper. Con apenas 39 millones de parámetros y un tamaño de archivo GGML de 75 MB, puede ejecutarse cómodamente en casi cualquier hardware — incluidas Raspberry Pi, portátiles antiguos y dispositivos móviles de gama baja. Transcribe a aproximadamente 10x la velocidad en tiempo real respecto al modelo large, lo que lo convierte en la mejor opción cuando la latencia importa más que una precisión perfecta.
- GGML: 75 MiB en disco
- RAM: ~273 MB en ejecución
- VRAM: ~1 GB (modo GPU)
- ~10x más rápido que large
- Casi instantáneo en Apple Silicon
- En tiempo real en la mayoría de las CPU
- WER en inglés: ~7.6%
- WER multilingüe: ~12%
- Tiene dificultades con acentos/ruido
En la variante tiny.en (solo inglés), el WER de LibriSpeech test-clean ronda el 5.6%, subiendo a ~14.9% en test-other (audio ruidoso/con acento). El modelo tiny multilingüe rinde algo peor en inglés pero admite los 99 idiomas de Whisper.
Tiny es ideal para notas rápidas, dictado de poca importancia, prototipos de subtitulado en vivo y dispositivos embebidos o de borde donde el cómputo es limitado. Es el modelo inicial por defecto de muchas herramientas basadas en whisper.cpp porque se descarga en segundos y se ejecuta al instante.
Base (74M de parámetros)
El modelo base duplica el número de parámetros de tiny (74M frente a 39M) sin dejar de ser muy ligero. Con 142 MiB (GGML) y ~388 MB de RAM en ejecución, sigue cabiendo cómodamente en prácticamente cualquier dispositivo moderno. La mejora de precisión respecto a tiny es notable — especialmente en audio ruidoso y voz con acento.
- GGML: 142 MiB en disco
- RAM: ~388 MB en ejecución
- VRAM: ~1 GB (modo GPU)
- ~7x más rápido que large
- Sigue siendo muy rápido en CPU
- Menos de un segundo en Apple Silicon
- WER en inglés: ~5.0%
- WER multilingüe: ~10%
- Mejor en audio ruidoso que tiny
La variante base.en alcanza alrededor del 4.3% de WER en LibriSpeech test-clean y ~12.8% en test-other. Es una mejora significativa respecto a tiny.en (5.6% y 14.9% respectivamente), sobre todo en audio difícil.
Base es una buena opción para dispositivos de bajo consumo donde tiny no es del todo lo bastante preciso. También es popular en flujos de transcripción en tiempo real donde quieres un equilibrio entre velocidad y calidad sin superar los 500 MB de RAM.
Small (244M de parámetros)
Small es donde Whisper empieza a sentirse genuinamente preciso. Con 244M de parámetros, supone un salto de 3.3x respecto a base y aporta una mejora de precisión significativa — especialmente para idiomas distintos del inglés y grabaciones ruidosas. El archivo GGML pesa 466 MiB y el uso de RAM en ejecución ronda los 852 MB. Se ejecuta a cerca de 4x la velocidad de large.
- GGML: 466 MiB en disco
- RAM: ~852 MB en ejecución
- VRAM: ~2 GB (modo GPU)
- ~4x más rápido que large
- Rápido en portátiles modernos
- En tiempo real en Apple Silicon
- WER en inglés: ~3.4%
- WER multilingüe: ~7%
- Maneja bien los acentos
La variante small.en alcanza alrededor del 3.0% de WER en LibriSpeech test-clean — un resultado notable para un modelo que cabe en menos de 500 MB. Para muchos casos de uso solo en inglés, small.en ofrece una precisión cercana a la de medium a una fracción del coste de recursos.
A menudo se recomienda small como modelo por defecto para la mayoría de los usuarios. Funciona bien en cualquier portátil moderno (incluido el MacBook Air M1 con 8 GB de RAM), ofrece buena precisión en varios idiomas y transcribe lo bastante rápido para flujos de dictado en tiempo real.
Nuestra recomendación: Si no estás seguro de qué modelo empezar a usar, empieza por small. Es el mejor equilibrio entre velocidad, precisión y uso de recursos para la mayoría del hardware y los casos de uso.
Medium (769M de parámetros)
Medium es donde empiezan a notarse los rendimientos decrecientes — pero las ganancias de precisión sobre small siguen siendo significativas, especialmente en transcripción multilingüe, vocabulario técnico y condiciones de audio difíciles. Con 769M de parámetros, requiere 1.5 GiB de espacio en disco (GGML) y unos 2.1 GB de RAM en ejecución.
- GGML: 1.5 GiB en disco
- RAM: ~2.1 GB en ejecución
- VRAM: ~5 GB (modo GPU)
- ~2x más rápido que large
- Cómodo en máquinas con 8 GB o más
- Necesita un hardware decente
- WER en inglés: ~2.9%
- WER multilingüe: ~5%
- Sólido en contenido técnico
El modelo medium.en alcanza alrededor del 3.0% de WER en LibriSpeech test-clean y aproximadamente un 7.5% en test-other. Sin embargo, en benchmarks más amplios — sobre todo los que incluyen acentos variados, ruido de fondo y vocabulario especializado — medium supera de forma consistente a small.
Medium es una opción sólida para flujos de transcripción profesionales donde la precisión importa pero no tienes el hardware (ni la paciencia) para large. Funciona bien en máquinas con 8 GB o más de RAM y se beneficia notablemente de la aceleración por GPU.
Large (1.550M de parámetros)
El modelo large es la variante más precisa de Whisper, con 1.55 mil millones de parámetros. Hay tres versiones: large-v1 (el lanzamiento original), large-v2 (entrenado durante 2.5x más épocas con regularización añadida) y large-v3 (entrenado con más datos y 128 bandas de frecuencia Mel en lugar de 80). Large-v3 es la versión recomendada actualmente para una precisión máxima.
- GGML: 2.9 GiB en disco
- RAM: ~3.9 GB en ejecución
- VRAM: ~10 GB (modo GPU)
- 1x (línea base — el más lento)
- GPU muy recomendada
- CPU: puede ser más lento que el tiempo real
- WER en inglés: ~2.4% (v3)
- WER multilingüe: ~3.5% (v3)
- El mejor en todos los idiomas
large-v2 vs large-v3
large-v2
- Entrenado durante 2.5x más épocas que large-v1
- Regularización añadida para una mejor generalización
- WER en LibriSpeech test-clean: ~3.0%
- Más estable en algunos tipos de audio
large-v3
- 128 bandas Mel (frente a 80) — resolución de frecuencia más fina
- Entrenado con 1M de horas etiquetadas + 4M de horas pseudoetiquetadas de audio
- Reducción de error del 10-20% sobre large-v2 en todos los idiomas
- Soporte añadido para el idioma cantonés
Qué modelo large usar: Para proyectos nuevos, usa large-v3. Es estrictamente mejor que large-v2 en promedio entre idiomas. Sin embargo, algunos usuarios han reportado que large-v2 produce menos alucinaciones (genera texto que no está presente en el audio) en ciertos casos límite con segmentos de audio muy silenciosos o en silencio. Si tienes problemas de alucinaciones con large-v3, prueba large-v2 como alternativa.
Turbo (809M de parámetros)
El modelo turbo es una versión destilada de large-v3 que reduce drásticamente el tiempo de inferencia conservando la mayor parte de la precisión. OpenAI lo logró podando el decodificador de 32 capas a tan solo 4 — recortando el número de parámetros de 1.550M a 809M. El codificador (que hace el trabajo pesado) permanece idéntico al de large-v3.
- GGML: ~1.6 GiB en disco
- RAM: ~2.3 GB en ejecución
- VRAM: ~6 GB (modo GPU)
- ~8x más rápido que large
- Precisión cercana a large, velocidad cercana a tiny
- Excelente en GPU con torch.compile
- WER en inglés: ~2.5%
- WER multilingüe: ~3.7%
- Pérdida mínima de calidad frente a large-v3
Turbo es la mejor opción cuando quieres una precisión cercana a large-v3 pero no puedes permitirte la latencia del modelo large completo. En GPU con optimizaciones como torch.compile, turbo puede lograr hasta 4.5x de mejora de velocidad sobre la inferencia estándar, lo que lo hace extremadamente rápido.
Limitación importante: El modelo turbo no fue entrenado para tareas de traducción. Si necesitas traducir voz de un idioma al inglés, usa medium o large-v3 en su lugar.
Modelos solo en inglés vs multilingües
Para los tamaños tiny, base, small y medium, Whisper ofrece dos variantes: un modelo multilingüe y un modelo solo en inglés ( .en ). Los modelos large y turbo son únicamente multilingües — no hay versiones solo en inglés.
Cuándo usar .en (solo inglés)
- Solo transcribes audio en inglés
- Mejor precisión en inglés en los niveles de tamaño tiny/base
- Algo más rápido — sin sobrecarga de detección de idioma
- Mismo tamaño de archivo que el equivalente multilingüe
Cuándo usar multilingüe
- Transcribes audio que no está en inglés
- Tu audio contiene idiomas mezclados
- Necesitas traducción de voz (al inglés)
- Obligatorio si usas large o turbo (no existe variante .en)
La diferencia de rendimiento entre los modelos .en y los multilingües es más marcada en los tamaños más pequeños. Para tiny y base, las variantes .en son notablemente mejores en inglés. Cuando llegas a small y medium, la diferencia se reduce considerablemente. En el nivel large, solo hay un modelo multilingüe — y rinde excelentemente en inglés de todos modos.
Regla general: Si usas exclusivamente inglés y eliges tiny o base, opta por la variante .en. Para small o superior, la versión multilingüe funciona de maravilla en inglés y te da flexibilidad para otros idiomas.
Requisitos de hardware: qué se ejecuta en cada equipo
El hardware que necesitas depende en gran medida del tamaño del modelo y de si usas whisper.cpp (CPU/Metal/CUDA) o la implementación de PyTorch (orientada a GPU). Esto es lo que puedes esperar en clases de hardware habituales.
MacBook Air M1 (8 GB de RAM)
- tiny/base: Instantáneo. Más rápido que el tiempo real.
- small: Rápido. En tiempo real o mejor con Metal.
- medium: Usable. Puede ser algo más lento que el tiempo real en CPU. Metal ayuda notablemente.
- large: Posible pero justo de RAM. Espera que sea más lento que el tiempo real.
- turbo: Buena opción. Casi en tiempo real con aceleración de Metal.
MacBook Pro M2/M3 (16-36 GB de RAM)
- tiny/base/small: Instantáneo. Todos muy dentro de los límites del hardware.
- medium: Rápido. Cómodo con Metal.
- large: Bueno. En tiempo real o cerca de él con Metal.
- turbo: Excelente. Transcripción rápida en tiempo real.
Portátil de gama media con Windows/Linux (8 GB de RAM, GPU integrada)
- tiny/base: Rápido. Solo con CPU funciona bien.
- small: Bueno. Cómodo en la mayoría de las CPU modernas.
- medium: Funcional. Puede ser 2-3x más lento que el tiempo real en CPU.
- large: Complicado. Solo con CPU será lento.
- turbo: Funcional. Se beneficia de Vulkan si está disponible.
Equipo de escritorio con GPU NVIDIA (RTX 3060+, 8 GB+ de VRAM)
- Todos los modelos: Rápido. La GPU lo maneja todo cómodamente.
- large: Necesita 10 GB de VRAM (RTX 3060 12GB o superior).
- turbo: La opción más rápida con CUDA. Significativamente más rápido que large.
- Usa el backend de CUDA en whisper.cpp para obtener el mejor rendimiento.
Backends de aceleración de whisper.cpp
whisper.cpp — el port en C/C++ que usan la mayoría de las apps de escritorio — admite varios backends de aceleración por hardware que pueden mejorar drásticamente el rendimiento:
Metal (Apple Silicon)
Inferencia completa en GPU en Macs M1/M2/M3/M4. Ejecuta todo el modelo en la GPU sin copias de memoria. Es el backend más rápido para usuarios de macOS y el que OpenWhispr usa en Mac.
Core ML (Apple)
Usa el neural engine de Apple para la inferencia. Puede ser más rápido que Metal en algunos tamaños de modelo en chips más nuevos, y más eficiente energéticamente. Requiere convertir primero los modelos al formato Core ML.
CUDA (NVIDIA)
Aceleración por GPU para tarjetas NVIDIA. El backend más rápido para usuarios con GPU NVIDIA dedicadas. Requiere el toolkit de CUDA. La mejor opción para los modelos large y turbo en escritorio.
Vulkan (GPU multifabricante)
Funciona con GPU de Intel, AMD y NVIDIA. Buena alternativa para sistemas sin NVIDIA. Disponible en Linux y Windows. El rendimiento varía según el fabricante de la GPU y el controlador.
Velocidad de transcripción aproximada
Factor de tiempo real (RTF) para un clip de audio de 60 segundos. Un RTF < 1.0 significa más rápido que el tiempo real. Son estimaciones aproximadas — el rendimiento real depende del contenido del audio, la cuantización del modelo y la carga del sistema.
| Modelo | MacBook Air M1 | MacBook M3 Pro | Intel i7 (CPU) | RTX 3060 (CUDA) |
|---|---|---|---|---|
| tiny | ~0.05x | ~0.03x | ~0.1x | ~0.02x |
| base | ~0.08x | ~0.05x | ~0.15x | ~0.04x |
| small | ~0.2x | ~0.12x | ~0.4x | ~0.08x |
| medium | ~0.6x | ~0.3x | ~1.2x | ~0.15x |
| large-v3 | ~1.5x | ~0.7x | ~3.0x | ~0.3x |
| turbo | ~0.3x | ~0.15x | ~0.6x | ~0.08x |
Cómo leer la tabla: 0.1x significa que transcribir 60 segundos de audio tarda unos 6 segundos. 1.0x = tiempo real. Los valores por encima de 1.0x significan más lento que el tiempo real. Todas las cifras usan whisper.cpp con la configuración predeterminada y el backend de Metal (Mac) o CUDA (NVIDIA) cuando corresponde.
¿Qué modelo deberías usar?
Aquí tienes recomendaciones concretas basadas en escenarios habituales. Ante la duda, empieza por small y sube o baja según tu experiencia.
"Quiero lo más rápido posible"
Usa tiny o tiny.en . Transcribe en milisegundos en hardware moderno. La precisión es básica pero usable para notas rápidas y dictado de poca importancia.
tiny / tiny.en"Quiero buena precisión en un portátil"
Usa small . El mejor equilibrio entre velocidad y precisión para portátiles modernos. Si tu máquina tiene 16 GB o más de RAM, medium también es una excelente opción.
small o medium"Quiero la mejor precisión"
Usa large-v3 . Es el modelo de Whisper más preciso en general. Si la velocidad también importa, turbo te da el 95% de la precisión a 8x la velocidad.
large-v3 o turbo"Solo uso inglés"
Usa la variante .en del tamaño que elijas para obtener la mejor precisión en inglés. Para tiny y base, los modelos .en son notablemente mejores. Para small en adelante, la diferencia es mínima.
small.en o medium.en"Uso varios idiomas"
Usa la variante multilingüe. small o medium para un rendimiento equilibrado. large-v3 para la mejor precisión multilingüe.
small, medium o large-v3"Tengo un hardware muy limitado"
Usa tiny o base . Ambos se ejecutan con 1 GB de RAM e incluso funcionan en Raspberry Pi y otras computadoras de placa única. Base ofrece un salto de precisión significativo sobre tiny con un coste adicional mínimo.
tiny o baseCómo gestiona OpenWhispr la selección de modelos
OpenWhispr es una app de dictado de escritorio de código abierto que usa whisper.cpp por debajo. Te permite descargar y cambiar entre cualquier modelo de Whisper directamente desde los ajustes — sin necesidad de línea de comandos. Los modelos se descargan una vez y se almacenan localmente. Puedes cambiar de modelo en cualquier momento para equilibrar velocidad y precisión según tu hardware.
Descarga cualquier modelo
Elige desde tiny hasta large-v3 en los ajustes. OpenWhispr descarga la versión GGML automáticamente.
Cambia al instante
Cambia de modelo en cualquier momento. Sin reinicios. Prueba distintos tamaños para encontrar el que mejor funciona en tu hardware.
Optimizado para tu hardware
Usa Metal en Apple Silicon, CUDA en NVIDIA e inferencia optimizada en CPU en el resto. Todo local, todo privado.
Nuestra sugerencia: Empieza por small . Si te resulta lento, baja a base o tiny. Si quieres más precisión y tu hardware lo permite, sube a medium o large-v3. OpenWhispr te facilita experimentar.
Fuentes
- Radford et al. "Robust Speech Recognition via Large-Scale Weak Supervision" (2022) — El artículo original de Whisper con todos los resultados de los benchmarks.
- Repositorio de OpenAI Whisper en GitHub — Tabla oficial de modelos, recuentos de parámetros, requisitos de VRAM y cifras de velocidad relativa.
- Ficha del modelo OpenAI Whisper — Composición oficial de los datos de entrenamiento y advertencias sobre la evaluación.
- Repositorio de whisper.cpp en GitHub — Tamaños de modelo GGML, uso de RAM y detalles de aceleración por hardware.
- Ficha del modelo Whisper large-v2 (HuggingFace) — Contexto del benchmark de LibriSpeech usado en muchas comparaciones de WER.
- Ficha del modelo Whisper large-v3 (HuggingFace) — Detalles de entrenamiento, cambios de arquitectura respecto a large-v2 y mejoras multilingües.
- Ficha del modelo Whisper large-v3-turbo (HuggingFace) — Detalles de la arquitectura de turbo, especificaciones de la poda del decodificador y compromisos de rendimiento.
- Anuncio de OpenAI Whisper Turbo (GitHub Discussion #2363) — Notas oficiales del lanzamiento de turbo y comparaciones de rendimiento entre idiomas.
- OpenWhispr — Contexto práctico de implementación local para elegir tamaños de modelo.
Prueba distintos modelos de Whisper en OpenWhispr
Dictado de código abierto y prioridad local. Descarga cualquier modelo de Whisper, cambia entre tamaños con un clic y encuentra el equilibrio perfecto para tu hardware.
Sin cuenta · Funciona sin conexión · Código abierto para siempre