Parakeet vs Whisper vs Nemotron: el mejor sistema local de voz a texto en 2026
Tres modelos abiertos ya pueden convertir voz en texto íntegramente en tu propio ordenador. Así se comparan de verdad en precisión, velocidad, idiomas y streaming, con cifras honestas de fuentes primarias.
OpenWhispr
Ingeniería
Tabla de contenidos
Para inglés y los principales idiomas europeos, NVIDIA Parakeet TDT 0.6B v3 es el mejor modelo local de voz a texto de 2026: supera a Whisper large-v3 en precisión medida, ocupa una cuarta parte y funciona mucho más rápido en una CPU convencional. Si quieres que el texto aparezca en directo mientras hablas, los nuevos modelos de streaming Nemotron de NVIDIA son los primeros modelos locales diseñados justo para eso. Y si hablas uno de los muchos idiomas que los modelos NVIDIA no cubren, Whisper de OpenAI —con 99 idiomas— sigue siendo la opción adecuada.
La sorpresa de 2026 es que Whisper ya no conserva la corona de precisión entre los modelos abiertos que ostentó durante tres años. Pero «qué modelo es mejor» se ha convertido en una pregunta genuinamente a tres bandas, porque cada uno destaca en algo distinto: Parakeet optimiza la precisión por vatio, Nemotron la latencia y Whisper la amplitud de cobertura. Este artículo los compara con cifras de sus propias fichas y del leaderboard público: sin impresiones vagas ni exagerar las diferencias.
Última actualización: 18 de julio de 2026. Desarrollamos OpenWhispr, una aplicación de dictado de código abierto que incluye las tres familias de modelos; por eso evaluamos y mantenemos cada una en producción. Ese es también nuestro sesgo: no vendemos ninguno de estos modelos y las ventajas e inconvenientes que explicamos aquí son los mismos que contamos a nuestros usuarios.
Comprobación rápida de datos (fuentes primarias)
- Parakeet TDT 0.6B v3 obtiene una tasa media de error de palabra del 6.34% en las ocho pruebas del Open ASR Leaderboard, con un rendimiento de 3,332× tiempo real. 600M parámetros, 25 idiomas y licencia CC-BY-4.0. Ficha del modelo Parakeet TDT v3 · Open ASR Leaderboard
- Whisper large-v3 obtiene aproximadamente un 7.4% en el mismo leaderboard y admite 99 idiomas con 1.55B parámetros y licencia MIT. Repositorio de OpenAI Whisper · Ficha del modelo Whisper large-v3
- Nemotron Speech Streaming EN 0.6B obtiene un WER medio del 6.93% durante el streaming (fragmentos de 1.12 segundos), alcanza el 2.32% en LibriSpeech test-clean y se entrenó con 530,000 horas de audio. Ficha de Nemotron Streaming EN
- Nemotron 3.5 ASR cubre 40 configuraciones regionales en un único modelo de streaming de 600M con detección automática del idioma, publicado el 4 de junio de 2026 con licencia OpenMDW. Ficha del modelo Nemotron 3.5 ASR
- Todos los tamaños en disco y comportamientos de la aplicación citados a continuación se pueden verificar en el registro de modelos de código abierto de OpenWhispr. OpenWhispr en GitHub · Página de modelos de OpenWhispr
Los tres candidatos
Los tres son modelos gratuitos de pesos abiertos que puedes descargar y ejecutar sin conexión. Sus arquitecturas son distintas, y esa diferencia explica casi todo lo que notarás en la práctica.
OpenAI Whisper (2022)
El modelo que llevó el reconocimiento de voz abierto al gran público. Es un transformer codificador-decodificador entrenado con 680,000 horas de audio, disponible en seis tamaños desde 75MB (tiny) hasta 3GB (large-v3), y cubre 99 idiomas. Genera el texto token a token, como un modelo de lenguaje; por eso también es el más lento de los tres. Licencia MIT.
NVIDIA Parakeet (2024–2025)
Un modelo transductor (TDT) de 600M parámetros creado para transcripción por lotes. En lugar de generar tokens de forma autorregresiva, emite texto en una sola pasada por el audio: es mucho más rápido y no inventa texto durante los silencios. Importan dos variantes: v3 multilingüe (25 idiomas, 680MB como INT8 ONNX) y Unified solo para inglés (631MB), que actualmente marca la mejor precisión del sector en inglés. Licencia CC-BY-4.0.
NVIDIA Nemotron ASR (2026)
La familia más reciente, creada para streaming: un transductor FastConformer con caché que transcribe el audio a medida que llega, sin esperar a que termine la grabación. El modelo en inglés se publicó en enero de 2026 y el modelo multilingüe 3.5 para 40 configuraciones regionales llegó en junio. Ambos tienen 600M parámetros (632–650MB como INT8 ONNX) y licencia abierta (OpenMDW).
Precisión: gana Parakeet, pero por menos de lo que parece
Los modelos de voz se miden mediante la tasa de error de palabra (WER): el porcentaje de palabras que el modelo reconoce mal. Cuanto menor, mejor. La referencia habitual es el Open ASR Leaderboard de Hugging Face, que promedia el WER en ocho conjuntos de datos diversos en inglés (reuniones, presentaciones de resultados, charlas TED, audiolibros y más), de modo que un único conjunto sencillo no pueda favorecer a un modelo.
Precisión en inglés: tasa media de error por palabra
Promedios de varios conjuntos de datos de las pruebas del Open ASR Leaderboard de Hugging Face (cuanto más bajo, mejor). Nemotron se muestra en su configuración de transmisión.
Fuentes: fichas de modelos de NVIDIA en Hugging Face y Open ASR Leaderboard, julio de 2026. WER = porcentaje de palabras transcritas incorrectamente.
Hay que leer el gráfico con rigor: todos estos modelos están listos para producción y entre el mejor y el peor solo hay unos 1.5 puntos. En el dictado diario, un modelo con 6.3% y otro con 7.4% se perciben parecidos con audio limpio; las diferencias aparecen con audio difícil (acentos, ruido, jerga). Lo notable de las cifras de NVIDIA es el coste para conseguirlas: Parakeet alcanza esa precisión con 600M parámetros frente a los 1.55B de Whisper, y Nemotron registra un 6.93% mientras transmite, sin conocer en absoluto el audio posterior.
La debilidad conocida de Whisper: alucinaciones durante el silencio
Como el decodificador de Whisper funciona de forma parecida a un modelo de lenguaje, puede generar frases fluidas pero totalmente inventadas durante silencios o ruido, un fallo documentado en todo el ecosistema. Los modelos transductores como Parakeet y Nemotron resisten este problema por su propia estructura: sin evidencia de audio, no hay tokens. En dictado, donde las grabaciones empiezan y terminan con silencio, eso importa más que un punto de benchmark.
Velocidad y eficiencia: no hay comparación
En el hardware del leaderboard, Parakeet TDT v3 transcribe a 3,332× tiempo real: una hora de audio en alrededor de un segundo. Whisper large-v3 no llega ni a una décima parte. La razón está en la arquitectura y se entiende fácilmente: Whisper escribe la transcripción token a token y cada paso espera al anterior, mientras que un transductor lee el audio una vez y emite el texto sobre la marcha. Sin bucles ni idas y vueltas por cada palabra.
En tu portátil las cifras absolutas son menores, pero la proporción se mantiene: un párrafo dictado que Whisper large tarda varios segundos en procesar aparece casi al instante con Parakeet, en CPU y sin GPU. Benchmarks independientes también indican que los transductores de NVIDIA consumen aproximadamente 8–10× menos energía por hora de audio que Whisper con una calidad comparable, algo importante si dictas todo el día con batería.
La respuesta de Whisper es turbo (1.6GB), una versión destilada de large-v3 que sacrifica algo de precisión para multiplicar por cerca de 8× la velocidad de Whisper-large. Es el Whisper adecuado para dictar, pero solo reduce la distancia, no la elimina. Consulta el desglose completo de todos los tamaños en nuestra guía de tamaños de modelos Whisper.
Cobertura de idiomas: la gran ventaja de Whisper
| Modelo | Idiomas | Notas |
|---|---|---|
| Whisper large-v3 | 99 | La mayor cobertura entre los modelos abiertos, incluidos idiomas con pocos recursos |
| Nemotron 3.5 ASR | 40 configuraciones regionales | Detección automática del idioma; 15 idiomas listos para transcribir, entre ellos japonés, coreano, árabe e hindi |
| Parakeet TDT v3 | 25 | Idiomas europeos, además de inglés y ruso; detección automática |
| Parakeet Unified / Nemotron EN | 1 | Solo inglés, a cambio de la mejor precisión de su categoría |
La regla general es sencilla. Para inglés o un idioma europeo importante sirve cualquiera de los tres: elige por velocidad. Nemotron 3.5 ya cubre japonés, coreano, vietnamita, árabe e hindi con streaming, toda una novedad entre los modelos locales. Para mandarín, tailandés, indonesio, suajili o audio que alterna mucho entre idiomas, Whisper sigue siendo la única opción seria, y no parece que vaya a cambiar pronto.
Streaming: la diferencia decisiva
En streaming, Nemotron no solo mejora un poco a los demás: hace algo que los otros dos no pueden hacer por su arquitectura. Whisper procesa el audio en ventanas de 30 segundos y vuelve a codificar todo lo que ve. Por tanto, Whisper «en directo» es en realidad el mismo modelo por lotes ejecutado una y otra vez sobre audio solapado: costoso, con retraso e irregular en las uniones. La arquitectura con caché de Nemotron se entrenó para streaming: procesa solo el fragmento de audio más reciente, conserva su estado interno y emite texto parcial con una latencia configurable de 80 milisegundos a 1.12 segundos.
A escala, la diferencia de eficiencia es enorme: NVIDIA informa de 17× más streams simultáneos que con su modelo de streaming de la generación anterior en la misma GPU. Pero en un portátil la ventaja se percibe de forma más sencilla: el texto aparece mientras hablas desde un modelo que se ejecuta en tu propia CPU. Explicamos toda la ingeniería necesaria para incluirlo en una aplicación de escritorio en nuestro análisis técnico del ASR en streaming.
Si el texto en directo no te importa —dictas, paras y quieres la transcripción final— el streaming no te aporta nada, y los modelos por lotes de Parakeet son la mejor elección. El streaming sirve para subtítulos en directo, agentes de voz y una vista previa del dictado que aparece al mismo ritmo que hablas.
Hardware: los tres funcionan en un portátil normal
Ninguno de estos modelos necesita GPU. Los modelos NVIDIA se distribuyen como archivos ONNX cuantizados a INT8 (631–680MB) que funcionan con soltura en cualquier CPU reciente —Apple Silicon o x86— mediante sherpa-onnx, un binario nativo sin Python ni PyTorch. Whisper funciona en todas partes mediante whisper.cpp; los tamaños small y turbo van bien en CPU, mientras que large-v3 (3GB, ~10GB RAM) sí se beneficia de la aceleración.
Si tienes una GPU, aprovéchala con Whisper: Metal viene integrado en Apple Silicon y OpenWhispr ofrece runtimes CUDA (NVIDIA) y Vulkan (AMD e Intel) con un solo clic y retorno automático a la CPU si falla el runtime de GPU. Los transductores NVIDIA ya son tan rápidos en CPU que acelerarlos por GPU apenas aporta nada al dictado.
¿Cuál deberías usar?
| Tu situación | Usa este |
|---|---|
| Dictado en inglés, buscas la mayor precisión | Parakeet Unified EN 0.6B |
| Idiomas europeos, transcripción rápida por lotes | Parakeet TDT 0.6B v3 |
| Texto en directo mientras hablas (inglés) | Nemotron Speech Streaming EN |
| Texto en directo en español, japonés, coreano, árabe, hindi… | Nemotron 3.5 ASR Streaming |
| Un idioma que los modelos NVIDIA no cubren | Whisper large-v3 o turbo |
| Hardware antiguo o con poca RAM, notas rápidas | Whisper tiny o base |
Y si la privacidad es lo que te lleva a usar un modelo local, los tres cumplen por igual: el audio se procesa en tu equipo y nunca se sube. Analizamos mejor esa elección en transcripción local frente a la nube.
Prueba los tres en dos minutos
La forma más honesta de elegir es dictar el mismo párrafo a cada modelo. OpenWhispr incluye todos los de este artículo —seis tamaños de Whisper, los dos Parakeet y los dos Nemotron— en un único menú de ajustes, de forma gratuita y con código abierto para macOS, Windows y Linux. Descarga un modelo, pulsa el atajo y habla. Nuestra página de modelos enumera todos los tamaños y sus ventajas e inconvenientes.
Preguntas frecuentes
¿Cuál es el mejor modelo local de voz a texto en 2026?
Para inglés y los principales idiomas europeos, NVIDIA Parakeet TDT 0.6B v3 ofrece el mejor equilibrio general: obtiene una tasa media de error de palabra del 6.34% en las pruebas del Open ASR Leaderboard —frente a aproximadamente el 7.4% de Whisper large-v3—, ocupa una cuarta parte y rinde mucho más en CPU. Si necesitas ver el texto mientras hablas, los modelos de streaming NVIDIA Nemotron son la mejor opción. Si necesitas un idioma que los modelos NVIDIA no cubren, usa Whisper.
¿Parakeet es más preciso que Whisper?
En las pruebas de inglés del Open ASR Leaderboard, sí: Parakeet TDT 0.6B v3 obtiene un WER medio del 6.34%, frente a cerca del 7.4% de Whisper large-v3, y el modelo Parakeet Unified solo para inglés alcanza el 5.91%. La salvedad importante es que una diferencia de ~1 punto de WER apenas se nota en el dictado diario. Las ventajas más claras de Parakeet son la velocidad, la eficiencia y que no alucina texto durante los silencios, un fallo conocido de Whisper.
¿Necesito una GPU para ejecutar estos modelos en local?
No. Los tres funcionan en una CPU moderna. Parakeet y Nemotron usan modelos ONNX cuantizados a INT8 (aproximadamente 630–680MB en disco) diseñados para inferencia en CPU. Whisper funciona en CPU mediante whisper.cpp, aunque su modelo grande de 3GB se beneficia de la aceleración por GPU. OpenWhispr admite Metal en Apple Silicon, CUDA en NVIDIA y Vulkan en GPU AMD/Intel, con retorno automático a la CPU.
¿Qué idiomas admite Nemotron ASR?
El modelo Nemotron 3.5 ASR de NVIDIA cubre 40 configuraciones regionales en un único modelo de 600M parámetros con detección automática del idioma. OpenWhispr habilita los 15 idiomas listos para transcribir: inglés, español, francés, italiano, portugués, neerlandés, alemán, turco, ruso, árabe, hindi, japonés, coreano, vietnamita y ucraniano. También está disponible el modelo Nemotron de streaming solo para inglés.
¿Whisper ha quedado obsoleto?
No. Whisper todavía cubre 99 idiomas —muchos más que los 25 de Parakeet o las 40 configuraciones regionales de Nemotron— y sigue siendo la opción más segura para los idiomas asiáticos salvo japonés, coreano y vietnamita, para idiomas con pocos recursos y para audio que mezcla mucho varios idiomas. También es el modelo más probado y con el ecosistema más amplio. Lo que ha cambiado es que Whisper ya no lidera ni en precisión ni en velocidad para el inglés.
¿Cuáles de estos modelos admite OpenWhispr?
Todos. OpenWhispr incluye seis tamaños de Whisper mediante whisper.cpp, los dos modelos Parakeet y los dos modelos de streaming Nemotron mediante sherpa-onnx, y permite cambiar entre ellos en Ajustes. Todo se ejecuta en tu dispositivo —el audio nunca sale de tu equipo— y la aplicación es gratuita y de código abierto.