Cómo funciona Whisper AI: guía completa
Una explicación técnica en profundidad del modelo de reconocimiento de voz open source de OpenAI, desde los espectrogramas log-mel hasta la decodificación Transformer.
OpenWhispr
Ingeniería
Tabla de contenidos
Whisper es un modelo de reconocimiento automático de voz (ASR) desarrollado por OpenAI. Lanzado en septiembre de 2022, es un sistema de reconocimiento de voz de propósito general entrenado con 680.000 horas de audio multilingüe recopilado de internet. Whisper usa una arquitectura Transformer codificador-decodificador que convierte el audio en espectrogramas log-mel, los procesa con un codificador de red neuronal y decodifica tokens de texto de forma autorregresiva. Admite transcripción en 99 idiomas, traducción al inglés, identificación de idioma y predicción de marcas de tiempo, todo dentro de un único modelo unificado. A diferencia de la mayoría de los servicios comerciales de ASR, los pesos de Whisper son completamente open source bajo la licencia MIT, lo que ha impulsado un ecosistema muy activo de ports, optimizaciones y aplicaciones, incluido whisper.cpp, la implementación en C/C++ que hace que Whisper sea práctico para el reconocimiento de voz en tiempo real y en el propio dispositivo.
Última actualización: 17 de febrero de 2026. Las afirmaciones cuantitativas de este artículo se contrastan con al menos dos fuentes primarias.
Resumen de verificación (dos fuentes)
- Lanzamiento de Whisper, escala de entrenamiento y licencia: OpenAI lanzó Whisper en septiembre de 2022, entrenado con 680.000 horas, bajo licencia MIT. artículo de arXiv · repositorio de OpenAI Whisper
- Alcance de tareas y compatibilidad lingüística: Whisper admite transcripción, traducción al inglés, identificación de idioma y tokens de marca de tiempo en 99 idiomas. model card de Whisper · README de Whisper
- Contexto de benchmarks en inglés: alrededor de un 3% de WER es una cifra de benchmark en LibriSpeech test-clean para evaluaciones centradas en inglés, no una tasa universal del mundo real. model card de large-v2 · detalles del benchmark
- Actualizaciones recientes del modelo: large-v3 reporta menos errores que large-v2 en muchos idiomas, y turbo se centra en menor latencia con menos cómputo en el decodificador. model card de large-v3 · discusión del lanzamiento de turbo
- Relevancia para OpenWhispr: OpenWhispr usa Whisper mediante whisper.cpp para dictado local y offline-first en plataformas de escritorio. whisper.cpp · OpenWhispr
Cómo procesa Whisper el audio
Por qué es importante para OpenWhispr:
Se ejecuta localmente a través de whisper.cpp: el audio sin procesar permanece en el dispositivo.
El tamaño del modelo controla la relación velocidad/precisión.
La misma canalización impulsa el dictado en macOS, Windows y Linux.
Qué es Whisper
Whisper se presentó en el artículo "Robust Speech Recognition via Large-Scale Weak Supervision" de Alec Radford, Jong Wook Kim, Tao Xu, Greg Brockman, Christine McLeavey e Ilya Sutskever en OpenAI. El código y los pesos del modelo se publicaron en GitHub en septiembre de 2022 bajo la licencia MIT.
Antes de Whisper, los sistemas de reconocimiento de voz de última generación solían entrenarse con conjuntos de datos curados y etiquetados por humanos, a menudo limitados a idiomas, acentos o dominios específicos. Whisper rompió con este enfoque al entrenarse con un conjunto de datos enorme y diverso de 680.000 horas de audio emparejado con transcripciones extraídas de internet. La idea clave fue que este enfoque "débilmente supervisado", que usa transcripciones imperfectas generadas por máquinas o subidas por usuarios en lugar de datos etiquetados manualmente, podía producir un modelo con una robustez notable ante idiomas, acentos, ruido de fondo y vocabulario técnico.
El resultado es un único modelo capaz de manejar varias tareas de procesamiento del habla: transcripción (voz a texto en el mismo idioma), traducción (voz en cualquier idioma a texto en inglés), identificación de idioma y detección de actividad de voz con marcas de tiempo. Esta capacidad multitarea está incorporada en la arquitectura del modelo mediante un sistema de tokens especiales que especifican qué tarea debe realizarse.
La publicación open source de Whisper fue importante. Democratizó el acceso a ASR de alta calidad, permitiendo que desarrolladores, investigadores y empresas usaran un modelo competitivo con las API comerciales sin precios por minuto, sin enviar audio a la nube y sin dependencia de un proveedor. Esto catalizó el desarrollo de herramientas como whisper.cpp, Faster Whisper y docenas de aplicaciones construidas sobre ellas, incluido OpenWhispr.
Análisis detallado de la arquitectura
Whisper usa una arquitectura Transformer codificador-decodificador: el mismo diseño fundamental detrás de modelos como el Transformer original (Vaswani et al., 2017) y muchos sistemas de traducción automática. El codificador procesa el audio y el decodificador genera texto. Así funciona cada etapa.
Preprocesamiento de audio
Antes de cualquier procesamiento con redes neuronales, el audio sin procesar se convierte en una representación visual del sonido llamada espectrograma log-mel. El proceso funciona así:
- El audio se remuestrea a 16.000 Hz (mono a 16 kHz).
- Se calcula una transformada de Fourier de tiempo corto (STFT) usando ventanas de 25 milisegundos con un salto de 10 milisegundos (hop length).
- El espectro de frecuencia se proyecta en 80 bancos de filtros de frecuencia mel (128 para large-v3), que aproximan la percepción auditiva humana espaciando las bandas de frecuencia de forma logarítmica.
- Se aplica una escala logarítmica, que produce el espectrograma log-mel final.
- El espectrograma se divide en fragmentos de 30 segundos. El audio de menos de 30 segundos se rellena con ceros; el audio más largo se procesa en fragmentos secuenciales.
El resultado es una representación 2D con forma (80, 3000): 80 canales mel por 3.000 pasos temporales (30 segundos con salto de 10 ms). Es análogo a una imagen, y el codificador lo procesa de forma similar a como un modelo de visión procesa datos de píxeles.
El codificador
El codificador convierte el espectrograma mel en una secuencia de representaciones de audio aprendidas. Consta de:
- Dos capas de convolución 1D: la primera convolución tiene tamaño de kernel 3 y padding 1, seguida de una activación GELU. La segunda convolución tiene tamaño de kernel 3, stride 2 y padding 1, lo que reduce a la mitad la dimensión temporal. Esto reduce los 3.000 pasos temporales a 1.500 posiciones.
- Embeddings posicionales sinusoidales: a diferencia del decodificador, el codificador usa embeddings sinusoidales fijos (no aprendidos) para codificar la posición de cada paso temporal.
- Bloques Transformer: una pila de capas codificadoras Transformer estándar, cada una con autoatención multi-head y una red feed-forward con activación GELU, conectadas mediante conexiones residuales y normalización de capas.
La salida es una secuencia de 1.500 vectores de características de audio contextualizadas, uno por cada 20 milisegundos de audio de entrada, a los que el decodificador atenderá durante la generación de texto.
El decodificador
El decodificador genera tokens de texto de forma autorregresiva: un token a la vez, cada uno condicionado por el audio codificado y por todos los tokens generados previamente. Consta de:
- Capa de embeddings de tokens: convierte IDs de tokens en representaciones vectoriales densas.
- Embeddings posicionales aprendidos: a diferencia de los embeddings sinusoidales del codificador, el decodificador usa embeddings posicionales aprendidos que se entrenan junto con el modelo.
- Bloques Transformer con atención cruzada: cada capa del decodificador tiene tres subcapas: autoatención enmascarada (para impedir que el modelo mire tokens futuros), atención cruzada hacia la salida del codificador (para permitir que el modelo "escuche" el audio) y una red feed-forward.
La salida final del decodificador se proyecta sobre el vocabulario para producir probabilidades de tokens. Las estrategias de decodificación incluyen búsqueda greedy, beam search y muestreo basado en temperatura.
Tokens especiales y entrenamiento multitarea
Whisper realiza varias tareas con un único modelo mediante un sistema ingenioso de tokens especiales que actúan como instrucciones. La entrada del decodificador sigue un formato estructurado:
<|startoftranscript|> <|en|> <|transcribe|> <|notimestamps|> Hello, how are you today? <|endoftext|><|startoftranscript|>— Señala el inicio de la secuencia de salida.<|en|>— Especifica el idioma (uno de 99 tokens de idioma). Puede detectarse automáticamente o fijarse manualmente.<|transcribe|>o<|translate|>— Especifica si se debe transcribir en el idioma original o traducir al inglés.<|notimestamps|>— Controla si se deben producir tokens de marca de tiempo. Cuando las marcas de tiempo están activadas, el modelo genera tokens de desplazamiento temporal como<|0.00|>y<|2.40|>que alinean el texto con el audio.
Este formato unificado de tokens significa que un solo modelo puede realizar transcripción, traducción, detección de idioma y transcripción con marcas de tiempo, todo sin cabezales de modelo separados ni ajuste fino. La tarea queda determinada por completo por la secuencia de tokens proporcionada al decodificador.
Datos de entrenamiento
Los modelos originales de Whisper (de tiny a large-v2) se entrenaron con 680.000 horas de audio emparejado con transcripciones recopiladas de internet. Este conjunto de datos no está disponible públicamente. Su característica clave es que está débilmente supervisado: las etiquetas de transcripción no fueron verificadas manualmente por anotadores humanos. En su lugar, procedían de fuentes como subtítulos, closed captions y otros textos generados por usuarios y emparejados con audio.
Composición de los datos
Según la model card oficial, el conjunto de entrenamiento de 680.000 horas se desglosa así:
| Segmento | Horas | Proporción | Descripción |
|---|---|---|---|
| ASR en inglés | 438,000 | 65% | Audio en inglés con transcripciones en inglés |
| Traducción (X a inglés) | 126,000 | 18% | Audio no inglés con transcripciones en inglés |
| ASR multilingüe | 117,000 | 17% | Audio no inglés con transcripciones en el idioma original (cubre 98 idiomas) |
El fuerte sesgo hacia el inglés (65% de los datos de entrenamiento) explica por qué Whisper funciona significativamente mejor en inglés que en idiomas con menos recursos. Para el modelo large-v3, lanzado en noviembre de 2023, OpenAI amplió el conjunto de entrenamiento a 1 millón de horas de audio débilmente etiquetado más 4 millones de horas adicionales de audio pseudoetiquetado generado ejecutando Whisper large-v2 sobre datos sin etiquetar, una forma de autoentrenamiento o destilación de conocimiento.
Por qué importa lo "débilmente supervisado"
La mayoría de los sistemas ASR anteriores se entrenaban con conjuntos de datos como LibriSpeech (960 horas) o Common Voice (unos pocos miles de horas por idioma), cuidadosamente curados y verificados por humanos. El enfoque de Whisper cambió calidad de etiquetas por escala pura: 680.000 horas frente a los cientos o pocos miles de horas usados por sistemas convencionales. El artículo demostró que ese intercambio valía la pena. La diversidad de los datos procedentes de internet dio a Whisper una robustez excepcional ante condiciones reales: ruido de fondo, habla superpuesta, acentos, vocabulario específico de dominio y entornos acústicos que pondrían en aprietos a modelos entrenados con lectura de calidad de estudio.
Sin embargo, la supervisión débil también introduce una limitación conocida: alucinación. Como las transcripciones de entrenamiento son imperfectas, el modelo a veces genera texto plausible que en realidad no se dijo, especialmente durante silencios o pasajes muy bajos. Es un compromiso inherente al enfoque y sigue siendo un área activa de mejora.
Tamaños de modelo
Whisper está disponible en varios tamaños, desde 39 millones hasta 1.550 millones de parámetros. Los modelos más pequeños son más rápidos pero menos precisos; los modelos más grandes son más precisos pero requieren más cómputo y memoria. Las variantes .en son modelos solo en inglés que tienden a funcionar mejor para inglés, especialmente en los tamaños más pequeños. No existen variantes solo en inglés para los modelos large.
| Modelo | Parámetros | Solo inglés | VRAM | Velocidad relativa |
|---|---|---|---|---|
| tiny | 39 M | tiny.en | ~1 GB | ~10x |
| base | 74 M | base.en | ~1 GB | ~7x |
| small | 244 M | small.en | ~2 GB | ~4x |
| medium | 769 M | medium.en | ~5 GB | ~2x |
| large (v1, v2, v3) | 1,550 M | -- | ~10 GB | 1x |
| turbo (large-v3-turbo) | 809 M | -- | ~6 GB | ~8x |
La velocidad es relativa al modelo large. Los requisitos de VRAM corresponden a inferencia en GPU usando precisión fp16 mediante la implementación original en Python. whisper.cpp usa bastante menos memoria (por ejemplo, el modelo large requiere ~3,9 GB de RAM en lugar de ~10 GB de VRAM).
El modelo turbo (lanzado en octubre de 2024) es una versión destilada de large-v3 con un decodificador significativamente más pequeño. Conserva la mayor parte de la precisión de large-v3 mientras se ejecuta aproximadamente 8 veces más rápido, lo que lo convierte en una opción sólida cuando la velocidad importa. Ten en cuenta que turbo no admite la tarea de traducción.
El modelo large ha pasado por tres iteraciones: large-v1 (septiembre de 2022), large-v2 (diciembre de 2022) y large-v3 (noviembre de 2023). Cada versión mejoró la precisión; large-v3 introdujo 128 bins de frecuencia mel (frente a 80) y se entrenó con un conjunto de datos mucho mayor. Para ver un desglose detallado de cada tamaño y cómo elegir, consulta nuestra guía de tamaños de modelos Whisper.
Qué tan preciso es Whisper
La precisión de Whisper suele medirse con la tasa de error de palabras (WER): el porcentaje de palabras transcritas incorrectamente (inserciones, eliminaciones y sustituciones combinadas). Cuanto menor es la WER, mejor.
Benchmarks en inglés
En LibriSpeech test-clean, el benchmark de ASR en inglés más usado, compuesto por lectura limpia de audiolibros, Whisper large-v2 alcanza una WER de aproximadamente 3,0%[1][2]. Esto es competitivo con sistemas ASR comerciales y modelos entrenados específicamente, aunque los modelos especializados ajustados con LibriSpeech pueden lograr una WER menor en ese benchmark concreto. La fortaleza de Whisper no está en superar benchmarks estrechos, sino en su robustez: rinde de forma consistentemente buena en una amplia variedad de condiciones reales.
Mejoras de large-v3
Según la evaluación de OpenAI, Whisper large-v3 muestra una reducción de errores del 10-20% frente a large-v2 en idiomas donde el modelo logra una tasa de error inferior al 60% en los conjuntos de evaluación Common Voice 15 y Fleurs[2][3]. Las mejoras son especialmente notables en idiomas distintos del inglés, donde la ampliación de los datos de entrenamiento (5 millones de horas en total) marca la mayor diferencia.
Cómo se compara Whisper (febrero de 2026)
Desde el lanzamiento de Whisper, modelos ASR open source más recientes lo han superado en benchmarks de habla limpia. Parakeet TDT de NVIDIA (0,6B parámetros) alcanza 1,69% de WER y su modelo Canary llega a 1,6% de WER en LibriSpeech test-clean, ambos muy por debajo del ~2,7% de Whisper large-v3. Sin embargo, Whisper sigue siendo el modelo ASR open source más desplegado gracias a la madurez de su ecosistema, su cobertura de idiomas y la disponibilidad de runtimes optimizados como whisper.cpp.
Tasa de error de palabras: Whisper frente a competidores de código abierto
LibriSpeech test-clean (leer voz en inglés): cuanto más bajo, mejor
Fuentes: tarjetas modelo Hugging Face, tarjetas modelo NVIDIA, Open ASR Leaderboard (Feb 2026). Solo lectura clara en inglés: la precisión en el mundo real varía según la calidad del audio, el acento y el dominio. Se omiten los API comerciales porque no publican puntos de referencia de LibriSpeech.
Nota: las API comerciales en la nube (Deepgram Nova-3, Google Chirp, AssemblyAI Universal-2) no publican cifras de WER en LibriSpeech, por lo que no pueden compararse directamente en este gráfico. Sus benchmarks usan conjuntos de prueba propietarios del mundo real. OpenAI también lanzó GPT-4o-transcribe en marzo de 2025 como modelo solo API (no open source y no basado en Whisper) con tasas de error supuestamente menores, pero es solo en la nube y no está disponible para inferencia local.
Dónde destaca Whisper
- +Robustez ante acentos y dialectos — Entrenado con audio diverso de internet, Whisper maneja los acentos regionales mejor que sistemas entrenados con habla leída.
- +Tolerancia al ruido de fondo — El modelo mantiene una precisión razonable incluso con música, otras personas hablando o ruido ambiental.
- +Vocabulario técnico — Gracias a la amplitud de sus datos de entrenamiento, Whisper maneja términos específicos de dominio (médicos, legales, técnicos) mejor que muchos sistemas ASR de propósito general.
- +Capacidad multilingüe — Un único modelo compatible con 99 idiomas, sin necesidad de ajuste fino por idioma.
Dónde le cuesta a Whisper
- -Alucinación — El problema citado con más frecuencia. Durante silencios o pasajes muy bajos, Whisper puede generar texto que nunca se dijo. Es una consecuencia del enfoque de entrenamiento débilmente supervisado.
- -Idiomas con pocos recursos — Los idiomas con pocos datos de entrenamiento (gran parte de las 680.000 horas está en inglés) tienen tasas de error significativamente más altas.
- -Generación repetitiva de texto — El decodificador autorregresivo puede quedarse "atascado" en bucles y producir la misma frase una y otra vez. Beam search con parámetros específicos puede mitigar este problema, pero no eliminarlo.
- -No es en tiempo real por defecto — Whisper procesa fragmentos de 30 segundos, así que hay una latencia inherente. Las soluciones de streaming (como el modo en tiempo real de whisper.cpp) lo rodean, pero añaden complejidad.
whisper.cpp e inferencia local
La implementación original de Whisper requiere Python, PyTorch y una GPU compatible con CUDA para ofrecer un rendimiento razonable. Esto la hace poco práctica para aplicaciones de escritorio, dispositivos móviles y despliegues en edge. whisper.cpp, creado por Georgi Gerganov, resuelve este problema.
whisper.cpp es una reimplementación completa de la inferencia de Whisper en C/C++ puro y sin dependencias. Lee los mismos pesos del modelo, pero se ejecuta sin Python, sin PyTorch y sin GPU (aunque se beneficia enormemente de tener una). Sus funciones clave incluyen:
- Cero asignaciones de memoria en tiempo de ejecución — Toda la memoria se preasigna, lo que hace que el rendimiento sea predecible y adecuado para sistemas embebidos.
- Optimización para Apple Silicon — En Macs con chips de la serie M, el codificador puede ejecutarse en Apple Neural Engine mediante Core ML, con una inferencia más de 3 veces más rápida que en CPU solamente. También se admite aceleración Metal GPU para inferencia completa en GPU.
- Soporte de cuantización — Los modelos pueden cuantizarse a precisión entera de 4, 5 u 8 bits, reduciendo drásticamente el uso de memoria y aumentando la velocidad con una pérdida mínima de precisión.
- Aceleración por GPU — Admite NVIDIA CUDA (vía cuBLAS), Vulkan (multivendor), OpenVINO (Intel) y OpenBLAS para aceleración en CPU.
- Detección de actividad de voz (VAD) — VAD integrada para saltar segmentos silenciosos, mejorando tanto la velocidad como la calidad de la transcripción.
Requisitos de memoria (whisper.cpp)
| Modelo | Tamaño en disco | RAM requerida |
|---|---|---|
| tiny | 75 MB | ~273 MB |
| base | 142 MB | ~388 MB |
| small | 466 MB | ~852 MB |
| medium | 1.5 GB | ~2.1 GB |
| large | 2.9 GB | ~3.9 GB |
whisper.cpp se ejecuta en macOS (Intel y Apple Silicon), Linux, Windows, iOS, Android, FreeBSD, Raspberry Pi e incluso en el navegador mediante WebAssembly. Logra transcripción más rápida que tiempo real en hardware de consumo modesto, incluidos dispositivos tan pequeños como Raspberry Pi 4 e iPhone 13.
Esta portabilidad es lo que hace práctico el reconocimiento de voz local y privado. Aplicaciones como OpenWhispr usan whisper.cpp por debajo para ofrecer dictado push-to-talk en tiempo real que se ejecuta por completo en el dispositivo del usuario: el audio nunca sale de la máquina.
Whisper frente a otros sistemas ASR
Whisper existe dentro de un panorama más amplio de sistemas de reconocimiento de voz. Así se compara con las alternativas más comunes.
Google Cloud Speech-to-Text
El servicio ASR en la nube de Google. Ofrece una precisión excelente, especialmente en inglés, con streaming en tiempo real y diarización de hablantes. Las diferencias principales: es propietario, requiere enviar audio a los servidores de Google y se cobra por minuto de audio procesado. Whisper ofrece una precisión comparable para uso general, se ejecuta localmente y es gratuito, pero no incluye streaming ni diarización integrados.
Amazon Transcribe (AWS)
El ASR en la nube de Amazon, muy integrado con el ecosistema AWS. Ofrece transcripción médica, analítica de llamadas y vocabulario personalizado. Presenta compromisos similares a Google: dependencia de la nube, precio por minuto y tecnología propietaria. Whisper encaja mejor en aplicaciones que necesitan funcionamiento offline, licencia open source o evitar la dependencia de un proveedor.
Mozilla DeepSpeech
El motor ASR open source de Mozilla basado en la investigación Deep Speech de Baidu. Fue uno de los primeros modelos ASR abiertos de alta calidad, pero Mozilla dejó de desarrollarlo activamente en 2021. Whisper ha superado en la práctica a DeepSpeech en precisión, compatibilidad multilingüe e impulso comunitario. DeepSpeech sigue siendo útil como línea base ligera y bien entendida, pero ya no se recomienda para proyectos nuevos.
Vosk
Un kit de reconocimiento de voz offline y open source compatible con más de 20 idiomas mediante modelos pequeños y rápidos. Vosk es excelente para entornos con recursos limitados: sus modelos tienen una fracción del tamaño de los de Whisper y funcionan bien en hardware de baja potencia. El compromiso es la precisión: Vosk es notablemente menos preciso que Whisper, sobre todo con habla acentuada, audio ruidoso y vocabulario técnico.
Faster Whisper (CTranslate2)
Una reimplementación de Whisper que usa el motor de inferencia CTranslate2 de SYSTRAN. Ejecuta los mismos modelos Whisper con la misma precisión, pero puede ser hasta 4 veces más rápida que la implementación original de OpenAI y usa menos memoria. Faster Whisper está basado en Python (a diferencia del C/C++ de whisper.cpp) y es una opción sólida para transcripción por lotes del lado del servidor. Admite GPU CUDA e inferencia en CPU con cuantización INT8.
Aplicaciones prácticas
La combinación de precisión, soporte multilingüe y disponibilidad open source de Whisper lo ha convertido en la base de una amplia variedad de aplicaciones:
Dictado de escritorio
Apps como OpenWhispr usan whisper.cpp para ofrecer dictado push-to-talk en todo el sistema en macOS, Windows y Linux. El audio se procesa localmente: no se envía nada a la nube.
Generación de subtítulos
La predicción de marcas de tiempo de Whisper lo hace muy adecuado para generar subtítulos y closed captions. Herramientas como stable-ts y auto-subtitle automatizan este flujo de trabajo.
Transcripción de podcasts y reuniones
Whisper maneja bien la transcripción de audio de larga duración, especialmente con el enfoque de procesamiento por fragmentos. Muchos editores de podcasts y herramientas de notas de reunión usan Whisper (o Faster Whisper) para transcribir grabaciones por lotes.
Traducción y localización
La capacidad de traducción integrada de Whisper (de cualquier idioma al inglés) se usa para acceso a contenido multilingüe, localización de medios y prototipos de traducción en tiempo real.
Accesibilidad
El subtitulado en tiempo real para personas sordas o con dificultades auditivas, las interfaces de voz para usuarios con discapacidades motoras y la transcripción de descripciones de audio son áreas activas donde se despliega Whisper.
Anotación de datos e investigación
Los investigadores usan Whisper para crear conjuntos de datos pseudoetiquetados con los que entrenar otros modelos, el mismo enfoque que OpenAI usó para crear los datos de entrenamiento de large-v3. También se usa ampliamente en investigación lingüística y creación de corpus.
Fuentes y lecturas recomendadas
- [Artículo] Radford, A., Kim, J. W., Xu, T., Brockman, G., McLeavey, C., & Sutskever, I. (2022). Robust Speech Recognition via Large-Scale Weak Supervision. arXiv:2212.04356. arxiv.org/abs/2212.04356
- [Código] Repositorio de GitHub de OpenAI Whisper. github.com/openai/whisper
- [Código] whisper.cpp: port en C/C++ de Georgi Gerganov. github.com/ggml-org/whisper.cpp
- [Model card] Whisper large-v2 en Hugging Face (benchmark WER: ~3,0% en LibriSpeech test-clean). huggingface.co/openai/whisper-large-v2
- [Model card] Whisper large-v3 en Hugging Face (reducción de errores del 10-20% frente a v2). huggingface.co/openai/whisper-large-v3
- [Model card] Whisper large-v3-turbo en Hugging Face (variante destilada centrada en latencia). huggingface.co/openai/whisper-large-v3-turbo
- [Model card] Model card de OpenAI Whisper (desglose de composición de datos de entrenamiento). github.com/openai/whisper/blob/main/model-card.md
- [Notas de versión] Anuncio de OpenAI large-v3 y notas de evaluación. github.com/openai/whisper/discussions/1762
- [Notas de versión] Discusión del lanzamiento de OpenAI turbo y compromisos centrados en velocidad. github.com/openai/whisper/discussions/2363
- [Código] Faster Whisper: reimplementación basada en CTranslate2 de SYSTRAN. github.com/SYSTRAN/faster-whisper
- [Producto] OpenWhispr usa Whisper mediante whisper.cpp para flujos de dictado local. openwhispr.com
Prueba Whisper localmente con OpenWhispr
OpenWhispr usa Whisper (mediante whisper.cpp) para dictado local y privado en macOS, Windows y Linux. Push-to-talk, más de 99 idiomas, sin nube. Pruébalo gratis.
No requiere cuenta · Funciona offline · Open source para siempre