Transcripción local vs. en la nube: privacidad, velocidad y precisión comparadas
Los datos de tu voz son valiosos. Esto es lo que les ocurre según dónde decidas procesarlos.
OpenWhispr
Ingeniería
Tabla de contenidos
La transcripción local procesa tu audio íntegramente en tu dispositivo usando modelos como OpenAI Whisper y NVIDIA Parakeet, ejecutados mediante entornos optimizados como whisper.cpp. El audio nunca sale de tu equipo. La transcripción en la nube envía tu audio a servidores remotos gestionados por proveedores como Google, AWS, Microsoft, Deepgram o AssemblyAI, donde grandes clústeres de GPU lo procesan y devuelven una transcripción de texto. Las principales ventajas y desventajas entre ambos enfoques se reducen a cinco factores: privacidad, latencia, precisión, coste y funcionamiento sin conexión. Este artículo examina cada uno con cifras reales y políticas reales, para que puedas tomar una decisión informada.
Última actualización: 17 de febrero de 2026. Las afirmaciones cuantitativas y de políticas se contrastan con al menos dos fuentes primarias.
Resumen de verificación (fuentes duales)
- Los modelos locales abiertos son aptos para producción: Whisper y Parakeet cuentan con fichas de modelo públicas e implementaciones abiertas adecuadas para la inferencia en el dispositivo. OpenAI Whisper · NVIDIA Parakeet
- El STT en la nube se cobra por uso: los principales proveedores facturan según el volumen de audio y el nivel del modelo. Precios de Google · Precios de AWS
- El tratamiento de datos varía según el proveedor: los ajustes de registro/retención y las opciones de exclusión son específicos de cada servicio y deben configurarse. Registro de datos de Google · Política de exclusión de IA de AWS
- El contexto normativo importa: las obligaciones sobre datos biométricos y sensibles varían según la jurisdicción y el caso de uso. Texto oficial del RGPD · Texto oficial de la Ley de IA de la UE
- Modelo de despliegue de OpenWhispr: OpenWhispr usa por defecto el procesamiento local y también admite el enrutamiento a la nube mediante BYOK cuando los usuarios lo necesitan. OpenWhispr · Entorno de ejecución whisper.cpp
Local vs. nube: principales compromisos
Local (OpenWhispr)
- Privacidad: El audio permanece en el dispositivo
- Latencia: Sin red de ida y vuelta
- Costo: Sin facturación API por minuto
- Sin conexión: Funciona sin internet
- controlar: Comportamiento local determinista
APIs en la nube
- Privacidad: Depende de la política + configuración
- Latencia: Sensible a la red y la región
- Costo: Facturación basada en el uso
- Sin conexión: No disponible
- Escala: Fácil para grandes cargas de trabajo por lotes
El mejor patrón práctico: priorizar lo local y dirigir los casos extremos a la nube solo cuando sea necesario.
Cómo funciona la transcripción en la nube
Cuando usas un servicio de voz a texto basado en la nube, tu audio recorre un trayecto de varios pasos. Primero, tu dispositivo captura el audio en bruto del micrófono y lo comprime a un formato apto para la transmisión, normalmente Opus, FLAC o PCM lineal. Ese audio comprimido se envía luego por internet al endpoint de la API del proveedor, generalmente a través de HTTPS o de una conexión WebSocket para la transmisión en tiempo real.
En el lado del servidor, el proveedor procesa tu audio con grandes modelos de redes neuronales alojados en clústeres de GPU. Estos modelos suelen entrenarse con cientos de miles de horas de datos de voz etiquetados, muchísimo más de lo que cualquier persona podría reunir por sí sola. La transcripción resultante se devuelve a tu dispositivo.
Entre los principales proveedores de transcripción en la nube se encuentran:
- Google Cloud Speech-to-Text — Amplia cobertura de idiomas con opciones por lotes y de transmisión en tiempo real.
- AWS Transcribe — La oferta de Amazon, con identificación automática del idioma, vocabulario personalizado y redacción de datos personales (PII).
- Microsoft Azure Speech — Integración profunda con el ecosistema de Microsoft, modelos de voz personalizados y transcripción en tiempo real.
- Deepgram — Reconocido por su velocidad y experiencia para desarrolladores, con su modelo Nova-3 que ofrece una gran precisión a precios competitivos.
- AssemblyAI — Centrado en la precisión y las herramientas para desarrolladores, con diarización de hablantes y moderación de contenido integradas.
La latencia en la nube es variable porque incluye la captura, la subida, la inferencia en el servidor y la entrega de la respuesta. En entornos con buena conexión puede resultar rápida, mientras que las redes inestables o las regiones con alta latencia pueden hacer que la experiencia sea notablemente más lenta. La transcripción por lotes puede tardar desde segundos hasta minutos según la duración del archivo y la cola de espera.
Cómo funciona la transcripción local
La transcripción local ejecuta el modelo de reconocimiento de voz directamente en tu dispositivo. No interviene ninguna red: el audio pasa de tu micrófono directamente a un modelo que se ejecuta en tu CPU o GPU, y el texto sale por el otro lado. Todo el proceso ocurre en la memoria de tu equipo.
El avance que hizo práctica la transcripción local de alta calidad fue el lanzamiento de Whisper por parte de OpenAI en septiembre de 2022: un modelo de código abierto entrenado con 680.000 horas de audio multilingüe. Más recientemente, NVIDIA lanzó su familia de modelos ASR Parakeet, que alcanzan una precisión puntera en las pruebas de referencia en inglés y están disponibles bajo licencias abiertas. Poco después, Georgi Gerganov creó whisper.cpp, una reimplementación en C/C++ optimizada para la inferencia en CPU, que llevó la precisión de Whisper al hardware cotidiano sin necesidad de una GPU dedicada.
Whisper viene en varios tamaños de modelo, cada uno intercambiando precisión por velocidad:
| Modelo | Parámetros | VRAM | Velocidad relativa |
|---|---|---|---|
| Tiny | 39M | ~1 GB | ~10x |
| Base | 74M | ~1 GB | ~7x |
| Small | 244M | ~2 GB | ~4x |
| Medium | 769M | ~5 GB | ~2x |
| Large-v3 | 1550M | ~10 GB | 1x (referencia) |
| Turbo | 809M | ~6 GB | ~8x |
En Apple Silicon (del M1 al M4), whisper.cpp ejecuta la inferencia completamente en la GPU mediante Metal, alcanzando velocidades en tiempo real o superiores incluso con el modelo medium. El modelo Turbo —una variante optimizada de large-v3 con una pérdida mínima de precisión— funciona con alto rendimiento en los MacBooks modernos, razón por la que se usa habitualmente en flujos de dictado local de baja latencia.
Otros motores de transcripción local incluyen Vosk (ligero, menor precisión) y Sherpa-ONNX (la nueva generación de Kaldi con soporte para el entorno ONNX). Sin embargo, OpenAI Whisper a través de whisper.cpp y NVIDIA Parakeet siguen siendo el referente en calidad de transcripción local.
Privacidad: la diferencia fundamental
La privacidad es el mayor factor diferenciador entre la transcripción local y la de la nube. Con el procesamiento local, la pregunta «¿qué ocurre con los datos de mi audio?» tiene una respuesta sencilla: nada. Permanecen en tu dispositivo, en tu RAM, y se descartan tras la transcripción. No hay un tercero en quien confiar, ninguna política que leer, ninguna filtración de datos de la que preocuparse.
La transcripción en la nube exige confiar en tu proveedor. Esto es lo que los principales proveedores dicen realmente sobre cómo tratan tu audio:
Google Cloud Speech-to-Text
El registro de datos de Google para Speech-to-Text está desactivado de forma predeterminada. Cuando está desactivado, Google afirma que los datos de audio se procesan en memoria, se usan únicamente para devolver el resultado de la transcripción y no se almacenan en servidores. Sin embargo, si activas el registro de datos (o utilizas ciertas funciones que lo requieren), tu audio y tus transcripciones pueden almacenarse y usarse para mejorar los modelos de Google. La documentación sobre registro de datos detalla estas distinciones.
La ubicación del procesamiento de datos puede especificarse por región, lo cual es relevante para el cumplimiento del RGPD.
AWS Transcribe
De forma predeterminada, AWS puede usar el contenido procesado por Amazon Transcribe para desarrollar y mejorar sus servicios de IA/ML. No obstante, puedes excluirte de ello mediante las políticas de exclusión de los servicios de IA de AWS. Cuando te excluyes, AWS afirma que tu contenido no se almacena ni se usa para mejorar el servicio. Los datos de audio se cifran en tránsito y en reposo.
Importante: la exclusión no es la opción predeterminada. Tienes que configurarla activamente.
Microsoft Azure Speech
Azure no usa los datos del cliente para mejorar sus modelos base de forma predeterminada. Su documentación sobre privacidad de datos indica que el audio enviado al servicio Speech se procesa y se elimina inmediatamente de sus servidores. Si creas un modelo personalizado, los datos de entrenamiento que proporcionas se almacenan en la misma región que el recurso hasta que los eliminas explícitamente.
Azure ofrece despliegue en contenedores desconectados para un procesamiento totalmente local (on-premises).
Consideraciones normativas
RGPD: Las grabaciones de voz se consideran datos biométricos según la legislación de la UE. Enviar audio a proveedores de la nube con sede en EE. UU. plantea problemas de transferencia de datos bajo el RGPD, incluso con las Cláusulas Contractuales Tipo (CCT) o el Marco de Privacidad de Datos UE-EE. UU. El procesamiento local evita esto por completo al mantener los datos biométricos dentro del propio dispositivo del interesado.
HIPAA: Los proveedores sanitarios que usan transcripción en la nube deben asegurarse de que su proveedor ofrezca un Acuerdo de Asociado Comercial (BAA). Google, AWS y Azure ofrecen BAA, pero los requisitos de configuración son estrictos. La transcripción local elude las normas de tratamiento de datos de la HIPAA porque la información médica protegida nunca abandona el control de la entidad cubierta.
La ventaja local
Con la transcripción local no hay ninguna política de privacidad que descifrar, ningún calendario de retención de datos en el que confiar y ninguna casilla de exclusión que buscar. Tu audio se procesa en la RAM y nunca se escribe en disco (a menos que decidas guardar una grabación). Es un modelo de confianza fundamentalmente distinto: no necesitas confiar en nadie, porque los datos nunca salen de tu equipo.
Precisión: ¿cuánto se acerca lo local?
Seamos honestos: los principales proveedores de la nube todavía tienen ventaja en precisión bruta para ciertos casos de uso. Entrenan con enormes conjuntos de datos propietarios, ofrecen actualizaciones de modelo en tiempo real y pueden aprovechar vocabularios personalizados según el contexto. Para audios difíciles —acentos marcados, entornos ruidosos, jerga especializada— servicios en la nube como Chirp 2 de Google o Nova-3 de Deepgram suelen rendir bien.
Dicho esto, la brecha se ha reducido drásticamente. OpenAI Whisper large-v3, entrenado con 680.000 horas de audio multilingüe, logra tasas de error por palabra (WER) competitivas en la mayoría de los idiomas comunes. Los modelos Parakeet de NVIDIA han elevado aún más el listón, alcanzando algunas de las WER más bajas en las pruebas de referencia estándar en inglés. Las pruebas independientes muestran de forma constante que estos modelos abiertos rinden a pocos puntos porcentuales de los servicios comerciales en la nube para el inglés, y a veces los superan en idiomas concretos de la cola larga.
El modelo Turbo —una variante destilada de large-v3 con 809M de parámetros en lugar de 1,55B— conserva la mayor parte de la precisión funcionando unas 8 veces más rápido. Para el dictado en tiempo real, cuando hablas con claridad ante un micrófono decente, la diferencia entre Turbo y una API en la nube es insignificante para la mayoría de los usuarios.
Ventajas de precisión de la nube
- Vocabulario personalizado y adaptación al dominio
- Mejoras continuas del modelo en el servidor
- Mejor diarización de hablantes (quién dijo qué)
- Puntuación y formato automáticos ajustados por idioma
Ventajas de precisión locales
- Sin artefactos de compresión de audio por la transmisión en red
- Rendimiento constante y determinista, sin variabilidad del servidor
- Audio completo a 16 kHz sin comprimir alimentado directamente al modelo
- Whisper large-v3 y Parakeet igualan a la nube en dictado con voz clara
En resumen: si dictas en un entorno silencioso con un micrófono decente, modelos como Whisper Turbo, Whisper large-v3 o Parakeet ejecutados localmente te darán resultados indistinguibles de los servicios en la nube para la mayoría de los usos prácticos. La nube saca ventaja en escenarios ruidosos con varios hablantes, idiomas poco habituales y vocabularios especializados.
Velocidad y latencia
La latencia importa sobre todo en el dictado en tiempo real, donde quieres ver tus palabras aparecer justo después de hablar. Aquí, la transcripción local y la de la nube tienen perfiles de latencia fundamentalmente distintos.
Desglose de la latencia en la nube
- Captura de audio + codificación
- Subida y descarga por red (variable según la calidad de la ruta)
- Cola en el servidor + inferencia (variable según la carga del proveedor)
- La latencia percibida por el usuario puede variar mucho según la red y la región.
Latencia local (Apple Silicon)
- Tiny/base: respuesta más rápida, menor techo de calidad
- Small: equilibrio entre velocidad y calidad
- Turbo: candidato a dictado de alta calidad en tiempo real
- Modelos grandes: máxima calidad, mayor exigencia de cómputo
- Sin dependencia de la red. Constante independientemente de la conexión.
Para la transmisión en tiempo real, los proveedores de la nube pueden devolver hipótesis parciales con rapidez cuando la conectividad es buena. Pero esto sigue requiriendo una conexión estable y de baja latencia. En un avión, en una Wi-Fi pública congestionada o tras rutas de VPN restrictivas, la latencia percibida puede degradarse rápidamente.
La transcripción local con whisper.cpp no es transmisión en tiempo real en el sentido tradicional. La mayoría de las implementaciones locales usan un patrón de «pulsar para hablar»: hablas, el audio se almacena en búfer y luego el modelo procesa el segmento completo. Con el modelo Turbo en un chip Apple de la serie M, este paso de procesamiento es lo bastante rápido como para que el retardo resulte insignificante en el dictado, normalmente menos de un segundo para frases cortas.
Para la transcripción de larga duración de archivos pregrabados, los servicios en la nube pueden paralelizar el trabajo entre clústeres de GPU y suelen terminar grandes lotes con rapidez. El rendimiento local está limitado por tu equipo y la elección del modelo, por lo que el tiempo de ejecución puede ser más lento en grabaciones muy largas.
Coste: gratis vs. pago por minuto
La transcripción local no cuesta nada más allá del hardware que ya tienes. No hay clave de API, ni panel de facturación, ni cargo por minuto. Descargas un archivo de modelo (que va desde 75 MB para Tiny hasta 3 GB para Large-v3) y listo. Para siempre.
Los proveedores de la nube cobran por uso (por minuto o por hora, según el proveedor y el modelo). Los planes y descuentos cambian con frecuencia, así que verifica las tarifas actuales antes de presupuestar:
| Proveedor | Por lotes / pregrabado | Streaming / tiempo real | Plan gratuito |
|---|---|---|---|
| Google Speech-to-Text | Cobro por uso (por niveles de modelo) | Cobro por uso (por niveles de modelo) | Las cuotas de prueba/gratuitas varían según la cuenta |
| AWS Transcribe | Cobro por uso | Cobro por uso | Plan gratuito inicial (por tiempo limitado) |
| Azure Speech | Varía según región/modelo | Varía según región/modelo | Cuota gratuita limitada |
| Deepgram | Cobro por uso según nivel de modelo | Cobro por uso según nivel de modelo | Prueba basada en créditos |
| AssemblyAI | Cobro por uso según nivel de modelo | Cobro por uso según nivel de modelo | Prueba basada en créditos |
| Local (Whisper / Parakeet) | Gratis | Gratis | Ilimitado, para siempre |
Cómo estimar tu gasto en la nube
Usa esta fórmula sencilla: minutos anuales de audio x tarifa del proveedor. Si tu equipo dicta mucho, el coste total escala de forma lineal con el uso y el número de licencias.
La inferencia local (Whisper/Parakeet) evita los cargos continuos de API, por lo que muchos equipos mantienen lo local como opción predeterminada y solo enrutan los casos especiales a la nube.
Nota: los precios de la nube suelen incluir cargos adicionales por funciones como la diarización de hablantes, la redacción de datos personales (PII) o los vocabularios personalizados. Los precios base anteriores corresponden únicamente a la transcripción estándar.
Funcionamiento sin conexión: cuándo gana lo local sin discusión
Este punto es binario: la transcripción en la nube requiere internet, la transcripción local no. Para muchas personas, este es el factor decisivo.
Escenarios en los que el funcionamiento sin conexión no es opcional:
Viajes y trabajo remoto
Vuelos, trenes, zonas rurales, regiones en desarrollo: cualquier sitio con una Wi-Fi intermitente o inexistente. La transcripción local funciona exactamente igual a 10.000 metros de altura que en tu escritorio.
Entornos aislados (air-gapped)
Instalaciones gubernamentales, contratistas de defensa, laboratorios de investigación seguros e instituciones financieras suelen operar en redes aisladas donde el acceso saliente a internet está bloqueado por completo. La transcripción local es la única opción.
Trabajo de campo
Periodistas en zonas de conflicto, investigadores en estaciones de campo remotas, personal sanitario en clínicas rurales: estos profesionales necesitan una transcripción fiable en entornos donde la cobertura móvil puede ser poco fiable o inexistente.
Fiabilidad
Incluso en oficinas bien conectadas, los servicios en la nube sufren caídas. AWS, Google Cloud y Azure han tenido incidentes de varias horas que afectaron a las API de voz. La transcripción local no tiene ninguna dependencia externa que pueda fallar.
Comparación lado a lado
| Factor | Local | Nube |
|---|---|---|
| Privacidad | ||
| Precisión (inglés) | ||
| Precisión (multilingüe) | ||
| Latencia | ||
| Coste | ||
| Uso sin conexión | ||
| Facilidad de configuración | ||
| Diarización de hablantes | ||
| Escalabilidad |
Cuándo elegir cada opción
Ningún enfoque es universalmente mejor. La elección adecuada depende de lo que priorices.
Elige local si...
- La privacidad es innegociable (medicina, derecho, diarios personales)
- Necesitas funcionar sin conexión o en entornos aislados
- Quieres cero costes continuos por la transcripción
- Tu caso de uso principal es el dictado (un solo hablante, audio claro)
- Estás sujeto al RGPD, la HIPAA o normativas similares
Elige la nube si...
- Necesitas diarización de hablantes para reuniones con varias personas
- Buscas la máxima precisión en condiciones de audio difíciles
- Estás creando una aplicación que necesita escalar a muchos usuarios
- Necesitas transcripción por streaming en tiempo real
- Tu hardware es limitado y no puede ejecutar modelos grandes
El enfoque híbrido
No tienes que elegir una opción de forma exclusiva. Algunas aplicaciones —incluida OpenWhispr— admiten ambos modos: usan modelos locales como Whisper y Parakeet de forma predeterminada por privacidad y coste cero, y opcionalmente te permiten aportar tu propia clave de API en la nube (OpenAI, Deepgram, etc.) cuando necesitas la precisión o las funciones adicionales que ofrece la nube. Este modelo «BYOK» (Bring Your Own Key, trae tu propia clave) te ofrece lo mejor de ambos mundos sin atarte a ninguno de los dos enfoques.
Fuentes y lecturas adicionales
- OpenAI Whisper — Repositorio original del modelo con tamaños de modelo, pruebas de referencia y documentación.
- whisper.cpp — Adaptación en C/C++ de Whisper optimizada para la inferencia en CPU y en la GPU de Apple Silicon.
- Ficha del modelo NVIDIA Parakeet RNNT — Métricas del modelo ASR abierto y guía de uso.
- Precios de Google Cloud Speech-to-Text — Niveles de precios actuales de la API de voz de Google.
- Precios de AWS Transcribe — Precios actuales de Amazon basados en el uso para procesamiento por lotes y streaming.
- Precios de Azure Speech Services — Precios de Microsoft para voz a texto en tiempo real y por lotes.
- Precios de Deepgram — Detalles de los precios por nivel de modelo de Deepgram.
- Precios de AssemblyAI — Detalles de los precios por uso y nivel de modelo de AssemblyAI.
- Registro de datos de Google Speech-to-Text — Documentación de Google sobre cómo se tratan y almacenan los datos de audio.
- Políticas de exclusión de los servicios de IA de AWS — Cómo impedir que AWS use tu contenido para mejorar sus servicios de IA.
- Privacidad de datos de Azure Speech — Documentación de Microsoft sobre privacidad y seguridad de datos para los Speech Services.
- Robust Speech Recognition via Large-Scale Weak Supervision — El artículo original de Whisper de Radford et al. (2022), que detalla la metodología de entrenamiento y las pruebas de referencia de WER.
- RGPD (texto oficial de la UE) — Base legal para el tratamiento de datos personales/biométricos.
- Ley de IA de la UE (texto oficial de la UE) — Obligaciones por niveles de riesgo de la IA relevantes para los sistemas biométricos y de alto riesgo.
- OpenWhispr — Ejemplo de un flujo de trabajo local-first con enrutamiento opcional a la nube mediante BYOK en una sola aplicación.
Prueba ambos enfoques en una sola aplicación
OpenWhispr admite tanto modelos locales (OpenAI Whisper y NVIDIA Parakeet) para privacidad y coste cero, como tus propias claves de API en la nube cuando necesitas la máxima precisión. De código abierto, gratis para siempre.
Sin necesidad de cuenta · Funciona sin conexión · Código abierto para siempre