Comparación

Transcripción local vs. en la nube: privacidad, velocidad y precisión comparadas

Los datos de tu voz son valiosos. Esto es lo que les ocurre según dónde decidas procesarlos.

OpenWhispr

OpenWhispr

Ingeniería

8 de febrero de 2026
Tabla de contenidos

La transcripción local procesa tu audio íntegramente en tu dispositivo usando modelos como OpenAI Whisper y NVIDIA Parakeet, ejecutados mediante entornos optimizados como whisper.cpp. El audio nunca sale de tu equipo. La transcripción en la nube envía tu audio a servidores remotos gestionados por proveedores como Google, AWS, Microsoft, Deepgram o AssemblyAI, donde grandes clústeres de GPU lo procesan y devuelven una transcripción de texto. Las principales ventajas y desventajas entre ambos enfoques se reducen a cinco factores: privacidad, latencia, precisión, coste y funcionamiento sin conexión. Este artículo examina cada uno con cifras reales y políticas reales, para que puedas tomar una decisión informada.

Última actualización: 17 de febrero de 2026. Las afirmaciones cuantitativas y de políticas se contrastan con al menos dos fuentes primarias.

Resumen de verificación (fuentes duales)

Local vs. nube: principales compromisos

Local (OpenWhispr)
  • Privacidad: El audio permanece en el dispositivo
  • Latencia: Sin red de ida y vuelta
  • Costo: Sin facturación API por minuto
  • Sin conexión: Funciona sin internet
  • controlar: Comportamiento local determinista
APIs en la nube
  • Privacidad: Depende de la política + configuración
  • Latencia: Sensible a la red y la región
  • Costo: Facturación basada en el uso
  • Sin conexión: No disponible
  • Escala: Fácil para grandes cargas de trabajo por lotes

El mejor patrón práctico: priorizar lo local y dirigir los casos extremos a la nube solo cuando sea necesario.

Cómo funciona la transcripción en la nube

Cuando usas un servicio de voz a texto basado en la nube, tu audio recorre un trayecto de varios pasos. Primero, tu dispositivo captura el audio en bruto del micrófono y lo comprime a un formato apto para la transmisión, normalmente Opus, FLAC o PCM lineal. Ese audio comprimido se envía luego por internet al endpoint de la API del proveedor, generalmente a través de HTTPS o de una conexión WebSocket para la transmisión en tiempo real.

En el lado del servidor, el proveedor procesa tu audio con grandes modelos de redes neuronales alojados en clústeres de GPU. Estos modelos suelen entrenarse con cientos de miles de horas de datos de voz etiquetados, muchísimo más de lo que cualquier persona podría reunir por sí sola. La transcripción resultante se devuelve a tu dispositivo.

Entre los principales proveedores de transcripción en la nube se encuentran:

  • Google Cloud Speech-to-Text — Amplia cobertura de idiomas con opciones por lotes y de transmisión en tiempo real.
  • AWS Transcribe — La oferta de Amazon, con identificación automática del idioma, vocabulario personalizado y redacción de datos personales (PII).
  • Microsoft Azure Speech — Integración profunda con el ecosistema de Microsoft, modelos de voz personalizados y transcripción en tiempo real.
  • Deepgram — Reconocido por su velocidad y experiencia para desarrolladores, con su modelo Nova-3 que ofrece una gran precisión a precios competitivos.
  • AssemblyAI — Centrado en la precisión y las herramientas para desarrolladores, con diarización de hablantes y moderación de contenido integradas.

La latencia en la nube es variable porque incluye la captura, la subida, la inferencia en el servidor y la entrega de la respuesta. En entornos con buena conexión puede resultar rápida, mientras que las redes inestables o las regiones con alta latencia pueden hacer que la experiencia sea notablemente más lenta. La transcripción por lotes puede tardar desde segundos hasta minutos según la duración del archivo y la cola de espera.

Cómo funciona la transcripción local

La transcripción local ejecuta el modelo de reconocimiento de voz directamente en tu dispositivo. No interviene ninguna red: el audio pasa de tu micrófono directamente a un modelo que se ejecuta en tu CPU o GPU, y el texto sale por el otro lado. Todo el proceso ocurre en la memoria de tu equipo.

El avance que hizo práctica la transcripción local de alta calidad fue el lanzamiento de Whisper por parte de OpenAI en septiembre de 2022: un modelo de código abierto entrenado con 680.000 horas de audio multilingüe. Más recientemente, NVIDIA lanzó su familia de modelos ASR Parakeet, que alcanzan una precisión puntera en las pruebas de referencia en inglés y están disponibles bajo licencias abiertas. Poco después, Georgi Gerganov creó whisper.cpp, una reimplementación en C/C++ optimizada para la inferencia en CPU, que llevó la precisión de Whisper al hardware cotidiano sin necesidad de una GPU dedicada.

Whisper viene en varios tamaños de modelo, cada uno intercambiando precisión por velocidad:

ModeloParámetrosVRAMVelocidad relativa
Tiny39M~1 GB~10x
Base74M~1 GB~7x
Small244M~2 GB~4x
Medium769M~5 GB~2x
Large-v31550M~10 GB1x (referencia)
Turbo809M~6 GB~8x

En Apple Silicon (del M1 al M4), whisper.cpp ejecuta la inferencia completamente en la GPU mediante Metal, alcanzando velocidades en tiempo real o superiores incluso con el modelo medium. El modelo Turbo —una variante optimizada de large-v3 con una pérdida mínima de precisión— funciona con alto rendimiento en los MacBooks modernos, razón por la que se usa habitualmente en flujos de dictado local de baja latencia.

Otros motores de transcripción local incluyen Vosk (ligero, menor precisión) y Sherpa-ONNX (la nueva generación de Kaldi con soporte para el entorno ONNX). Sin embargo, OpenAI Whisper a través de whisper.cpp y NVIDIA Parakeet siguen siendo el referente en calidad de transcripción local.

Privacidad: la diferencia fundamental

La privacidad es el mayor factor diferenciador entre la transcripción local y la de la nube. Con el procesamiento local, la pregunta «¿qué ocurre con los datos de mi audio?» tiene una respuesta sencilla: nada. Permanecen en tu dispositivo, en tu RAM, y se descartan tras la transcripción. No hay un tercero en quien confiar, ninguna política que leer, ninguna filtración de datos de la que preocuparse.

La transcripción en la nube exige confiar en tu proveedor. Esto es lo que los principales proveedores dicen realmente sobre cómo tratan tu audio:

Google Cloud Speech-to-Text

El registro de datos de Google para Speech-to-Text está desactivado de forma predeterminada. Cuando está desactivado, Google afirma que los datos de audio se procesan en memoria, se usan únicamente para devolver el resultado de la transcripción y no se almacenan en servidores. Sin embargo, si activas el registro de datos (o utilizas ciertas funciones que lo requieren), tu audio y tus transcripciones pueden almacenarse y usarse para mejorar los modelos de Google. La documentación sobre registro de datos detalla estas distinciones.

La ubicación del procesamiento de datos puede especificarse por región, lo cual es relevante para el cumplimiento del RGPD.

AWS Transcribe

De forma predeterminada, AWS puede usar el contenido procesado por Amazon Transcribe para desarrollar y mejorar sus servicios de IA/ML. No obstante, puedes excluirte de ello mediante las políticas de exclusión de los servicios de IA de AWS. Cuando te excluyes, AWS afirma que tu contenido no se almacena ni se usa para mejorar el servicio. Los datos de audio se cifran en tránsito y en reposo.

Importante: la exclusión no es la opción predeterminada. Tienes que configurarla activamente.

Microsoft Azure Speech

Azure no usa los datos del cliente para mejorar sus modelos base de forma predeterminada. Su documentación sobre privacidad de datos indica que el audio enviado al servicio Speech se procesa y se elimina inmediatamente de sus servidores. Si creas un modelo personalizado, los datos de entrenamiento que proporcionas se almacenan en la misma región que el recurso hasta que los eliminas explícitamente.

Azure ofrece despliegue en contenedores desconectados para un procesamiento totalmente local (on-premises).

Consideraciones normativas

RGPD: Las grabaciones de voz se consideran datos biométricos según la legislación de la UE. Enviar audio a proveedores de la nube con sede en EE. UU. plantea problemas de transferencia de datos bajo el RGPD, incluso con las Cláusulas Contractuales Tipo (CCT) o el Marco de Privacidad de Datos UE-EE. UU. El procesamiento local evita esto por completo al mantener los datos biométricos dentro del propio dispositivo del interesado.

HIPAA: Los proveedores sanitarios que usan transcripción en la nube deben asegurarse de que su proveedor ofrezca un Acuerdo de Asociado Comercial (BAA). Google, AWS y Azure ofrecen BAA, pero los requisitos de configuración son estrictos. La transcripción local elude las normas de tratamiento de datos de la HIPAA porque la información médica protegida nunca abandona el control de la entidad cubierta.

La ventaja local

Con la transcripción local no hay ninguna política de privacidad que descifrar, ningún calendario de retención de datos en el que confiar y ninguna casilla de exclusión que buscar. Tu audio se procesa en la RAM y nunca se escribe en disco (a menos que decidas guardar una grabación). Es un modelo de confianza fundamentalmente distinto: no necesitas confiar en nadie, porque los datos nunca salen de tu equipo.

Precisión: ¿cuánto se acerca lo local?

Seamos honestos: los principales proveedores de la nube todavía tienen ventaja en precisión bruta para ciertos casos de uso. Entrenan con enormes conjuntos de datos propietarios, ofrecen actualizaciones de modelo en tiempo real y pueden aprovechar vocabularios personalizados según el contexto. Para audios difíciles —acentos marcados, entornos ruidosos, jerga especializada— servicios en la nube como Chirp 2 de Google o Nova-3 de Deepgram suelen rendir bien.

Dicho esto, la brecha se ha reducido drásticamente. OpenAI Whisper large-v3, entrenado con 680.000 horas de audio multilingüe, logra tasas de error por palabra (WER) competitivas en la mayoría de los idiomas comunes. Los modelos Parakeet de NVIDIA han elevado aún más el listón, alcanzando algunas de las WER más bajas en las pruebas de referencia estándar en inglés. Las pruebas independientes muestran de forma constante que estos modelos abiertos rinden a pocos puntos porcentuales de los servicios comerciales en la nube para el inglés, y a veces los superan en idiomas concretos de la cola larga.

El modelo Turbo —una variante destilada de large-v3 con 809M de parámetros en lugar de 1,55B— conserva la mayor parte de la precisión funcionando unas 8 veces más rápido. Para el dictado en tiempo real, cuando hablas con claridad ante un micrófono decente, la diferencia entre Turbo y una API en la nube es insignificante para la mayoría de los usuarios.

Ventajas de precisión de la nube

  • Vocabulario personalizado y adaptación al dominio
  • Mejoras continuas del modelo en el servidor
  • Mejor diarización de hablantes (quién dijo qué)
  • Puntuación y formato automáticos ajustados por idioma

Ventajas de precisión locales

  • Sin artefactos de compresión de audio por la transmisión en red
  • Rendimiento constante y determinista, sin variabilidad del servidor
  • Audio completo a 16 kHz sin comprimir alimentado directamente al modelo
  • Whisper large-v3 y Parakeet igualan a la nube en dictado con voz clara

En resumen: si dictas en un entorno silencioso con un micrófono decente, modelos como Whisper Turbo, Whisper large-v3 o Parakeet ejecutados localmente te darán resultados indistinguibles de los servicios en la nube para la mayoría de los usos prácticos. La nube saca ventaja en escenarios ruidosos con varios hablantes, idiomas poco habituales y vocabularios especializados.

Velocidad y latencia

La latencia importa sobre todo en el dictado en tiempo real, donde quieres ver tus palabras aparecer justo después de hablar. Aquí, la transcripción local y la de la nube tienen perfiles de latencia fundamentalmente distintos.

Desglose de la latencia en la nube

  • Captura de audio + codificación
  • Subida y descarga por red (variable según la calidad de la ruta)
  • Cola en el servidor + inferencia (variable según la carga del proveedor)
  • La latencia percibida por el usuario puede variar mucho según la red y la región.

Latencia local (Apple Silicon)

  • Tiny/base: respuesta más rápida, menor techo de calidad
  • Small: equilibrio entre velocidad y calidad
  • Turbo: candidato a dictado de alta calidad en tiempo real
  • Modelos grandes: máxima calidad, mayor exigencia de cómputo
  • Sin dependencia de la red. Constante independientemente de la conexión.

Para la transmisión en tiempo real, los proveedores de la nube pueden devolver hipótesis parciales con rapidez cuando la conectividad es buena. Pero esto sigue requiriendo una conexión estable y de baja latencia. En un avión, en una Wi-Fi pública congestionada o tras rutas de VPN restrictivas, la latencia percibida puede degradarse rápidamente.

La transcripción local con whisper.cpp no es transmisión en tiempo real en el sentido tradicional. La mayoría de las implementaciones locales usan un patrón de «pulsar para hablar»: hablas, el audio se almacena en búfer y luego el modelo procesa el segmento completo. Con el modelo Turbo en un chip Apple de la serie M, este paso de procesamiento es lo bastante rápido como para que el retardo resulte insignificante en el dictado, normalmente menos de un segundo para frases cortas.

Para la transcripción de larga duración de archivos pregrabados, los servicios en la nube pueden paralelizar el trabajo entre clústeres de GPU y suelen terminar grandes lotes con rapidez. El rendimiento local está limitado por tu equipo y la elección del modelo, por lo que el tiempo de ejecución puede ser más lento en grabaciones muy largas.

Coste: gratis vs. pago por minuto

La transcripción local no cuesta nada más allá del hardware que ya tienes. No hay clave de API, ni panel de facturación, ni cargo por minuto. Descargas un archivo de modelo (que va desde 75 MB para Tiny hasta 3 GB para Large-v3) y listo. Para siempre.

Los proveedores de la nube cobran por uso (por minuto o por hora, según el proveedor y el modelo). Los planes y descuentos cambian con frecuencia, así que verifica las tarifas actuales antes de presupuestar:

ProveedorPor lotes / pregrabadoStreaming / tiempo realPlan gratuito
Google Speech-to-TextCobro por uso (por niveles de modelo)Cobro por uso (por niveles de modelo)Las cuotas de prueba/gratuitas varían según la cuenta
AWS TranscribeCobro por usoCobro por usoPlan gratuito inicial (por tiempo limitado)
Azure SpeechVaría según región/modeloVaría según región/modeloCuota gratuita limitada
DeepgramCobro por uso según nivel de modeloCobro por uso según nivel de modeloPrueba basada en créditos
AssemblyAICobro por uso según nivel de modeloCobro por uso según nivel de modeloPrueba basada en créditos
Local (Whisper / Parakeet)GratisGratisIlimitado, para siempre

Cómo estimar tu gasto en la nube

Usa esta fórmula sencilla: minutos anuales de audio x tarifa del proveedor. Si tu equipo dicta mucho, el coste total escala de forma lineal con el uso y el número de licencias.

La inferencia local (Whisper/Parakeet) evita los cargos continuos de API, por lo que muchos equipos mantienen lo local como opción predeterminada y solo enrutan los casos especiales a la nube.

Nota: los precios de la nube suelen incluir cargos adicionales por funciones como la diarización de hablantes, la redacción de datos personales (PII) o los vocabularios personalizados. Los precios base anteriores corresponden únicamente a la transcripción estándar.

Funcionamiento sin conexión: cuándo gana lo local sin discusión

Este punto es binario: la transcripción en la nube requiere internet, la transcripción local no. Para muchas personas, este es el factor decisivo.

Escenarios en los que el funcionamiento sin conexión no es opcional:

Viajes y trabajo remoto

Vuelos, trenes, zonas rurales, regiones en desarrollo: cualquier sitio con una Wi-Fi intermitente o inexistente. La transcripción local funciona exactamente igual a 10.000 metros de altura que en tu escritorio.

Entornos aislados (air-gapped)

Instalaciones gubernamentales, contratistas de defensa, laboratorios de investigación seguros e instituciones financieras suelen operar en redes aisladas donde el acceso saliente a internet está bloqueado por completo. La transcripción local es la única opción.

Trabajo de campo

Periodistas en zonas de conflicto, investigadores en estaciones de campo remotas, personal sanitario en clínicas rurales: estos profesionales necesitan una transcripción fiable en entornos donde la cobertura móvil puede ser poco fiable o inexistente.

Fiabilidad

Incluso en oficinas bien conectadas, los servicios en la nube sufren caídas. AWS, Google Cloud y Azure han tenido incidentes de varias horas que afectaron a las API de voz. La transcripción local no tiene ninguna dependencia externa que pueda fallar.

Comparación lado a lado

FactorLocalNube
Privacidad
Precisión (inglés)
Precisión (multilingüe)
Latencia
Coste
Uso sin conexión
Facilidad de configuración
Diarización de hablantes
Escalabilidad

Cuándo elegir cada opción

Ningún enfoque es universalmente mejor. La elección adecuada depende de lo que priorices.

Elige local si...

  • La privacidad es innegociable (medicina, derecho, diarios personales)
  • Necesitas funcionar sin conexión o en entornos aislados
  • Quieres cero costes continuos por la transcripción
  • Tu caso de uso principal es el dictado (un solo hablante, audio claro)
  • Estás sujeto al RGPD, la HIPAA o normativas similares

Elige la nube si...

  • Necesitas diarización de hablantes para reuniones con varias personas
  • Buscas la máxima precisión en condiciones de audio difíciles
  • Estás creando una aplicación que necesita escalar a muchos usuarios
  • Necesitas transcripción por streaming en tiempo real
  • Tu hardware es limitado y no puede ejecutar modelos grandes

El enfoque híbrido

No tienes que elegir una opción de forma exclusiva. Algunas aplicaciones —incluida OpenWhispr— admiten ambos modos: usan modelos locales como Whisper y Parakeet de forma predeterminada por privacidad y coste cero, y opcionalmente te permiten aportar tu propia clave de API en la nube (OpenAI, Deepgram, etc.) cuando necesitas la precisión o las funciones adicionales que ofrece la nube. Este modelo «BYOK» (Bring Your Own Key, trae tu propia clave) te ofrece lo mejor de ambos mundos sin atarte a ninguno de los dos enfoques.

Fuentes y lecturas adicionales

Prueba ambos enfoques en una sola aplicación

OpenWhispr admite tanto modelos locales (OpenAI Whisper y NVIDIA Parakeet) para privacidad y coste cero, como tus propias claves de API en la nube cuando necesitas la máxima precisión. De código abierto, gratis para siempre.

Sin necesidad de cuenta · Funciona sin conexión · Código abierto para siempre