Por qué el código abierto importa en las herramientas de voz
Tu voz es un dato biométrico. El software que la procesa debería poder auditarse.
OpenWhispr
Ingeniería
Tabla de contenidos
Las herramientas de voz de código abierto te permiten verificar exactamente qué ocurre con tu audio. Con el software de voz propietario, confías en la política de privacidad de una empresa. Con el código abierto, puedes leer el código, compilarlo tú mismo y confirmar que tus datos de voz nunca salen de tu dispositivo. Esta distinción importa más en las herramientas de voz que en casi cualquier otra categoría de software, porque los datos de voz son singularmente personales: son biométricos, son difíciles de anonimizar y, una vez grabados, no pueden dejar de oírse.
Última actualización: 17 de febrero de 2026. Las afirmaciones sobre incidentes y políticas se contrastan con al menos dos fuentes primarias.
Resumen de verificación (fuentes duales)
- Los datos de voz pueden ser identificativos y de alto riesgo: los marcos legales y normativos tratan cada vez más el tratamiento de datos biométricos como sensible. Texto oficial del RGPD · Texto oficial de la Ley de IA de la UE
- Los grandes asistentes se han enfrentado a controversias sobre datos de voz: los incidentes de Amazon, Google y Apple están documentados por reguladores o por grandes medios de comunicación. Caso de la FTC contra Amazon · Acuerdo de Siri según Reuters
- El abuso de la clonación de voz es un riesgo real para los consumidores: tanto los reguladores estadounidenses como las directrices de ciberseguridad alertan del riesgo de suplantación. Alerta de la FTC · Contexto de riesgo de IBM
- El ecosistema de modelos abiertos es real: Whisper y los entornos de ejecución derivados permiten implementaciones locales auditables. Whisper de OpenAI · whisper.cpp
- Posicionamiento de OpenWhispr: OpenWhispr está diseñado como un flujo de trabajo de voz abierto y local-first construido sobre ASR de código abierto. OpenWhispr · Whisper original
Por qué el código abierto mejora la confianza entre voz y datos
Los datos de voz son diferentes
El texto es texto. Puedes eliminar metadatos, anonimizar nombres y agregarlo en estadísticas. La voz no es nada de eso.
Tu voz es un identificador biométrico. Como una huella dactilar, es única tuya: los sistemas de autenticación por voz que usan los bancos y las administraciones públicas dependen de este hecho. Pero esa misma singularidad hace que las grabaciones de voz sean intrínsecamente identificativas. Una base de datos filtrada de transcripciones de texto es un incidente de privacidad. Una base de datos filtrada de grabaciones de voz es una brecha biométrica.
Lo que pueden revelar las grabaciones de voz
- •Identidad: la biometría de voz puede identificar de forma única a un hablante
- •Estado de salud: los biomarcadores vocales pueden indicar párkinson, depresión o enfermedades respiratorias
- •Estado emocional: el estrés, la ira y el cansancio se detectan en los patrones vocales
- •Datos demográficos: edad, género, acento, lengua materna y origen regional
Por qué la anonimización es más difícil
- •Puedes redactar palabras de una transcripción, pero no puedes redactar una voz de una grabación sin destruirla
- •La tecnología de clonación de voz hace que el audio filtrado pueda usarse para generar deepfakes de tu voz
- •La Ley de IA de la UE clasifica los sistemas de identificación biométrica, incluida la voz, como IA de alto riesgo, sujeta a estrictos requisitos de cumplimiento
La clonación de voz ha pasado de ser una curiosidad de investigación a un servicio de consumo masivo. Con apenas unos segundos de audio, los modelos modernos de síntesis de voz pueden producir réplicas convincentes de la voz de una persona. No es un riesgo hipotético: la FTC ha advertido sobre las estafas de clonación de voz con IA desde 2023. Cuando el software que procesa tu voz es una caja negra, no tienes forma de saber si las grabaciones se almacenan, se transmiten o se usan para entrenar modelos.
El problema de la confianza con las herramientas de voz propietarias
El argumento a favor del código abierto no es teórico. Todos los grandes asistentes de voz han sido sorprendidos manejando el audio de formas que sus usuarios no esperaban.
Amazon Alexa
En abril de 2019, Bloomberg informó de que Amazon empleaba a miles de trabajadores en todo el mundo para escuchar las grabaciones de voz de Alexa captadas en los hogares y oficinas de los clientes. Los trabajadores transcribían, anotaban y revisaban fragmentos de audio para mejorar el sistema de reconocimiento de voz. Algunos revisores afirmaron haber oído grabaciones que les resultaron perturbadoras, incluido lo que parecía ser una agresión sexual. La respuesta de Amazon reconoció la práctica, pero subrayó que se aplicaba a "una muestra extremadamente pequeña". La empresa añadió después controles para desactivarla, pero las grabaciones ya se habían recopilado bajo una política de privacidad que la mayoría de los usuarios nunca leyó con atención. En 2023, Amazon pagó 25 millones de dólares para resolver los cargos de la FTC que la acusaban de vulnerar la privacidad de los menores al conservar indefinidamente las grabaciones de voz de Alexa de niños.
Google Assistant
En julio de 2019, la emisora belga VRT NWS obtuvo más de 1000 grabaciones de Google Assistant a través de un contratista. Las grabaciones incluían conversaciones de dormitorio, llamadas de negocios e interacciones con niños, muchas de ellas captadas por activaciones accidentales en las que nadie había dicho "OK Google". Google confirmó que revisores humanos escuchaban alrededor del 0,2 % de todas las grabaciones de voz y suspendió la práctica en Europa tras la filtración. Una investigación posterior de la autoridad de protección de datos de Hamburgo derivó en una prohibición temporal de la práctica en toda la UE.
Apple Siri
En julio de 2019, un denunciante reveló a The Guardian que los contratistas de Apple oían con regularidad información médica confidencial, transacciones de drogas y encuentros sexuales mientras evaluaban grabaciones de Siri. Apple no había revelado el programa de revisión humana en su documentación de privacidad. La empresa pidió disculpas, suspendió el programa a nivel mundial y lo convirtió en opcional, pero las grabaciones que ya se habían revisado se recopilaron sin consentimiento informado. Apple resolvió más tarde una demanda colectiva de 95 millones de dólares por las vulneraciones de privacidad de Siri en enero de 2025.
El patrón es constante: una empresa dice "nos tomamos muy en serio tu privacidad", mientras que las prácticas reales de tratamiento de datos solo se descubren a través de filtraciones, denunciantes o acciones reguladoras. No eran pequeñas empresas tomando atajos. Eran Apple, Google y Amazon: tres de las organizaciones más sofisticadas técnicamente y mejor dotadas de recursos del planeta.
"No almacenamos tus datos" es una afirmación que exige confianza. El código abierto es una afirmación que solo exige saber leer.
Lo que realmente te da el código abierto
El código abierto no es una etiqueta de marketing. Es un conjunto de propiedades concretas que cambian el modelo de confianza entre tú y el software que usas.
Auditabilidad
Cualquiera puede leer el código fuente y verificar exactamente cómo se manejan los datos de audio. ¿La app envía las grabaciones a un servidor? ¿Almacena el audio en disco? ¿Envía datos de telemetría a casa? No necesitas confiar en una política de privacidad: puedes comprobarlo.
Reproducibilidad
Puedes compilar la aplicación desde el código fuente y compararla con el binario distribuido. Esto cierra la brecha entre "publicamos el código" y "la app que descargaste realmente ejecuta este código". Las compilaciones reproducibles son el estándar de oro de la confianza en el software.
Revisión comunitaria
Investigadores de seguridad, defensores de la privacidad y desarrolladores con experiencia pueden revisar el código de forma independiente. Las vulnerabilidades se encuentran y se corrigen de manera abierta. No es un beneficio teórico: es la razón por la que Linux, OpenSSL y toda la infraestructura de internet funcionan con código abierto.
Derecho a bifurcar
Si los responsables del proyecto toman decisiones con las que no estás de acuerdo (añadir telemetría, eliminar funciones, vender a un comprador), la comunidad puede bifurcar el proyecto y continuar su desarrollo de forma independiente. No es solo un seguro; es un incentivo estructural para que los responsables actúen en interés de los usuarios.
Sin dependencia forzada
Tus flujos de trabajo no quedan a merced de las decisiones comerciales de una empresa. Si una herramienta de dictado propietaria es adquirida, cambia de rumbo o cierra, tu inversión en aprenderla y configurarla se pierde. Las herramientas de código abierto perduran mientras a alguien le importe lo suficiente como para ejecutarlas.
Longevidad
Las empresas desaparecen. Los proyectos de código abierto perduran. Apache HTTP Server lleva funcionando desde 1995. PostgreSQL desde 1996. GCC desde 1987. Dragon NaturallySpeaking fue el producto de dictado líder durante décadas; luego Nuance fue adquirida por Microsoft y el producto independiente quedó prácticamente descontinuado. El código abierto no tiene este modo de fallo.
El efecto de los modelos abiertos: de Whisper a Parakeet
En septiembre de 2022, OpenAI lanzó Whisper , un modelo de reconocimiento de voz de propósito general entrenado con 680 000 horas de audio multilingüe, y lo liberó como código abierto bajo la licencia MIT. Fue un momento decisivo para las herramientas de voz.
Antes de Whisper, el reconocimiento automático del habla (ASR) de alta calidad era caro y propietario. Google Cloud Speech-to-Text, Amazon Transcribe y Microsoft Azure Speech Services cobraban por minuto de audio y exigían enviar las grabaciones a sus servidores. Las mejores opciones sin conexión (CMU Sphinx, Kaldi, VOSK) eran funcionales, pero notablemente menos precisas que las API en la nube.
OpenAI Whisper cambió esa ecuación de la noche a la mañana. Por primera vez, un modelo que igualaba o superaba la precisión de las API comerciales estaba disponible para que cualquiera lo descargara y ejecutara localmente, sin coste y sin que ningún dato saliera de su máquina. NVIDIA siguió un camino similar con su familia de modelos ASR Parakeet, alcanzando una precisión de vanguardia en inglés y publicándolos bajo licencias abiertas. La tendencia es clara: los mejores modelos de reconocimiento de voz son cada vez más de código abierto.
El ecosistema que vino después
El lanzamiento de OpenAI Whisper es una de las demostraciones más claras de cómo el código abierto crea ecosistemas. Un único modelo abierto dio lugar a entornos de ejecución optimizados, nuevas capacidades y decenas de productos que nunca habrían existido si el modelo hubiera permanecido detrás de un muro de pago de una API. NVIDIA Parakeet continuó este patrón, demostrando que varias organizaciones ven valor en liberar como código abierto un ASR de alta calidad. Hoy, cualquier desarrollador puede crear una herramienta de voz con precisión de vanguardia sin pagar por minuto, sin enviar audio a un tercero y sin pedir permiso.
Código abierto no significa menos pulido
Existe la idea persistente de que el código abierto implica acabados más toscos. Que cambias acabado por libertad. Esto quizá era cierto en 2005. No lo es en 2026.
Firefox
Un navegador convencional usado por cientos de millones de personas
VS Code
El editor de código más popular del mundo
Signal
Mensajería con cifrado de extremo a extremo y una experiencia de usuario pulida
Blender
Herramienta de animación 3D y VFX ganadora de un Óscar
VLC
Reproduce de todo, funciona en todas partes, sin anuncios
Linux
Hace funcionar la mayoría de los servidores y smartphones del mundo
La calidad del software de código abierto ha mejorado de forma drástica porque las estructuras de incentivos han cambiado. Hoy hay empresas que construyen negocios sobre núcleos de código abierto (Red Hat, Elastic, GitLab). Equipos bien financiados mantienen proyectos a tiempo completo. Las contribuciones de la comunidad detectan errores y añaden funciones para las que los equipos pequeños nunca habrían tenido capacidad.
Para ser justos con las contrapartidas: las herramientas de voz de código abierto a veces tienen equipos más pequeños y ciclos de lanzamiento más lentos que los competidores propietarios bien financiados. La documentación puede ser desigual. Pero son retos prácticos, no limitaciones inherentes. Y la brecha se ha ido cerrando rápido, sobre todo en el ámbito de las herramientas de voz, donde modelos abiertos como OpenAI Whisper y NVIDIA Parakeet dan a los proyectos de código abierto acceso a la misma calidad de modelo base que cualquier producto comercial.
Cómo se sostienen las herramientas de voz de código abierto
Una pregunta razonable: si el software es gratis, ¿cómo se le paga a alguien por trabajar en él?
La respuesta es que "código abierto" y "gratis" no son sinónimos. Los proyectos de código abierto más sostenibles separan el motor central (gratuito, abierto, auditable) de las funciones de conveniencia que justifican un plan de pago. Esto se conoce como el modelo de núcleo abierto, y funciona porque alinea los incentivos: la empresa genera ingresos mejorando el producto, no atrapando a los usuarios ni monetizando sus datos.
Por qué el núcleo abierto funciona bien para las herramientas centradas en la privacidad
- El producto principal funciona de forma local y sin conexión: no se requiere recopilación de datos para el plan gratuito
- Las funciones en la nube (como las API de transcripción gestionadas) ofrecen una conveniencia real por la que vale la pena pagar
- Las contribuciones de la comunidad mejoran el producto para todos, incluidos los clientes de pago
- Los usuarios que no pueden pagar siguen beneficiándose y aportan informes de errores, traducciones y código
Este es el modelo que usa OpenWhispr: la app de escritorio de código abierto realiza la transcripción de forma local usando modelos como OpenAI Whisper y NVIDIA Parakeet sin coste alguno. Un plan Pro opcional añade transcripción potenciada en la nube y limpieza de texto con IA para los usuarios que quieren resultados más rápidos o que no desean ejecutar modelos en su propio hardware. Lo importante es que la elección es tuya: la versión local, privada y totalmente funcional siempre es gratuita.
Qué debes buscar en una herramienta de voz de código abierto
No todas las afirmaciones de "código abierto" son iguales. Aquí tienes una lista práctica para evaluar herramientas de voz.
¿Está disponible todo el código fuente?
Algunos proyectos liberan una biblioteca como código abierto, pero mantienen la aplicación como propietaria. Comprueba que el producto que realmente usas (la app de escritorio, la app móvil) tenga su código fuente publicado.
¿Puedes compilarlo desde el código fuente?
El código fuente publicado que no compila no es abierto en un sentido significativo. Busca instrucciones de compilación, canalizaciones de CI e informes de la comunidad sobre compilaciones exitosas.
¿Cuál es la licencia? (¿MIT, Apache, GPL, AGPL?)
Las licencias permisivas (MIT, Apache 2.0) ofrecen la máxima flexibilidad. Las licencias copyleft (GPL, AGPL) garantizan que los derivados sigan siendo abiertos. Ambas son legítimas: solo asegúrate de saber qué estás obteniendo.
¿Funciona sin conexión y de forma local?
El código abierto que necesita una conexión a la nube para funcionar sigue enviando tus datos a un servidor. En las herramientas de voz, el procesamiento local sin conexión es el mínimo en materia de privacidad.
¿Se mantiene activamente?
Revisa el historial de commits, el rastreador de incidencias y la cadencia de lanzamientos. Un proyecto de código abierto abandonado puede tener vulnerabilidades de seguridad sin parchear.
¿Existe una comunidad? (Incidencias, PR, debates)
Un proyecto de código abierto saludable tiene más de un colaborador. Busca implicación de la comunidad: pull requests de colaboradores externos, debates en las incidencias y responsables que respondan.
Fuentes y lecturas adicionales
- Bloomberg: "Is Anyone Listening to You on Alexa? A Global Team Reviews Audio" (abril de 2019)
- VRT NWS: "Google employees are eavesdropping, even in Flemish living rooms" (julio de 2019)
- The Guardian: "Apple contractors 'regularly hear confidential details' on Siri recordings" (julio de 2019)
- Reuters: "Apple agrees to pay $95 million to settle Siri privacy lawsuit" (enero de 2025)
- FTC: Amazon acusada de vulnerar la ley de privacidad de menores por conservar las grabaciones de Alexa de niños (mayo de 2023)
- FTC: Los estafadores usan la clonación de voz con IA para potenciar las estafas de emergencias familiares (marzo de 2023)
- OpenAI: Presentación de Whisper (septiembre de 2022)
- Repositorio de OpenAI Whisper en GitHub (modelos, licencia, documentación)
- Radford et al. (2022): Robust Speech Recognition via Large-Scale Weak Supervision
- Texto oficial del RGPD (UE 2016/679)
- Texto oficial de la Ley de IA de la UE (UE 2024/1689)
- whisper.cpp — Port en C/C++ de OpenAI Whisper
- faster-whisper — Implementación de Whisper basada en CTranslate2
- OpenWhispr — Contexto del producto de dictado abierto y local-first
OpenWhispr es de código abierto
Creamos OpenWhispr de forma abierta porque creemos que el software de voz debería ser transparente. No te fíes solo de nuestra palabra: revisa el código tú mismo.
Sin cuenta · Funciona sin conexión · Con licencia MIT · Código abierto para siempre