Las mejores herramientas de dictado para Linux en 2026
Durante años, los usuarios de Linux han tenido pocas opciones de software de dictado. Eso por fin está cambiando. Aquí tienes todas las alternativas viables en 2026, comparadas con honestidad.
OpenWhispr
Ingeniería
Tabla de contenidos
La mejor herramienta de dictado para Linux en 2026 depende de lo que necesites. Para la mayoría de quienes buscan una experiencia pulida, lista para usar y con limpieza de texto mediante IA, OpenWhispr ofrece el paquete más completo: dictado de pulsar para hablar impulsado por whisper.cpp, atajo de teclado global, más de 99 idiomas y formato opcional con IA, todo de código abierto. Para usuarios orientados a la CLI que prefieren dependencias mínimas, Nerd Dictation es excelente. Los usuarios de KDE y Qt deberían fijarse en Speech Note. Quienes se sientan cómodos canalizando audio por la terminal pueden usar whisper.cpp directamente. Y si necesitas control total del ordenador con manos libres más allá del simple dictado, Talon Voice está en una categoría aparte.
Última actualización: febrero de 2026. La disponibilidad de las herramientas y las afirmaciones sobre sus funciones se contrastan con al menos dos fuentes por cada afirmación importante.
Resumen verificado (fuentes duales)
- OpenWhispr ejecuta Whisper en local a través de whisper.cpp: su conjunto de funciones y su ejecución local están documentados públicamente. openwhispr.com · whisper.cpp
- Las opciones para Linux van desde interfaces gráficas pulidas hasta scripts de CLI: los repositorios de los proyectos y las páginas de distribución confirman su alcance y su estado de mantenimiento. Nerd Dictation · Speech Note (Flathub)
- Las herramientas que priorizan la nube cambian comodidad por privacidad: la escritura por voz del navegador es fácil, pero enruta el audio a través de la infraestructura del proveedor. Ayuda de escritura por voz de Chrome · Registro de datos de Google STT
- Existen proyectos de voz veteranos para Linux, pero pueden estar desactualizados: antes de adoptarlos conviene revisar la actividad del repositorio y el historial de versiones. Repositorio de Simon · Archivo de proyectos sin mantenimiento de KDE
- Posicionamiento de OpenWhispr: OpenWhispr se incluye aquí porque combina ASR local, captura global y posprocesado opcional en una sola app compatible con Linux. OpenWhispr · Whisper original
Linux Panorama del dictado (2026)
1. OpenWhispr
OpenWhispr es una app de dictado de escritorio de código abierto y multiplataforma, construida sobre Electron y whisper.cpp. Ofrece dictado de pulsar para hablar que funciona en todo el sistema: mantén un atajo, habla, suéltalo y tu texto transcrito aparece justo donde está el cursor. También incluye un modo agente con IA capaz de limpiar, formatear y reestructurar el texto dictado mediante LLM (OpenAI, Anthropic, Google Gemini o modelos locales).
Ventajas
- Interfaz gráfica pulida con atajo global de pulsar para hablar
- Modo agente con IA para limpiar y formatear el texto automáticamente
- Más de 99 idiomas mediante modelos de Whisper (de tiny a large)
- Totalmente de código abierto: compílalo desde el código o usa los binarios precompilados
Desventajas
- Basado en Electron: consume más recursos que las apps nativas
- Las funciones de limpieza con IA requieren claves de API o una suscripción Pro
- Los modelos Whisper más grandes necesitan hardware decente para rendir en tiempo real
2. Nerd Dictation
Nerd Dictation es un script de Python de un solo archivo que ofrece voz a texto sin conexión usando la API de VOSK. Está pensado para usuarios avanzados de Linux que se sienten cómodos con la línea de comandos. Lo inicias y lo detienes manualmente con comandos de CLI, y escribe en la ventana que tenga el foco usando xdotool. La configuración del usuario es un script de Python, lo que lo hace infinitamente personalizable.
Ventajas
- Extremadamente ligero: un único archivo de Python con dependencias mínimas
- Totalmente sin conexión con modelos de idioma VOSK pequeños (menos de 50 MB)
- Infinitamente personalizable mediante scripts de configuración en Python
- Sin procesos en segundo plano: se inicia y se detiene bajo demanda
Desventajas
- Sin interfaz gráfica: totalmente basado en CLI, poco apto para principiantes
- La precisión de VOSK es notablemente inferior a la de las herramientas basadas en Whisper
- Requiere xdotool (solo X11: soporte limitado para Wayland)
3. Speech Note (Dsnote)
Speech Note es una aplicación de Linux basada en Qt para tomar notas, leer y traducir usando voz a texto, texto a voz y traducción automática sin conexión. Admite varios motores de STT, incluido Whisper (a través de whisper.cpp y Faster Whisper), y está disponible como Flatpak en Flathub. Las versiones más recientes admiten aceleración por GPU mediante Vulkan para tarjetas Intel, AMD y NVIDIA.
Ventajas
- Interfaz gráfica completa con funciones integradas de toma de notas, TTS y traducción
- Admite varios motores de STT, incluidos los modelos de Whisper
- Aceleración por GPU (Vulkan) para transcribir más rápido
- Instalación sencilla mediante Flatpak en la mayoría de las distribuciones
Desventajas
- Diseñada como app de toma de notas, no como herramienta de dictado en todo el sistema
- Tiene atajos de teclado globales, pero son menos fluidos que pulsar para hablar
- La interfaz Qt puede sentirse menos pulida en escritorios basados en GNOME
4. Simon (KDE)
Simon es un sistema de reconocimiento de voz de código abierto desarrollado originalmente como parte del proyecto KDE. Adopta un enfoque singular del estilo «hazlo tú mismo», que permite a los usuarios crear modelos de idioma y acústicos personalizados desde cero en lugar de depender de modelos preentrenados. Sin embargo, conviene ser claro: Simon prácticamente no recibe mantenimiento. Su última versión relevante fue en 2013 y, pese a un breve intento de reactivación en 2017, no ha habido desarrollo activo en los últimos años.
Ventajas
- Se pueden entrenar modelos acústicos personalizados para vocabularios específicos
- Totalmente de código abierto y con interfaz gráfica
- Funciona por completo sin conexión
Desventajas
- Prácticamente abandonado: sin actualizaciones significativas desde 2013
- Nunca se portó a KDE Frameworks 5 ni a Qt5/Qt6
- Precisión de reconocimiento muy por debajo de las herramientas modernas basadas en Whisper
Valoración honesta: Simon fue pionero del reconocimiento de voz de código abierto en Linux, pero herramientas modernas como whisper.cpp han dejado obsoleto su enfoque. Lo incluimos aquí para que la lista sea completa, pero no lo recomendaríamos a usuarios nuevos.
5. Escritura por voz de Google Chrome
La escritura por voz integrada de Google está al alcance de los usuarios de Linux a través de Chrome o Google Docs (Herramientas > Escritura por voz). Usa el reconocimiento de voz en la nube de Google y admite una amplia variedad de idiomas. No requiere más instalación que tener Chrome, lo que la convierte en la opción con menos fricción, pero también en la más limitada.
Ventajas
- Cero configuración: solo abre Chrome y empieza a hablar
- Buena precisión gracias a los modelos de voz de Google
- Admite más de 100 idiomas
Desventajas
- Solo funciona dentro de Chrome/Google Docs: no en todo el sistema
- Todo el audio se envía a los servidores de Google: sin modo sin conexión
- No es de código abierto: es un servicio propietario y cerrado
6. Whisper.cpp CLI
Whisper.cpp es una adaptación en C/C++ del modelo de reconocimiento de voz Whisper de OpenAI, optimizada para inferencia en CPU. No es una app de dictado como tal: es una herramienta de línea de comandos para transcribir archivos de audio. Aun así, muchos usuarios de Linux montan flujos de trabajo de dictado a su alrededor canalizando la entrada del micrófono mediante scripts. Proyectos como whisper-dictation y whispertux envuelven whisper.cpp en interfaces de pulsar para hablar precisamente con ese fin.
Ventajas
- Precisión de Whisper de última generación, ejecutándose en local
- C++ muy optimizado: rápido incluso en máquinas que solo usan CPU
- Más de 99 idiomas admitidos en todos los tamaños de modelo de Whisper
- Totalmente de código abierto y con mantenimiento muy activo
Desventajas
- Sin interfaz gráfica ni pulsar para hablar: es puramente un motor de transcripción
- Requiere scripting para montar un flujo de dictado en tiempo real
- Diseñado para transcribir archivos, no para dictado en streaming en directo
7. Talon Voice
Talon Voice es un sistema integral de entrada con manos libres que va mucho más allá del dictado. Te permite controlar todo el ordenador (gestión de ventanas, programación, cambio de aplicaciones, navegación de archivos) por completo con la voz, con seguimiento ocular opcional mediante dispositivos Tobii. Talon es compatible con Linux en X11 (Ubuntu 18.04 o superior y la mayoría de las distribuciones modernas). Sin embargo, Wayland no es compatible ni está previsto que lo sea al momento de escribir esto.
Ventajas
- Control total del ordenador con manos libres, no solo dictado
- Programación por voz diseñada a medida con comandos específicos por lenguaje
- Integración de seguimiento ocular para sustituir el ratón
- Inestimable para la accesibilidad: realmente transformador para quienes sufren lesiones por esfuerzo repetitivo
Desventajas
- Curva de aprendizaje pronunciada: hay que memorizar comandos y un alfabeto fonético
- El motor principal es propietario (los scripts de la comunidad son de código abierto)
- Soporte de Linux limitado a X11: sin compatibilidad con Wayland
Comparativa lado a lado
| Herramienta | Código abierto | Sin conexión | Idiomas | Limpieza con IA | En todo el sistema | Precio |
|---|---|---|---|---|---|---|
| OpenWhispr | Más de 99 | Gratis (Pro 8 $/mes) | ||||
| Nerd Dictation | Varía según el modelo VOSK | Gratis | ||||
| Speech Note | Varía según el backend/modelo | Gratis | ||||
| Simon | Personalizado | Gratis | ||||
| Chrome Voice Typing | Muchos idiomas admitidos por el navegador | Gratis | ||||
| Whisper.cpp CLI | Más de 99 | Gratis | ||||
| Talon Voice | Inglés | Núcleo gratis / niveles de pago en Patreon |
Nuestras recomendaciones
No existe una única herramienta de dictado «mejor» para Linux: depende de lo que valores. Así es como lo desglosaríamos:
Para la mayoría de los usuarios
OpenWhispr ofrece la experiencia más completa: una interfaz gráfica de verdad, pulsar para hablar en todo el sistema, limpieza con IA, la precisión de Whisper y, además, es de código abierto. Es lo más parecido que tiene Linux a lo que los usuarios de macOS y Windows dan por sentado.
Para los puristas de la CLI
Nerd Dictation es brillante por su sencillez. Un único archivo de Python, impulsado por VOSK e infinitamente personalizable. Si prefieres configurar tus herramientas mediante scripts y no necesitas la precisión de Whisper, es difícil de superar.
Para usuarios de KDE/Qt
Speech Note se integra bien con los escritorios basados en Qt y ofrece traducción y TTS además del reconocimiento de voz. Es una opción sólida si quieres una herramienta de notas todo en uno.
Para desarrolladores
Whisper.cpp CLI es el motor que impulsa muchas de estas herramientas. Si quieres el máximo control y te sientes cómodo montando tu propia canalización, ve directo a la fuente.
Para accesibilidad y computación con manos libres
Talon Voice está en una categoría totalmente distinta. Si necesitas sustituir el teclado y el ratón, y no solo complementarlos con dictado, Talon es la herramienta que conviene aprender. La inversión de tiempo es considerable, pero la recompensa es transformadora.
Fuentes y lecturas adicionales
¿Quieres probar OpenWhispr?
Dictado de código abierto para Linux, macOS y Windows. Pulsar para hablar, whisper.cpp, limpieza con IA y más de 99 idiomas, gratis para siempre.
Sin cuenta · Funciona sin conexión · Código abierto para siempre