Entrada de voz
Dicta a MadoHub con speech-to-text en el dispositivo — tu audio nunca sale de la máquina.
La entrada de voz te permite dictar en lugar de escribir. Mantén un atajo, habla, suéltalo — la transcripción aterriza donde le hayas dicho. Todo el pipeline corre localmente: captura de audio, remuestreo y transcripción ocurren todos en tu máquina, sin llamada a la red por medio.
Si alguna vez dictaste a una API de voz en la nube y te preguntaste dónde acabó ese audio, este es el otro diseño. Tu voz se captura, se transcribe con un modelo Whisper local y se escribe en MadoHub — todo en el mismo proceso, en tu máquina. Nada del audio ni de la transcripción se sube.
Qué puedes hacer con esto
- Dictado push-to-talk — mantén un atajo, habla, suéltalo para transcribir.
- Reintentar la última grabación — vuelve a ejecutar la transcripción sobre el mismo audio capturado sin hablar de nuevo, útil cuando el primer pase te malinterpretó.
- Enrutar la transcripción a uno de tres destinos — a la entrada de chat de MadoAgent, al terminal con foco sin enviar, o al terminal con foco y enviar de inmediato.
- Cambiar de destino al vuelo — cambia a dónde va el dictado desde la paleta de comandos sin abrir Configuración.
- Elegir un tamaño de modelo — desde
tiny(~75 MB) hastamedium(~1.5 GB); los modelos más grandes son más precisos pero más lentos y pesados de descargar. - Fijar un idioma o autodetectar — inglés, chino, japonés, coreano, español, francés, alemán, o auto.
Cómo usarlo
- Activa la entrada de voz desde Configuración → Voz, o desde la paleta de comandos (Cmd+Shift+P) vía la entrada Enable Voice Input (buscable por "voice", "dictation", "push-to-talk" o "语音").
- Si todavía no has descargado un modelo Whisper, MadoHub abre Configuración en la pestaña Voz con un toast que te dice qué descargar — no grabará en el silencio.
- Mantén Cmd+Shift+V (el atajo push-to-talk por defecto) para grabar, y suéltalo para parar y transcribir.
- Pulsa Cmd+Shift+R para reintentar la última grabación si el primer pase te malinterpretó. Reintentar solo funciona dentro de 30 segundos de una transcripción exitosa y solo si no has empezado una grabación nueva desde entonces.
- Elige a dónde van las transcripciones en Configuración → Voz, o cambia de destino al vuelo desde la paleta de comandos.
| Destino | Comportamiento |
|---|---|
| Agent (predeterminado) | Se redacta en la entrada de chat de MadoAgent, que se auto-abre para que veas aterrizar. Tú revisas, editas y pulsas Enter tú mismo. |
| Terminal — insert | Se escribe en el tile de terminal con foco actualmente sin enviar. Los saltos de línea se colapsan a espacios para que no se auto-envíe en una shell. |
| Terminal — auto | Se escribe en el tile de terminal con foco y se envía de inmediato. |
Los dos destinos de terminal se fijan al tile de terminal que tuviera el foco cuando empezaste a grabar — un cambio de foco a mitad de grabación no puede enrutar mal la transcripción. Si ningún terminal tenía el foco (o el tile se cerró antes de que terminaras de hablar), MadoHub cae al destino Agent y muestra un toast explicando por qué.
Casos de uso comunes
- "Refactoriza el módulo de auth para usar una clase, añade tests para el flujo de login." — dicta un prompt largo a MadoAgent mientras repasas el código mentalmente, luego revisa y envía.
- "Ejecutar un comando rápido de shell sin escribir" — pon el destino en Terminal — auto y dicta
git statusopnpm test. - "Dictado CJK" — fija el idioma a chino/japonés/coreano para mejor precisión en frases cortas, puesto que el autodetect de Whisper puede fallar en clips CJK silenciosos o muy cortos.
Consejos y buenas prácticas
- Empieza con el modelo
small(el predeterminado) para un buen equilibrio precisión/tamaño. Sube amediumsolo si dictas a menudo y necesitas la precisión extra. - Fija un idioma cuando sepas qué estás hablando — evita errores de autodetección en clips cortos o silenciosos.
- Reasigna los atajos de push-to-talk y de reintento en Configuración si colisionan con atajos que ya usas; Configuración te avisa de conflictos.
- Usa Terminal — insert en lugar de Terminal — auto cuando dictes entrada multi-línea, para poder revisar antes de enviar.
Funciones relacionadas
- Paleta de comandos — activa la entrada de voz y cambia destinos desde aquí.
- Configuración — la pestaña Voz donde configuras modelo, idioma, atajos y destino.
- MadoAgent — el destino de dictado por defecto.
Limitaciones
- La entrada de voz viene desactivada por defecto; actívala antes del primer uso.
- Reintentar solo funciona dentro de 30 segundos de una transcripción exitosa, y solo si no has empezado una grabación nueva desde entonces.
- Los destinos de terminal requieren un tile de terminal vivo con el foco en el momento de empezar a grabar. Si no, MadoHub cae al destino Agent.
- Un modelo debe estar descargado antes de grabar; MadoHub no grabará en el silencio.