Entrada por voz en el chat del Asistente IA

¿Para qué sirve esto?

La entrada por voz te permite dictar tus peticiones al Asistente IA en lugar de teclear. Hablas, el sistema convierte tu voz en texto, tú revisas y, solo cuando estés conforme, envías el mensaje. Es más rápido que escribir y te permite formular peticiones complejas de forma natural mientras miras la pantalla del Organizador.

Dónde está el botón de voz

En el panel lateral del chat, en la parte izquierda del campo de entrada de texto, verás un icono de micrófono (🎤). Al pasar el ratón aparece la etiqueta «Entrada por voz».

Estados visuales del icono:

  • Micrófono gris — Listo para empezar. Pulsa para iniciar la grabación.
  • Micrófono rojo (cuadrado Stop) con pulsación — Grabando tu voz. Pulsa de nuevo para forzar la parada antes del corte automático.

Paso a paso: cómo usar la voz

  1. Abre el chat — Pulsa el botón hexagonal verde en la esquina inferior derecha del Organizador.
  2. Pulsa el micrófono — Icono 🎤 a la izquierda del campo de entrada.
  3. Permite el acceso al micrófono — La primera vez el navegador pedirá permiso; elige «Permitir». (Si bloqueaste por error, ver sección «Errores frecuentes»).
  4. Habla con claridad — No hace falta mantener pulsado el botón. El sistema escucha continuamente.
  5. Detención automática — Al detectar 1,5 segundos de silencio total, la grabación se detiene sola.
  6. El texto aparece en el campo de entrada — Léelo.
  7. Corrige si hace falta — Edita con teclado cualquier error de reconocimiento.
  8. Envía — Pulsa Intro o el icono del avión de papel para mandar el mensaje al Asistente.

Importante: El mensaje no se envía automáticamente tras el reconocimiento. Es una decisión deliberada: tú controlas qué se envía a la IA.

Detalles técnicos que afectan tu experiencia

  • Detección de silencio (VAD): El sistema usa tecnología de detección de actividad de voz (VAD). Si callas 1,5 segundos — la grabación para sola. No necesitas pulsar Stop si terminaste la frase.
  • Parada forzada: Si quieres parar antes (p. ej., te arrepientes o te interrumpen) — pulsa el micrófono rojo (Stop) otra vez.
  • Duración máxima: Hay un límite duro de grabación (failsafe) — aprox. 60 segundos. Si hablas sin pausas más tiempo — la grabación parará automáticamente.
  • Idioma de reconocimiento: El sistema detecta automáticamente el idioma de tu habla (ucraniano, inglés, español y otros). Funciona mejor si hablas un solo idioma durante toda la grabación.
  • Calidad de audio: Para mejor resultado habla cerca del micrófono, en lugar tranquilo. Ruido de fondo, música, otras voces pueden bajar la precisión.
  • Navegadores: Funciona en Chrome, Edge, Firefox, Safari (versiones modernas). Requiere HTTPS (o localhost).

Posibles errores y cómo arreglarlos

Situación Qué ves Qué hacer
Navegador bloqueó el micrófono No salió el popup «Permitir acceso al micrófono?» o pulsaste «Bloquear» Pulsa el icono de candado/micrófono en la barra de direcciones del navegador → permite el micrófono para este sitio → recarga la página e inténtalo de nuevo.
«No se pudo iniciar la grabación» (error) Toast rojo con texto «No se pudo iniciar la grabación» Comprueba que el micrófono está conectado, que no lo usa otra app (Zoom, Meet, etc.). Recarga la página.
«No se grabó audio» Notificación «No se grabó audio» Pulsaste Stop muy rápido, sin decir ni una palabra. Pulsa el micrófono otra vez y habla.
«No se pudo reconocer el audio» Notificación «No se pudo reconocer el audio» Inténtalo de nuevo: habla más fuerte, más claro, más cerca del micrófono. Comprueba internet (el reconocimiento ocurre en servidor).
Texto reconocido con errores Texto en el campo de entrada con errores Corrige a mano antes de enviar. El sistema aprende, pero no es perfecto.

Consejos para mejor reconocimiento

  • Habla en frases, no palabra a palabra — el contexto ayuda al modelo.
  • Haz pausas entre ideas — 1,5 segundos de silencio funcionan como punto final.
  • Evita ruido de fondo (aire acondicionado, música, charlas de colegas).
  • No grites ni susurres — volumen normal de conversación es lo mejor.
  • Si cambias de idioma (p. ej., de español a inglés) — mejor para la grabación, envía el mensaje, y empieza una nueva grabación para el otro idioma.

Ventajas de la entrada por voz en el contexto del Asistente IA

  • Velocidad: Dictar es 3-4 veces más rápido que teclear en teclado.
  • Formulación natural: Dices «Crea formulario para webinar con campos: nombre, email corporativo, empresa, cargo obligatorio», en vez de pensar cómo escribirlo abreviado.
  • Multitarea: Puedes hablar mientras miras la pantalla del formulario, haces scroll por la lista de campos, etc.
  • Accesibilidad: Ayuda a usuarios con limitaciones de movilidad en manos o visión.

Limitaciones

  • No hay auto-envío — es una feature, no un bug. Tú controlas el momento del envío.
  • Solo grabación individual — si hablan varias personas a la vez, la calidad baja.
  • Depende de internet — el reconocimiento ocurre en servidor (Whisper API). Offline no funciona.
  • No se admiten archivos — no se puede subir un archivo de audio para reconocimiento, solo micrófono en vivo.

Ejemplo de escenario

Tú: pulsas micrófono → «Crea formulario de inscripción a conferencia para desarrolladores con campos: nombre completo, email corporativo, nombre de empresa, nivel de experiencia lista: junior, mid, senior, team lead, y campo para restricciones dietéticas no obligatorio»

Sistema: a los 1,5 seg de silencio la grabación para, el texto aparece en el campo

Tú: lees, corriges «dietéticas» por «dietéticas», pulsas «Enviar»

IA: «¡Listo! Formulario creado. Revisa el borrador en el editor y pulsa «Aplicar»».


Recuerda: La entrada por voz es herramienta para crear el texto del mensaje, no para controlar la interfaz. Comandos tipo «cierra el chat», «minimiza la ventana» por voz no funcionarán — usa los botones de la interfaz.