Ir al contenido

Hablando con el asistente

Puedes hablar con el asistente en lugar de escribir, y que sus respuestas se lean en voz alta. Un mensaje hablado se convierte en texto y luego se maneja exactamente como algo que escribiste — así que los intents, formularios de parámetros, workflows y todo lo demás se comportan de la misma manera. La transcripción es el mensaje, y tu audio no se guarda.

Dónde Hablando con él Escuchando respuestas
La aplicación Micrófono en el compositor, o manos libres Un botón de hablar por respuesta, o automático
Un widget embebido Micrófono en el widget Un botón de hablar por respuesta
Slack Enviar una nota de voz No por defecto
Formularios Responder hablando Un control “Leer formulario”

Presiona el micrófono y habla. Tus palabras aparecen como un mensaje normal.

Manos libres sigue escuchando: nota cuándo empiezas y dejas de hablar, envía cada turno y reproduce la respuesta a medida que llega — así puedes mantener una conversación sin tocar nada. Algunas cosas con las que la gente se encuentra:

  • El asistente se interrumpe a sí mismo. Tus altavoces están siendo escuchados como si fueran voz. Los auriculares lo solucionan por completo.
  • Los turnos terminan a mitad de una frase. Está tratando tus pausas como el final de un turno.
  • El ruido de fondo inicia un turno. Es demasiado sensible para la habitación. Un turno que se abre y se retracta nunca se transcribe, así que esto no cuesta nada más que molestias.

Los dos primeros y el tercero se pueden ajustar; pregunta a quien administre tu instalación.

Nada que configurar — si la voz está activada, el micrófono aparece. El widget utiliza el idioma de tu visitante en lugar del del creador del embebido.

Si falta el micrófono en tu sitio, la página casi seguramente se sirve a través de HTTP simple. Los navegadores solo otorgan acceso al micrófono a través de una conexión segura, así que el control no se muestra en absoluto en lugar de mostrarse roto. Sirve la página a través de HTTPS.

Envía una nota de voz en un mensaje directo o en un canal donde menciones al asistente. Se transcribe y se responde como un mensaje ordinario. Las respuestas de Slack vuelven como texto por defecto; las respuestas habladas se pueden activar.

Las conversaciones en Slack se manejan en inglés. Un mensaje de Slack no lleva ninguna preferencia de idioma, así que no hay nada mejor de lo que trabajar.

En la aplicación, la voz sigue el idioma que tienes configurado en la interfaz. En un widget, sigue el del visitante. El cantonés y el mandarín se distinguen correctamente, lo cual es importante para el habla — el texto escrito por sí solo no puede diferenciarlos.

Una cosa no se traduce: las etiquetas de campo de un formulario que se leen en voz alta. Esas fueron escritas por quien construyó el workflow, así que se leen tal como están escritas. Los controles a su alrededor están traducidos.

  • Acceso al micrófono, lo que requiere una conexión segura — HTTPS.
  • Un navegador con soporte para grabación de audio. Donde falta, el botón no se muestra en lugar de mostrarse fallando.
  • Manos libres necesita un poco más, y puede mostrar dos indicadores de micrófono. Eso es esperado.
  • Solo una respuesta habla a la vez.
  • La reproducción automática puede estar bloqueada hasta que haya hecho clic en algo en la página — los navegadores rechazan audio que una persona no inició. El botón de hablar por respuesta siempre funciona.
Lo que ves Lo que es
Sin botón de micrófono La página no está en HTTPS, o el navegador no puede grabar
“El acceso al micrófono fue bloqueado” Rechazaste el permiso — cámbialo en la configuración del sitio
La respuesta llega pero nunca habla Se rechazó la reproducción automática, o la respuesta no tenía nada que se pudiera decir
Slack: “No pude entender ese mensaje de voz”, cada vez La aplicación de Slack necesita ser reinstalada con permiso para leer archivos
Una nota de voz de Slack no recibe respuesta Las notas de voz están desactivadas, o fue un mensaje de canal sin mención
Todo se niega El workspace no tiene una suscripción activa

La entrada de voz es medida por la duración del audio; la salida de voz por los caracteres hablados. Ambos son separados de los tokens del modelo — consulta la referencia de unidades de facturación.

Una respuesta hablada emitida se factura por frase a medida que avanza, así que una respuesta puede mostrar varios cargos que suman el total. Eso es esperado, no un doble cobro.