Inteligencia y Voz de tu asistente de IA

Ajusta modelo, reconocimiento de voz y voz en unos pocos pasos guiados.

Videotutorial - Asistente AI4CALL: Inteligencia & Voz

Inteligencia y Voz: los tres componentes del asistente AI4CALL

La sección Inteligencia y Voz de un asistente AI4CALL configura tres componentes. El modelo procesa la solicitud y decide la respuesta. El reconocimiento de voz transforma en texto la voz de quien llama. La síntesis de voz devuelve la respuesta en audio.

Cada componente tiene su propia pestaña, pero lo que percibe quien llama depende de cómo trabajan juntos los tres. En este videotutorial vemos dónde están los ajustes, qué hace cada parámetro y cómo comprobar el resultado antes de guardar.

Modelo LLM: cómo decide la respuesta el asistente

Abre Configurar en la pestaña Modelo LLM. El modelo sigue el prompt y decide cuándo llamar a las herramientas disponibles: determina, por tanto, tanto el contenido de la respuesta como el momento en que el asistente usa una herramienta.

Proveedor AI4CALL o tus propias API keys

Con un proveedor ofrecido por ai for call usas los servicios disponibles en la plataforma: seleccionas el modelo del catálogo y consultas la lista de precios para los consumos correspondientes.

La modalidad con tus API keys conecta en cambio una cuenta tuya con el proveedor. Eliges el proveedor y la configuración de la cartera y, si aún no existe, la creas desde esta pantalla. En esta modalidad eres tú quien mantiene válidas las credenciales y controla el crédito y los límites del proveedor. Valora también los tiempos de respuesta: durante una llamada telefónica, cada espera se nota.

Ajustes avanzados: Temperature, Max Tokens y generación

En los ajustes avanzados puedes dejar los campos vacíos y usar los valores predeterminados del modelo. Temperature regula la variabilidad de las respuestas, Max Tokens limita la cantidad de texto generado. Los demás parámetros afectan a la selección de tokens, las repeticiones y la parada de la generación. La disponibilidad real depende del modelo y del proveedor elegidos.

  • Para evaluar un cambio, modifica un parámetro cada vez y compara conversaciones similares.
  • Un límite demasiado bajo puede interrumpir una respuesta útil.
  • Los parámetros avanzados no sustituyen a un prompt claro.
  • Para respuestas breves, indica también el estilo y la longitud deseados en las instrucciones.
  • Dejar los campos vacíos significa usar los valores predeterminados del modelo.

Reconocimiento de voz: transcribir lo que dice quien llama

El reconocimiento de voz transcribe lo que se dice durante la llamada. Aquí eliges el motor y el idioma de quien llama. Comprueba el resultado con nombres, números y direcciones típicos de tu servicio.

El idioma del reconocimiento es una elección distinta de la voz con la que hablará el asistente: dos ajustes separados, que hay que verificar por separado.

Síntesis de voz: la voz que escucha quien llama

En la pestaña TTS eliges el proveedor, la voz y el género: son los ajustes de la voz con la que el asistente habla durante las llamadas. El nombre visible en este ejemplo pertenece a la configuración del asistente. Elige la voz según el idioma, la claridad y la naturalidad.

El menú de voces incluye las vistas previas de escucha. Compara las candidatas usando frases representativas de tu servicio y comprueba en particular nombres propios, términos ingleses y números. Para una verificación completa, prueba después la voz en el contexto de una llamada.

Sonido de fondo: cuándo usarlo y cómo comprobarlo

La pestaña Fondo permite elegir un audio ambiental o musical: puedes consultar los fondos disponibles y sus vistas previas. Ninguna selección significa ningún sonido de fondo. Si lo utilizas, verifica que la voz siga siendo siempre comprensible.

El control final antes de guardar el asistente

Antes de terminar, controla juntos el modelo, el reconocimiento y la síntesis de voz: el modelo debe responder correctamente, el reconocimiento entender a quien llama, la voz resultar clara. Confirma las ventanas modificadas y guarda el asistente.

Una llamada de prueba muestra cómo trabajan juntos los tres componentes: es la forma más directa de ver si la configuración aguanta en condiciones reales.

Los tres componentes en resumen

<b>Modelo:</b> procesa la solicitud, decide la respuesta y cuándo llamar a las herramientas disponibles. <b>Reconocimiento de voz:</b> transcribe a texto lo que dice quien llama, según el motor y el idioma elegidos. <b>Síntesis de voz:</b> devuelve la respuesta en audio, con el proveedor, la voz y el género seleccionados. Confirma las ventanas modificadas, guarda el asistente y comprueba el resultado con una llamada de prueba.

Preguntas frecuentes

¿Cuál es la diferencia entre reconocimiento de voz y síntesis de voz?

El reconocimiento de voz transforma en texto la voz de quien llama, la síntesis de voz devuelve la respuesta en audio. Son dos ajustes distintos: el idioma del reconocimiento es una elección separada de la voz con la que hablará el asistente.

¿Conviene usar el proveedor AI4CALL o las propias API keys?

Con un proveedor ofrecido por ai for call usas los servicios disponibles en la plataforma: seleccionas el modelo del catálogo y consultas la lista de precios para los consumos. Con tus propias API keys conectas una cuenta tuya con el proveedor y eres tú quien mantiene válidas las credenciales, controla el crédito y los límites y valora los tiempos de respuesta.

¿Qué ocurre si dejo vacíos los ajustes avanzados?

Dejar los campos vacíos significa usar los valores predeterminados del modelo. Es la opción recomendada mientras no tengas un motivo concreto para intervenir: los parámetros avanzados no sustituyen a un prompt claro.

Configuremos juntos tu asistente de voz

Modelo, reconocimiento y voz: te mostramos cómo ajustarlos a tu caso de uso y cómo comprobarlos con una llamada de prueba.


Algunos de los usuarios de ai4call
AI4Call Demo

Chiama e prova la qualità dei nostri assistenti A.I.