Intelligence et Voix : les trois composants de l'assistant AI4CALL
La section Intelligence et Voix d'un assistant AI4CALL configure trois composants. Le modèle traite la demande et décide de la réponse. La reconnaissance vocale transforme en texte la voix de l'appelant. La synthèse vocale restitue la réponse en audio.
Chaque composant a son onglet dédié, mais ce que perçoit l'appelant dépend de la façon dont les trois fonctionnent ensemble. Dans ce vidéotutoriel, nous voyons où se trouvent les réglages, ce que fait chaque paramètre et comment vérifier le résultat avant d'enregistrer.
Modèle LLM : comment l'assistant décide de la réponse
Ouvrez Configurer dans l'onglet Modèle LLM. Le modèle suit le prompt et décide quand appeler les outils disponibles : il détermine donc à la fois le contenu de la réponse et le moment où l'assistant utilise un outil.
Fournisseur AI4CALL ou vos propres clés API
Avec un fournisseur proposé par ai for call, vous utilisez les services disponibles sur la plateforme : vous sélectionnez le modèle dans le catalogue et consultez la grille tarifaire pour les consommations correspondantes.
Le mode avec vos clés API relie en revanche votre propre compte chez le fournisseur. Vous choisissez le fournisseur et la configuration du portefeuille et, si elle n'existe pas encore, vous la créez depuis cet écran. Dans ce mode, c'est à vous de maintenir les identifiants valides et de surveiller le crédit et les limites du fournisseur. Évaluez aussi les temps de réponse : pendant un appel téléphonique, chaque attente s'entend.
Paramètres avancés : Temperature, Max Tokens et génération
Dans les paramètres avancés, vous pouvez laisser les champs vides et utiliser les valeurs par défaut du modèle. Temperature règle la variabilité des réponses, Max Tokens limite la quantité de texte généré. Les autres paramètres concernent la sélection des tokens, les répétitions et l'arrêt de la génération. La disponibilité réelle dépend du modèle et du fournisseur choisis.
- Pour évaluer une modification, changez un paramètre à la fois et comparez des conversations similaires.
- Une limite trop basse peut interrompre une réponse utile.
- Les paramètres avancés ne remplacent pas un prompt clair.
- Pour des réponses courtes, indiquez aussi le style et la longueur souhaités dans les instructions.
- Laisser les champs vides signifie utiliser les valeurs par défaut du modèle.
Reconnaissance vocale : transcrire ce que dit l'appelant
La reconnaissance vocale transcrit ce qui est dit pendant l'appel. Vous y choisissez le moteur et la langue de l'appelant. Vérifiez le résultat avec les noms, les numéros et les adresses typiques de votre service.
La langue de la reconnaissance est un choix distinct de la voix avec laquelle parlera l'assistant : deux réglages séparés, à vérifier séparément.
Synthèse vocale : la voix que l'appelant entend
Dans l'onglet TTS, vous choisissez le fournisseur, la voix et le genre : ce sont les réglages de la voix avec laquelle l'assistant parle pendant les appels. Le nom visible dans cet exemple appartient à la configuration de l'assistant. Choisissez la voix selon la langue, la clarté et le naturel.
Le menu des voix inclut les aperçus d'écoute. Comparez les candidates avec des phrases représentatives de votre service et vérifiez en particulier les noms propres, les termes anglais et les nombres. Pour une vérification complète, essayez ensuite la voix dans le contexte d'un appel.
Fond sonore : quand l'utiliser et comment le vérifier
L'onglet Fond sonore permet de choisir un audio d'ambiance ou musical : vous pouvez consulter les fonds disponibles et leurs aperçus. Aucune sélection signifie aucun fond sonore. Si vous en utilisez un, vérifiez que la voix reste toujours compréhensible.
Le contrôle final avant d'enregistrer l'assistant
Avant de conclure, contrôlez ensemble le modèle, la reconnaissance et la synthèse vocale : le modèle doit répondre correctement, la reconnaissance comprendre l'appelant, la voix être claire. Confirmez les fenêtres modifiées et enregistrez l'assistant.
Un appel d'essai montre comment les trois composants travaillent ensemble : c'est la manière la plus directe de voir si la configuration tient en conditions réelles.
Les trois composants en résumé
<b>Modèle :</b> traite la demande, décide de la réponse et du moment où appeler les outils disponibles. <b>Reconnaissance vocale :</b> transcrit en texte ce que dit l'appelant, selon le moteur et la langue choisis. <b>Synthèse vocale :</b> restitue la réponse en audio, avec le fournisseur, la voix et le genre sélectionnés. Confirmez les fenêtres modifiées, enregistrez l'assistant et vérifiez le résultat avec un appel d'essai.
Questions fréquentes
Quelle est la différence entre reconnaissance vocale et synthèse vocale ?
La reconnaissance vocale transforme en texte la voix de l'appelant, la synthèse vocale restitue la réponse en audio. Ce sont deux réglages distincts : la langue de la reconnaissance est un choix séparé de la voix avec laquelle parlera l'assistant.
Faut-il utiliser le fournisseur AI4CALL ou ses propres clés API ?
Avec un fournisseur proposé par ai for call, vous utilisez les services disponibles sur la plateforme : vous sélectionnez le modèle dans le catalogue et consultez la grille tarifaire pour les consommations. Avec vos propres clés API, vous reliez votre compte chez le fournisseur et c'est à vous de maintenir les identifiants valides, de surveiller le crédit et les limites et d'évaluer les temps de réponse.
Que se passe-t-il si je laisse les paramètres avancés vides ?
Laisser les champs vides signifie utiliser les valeurs par défaut du modèle. C'est le choix conseillé tant que vous n'avez pas une raison précise d'intervenir : les paramètres avancés ne remplacent pas un prompt clair.
Configurons ensemble votre assistant vocal
Modèle, reconnaissance et voix : nous vous montrons comment les régler pour votre cas d'usage et comment les vérifier avec un appel d'essai.