Synthèse et reconnaissance vocale : les définitions.
La différence entre faire parler et faire entendre une machine, et les limites réelles de chacune sur une ligne téléphonique belge.
Ni l'une ni l'autre ne comprend quoi que ce soit. Elles transforment du son en texte, et l'inverse. Notre réceptionniste IA · +32 460 25 44 13
Elles vont dans deux sens opposés
La synthèse vocale — text-to-speech — transforme du texte en parole. C'est ce qui donne une voix à un système : on lui fournit une phrase écrite, il produit un son.
La reconnaissance vocale — speech-to-text — fait l'inverse : elle transforme de la parole en texte. C'est ce qui permet à un système de savoir ce que la personne a dit.
Ni l'une ni l'autre ne comprend. Ce sont des transformations ; l'interprétation de ce qui a été dit est le travail d'une autre couche, et c'est là que se joue la qualité d'une conversation.
Elles vont dans deux sens opposés.
La voix ne s'entend presque plus
Pendant longtemps, la synthèse vocale se reconnaissait immédiatement : débit plat, liaisons manquées, intonation absente. C'est ce qui a formé l'idée que « ça s'entend tout de suite ».
Ce n'est plus le cas, et il faut le dire aussi franchement que le reste : une voix de synthèse contemporaine passe souvent inaperçue sur une ligne téléphonique.
C'est précisément pour cela que l'annonce est obligatoire. Le règlement européen sur l'intelligence artificielle impose d'informer la personne qu'elle interagit avec un système d'IA, et nous le faisons dès la première phrase. Une voix indiscernable rend cette obligation plus nécessaire, pas moins.
Trois cas en Belgique
La reconnaissance vocale est la brique la plus fragile des deux, et ses points faibles sont identifiables.
Les noms propres et les adresses. Un patronyme peu courant, un nom de rue flamand prononcé en français, une commune à orthographe difficile : c'est le premier endroit où une transcription se trompe. C'est pourquoi un numéro de rappel se fait répéter chiffre par chiffre plutôt que de se deviner.
Le bruit. Un appel passé depuis un chantier, une salle de restaurant en service ou une voiture dégrade la reconnaissance bien plus que la qualité de la voix synthétique.
Le passage d'une langue à l'autre. Un appelant qui commence en français et glisse un mot néerlandais — ou l'inverse — est un cas courant en Belgique et difficile partout.
Pas la voix : ce qui se passe après.
Pas la voix, ce qui se passe après
Quand on évalue une offre, la qualité de la voix est le critère le plus visible et le moins informatif.
Ce qui décide de l'expérience, c'est ce qui arrive quand la reconnaissance se trompe. Un système qui redemande sèchement la même chose fait raccrocher. Un système qui reformule, propose une épellation, ou repart autrement garde l'appelant.
Et ce qui décide du résultat, c'est ce qui est produit à la fin : une fiche exploitable et un rendez-vous posé, ou une transcription approximative à relire.
La voix : vos questions
Quelle différence entre les deux ?
Est-ce que ça comprend ce que je dis ?
Est-ce qu'on entend que c'est une machine ?
Où la reconnaissance se trompe-t-elle le plus ?
Comment évite-t-on les erreurs sur les numéros ?
Où sont hébergées les données ?
À lire ensuite
La voix n'est pas le sujet. Ce qui suit l'erreur, si.
Notre réceptionniste IA · +32 460 25 44 13. Donnez-lui un nom de rue difficile, exprès.