Skip to main content

Cartesia vs ElevenLabs pour les agents vocaux

Les deux sont très bons, et ils sont bons sur des choses différentes. Cartesia est notre moteur de synthèse vocale par défaut ; les voix ElevenLabs sont livrées dans la bibliothèque de voix. Voici à quoi ressemble réellement ce choix une fois que les appels sont réels, écrit par des gens qui utilisent les deux plutôt que par des gens qui lisent les deux changelogs.

Le compromis

Le compromis, dit simplement

ElevenLabs s'est fait une réputation sur le réalisme des voix et sur une très grande bibliothèque de voix multilingues, et cette réputation est méritée — pour la narration, le contenu et partout où un humain écoute un long passage ininterrompu, c'est exceptionnel.

Cartesia est conçu autour du streaming pour la conversation en temps réel, ce qui est un objectif d'optimisation différent. Un appel téléphonique ne cherche pas le meilleur rendu possible d'un paragraphe ; il veut que la première syllabe arrive avant que le silence ne devienne gênant, et que la synthèse s'arrête instantanément quand l'appelant interrompt.

C'est pourquoi Cartesia est notre choix par défaut et pourquoi la réponse n'est pas universelle. La bonne question n'est pas quel moteur est le meilleur, mais quelle défaillance vous préférez : une voix un peu moins remarquable, ou une pause un peu plus longue.

Latence

Ce qui compte sur un appel téléphonique

Trois choses, à peu près dans cet ordre, et une seule d'entre elles est ce sur quoi les démos sont jugées.

Délai avant le premier octet audio. Pas le temps de synthèse total. L'appelant entend le début de la phrase pendant que la fin est encore en cours de génération : le chiffre qui compte est donc le moment où l'audio démarre. Demandez-le en conditions de streaming et sur vos propres textes.

Comportement en cas d'interruption. Quand quelqu'un parle par-dessus l'agent, la synthèse doit s'arrêter — vraiment, pas après avoir terminé le segment en cours. Un agent qui continue de parler pendant une seconde et demie donne une pire impression qu'un agent à la voix un peu plus terne. Barge-in est une exigence, pas une fonctionnalité.

Comment le système gère votre vocabulaire. Chaque entreprise a des mots qui cassent le TTS — noms de famille, noms de médicaments, SKU, noms de rues, votre propre produit. Les deux moteurs peuvent être corrigés ; testez-les sur vos termes réels plutôt que sur un paragraphe de prose générique, car la défaillance sera spécifique à votre cas.

Qualité vocale

Là où l'appel téléphonique contraint les deux

À savoir avant de se torturer sur ce choix : le réseau téléphonique rééchantillonne l'audio à 8 kHz. Une bonne partie de ce qui sépare deux moteurs haut de gamme lors d'une écoute comparative sur un bon casque n'est tout simplement plus là quand le son arrive sur le combiné de l'appelant.

C'est la manière la plus courante pour une équipe de perdre quinze jours. Les différences sont réelles en studio et compressées sur une ligne téléphonique, alors que la latence et la gestion des interruptions ne sont pas compressées du tout — elles s'entendent exactement autant à 8 kHz. Passez plutôt ces quinze jours sur le budget de latence ; les gains y sont plus importants et ils survivent au codec.

Bien choisir

Questions fréquentes

Lequel est le plus rapide ?
Nous n'avons pas publié de benchmark contrôlé entre les deux et nous ne citerons pas un chiffre que nous n'avons pas mesuré nous-mêmes. Ce que nous pouvons dire relève de l'architecture : le temps jusqu'au premier octet audio compte bien plus que la durée totale de synthèse lors d'un appel téléphonique, car l'appelant entend le début de la phrase pendant que le reste est encore en cours de génération. Demandez à tout fournisseur le temps jusqu'au premier octet en streaming, et non un nombre de caractères par seconde, et testez-le sur vos propres textes — les chiffres des pages marketing sont rarement mesurés comme fonctionne un appel téléphonique.
Peut-on utiliser les deux ?
Oui, et il y a une bonne raison de le faire. Le choix du TTS se fait par agent et non par compte, donc une campagne sortante à fort volume et une ligne entrante vitrine n'ont pas à faire le même compromis. Cartesia est le choix par défaut ; les voix ElevenLabs sont disponibles dans la bibliothèque de voix.
La voix change-t-elle vraiment la conversion ?
Elle change la durée pendant laquelle les gens restent en ligne, ce qui conditionne tout le reste. Mais l'effet est plus faible que les équipes ne l'imaginent et il sature vite — au-delà d'un certain seuil de qualité, les appelants réagissent au fait que l'agent les a compris et a fait ce qu'il fallait, pas au timbre. La latence et la gestion des interruptions méritent en général plus d'attention que le choix de la voix, et elles sont moins coûteuses à corriger.

Aucun chiffre de benchmark ne figure sur cette page. Nous n'avons pas mené de comparaison contrôlée de latence ou de qualité entre ces deux moteurs, et citer un résultat que nous n'avons pas produit ruinerait la seule chose qui rend cette page utile à lire.

Écoutez les deux sur votre propre script

Apportez les mots que votre entreprise emploie vraiment — les noms de famille, les noms de produits, la rue. C'est là que les deux divergent.