Skip to main content

Cartesia vs ElevenLabs para agentes de voz

Os dois são muito bons, e são bons em coisas diferentes. O Cartesia é nosso text-to-speech padrão; as vozes do ElevenLabs vêm na biblioteca de vozes. Isto é o que a escolha significa de fato quando as chamadas são reais, escrito por quem roda os dois e não por quem lê os changelogs dos dois.

O trade-off

A escolha, dita sem rodeios

O ElevenLabs construiu sua reputação com realismo de voz e uma biblioteca multilíngue de vozes muito grande, e essa reputação é merecida — para narração, conteúdo e qualquer lugar em que uma pessoa ouve um trecho longo e ininterrupto, ele é excepcional.

O Cartesia é construído em torno de streaming para conversa em tempo real, o que é um alvo de otimização diferente. Uma chamada telefônica não quer a melhor renderização possível de um parágrafo; quer que a primeira sílaba chegue antes que o silêncio fique constrangedor, e quer que a síntese pare na hora quando quem liga interrompe.

É por isso que o Cartesia é nosso padrão e por isso que a resposta não é universal. A pergunta certa não é qual motor é melhor, mas qual falha você prefere ter: uma voz um pouco menos notável, ou uma pausa um pouco mais longa.

Latência

O que importa em uma chamada telefônica

Três coisas, mais ou menos nesta ordem, e só uma delas é o que se avalia em uma demo.

Tempo até o primeiro byte de áudio. Não o tempo total de síntese. Quem liga ouve o começo da frase enquanto o fim ainda está sendo gerado, então o número que importa é quando o áudio começa. Peça esse dado em condições de streaming e com o seu próprio texto.

Comportamento em interrupções. Quando alguém fala por cima do agente, a síntese tem que parar — de verdade, e não depois de terminar o trecho atual. Um agente que continua falando por mais um segundo e meio soa pior do que um com uma voz um pouco menos interessante. Barge-in é um requisito, não um recurso.

Como lida com o seu vocabulário. Toda empresa tem palavras que quebram o TTS — sobrenomes, nomes de medicamentos, SKUs, nomes de ruas, o seu próprio produto. Os dois engines podem ser corrigidos; teste-os com os seus termos reais, e não com um parágrafo de texto genérico, porque a falha vai ser específica do seu caso.

Qualidade de voz

Onde a ligação telefônica limita os dois

Vale saber antes de sofrer com a escolha: a rede telefônica reamostra o áudio para 8 kHz. Boa parte do que separa dois motores premium numa escuta lado a lado com fones bons simplesmente não está mais lá quando o som chega ao aparelho de quem ligou.

Essa é a forma mais comum de as equipes desperdiçarem duas semanas. As diferenças são reais num estúdio e ficam comprimidas numa linha telefônica, enquanto a latência e o tratamento de interrupções não são comprimidos — são exatamente tão perceptíveis a 8 kHz. Gaste essas duas semanas no orçamento de latência em vez disso; os ganhos ali são maiores e sobrevivem ao codec.

Como escolher

Perguntas frequentes

Qual dos dois é mais rápido?
Não publicamos um benchmark controlado entre os dois e não vamos citar um que não executamos. O que podemos dizer é arquitetural: o tempo até o primeiro byte de áudio importa muito mais do que o tempo total de síntese em uma chamada telefônica, porque quem liga ouve o início da frase enquanto o resto ainda está sendo gerado. Peça a qualquer fornecedor o tempo até o primeiro byte em streaming, não caracteres por segundo, e teste com o seu próprio texto — números em páginas de marketing raramente são medidos do jeito que uma chamada telefônica funciona.
Podemos usar os dois?
Sim, e há um motivo sensato para isso. A escolha de TTS é por agente, e não por conta, então uma campanha outbound de alto volume e uma linha inbound principal não precisam fazer a mesma escolha. A Cartesia é o padrão; as vozes da ElevenLabs estão disponíveis na biblioteca de vozes.
A voz realmente muda a conversão?
Ela muda quanto tempo as pessoas ficam na chamada, o que está a montante de todo o resto. Mas o efeito é menor do que as equipes esperam e satura rápido — passado certo patamar de qualidade, quem liga responde a se o agente entendeu e fez o que precisava, não ao timbre. Latência e tratamento de interrupções geralmente merecem mais atenção do que a escolha da voz, e são mais baratos de corrigir.

Nenhum número de benchmark aparece nesta página. Não fizemos uma comparação controlada de latência ou qualidade entre esses dois motores, e citar uma que não fizemos destruiria a única coisa que torna esta página digna de leitura.

Ouça os dois com o seu próprio roteiro

Traga as palavras que a sua empresa realmente diz — os sobrenomes, os nomes de produto, a rua. É aí que os dois divergem.