Skip to main content

Calculateur de latence pour l'IA vocale

Réglez chaque étape du pipeline et voyez le délai que le correspondant vit réellement : de l'instant où il cesse de parler à celui où il entend une réponse. La décomposition sépare ce que contrôlent vos fournisseurs de ce que vous contrôlez — et le poste le plus lourd est presque toujours le second type.

Perceived response gap
1520ms

Callers will talk over the agent and assume the line dropped.

Target is 800ms or better. Natural human turn gaps sit near 200ms.

Where the time goes

Endpointing silenceyours to tune600ms 39%
How long the system waits to be sure the caller has finished. Yours to tune, and usually the biggest single item.
Speech to text150ms 10%
End of speech to a final transcript. Streaming engines have most of it already.
LLM first token400ms 26%
Time to first token. Prompt length and reasoning depth both push this up.
Text to speech150ms 10%
First token to first audio byte. Streaming TTS starts speaking before the sentence is complete.
Network round tripsyours to tune120ms 8%
Two hops at the round-trip time you entered. Region choice moves this more than anything else.
Telephony and jitter buffer100ms 7%
Carrier path and buffering. Largely fixed unless you change carrier or codec.

Fix this first

Endpointing silence is 39% of your budget at 600ms. The vendor pipeline — transcription, model and voice together — accounts for 920ms of the 1520ms total. Endpointing is a setting, not a vendor limit: dropping it is usually the cheapest win available, at the cost of occasionally cutting a caller off mid-pause.

Comment ce calcul est effectué

L'écart perçu est la somme de chaque étape entre la fin de la parole et le premier son : le silence que vous attendez avant de conclure que l'appelant a terminé, la finalisation de la transcription, le premier token du modèle, le premier octet de la voix, deux sauts réseau et le trajet téléphonique.

perceived gap = endpointing silence      ← your setting
              + STT finalisation
              + LLM time to first token
              + TTS time to first byte
              + network RTT × 2           ← your region choice
              + telephony / jitter buffer

Pourquoi ce n'est généralement pas le modèle

Dans une configuration classique, le seuil de silence de l'endpointing est le poste le plus important à lui seul — environ 600 ms sur un budget d'à peu près 1 500 ms, soit 40 % de tout ce que l'appelant attend. Ce n'est pas une limite imposée par le fournisseur. C'est un nombre dans votre configuration qui décide combien de temps le système écoute le silence avant de conclure que l'appelant a fini, et les équipes passent régulièrement des semaines à comparer des modèles pendant qu'il reste à une valeur par défaut que personne n'a choisie.

Le réduire est le gain le moins coûteux à disposition, et c'est un vrai compromis plutôt qu'un cadeau : coupez trop et vous interrompez quiconque marque une pause au milieu d'une phrase. Le choix de la région est l'autre levier entre vos mains — l'aller-retour réseau est compté deux fois, donc un déploiement inter-régions peut ajouter 400 ms avant qu'aucun fournisseur n'ait mal fait quoi que ce soit.

À quoi ressemble le bon niveau

Les intervalles naturels de tour de parole chez l'humain avoisinent 200 ms. En dessous de 500 ms, un agent paraît immédiat ; en dessous de 800 ms, cela se lit comme une pause normale. Au-delà d'environ 1,2 seconde, les appelants commencent à se répéter ou à parler par-dessus l'agent, parce que le silence se lit comme une ligne coupée et non comme une réflexion. Un modèle de raisonnement à 1,4 seconde jusqu'au premier token consomme le budget entier à lui seul — raison pour laquelle ces modèles ont leur place après l'appel, pour résumer et décider, plutôt que sur le tour en direct.

Les chiffres par étape présentés ici sont des plages typiques, publiées ou observées, et non des garanties. La latence réelle varie selon la région, la charge, la taille des données et les conditions réseau — mesurez la vôtre et servez-vous de ceci comme d'un budget de conception.

Last reviewed July 2026.

Questions fréquentes

Quelle est une bonne latence pour un agent vocal IA ?
En dessous de 800 ms, c'est confortable ; en dessous de 500 ms, c'est immédiat — les pauses naturelles entre tours de parole humains tournent autour de 200 ms. Au-delà d'environ 1,2 seconde, les appelants commencent à se répéter ou à parler par-dessus l'agent, car le silence se lit comme une ligne coupée plutôt que comme une réflexion.
Pourquoi mon agent vocal est-il lent alors que chaque fournisseur promet une latence faible ?
Parce que les chiffres des fournisseurs ne couvrent qu'une partie du budget. Dans une configuration classique, le seuil de silence de l'endpointing — le temps d'attente pour être sûr que l'appelant a cessé de parler — est le plus gros contributeur à lui seul, souvent 40% du total. C'est un réglage de votre côté, pas une limite du fournisseur, et aucun changement de modèle n'y remédiera.
Comment réduire la latence d'un agent vocal ?
Par ordre de rendement : raccourcir le seuil d'endpointing, déployer dans la même région que vos fournisseurs, raccourcir le prompt système, diffuser le texte en streaming vers la synthèse vocale plutôt que d'attendre une réponse complète, et seulement ensuite envisager un modèle plus rapide. Les deux premiers points sont gratuits et valent en général plus que tout le reste réuni.
Qu'est-ce que l'endpointing ?
Déterminer quand l'appelant a fini de parler. Attendez trop longtemps et chaque réponse paraît poussive ; coupez trop tôt et vous interrompez quiconque marque une pause en milieu de phrase. C'est un véritable arbitrage plutôt qu'un bug — mais un arbitrage que la plupart des équipes ne font jamais consciemment, laissant une valeur par défaut en place et accusant le modèle.
Un modèle de raisonnement a-t-il du sens pour la voix ?
Rarement sur le chemin critique. Un modèle qui met 1,4 seconde à produire son premier token consomme à lui seul tout le budget. Les modèles de raisonnement conviennent mieux après l'appel — résumer, extraire, décider des actions suivantes — pendant que le tour de parole en direct tourne sur quelque chose conçu pour le time to first token.

Put this calculator on your site

Free to embed on any site, commercial or not. No signup, no API key, nothing to break when we ship changes — the embed always runs the current version.

<iframe src="https://www.hirefinn.ai/embed/tools/voice-latency-calculator" title="Calculateur de latence pour l'IA vocale" width="100%" height="900" style="border:1px solid #E7DFD0;border-radius:12px;max-width:100%" loading="lazy"></iframe>
<p style="font:14px/1.5 system-ui,sans-serif;margin:8px 0 0">Calculateur de latence pour l'IA vocale by <a href="https://www.hirefinn.ai/tools/voice-latency-calculator">Finn</a></p>

The credit line sits outside the iframe on purpose: a link inside a frame belongs to the framed document and does nothing for the page hosting it. Keeping that line is the only thing we ask in return — remove it and the calculator still works.

Default frame height 900px, responsive to full width.