Alla leverantörer av voice AI marknadsför en latenssiffra. Vapi säger ~500ms. Retell säger ~800ms. Synthflow hänvisar till en Deepgram-blogg om ~300ms STT. Haken: ingen av de siffrorna beskriver vad den som ringer i andra änden faktiskt hör.
Vi lade sex veckor på att köra en öppen testrigg mot fem voice-plattformar i produktion — Retell, Vapi, Synthflow, Deepgram Voice Agent och Finn — över rutter i US-East, EU-West och Indien. Det här inlägget publicerar P50-/P90-/P99-siffrorna, en metodik du kan köra om själv, och de delar av pipelinen som leverantörer tyst utelämnar ur sina marknadsföringsdiagram.
Varför "latens" är fel siffra
När en leverantör marknadsför latency: 500ms menar de nästan alltid TTFB — tiden från att användaren slutar tala till första ljudbyten som TTS:en skickar ut. Det är en användbar teknisk siffra. Det är inte vad användaren upplever.
Det användaren upplever är fördröjningen i turtagningen: tystnaden mellan att hen slutar tala och att hen hör agenten tala. Den siffran innehåller:
- Endpointing-fördröjning — hur länge VAD:en väntar innan den avgör att du är klar (typiskt 200–600ms av avsiktlig tystnad).
- Nätverkets jitterbuffer på SIP-/WebRTC-benet (40–120ms).
- Från TTS första byte till spelbar TTS — första chunken måste vara stor nog för en jittertålig uppspelning.
- Återhämtning efter barge-in när användaren avbryter mitt i svaret.
En plattform som anger 500ms TTFB men använder 600ms endpointing ger en upplevd turtagningsfördröjning norr om 1.2s. En annan leverantör som marknadsför 800ms, men med aggressiv semantisk endpointing på 150ms, känns märkbart snabbare i samtalet. Marknadsföringssiffror och mänskligt upplevda siffror ligger inte på samma axel.
Tumregel från CX-forskningen: under 800ms upplevd turtagning känns som ett samtal. 800–1200ms känns som "AI, men uthärdligt". Över 1.2s börjar den som ringer prata i mun på agenten.
Anatomin hos en voice AI-förfrågan
Här är hela pipelinen för ett enda turtag, med den medianbudget vi mätte över de fem plattformarna 2026:
| Steg | Vad som händer | Median (ms) | P90 (ms) |
|---|---|---|---|
| SIP-/WebRTC-ingress | Ljudramen når mediaservern | 20 | 60 |
| VAD + endpointing | Upptäck slutet på användarens tal | 280 | 520 |
| STT-finalisering | Tvinga fram slutgiltig deltranskribering | 90 | 180 |
| LLM TTFT | Första token från modellen | 320 | 780 |
| Överlämning LLM → TTS | Meningsgräns + strömstart | 40 | 120 |
| TTS första byte | Första ljudchunken skickas ut | 180 | 410 |
| TTS → spelbar | Tillräcklig buffer för säker start | 60 | 140 |
| Jitterbuffer vid utgång | Utjämning på operatörssidan | 50 | 110 |
| Totalt upplevt | Slut på yttrandet → första ljudet hörs | ~1040 | ~2320 |
De två steg som leverantörerna konkurrerar hårdast om — LLM TTFT och TTS första byte — utgör bara ~48 % av medianbudgeten. Endpointing och ackumulerad jitter äger svansen.
Benchmarktabellen för 2026 — uppmätt, inte marknadsförd
Alla siffror nedan är upplevd turtagningsfördröjning, uppringare i US-East → leverantörens standardregion, inspelat över 500 turtag per plattform med ett fast manus på 8 turtag för tidsbokning. Hårdvara: Mac mini M4, PSTN-bryggat via ett Twilio Programmable Voice-nummer, inspelningar analyserade med vårt öppna skript (länk i repot nedan). Fullständig metodik i nästa avsnitt.
| Plattform | Marknadsfört | P50 uppmätt | P90 uppmätt | P99 uppmätt | Återhämtning efter barge-in |
|---|---|---|---|---|---|
| Retell | ~800ms | 1180 | 1740 | 2680 | 410ms |
| Vapi (standard) | ~500ms | 1020 | 1620 | 2510 | 380ms |
| Vapi (egen STT/LLM) | — | 880 | 1410 | 2240 | 360ms |
| Synthflow | ~600ms | 1240 | 1980 | 3120 | 520ms |
| Deepgram Voice Agent | ~300ms STT | 940 | 1480 | 2390 | 290ms |
| Finn | — | 820 | 1290 | 1980 | 240ms |
Slutsatser som de flesta leverantörsbenchmarks begraver:
- Varje plattforms P90 är ungefär 1.5–2× dess P50. Om du bara tittar på medelvärden känns dina sämsta 10 % av samtalen som en helt annan produkt.
- P99 passerar alltid 2 sekunder. Det är i svanslatensen som användarna lägger på.
- Återhämtning efter barge-in — hur snabbt agenten tystnar när den avbryts — varierar med 2×. Den här enda siffran driver fler klagomål om "dåligt samtal" än TTFB.
Så reproducerar du siffrorna
Riggen är medvetet tråkig. Ingen proprietär lastgenerator, ingen syntetisk SIP — ett riktigt telefonnummer som ringer en riktig agent, med en tidsstämplingsrigg via mikrofonloopback.
Vanliga frågor
Vad betyder sub-second latens egentligen?
Det beror på vad som mäts. Modellens inferenstid, tid till första ljudet och mun-till-öra-latens är tre olika siffror, och bara den sista är den som uppringaren upplever.
Vilken latenssiffra ska jag hålla en leverantör till?
Mun-till-öra i ett riktigt samtal över en riktig operatör, mätt i svansen snarare än i medelvärdet. Ett bra medelvärde med dålig p95 betyder att ett samtal av tjugo är oanvändbart.
Varför blev latensen sämre i produktion än i testerna?
Oftast är det nätverksvägen. En demo över en lokal uppkoppling hoppar över operatörsbenet och regionshoppet som produktionssamtal betalar för.




