Skip to main content

Latensbenchmarks för voice AI: vad sub-second betyder

Alla leverantörer av voice AI marknadsför en latenssiffra. Vapi säger 500ms. Retell säger 800ms. Synthflow hänvisar till en Deepgram-blogg om 300ms STT.

Digvijay Singh Shekhawat
Digvijay Singh Shekhawat
July 26, 2026
4 min read
Ett tomt gyllene stoppur står under gröna och bärnstensfärgade vågiga bågar intill persikofärgade trappsteg i solljus

Alla leverantörer av voice AI marknadsför en latenssiffra. Vapi säger ~500ms. Retell säger ~800ms. Synthflow hänvisar till en Deepgram-blogg om ~300ms STT. Haken: ingen av de siffrorna beskriver vad den som ringer i andra änden faktiskt hör.

Vi lade sex veckor på att köra en öppen testrigg mot fem voice-plattformar i produktion — Retell, Vapi, Synthflow, Deepgram Voice Agent och Finn — över rutter i US-East, EU-West och Indien. Det här inlägget publicerar P50-/P90-/P99-siffrorna, en metodik du kan köra om själv, och de delar av pipelinen som leverantörer tyst utelämnar ur sina marknadsföringsdiagram.

Varför "latens" är fel siffra

När en leverantör marknadsför latency: 500ms menar de nästan alltid TTFB — tiden från att användaren slutar tala till första ljudbyten som TTS:en skickar ut. Det är en användbar teknisk siffra. Det är inte vad användaren upplever.

Det användaren upplever är fördröjningen i turtagningen: tystnaden mellan att hen slutar tala och att hen hör agenten tala. Den siffran innehåller:

  • Endpointing-fördröjning — hur länge VAD:en väntar innan den avgör att du är klar (typiskt 200–600ms av avsiktlig tystnad).
  • Nätverkets jitterbuffer på SIP-/WebRTC-benet (40–120ms).
  • Från TTS första byte till spelbar TTS — första chunken måste vara stor nog för en jittertålig uppspelning.
  • Återhämtning efter barge-in när användaren avbryter mitt i svaret.

En plattform som anger 500ms TTFB men använder 600ms endpointing ger en upplevd turtagningsfördröjning norr om 1.2s. En annan leverantör som marknadsför 800ms, men med aggressiv semantisk endpointing på 150ms, känns märkbart snabbare i samtalet. Marknadsföringssiffror och mänskligt upplevda siffror ligger inte på samma axel.

Tumregel från CX-forskningen: under 800ms upplevd turtagning känns som ett samtal. 800–1200ms känns som "AI, men uthärdligt". Över 1.2s börjar den som ringer prata i mun på agenten.

Anatomin hos en voice AI-förfrågan

Här är hela pipelinen för ett enda turtag, med den medianbudget vi mätte över de fem plattformarna 2026:

StegVad som händerMedian (ms)P90 (ms)
SIP-/WebRTC-ingressLjudramen når mediaservern2060
VAD + endpointingUpptäck slutet på användarens tal280520
STT-finaliseringTvinga fram slutgiltig deltranskribering90180
LLM TTFTFörsta token från modellen320780
Överlämning LLM → TTSMeningsgräns + strömstart40120
TTS första byteFörsta ljudchunken skickas ut180410
TTS → spelbarTillräcklig buffer för säker start60140
Jitterbuffer vid utgångUtjämning på operatörssidan50110
Totalt upplevtSlut på yttrandet → första ljudet hörs~1040~2320

De två steg som leverantörerna konkurrerar hårdast om — LLM TTFT och TTS första byte — utgör bara ~48 % av medianbudgeten. Endpointing och ackumulerad jitter äger svansen.

Benchmarktabellen för 2026 — uppmätt, inte marknadsförd

Alla siffror nedan är upplevd turtagningsfördröjning, uppringare i US-East → leverantörens standardregion, inspelat över 500 turtag per plattform med ett fast manus på 8 turtag för tidsbokning. Hårdvara: Mac mini M4, PSTN-bryggat via ett Twilio Programmable Voice-nummer, inspelningar analyserade med vårt öppna skript (länk i repot nedan). Fullständig metodik i nästa avsnitt.

PlattformMarknadsförtP50 uppmättP90 uppmättP99 uppmättÅterhämtning efter barge-in
Retell~800ms118017402680410ms
Vapi (standard)~500ms102016202510380ms
Vapi (egen STT/LLM)88014102240360ms
Synthflow~600ms124019803120520ms
Deepgram Voice Agent~300ms STT94014802390290ms
Finn82012901980240ms

Slutsatser som de flesta leverantörsbenchmarks begraver:

  1. Varje plattforms P90 är ungefär 1.5–2× dess P50. Om du bara tittar på medelvärden känns dina sämsta 10 % av samtalen som en helt annan produkt.
  2. P99 passerar alltid 2 sekunder. Det är i svanslatensen som användarna lägger på.
  3. Återhämtning efter barge-in — hur snabbt agenten tystnar när den avbryts — varierar med 2×. Den här enda siffran driver fler klagomål om "dåligt samtal" än TTFB.

Så reproducerar du siffrorna

Riggen är medvetet tråkig. Ingen proprietär lastgenerator, ingen syntetisk SIP — ett riktigt telefonnummer som ringer en riktig agent, med en tidsstämplingsrigg via mikrofonloopback.

Vanliga frågor

Vad betyder sub-second latens egentligen?
Det beror på vad som mäts. Modellens inferenstid, tid till första ljudet och mun-till-öra-latens är tre olika siffror, och bara den sista är den som uppringaren upplever.

Vilken latenssiffra ska jag hålla en leverantör till?
Mun-till-öra i ett riktigt samtal över en riktig operatör, mätt i svansen snarare än i medelvärdet. Ett bra medelvärde med dålig p95 betyder att ett samtal av tjugo är oanvändbart.

Varför blev latensen sämre i produktion än i testerna?
Oftast är det nätverksvägen. En demo över en lokal uppkoppling hoppar över operatörsbenet och regionshoppet som produktionssamtal betalar för.

Relaterat: Voice.ai vs voice AI: vad du faktiskt behöver

Digvijay Singh Shekhawat
Digvijay Singh Shekhawat

Grundare, Finn AI

Digvijay bygger Finn – lagret för röstorkestrering för företag som resonerar sig genom samtal, extraherar data och uppdaterar dina system i realtid. Skriver om röst-AI, go-to-market och vad som krävs för att leverera autonoma agenter i stor skala.