Skip to main content

Latenskalkylator för röst-AI

Ställ in varje steg i pipelinen och se den paus som den som ringer faktiskt upplever: från det ögonblick de slutar tala till det ögonblick de hör ett svar. Uppdelningen skiljer det dina leverantörer styr över från det du styr över – och den största posten är nästan alltid av det andra slaget.

Perceived response gap
1520ms

Callers will talk over the agent and assume the line dropped.

Target is 800ms or better. Natural human turn gaps sit near 200ms.

Where the time goes

Endpointing silenceyours to tune600ms 39%
How long the system waits to be sure the caller has finished. Yours to tune, and usually the biggest single item.
Speech to text150ms 10%
End of speech to a final transcript. Streaming engines have most of it already.
LLM first token400ms 26%
Time to first token. Prompt length and reasoning depth both push this up.
Text to speech150ms 10%
First token to first audio byte. Streaming TTS starts speaking before the sentence is complete.
Network round tripsyours to tune120ms 8%
Two hops at the round-trip time you entered. Region choice moves this more than anything else.
Telephony and jitter buffer100ms 7%
Carrier path and buffering. Largely fixed unless you change carrier or codec.

Fix this first

Endpointing silence is 39% of your budget at 600ms. The vendor pipeline — transcription, model and voice together — accounts for 920ms of the 1520ms total. Endpointing is a setting, not a vendor limit: dropping it is usually the cheapest win available, at the cost of occasionally cutting a caller off mid-pause.

Så räknas det ut

Den upplevda pausen är summan av varje steg mellan talets slut och första ljudet: tystnaden du väntar ut innan du avgör att den som ringer har talat färdigt, färdigställandet av transkriptionen, modellens första token, röstens första byte, två nätverkshopp och telefonivägen.

perceived gap = endpointing silence      ← your setting
              + STT finalisation
              + LLM time to first token
              + TTS time to first byte
              + network RTT × 2           ← your region choice
              + telephony / jitter buffer

Varför det oftast inte är modellen

I en typisk uppsättning är tystnadströskeln för endpointing den enskilt största posten – runt 600 ms av en budget på ungefär 1 500 ms, eller 40% av allt som den som ringer får vänta igenom. Det är ingen begränsning från leverantören. Det är en siffra i din konfiguration som avgör hur länge systemet lyssnar på tystnad innan det drar slutsatsen att den som ringer har talat färdigt, och team lägger rutinmässigt veckor på att benchmarka modeller medan den ligger kvar på ett standardvärde som ingen har valt.

Att korta ner den är den billigaste vinsten som finns att hämta, och det är en verklig avvägning snarare än gratis: kapa för mycket och du avbryter alla som pausar mitt i en mening. Regionvalet är den andra spaken du har i handen – nätverkets tur och retur räknas två gånger, så en driftsättning över regiongränser kan lägga på 400 ms innan någon leverantör har gjort något fel alls.

Så här ser bra ut

Naturliga pauser i mänskligt turtagande ligger nära 200 ms. Under 500 ms känns en agent omedelbar; under 800 ms uppfattas det som en normal paus. Efter ungefär 1,2 sekunder börjar de som ringer upprepa sig eller tala i mun på agenten, eftersom tystnaden läses som ett brutet samtal snarare än som eftertanke. En resonerande modell på 1,4 sekunder till första token gör av med hela budgeten på egen hand – och därför hör sådana hemma efter samtalet, för att sammanfatta och besluta, snarare än i den direkta turen.

Siffrorna per steg här är typiska publicerade eller observerade intervall, inte garantier. Verklig latens varierar med region, belastning, payload och nätverksförhållanden – mät dina egna och använd detta som en budget att konstruera mot.

Last reviewed July 2026.

Vanliga frågor

Vad är en bra latens för en röst-AI-agent?
Under 800ms känns bekvämt och under 500ms känns omedelbart — naturliga mänskliga turtagningspauser ligger runt 200ms. Efter ungefär 1.2 sekunder börjar de som ringer upprepa sig eller tala i mun på agenten, eftersom tystnaden läses som en bruten linje snarare än som eftertanke.
Varför är min röstagent långsam när varje leverantör påstår sig ha låg latens?
Därför att leverantörens siffror bara är en del av budgeten. I en typisk uppsättning är tystnadströskeln för endpointing — tiden du väntar för att vara säker på att den som ringer har slutat tala — den enskilt största bidragsgivaren, ofta 40% av totalen. Det är en inställning på din sida, inte en gräns hos leverantören, och hur mycket du än shoppar modeller löser det inte.
Hur minskar jag latensen hos en röstagent?
I ordning efter avkastning: korta ner endpointing-tröskeln, driftsätt i samma region som dina leverantörer, korta ner systemprompten, strömma text till tal istället för att vänta på ett komplett svar, och först därefter överväg en snabbare modell. De två första är gratis och är oftast värda mer än resten tillsammans.
Vad är endpointing?
Att avgöra när den som ringer har talat färdigt. Väntar du för länge känns varje svar trögt; klipper du för tidigt avbryter du alla som pausar mitt i en mening. Det är en verklig avvägning snarare än en bugg — men det är en avvägning de flesta team aldrig gör medvetet, utan låter en standardinställning stå kvar och skyller på modellen.
Är en reasoning-modell rimlig för röst?
Sällan på den kritiska vägen. En modell som tar 1.4 sekunder till första token spränger hela budgeten på egen hand. Reasoning-modeller passar bättre efter samtalet — sammanfatta, extrahera, besluta nästa steg — medan den direkta turen körs på något byggt för tid till första token.

Put this calculator on your site

Free to embed on any site, commercial or not. No signup, no API key, nothing to break when we ship changes — the embed always runs the current version.

<iframe src="https://www.hirefinn.ai/embed/tools/voice-latency-calculator" title="Latenskalkylator för röst-AI" width="100%" height="900" style="border:1px solid #E7DFD0;border-radius:12px;max-width:100%" loading="lazy"></iframe>
<p style="font:14px/1.5 system-ui,sans-serif;margin:8px 0 0">Latenskalkylator för röst-AI by <a href="https://www.hirefinn.ai/tools/voice-latency-calculator">Finn</a></p>

The credit line sits outside the iframe on purpose: a link inside a frame belongs to the framed document and does nothing for the page hosting it. Keeping that line is the only thing we ask in return — remove it and the calculator still works.

Default frame height 900px, responsive to full width.