Latenskalkylator för röst-AI
Ställ in varje steg i pipelinen och se den paus som den som ringer faktiskt upplever: från det ögonblick de slutar tala till det ögonblick de hör ett svar. Uppdelningen skiljer det dina leverantörer styr över från det du styr över – och den största posten är nästan alltid av det andra slaget.
Callers will talk over the agent and assume the line dropped.
Target is 800ms or better. Natural human turn gaps sit near 200ms.
Where the time goes
Fix this first
Endpointing silence is 39% of your budget at 600ms. The vendor pipeline — transcription, model and voice together — accounts for 920ms of the 1520ms total. Endpointing is a setting, not a vendor limit: dropping it is usually the cheapest win available, at the cost of occasionally cutting a caller off mid-pause.
Så räknas det ut
Den upplevda pausen är summan av varje steg mellan talets slut och första ljudet: tystnaden du väntar ut innan du avgör att den som ringer har talat färdigt, färdigställandet av transkriptionen, modellens första token, röstens första byte, två nätverkshopp och telefonivägen.
perceived gap = endpointing silence ← your setting
+ STT finalisation
+ LLM time to first token
+ TTS time to first byte
+ network RTT × 2 ← your region choice
+ telephony / jitter bufferVarför det oftast inte är modellen
I en typisk uppsättning är tystnadströskeln för endpointing den enskilt största posten – runt 600 ms av en budget på ungefär 1 500 ms, eller 40% av allt som den som ringer får vänta igenom. Det är ingen begränsning från leverantören. Det är en siffra i din konfiguration som avgör hur länge systemet lyssnar på tystnad innan det drar slutsatsen att den som ringer har talat färdigt, och team lägger rutinmässigt veckor på att benchmarka modeller medan den ligger kvar på ett standardvärde som ingen har valt.
Att korta ner den är den billigaste vinsten som finns att hämta, och det är en verklig avvägning snarare än gratis: kapa för mycket och du avbryter alla som pausar mitt i en mening. Regionvalet är den andra spaken du har i handen – nätverkets tur och retur räknas två gånger, så en driftsättning över regiongränser kan lägga på 400 ms innan någon leverantör har gjort något fel alls.
Så här ser bra ut
Naturliga pauser i mänskligt turtagande ligger nära 200 ms. Under 500 ms känns en agent omedelbar; under 800 ms uppfattas det som en normal paus. Efter ungefär 1,2 sekunder börjar de som ringer upprepa sig eller tala i mun på agenten, eftersom tystnaden läses som ett brutet samtal snarare än som eftertanke. En resonerande modell på 1,4 sekunder till första token gör av med hela budgeten på egen hand – och därför hör sådana hemma efter samtalet, för att sammanfatta och besluta, snarare än i den direkta turen.
Siffrorna per steg här är typiska publicerade eller observerade intervall, inte garantier. Verklig latens varierar med region, belastning, payload och nätverksförhållanden – mät dina egna och använd detta som en budget att konstruera mot.
Last reviewed July 2026.
Vanliga frågor
- Vad är en bra latens för en röst-AI-agent?
- Under 800ms känns bekvämt och under 500ms känns omedelbart — naturliga mänskliga turtagningspauser ligger runt 200ms. Efter ungefär 1.2 sekunder börjar de som ringer upprepa sig eller tala i mun på agenten, eftersom tystnaden läses som en bruten linje snarare än som eftertanke.
- Varför är min röstagent långsam när varje leverantör påstår sig ha låg latens?
- Därför att leverantörens siffror bara är en del av budgeten. I en typisk uppsättning är tystnadströskeln för endpointing — tiden du väntar för att vara säker på att den som ringer har slutat tala — den enskilt största bidragsgivaren, ofta 40% av totalen. Det är en inställning på din sida, inte en gräns hos leverantören, och hur mycket du än shoppar modeller löser det inte.
- Hur minskar jag latensen hos en röstagent?
- I ordning efter avkastning: korta ner endpointing-tröskeln, driftsätt i samma region som dina leverantörer, korta ner systemprompten, strömma text till tal istället för att vänta på ett komplett svar, och först därefter överväg en snabbare modell. De två första är gratis och är oftast värda mer än resten tillsammans.
- Vad är endpointing?
- Att avgöra när den som ringer har talat färdigt. Väntar du för länge känns varje svar trögt; klipper du för tidigt avbryter du alla som pausar mitt i en mening. Det är en verklig avvägning snarare än en bugg — men det är en avvägning de flesta team aldrig gör medvetet, utan låter en standardinställning stå kvar och skyller på modellen.
- Är en reasoning-modell rimlig för röst?
- Sällan på den kritiska vägen. En modell som tar 1.4 sekunder till första token spränger hela budgeten på egen hand. Reasoning-modeller passar bättre efter samtalet — sammanfatta, extrahera, besluta nästa steg — medan den direkta turen körs på något byggt för tid till första token.
Put this calculator on your site
Free to embed on any site, commercial or not. No signup, no API key, nothing to break when we ship changes — the embed always runs the current version.
<iframe src="https://www.hirefinn.ai/embed/tools/voice-latency-calculator" title="Latenskalkylator för röst-AI" width="100%" height="900" style="border:1px solid #E7DFD0;border-radius:12px;max-width:100%" loading="lazy"></iframe> <p style="font:14px/1.5 system-ui,sans-serif;margin:8px 0 0">Latenskalkylator för röst-AI by <a href="https://www.hirefinn.ai/tools/voice-latency-calculator">Finn</a></p>
The credit line sits outside the iframe on purpose: a link inside a frame belongs to the framed document and does nothing for the page hosting it. Keeping that line is the only thing we ask in return — remove it and the calculator still works.
Default frame height 900px, responsive to full width.
Relaterad läsning
Att bemanna kön är ett alternativ. Att svara i den med AI är ett annat.
Finn hanterar inkommande och utgående samtal till minutpris, utan shrinkage och utan något occupancy-tak att planera runt. Boka en demo så kör vi det mot din egen volym.