Skip to main content

Acceptabel VoIP-latens för röstagenter

ITU-T G.114 sätter latensen för samtal till 150ms enkelriktat. En röstagent måste hinna tänka inom den budgeten. Här försvinner millisekunderna.

Digvijay Singh Shekhawat
Digvijay Singh Shekhawat
July 28, 2026
3 min read
Ett tidtagarur i mässing på en persikofärgad piedestal med en grön keramikring och svävande rosa sfärer

VoIP-latens är fördröjningen mellan att någon talar och att motparten hör det. ITU-T-rekommendationen G.114 sätter taket för ett normalt samtal vid 150 millisekunder enkelriktat — bortom ungefär det börjar folk prata i mun på varandra.

För en röstagent med AI är budgeten ännu snävare, eftersom agenten måste hinna tänka inom den.

Vart millisekunderna tar vägen

I ett samtal mellan människor är latens transport: paketering, nättransit, jitterbuffert och uppspelning. En välskött VoIP-väg håller sig med god marginal inom G.114.

En röstagent lägger in en bearbetningskedja mellan de två människornas transportled:

  • Fångst och kodning av den uppringandes ljud
  • Taligenkänning, som inte kan bli klar förrän den uppringande slutat tala
  • Endpointing — att avgöra att personen faktiskt har slutat, vilket är en gissning och kostar tid
  • Modellen som genererar ett svar
  • Talsyntes som producerar ljud
  • Transport tillbaka till den uppringande

Varje steg är litet. Summan är det inte. Och delarna adderas inte så som ett arkitekturdiagram antyder, eftersom ett av dem dominerar på ett sätt som är lätt att missa.

Tiden till första ljudet är siffran som räknas

Total bearbetningstid är fel mätvärde. Det den uppringande upplever är tystnaden innan hen hör något alls.

En agent som behöver 900ms för ett fullständigt svar men börjar tala efter 300ms känns responsiv. En som tar 600ms totalt men inte säger något förrän vid 600ms känns långsam. Streaming påverkar den upplevda latensen långt mer än ren hastighet, och därför blir jakten på en snabbare modell ofta en besvikelse medan det hjälper direkt att stycka upp svaret.

Det är också därför endpointing ligger på den kritiska vägen. Varje millisekund som går åt till att avgöra att den uppringande är klar är en millisekund innan något annat kan starta. Aggressiv endpointing sänker latensen och avbryter folk; försiktig endpointing är artig och långsam.

Budgeten i praktiken

Baklänges från känslan av ett samtal:

  • Under ~800ms upplevs mun-till-öra som naturligt
  • 800ms–1,2s märks men går att stå ut med
  • Bortom ~1,2s börjar de uppringande tala i mun på agenten, och varje krock kostar en reparationstur

Mot det kan enbart transporten i ett inrikessamtal ta 80–150ms tur och retur. Utlandssamtal lägger till mer, och det är inte valfritt — fysiken sätter ett golv. En pipeline som skickar ljudet till en avlägsen region gör av med en stor del av budgeten innan någon bearbetning ens börjat, vilket är den vanliga förklaringen till att en demo som kändes omedelbar i testet känns trög i produktion.

Latenskalkylatorn för röst summerar stegen så att du ser vilket som faktiskt gör av med din budget, i stället för att anta att det är modellen.

Att mäta ärligt

Mät mun-till-öra i ett riktigt samtal över en riktig operatör. Modellens inferenstid isolerat är inte latens; det är en term i summan, och sällan den största.

Mät svansen, inte medelvärdet. En pipeline med 700ms i snitt och p95 på 2 sekunder är ingen 700ms-pipeline — vart tjugonde samtal är oanvändbart, och det är just de samtalen folk minns.

Se även röstlatens för de enskilda begreppen.

Vanliga frågor

Vad är en acceptabel latens för VoIP? ITU-T G.114 rekommenderar att den enkelriktade fördröjningen hålls under 150ms för ett normalt samtal. Röstagenter behöver en snävare budget eftersom bearbetningen ryms i samma fönster.

Varför känns min röstagent långsam när modellen är snabb? Oftast handlar det om endpointing och tid till första ljudet snarare än inferens. Om agenten väntar på att bli klar med genereringen innan den talar hör den uppringande hela pipelinen i stället för början på en mening.

Spelar jitter lika stor roll som latens? Den spelar roll på ett annat sätt. Jitter absorberas av en buffert, och bufferten lägger själv till fördröjning — så mindre jitter kan indirekt sänka latensen.

Räcker 500ms? För mun-till-öra oftast ja. Under ungefär 800ms upplevs det som samtalsmässigt; problemen börjar efter drygt 1,2 sekunder.

Digvijay Singh Shekhawat
Digvijay Singh Shekhawat

Grundare, Finn AI

Digvijay bygger Finn – lagret för röstorkestrering för företag som resonerar sig genom samtal, extraherar data och uppdaterar dina system i realtid. Skriver om röst-AI, go-to-market och vad som krävs för att leverera autonoma agenter i stor skala.