La latenza VoIP è il ritardo tra il momento in cui qualcuno parla e quello in cui l'altra parte lo sente. La Raccomandazione ITU-T G.114 fissa il tetto per una conversazione normale a 150 millisecondi in un senso: oltre quella soglia, all'incirca, le persone iniziano a sovrapporsi.
Per un agente vocale basato su IA il budget è ancora più stretto, perché l'agente deve pensare al suo interno.
Dove finiscono i millisecondi
In una chiamata tra persone la latenza è trasporto: pacchettizzazione, transito di rete, jitter buffer, riproduzione. Un percorso VoIP gestito bene resta comodamente entro la G.114.
Un agente vocale inserisce uno stack di elaborazione tra i due tratti di trasporto lato umano:
- Acquisizione e codifica dell'audio del chiamante
- Riconoscimento vocale, che non può concludersi finché il chiamante non smette di parlare
- Endpointing — decidere che ha davvero smesso: è una scommessa e ha un costo
- Il modello che genera una risposta
- Sintesi vocale che produce l'audio
- Trasporto di ritorno verso il chiamante
Ogni passaggio è breve. La somma no. E le parti non si sommano come suggerisce un diagramma di architettura, perché una di esse domina in un modo che è facile non notare.
Il tempo al primo audio è il numero che conta
Il tempo totale di elaborazione è la metrica sbagliata. Ciò che il chiamante vive è il vuoto prima di sentire qualsiasi cosa.
Un agente che impiega 900ms a produrre una risposta completa ma inizia a parlare a 300ms sembra reattivo. Uno che impiega 600ms in tutto ma non dice nulla fino a 600ms sembra lento. Lo streaming cambia la latenza percepita molto più della velocità pura: per questo inseguire un modello più veloce spesso delude, mentre spezzettare la risposta in chunk aiuta subito.
È anche il motivo per cui l'endpointing sta sul percorso critico. Ogni millisecondo speso a decidere che il chiamante ha finito è un millisecondo prima che qualsiasi altra cosa possa partire. Un endpointing aggressivo taglia la latenza e interrompe le persone; uno conservativo è educato e lento.
Il budget nella pratica
Ragionando a ritroso a partire dalla sensazione di conversazione:
- Sotto ~800ms il bocca-orecchio suona naturale
- Tra 800ms e 1,2s si nota, ma è tollerabile
- Oltre ~1,2s i chiamanti iniziano a parlare sopra l'agente, e ogni collisione costa un turno di riparazione
A fronte di questo, il solo trasporto su una chiamata nazionale può richiedere 80–150ms andata e ritorno. L'internazionale aggiunge altro, e non è opzionale: la fisica impone un pavimento. Una pipeline che instrada l'audio verso una regione lontana consuma una fetta consistente del budget prima ancora che l'elaborazione inizi, ed è la ragione tipica per cui una demo istantanea in test risulta fiacca in produzione.
Il calcolatore di latenza vocale somma le fasi così puoi vedere quale sta davvero consumando il tuo budget, invece di dare per scontato che sia il modello.
Misurarla onestamente
Misura il bocca-orecchio su una chiamata reale attraverso un operatore reale. Il tempo di inferenza del modello isolato non è latenza: è un addendo della somma, e di solito non il maggiore.
Misura la coda, non la media. Una pipeline con media di 700ms e p95 di 2 secondi non è una pipeline da 700ms: una chiamata su venti è inutilizzabile, e sono proprio quelle che la gente ricorda.
Vedi anche latenza vocale per i singoli termini.
Domande frequenti
Qual è una latenza accettabile per il VoIP? La ITU-T G.114 raccomanda di mantenere il ritardo in un senso sotto i 150ms per una conversazione normale. Gli agenti vocali hanno bisogno di un budget più stretto perché l'elaborazione rientra nella stessa finestra.
Perché il mio agente vocale sembra lento se il modello è veloce? Di solito la causa è l'endpointing e il tempo al primo audio, non l'inferenza. Se l'agente aspetta di finire di generare prima di parlare, il chiamante sente l'intera pipeline invece dell'inizio di una frase.
Il jitter conta quanto la latenza? Conta in modo diverso. Il jitter viene assorbito da un buffer, e quel buffer aggiunge a sua volta ritardo: ridurre il jitter può quindi ridurre la latenza indirettamente.
500ms bastano? Per il bocca-orecchio, di solito sì. Sotto gli 800ms circa suona conversazionale; i problemi iniziano oltre 1,2 secondi circa.



