Ogni articolo «Whisper vs Deepgram» che leggerai è scritto da qualcuno che vende uno dei due. Il confronto pubblicato da Deepgram apre con «oltre il 90 % di accuratezza in 300 ms». Vero, e fuori tema. Se stai collegando il riconoscimento vocale a un agente vocale in tempo reale che risponde alle telefonate, l'accuratezza su una clip di podcast pulita non è il numero che decide se il tuo agente sembra umano o sembra rotto.
In Finn costruiamo agenti vocali per contact center. Abbiamo portato in produzione entrambi i motori. Ecco la versione neutrale: quella fondata su audio telefonico a 8 kHz, un budget di latenza reale e il conto operativo che nessuno mette a preventivo.
La vera decisione: lo STT in streaming è un budget di latenza, non una classifica di accuratezza
Un agente vocale ha un vincolo rigido: la persona al telefono si aspetta una risposta più o meno nello stesso tempo in cui la darebbe un'altra persona — diciamo da 800 ms a 1,2 s dal momento in cui smette di parlare. Quel giro completo deve coprire la finalizzazione dello STT, l'inferenza dell'LLM, il primo byte del TTS e il trasporto di rete/SIP. Lo STT non prende tutto il budget. Ne prende forse 300 ms.
Quindi la domanda non è «quale motore ha il tasso di errore sulle parole più basso». È «quale motore mi dà trascrizioni utilizzabili abbastanza in fretta perché le altre tre fasi ci stiano ancora dentro». Un modello più accurato del 2 % ma che aggiunge 400 ms di latenza di finalizzazione è un motore peggiore per un agente vocale, punto. I benchmark di accuratezza in batch misurano l'asse sbagliato per questo lavoro.
Impostazione del benchmark: audio di qualità telefonica, WER e perché i punteggi su audio pulito mentono
La maggior parte dei numeri di WER pubblicati arriva da LibriSpeech o simili: parlato letto, 16 kHz, pulito da studio. Le telefonate sono l'opposto: banda stretta a 8 kHz (o G.711 μ-law), artefatti del codec, rumore di fondo, sovrapposizione di voci, accenti e chi biascica il proprio numero di conto.
Quando rilanci gli stessi modelli su audio telefonico, il divario si sposta:
- Whisper large-v3 su 16 kHz pulito: ~5-8 % di WER. Su telefonia rumorosa a 8 kHz: spesso 12-18 % di WER, e allucina testo fluente ma sbagliato su silenzio e rumore — una modalità di fallimento nota, pericolosa quando la trascrizione alimenta un LLM.
- Deepgram Nova-2/Nova-3, tarato per l'audio telefonico e lo streaming: 8-13 % di WER sullo stesso set telefonico, e degrada in modo più elegante — tende a perdere parole invece di inventarle.
La lezione: fai il benchmark sul tuo audio. Prendi 200 telefonate reali registrate, etichettale a mano e valuta entrambi i motori su quello. La classifica che otterrai non coinciderà con nessun blog di fornitore, incluso questo. Se porti via una cosa sola, porta via questa.
Latenza ed endpointing: primo token, finalizzazione e barge-in
Contano tre numeri di latenza, e solo uno compare nel marketing.
Latenza del primo token — quanto velocemente le trascrizioni parziali iniziano a tornare in streaming. Deepgram trasmette risultati intermedi in ~100-200 ms. Whisper è un modello batch; i wrapper di streaming della community (whisper-streaming, WhisperLive) spezzettano l'audio e ridecodificano, il che significa che i parziali arrivano in 500 ms-1 s o più e oscillano sotto carico.
Latenza di finalizzazione — quanto passa da quando chi chiama smette di parlare a quando ottieni una trascrizione finale stabile da passare all'LLM. È governata dall'endpointing (il rilevamento dell'attività vocale che decide che il turno è concluso). Deepgram offre endpointing regolabile (endpointing=300). Con Whisper ti innesti il tuo VAD (Silero, WebRTC VAD) e lo tari da solo: più controllo, più corda per impiccarti.
Barge-in — quando chi chiama interrompe l'agente a metà frase, devi rilevare il parlato e uccidere il TTS in ~100-200 ms, altrimenti l'agente gli parla sopra. È un problema di parziali in streaming più VAD. I motori con streaming nativo lo rendono facile; Whisper in batch lo trasforma in un progetto.
Tarare l'endpointing è la leva di latenza con il maggior rendimento di tutto lo stack: troppo aggressiva e tagli chi chiama a metà parola; troppo lasca e aggiungi 500 ms di silenzio a ogni turno. Vedi il nostro smontaggio dei motori vocali a bassa latenza per capire dove si colloca nella pipeline.
Whisper auto-ospitato: costo GPU, batching e il carico operativo che nessuno mette a preventivo
«Whisper è gratis» è la frase più costosa dell'IA vocale. I pesi del modello sono gratuiti. Farli girare in tempo reale alla concorrenza di un call center non lo è.
Numeri reali per un deployment auto-ospitato di faster-whisper (CTranslate2) large-v3:
- GPU: una A10G o una L4 regge all'incirca 8-15 flussi in tempo reale simultanei con large-v3 prima che la latenza degradi. A 100 chiamate simultanee servono ~8-12 GPU. Una A10G cloud on demand costa ~$1.00-1.30/hr; riservata scende. Metti in conto $7,000-10,000/month di GPU per reggere 100 flussi simultanei, prima della ridondanza.
- Compromesso del batching: il batching alza il throughput per GPU ma aggiunge latenza, esattamente ciò che stai proteggendo. La voce in tempo reale limita quanto puoi accorpare, quindi l'utilizzo della GPU resta basso (spesso 30-50 %), e sono soldi che bruciano.
- Carico operativo: caricamento del modello, pool caldi per evitare l'avvio a freddo, autoscaling su traffico in entrata a raffiche, taratura del VAD, filtraggio delle allucinazioni, manutenzione di driver GPU/CUDA e reperibilità 24/7 quando un nodo si inchioda a metà chiamata. Sono 0,5-1 FTE di ingegneria di piattaforma che non compaiono mai in un confronto al minuto.
Ammortizzato, Whisper auto-ospitato a 100 chiamate simultanee si assesta spesso su $0.006-0.012/min tutto compreso: competitivo sulla carta, ma solo dopo aver pagato l'ingegneria che lo rende affidabile. Sotto volumi seri, quasi mai ne vale la pena. La nostra pipeline ASR ibrida sotto i 120 ms approfondisce i conti tra batching e latenza.
Deepgram / API gestite: costo al minuto su scala e routing regionale
Lo STT gestito ribalta il compromesso: costo marginale più alto, operatività quasi nulla.
- Deepgram Nova in streaming è a listino intorno a $0.0077/min (Nova a consumo, streaming), con sconti a volume o a impegno che lo abbassano su scala.
- Niente GPU, niente pool caldi, niente CUDA. Ottieni autoscaling, endpointing e streaming a costo zero di fatica.
- Il routing regionale conta più del prezzo di listino. Se il tuo media termina a Mumbai e il tuo endpoint STT è in us-east, hai appena aggiunto 200-300 ms di andata e ritorno transatlantico a ogni parziale. I fornitori gestiti con endpoint regionali (o deployment enterprise auto-ospitati vicino al tuo piano media) lo cancellano. Per stack a doppio mercato USA-India questo è decisivo: vedi la nostra architettura di latenza transfrontaliera.
La lettura onesta: per la maggior parte dei team sotto le ~50 chiamate simultanee, il gestito vince sul costo totale non appena metti a prezzo l'ingegnere. Sopra quella soglia, i conti iniziano a favorire l'auto-hosting — se hai il team di piattaforma.
Come la scelta dello STT si ripercuote sulla latenza totale di andata e ritorno
Ecco un budget di turno rappresentativo per una chiamata in entrata, con obiettivo di risposta percepita < 1000ms:
| Fase | Gestito (Deepgram) | Whisper auto-ospitato (ingenuo) |
|---|---|---|
| Trasporto SIP/media | 80ms | 80ms |
| Finalizzazione STT (post-endpoint) | 250ms | 700ms |
| Primo token dell'LLM | 350ms | 350ms |
| Primo byte del TTS | 150ms | 150ms |
| Risposta percepita | ~830ms | ~1280ms |
Stesso LLM, stesso TTS. La sola scelta dello STT sposta l'esperienza di chi chiama al di là della linea del «sembra umano». Quei 450 ms sono la differenza tra un agente con cui la gente parla e uno a cui riattacca. La latenza dello STT non è una voce di costo: è un moltiplicatore su tutto ciò che sta a valle. Per questo la trattiamo come un budget, non come un benchmark. Altro sulla pipeline completa in oltre il wrapper.
Matrice decisionale: scegli in base a volume di chiamate, mix linguistico e SLA di latenza
- < 50 simultanee, prevalenza dell'inglese, SLA stretto → Gestito (Deepgram o equivalente). Non batti il costo corretto per lo sforzo, e streaming/endpointing è già risolto.
- Volume alto (100+ simultanee), traffico stabile, team di piattaforma in organico → Whisper auto-ospitato (faster-whisper) inizia a vincere sul costo marginale. Metti a budget l'FTE con onestà.
- Fortemente multilingue / code-switching → Testa entrambi sulle tue lingue. L'ampiezza multilingue di Whisper è forte ma il WER varia moltissimo da lingua a lingua; anche i motori gestiti variano. Non dare per scontato: misura. Vedi la tassa multilingue nascosta.
- Regolamentato / residenza dei dati (sanità, DLT indiano, UE) → Auto-ospitato o un deployment gestito regionale, scelto in base a dove il tuo media deve restare per legge.
- Sensibile alle allucinazioni (la trascrizione alimenta un LLM che ci agisce sopra) → Pesa l'allucinazione sul silenzio di Whisper contro il degrado elegante di Deepgram, e aggiungi guardrail comunque. Il nostro manuale per fermare le allucinazioni nell'IA vocale si applica direttamente.
In sintesi
Whisper vs Deepgram non è una gara di accuratezza: è una decisione di budget di latenza e carico operativo. Il gestito vince su sforzo e tempo di rilascio; Whisper auto-ospitato vince sul costo marginale solo su scala reale e solo con un team di piattaforma alle spalle. In ogni caso: fai il benchmark sul tuo audio telefonico, tara l'endpointing con decisione e contabilizza l'intero giro. La trascrizione è solo i primi 300 ms di una promessa di un secondo a chi chiama.
Domande frequenti
Whisper è più accurato di Deepgram nel 2025? Su audio pulito a 16 kHz, Whisper large-v3 è molto solido. Su telefonia rumorosa a 8 kHz — l'audio che un agente vocale sente davvero — il divario si restringe o si inverte, e l'allucinazione sul silenzio di Whisper è un rischio concreto. Fai il benchmark sulle tue telefonate registrate prima di decidere.
Quanto costa davvero auto-ospitare Whisper?
Non è gratis. A 100 flussi in tempo reale simultanei, aspettati 8-12 GPU ($7-10k/month) più 0,5-1 FTE di ingegneria di piattaforma. Tutto compreso si assesta intorno a $0.006-0.012/min: competitivo con il gestito solo su scala.
Whisper può fare streaming in tempo reale? Non nativamente: è un modello batch. I wrapper della community (WhisperLive, faster-whisper + VAD) aggiungono lo streaming, ma la latenza del primo token (500 ms-1 s o più) e le oscillazioni sono peggiori rispetto alle API con streaming nativo. Barge-in ed endpointing diventano un problema tuo da costruire.
Quale è meglio per un agente vocale di contact center? Per la maggior parte dei team sotto le ~50 chiamate simultanee, un'API gestita in streaming (Deepgram o equivalente) con endpointing tarato e un endpoint regionale. Sopra quella soglia, con un team di piattaforma, Whisper auto-ospitato inizia a vincere sul costo. A decidere dev'essere lo SLA, non il WER.
Costruisci un agente vocale che rispetta il budget di latenza
Finn consegna agenti vocali per contact center in produzione con STT, endpointing e routing regionale già tarati sul giro sotto il secondo — così salti i conti sulle GPU e il cercapersone alle 3 di notte. Scopri come Finn tiene gli agenti vocali sotto la linea di latenza →
Correlato: Deployment di agenti IA: far girare agenti vocali in modo affidabile
Correlato: Call tracking per agenti vocali IA: dall'attribuzione al fatturato




