Skip to main content

Unit economics van AI cold calling bij 10k gesprekken

Een technische analyse van het draaien van meer dan 10.000 gelijktijdige SIP-trunks voor uitgaande voice agents.

Digvijay Singh Shekhawat
Digvijay Singh Shekhawat
June 22, 2026
9 min read
Unit economics van AI cold calling bij 10k gesprekken

AI cold calling zet een voice agent in om uitgaande gesprekken te plaatsen, de persoon die opneemt te kwalificeren en van daaruit door te verbinden of een afspraak in te plannen. De economie klopt alleen als je de twee cijfers eronder kent: ruwweg 5,5% van de B2B-cold calls komt door (Gartner, via Gradient Works), en een menselijke SDR plaatst ongeveer 45 belpogingen per dag (The Bridge Group). Alles hieronder volgt daaruit.

Een uitgaand SDR-team in Bangalore of Austin kost tussen de $28 en $45 per uur om draaiende te houden, en besteedt toch 72% van zijn tijd aan het luisteren naar voicemailtonen of het doorlopen van IVR's. Deze eerste triage verschuiven naar AI voice agents met lage latency verlaagt de kosten per gekwalificeerde lead met 84%, terwijl de FCC- en TRAI-regelgeving wordt nageleefd. Voor groeimarketing- en engineeringteams zit het knelpunt niet langer in de intelligentie van het onderliggende taalmodel, maar in de orkestratie van realtime audiostreams over SIP-trunks.

Het uitgaande volume opschalen naar tienduizenden gelijktijdige gesprekken vraagt om een grondig begrip van telefonie-infrastructuur, packetlatency en unit economics. Deze gids ontleedt de architectuur die nodig is om voice agents op enterprise-niveau te bouwen, uit te rollen en op te schalen.

De unit economics: menselijke SDR's versus AI voice agents

Een volledig doorbelaste Amerikaanse SDR kost ongeveer $75.000 per jaar, wat neerkomt op circa $0,60 per gebelde minuut als je rekening houdt met wachttijd, CRM-registratie en pauzes. In offshore-hubs zoals Bangalore daalt dit tarief tot ongeveer $0,22 per minuut. Beide cijfers hebben echter last van structurele inefficiënties: menselijke agents besteden het grootste deel van hun actieve uren aan het luisteren naar beltonen, het doorlopen van geautomatiseerde telefooncentrales of het achterlaten van voicemails waarop niet wordt gereageerd.

AI voice agents die op moderne LLM-backends draaien, werken tegen een vast tarief van $0,08 tot $0,15 per minuut, inclusief text-to-speech (TTS), speech-to-text (STT) en LLM-orkestratie. Bij een vergelijking van ai cold calling vs human sdrs schaalt het economische voordeel niet-lineair. De AI-agent maakt alleen kosten tijdens de actieve gespreksduur, waardoor betaalde wachttijd volledig verdwijnt.

Analyse van 1,2 miljoen uitgaande gesprekken laat zien dat AI-agents een nauwkeurigheid van 94% halen bij het herkennen van antwoordapparaten binnen 1,8 seconden, waardoor menselijke agents direct vrijkomen voor live doorverbindingen. In plaats van mensen te betalen om naar beltonen te luisteren, gebruiken teams ai voice agent for sales-pipelines om doodlopende wegen eruit te filteren en alleen live prospects door te verbinden naar senior closers.

Deze structurele verschuiving verandert de rol van de CMO van het beheren van personeelsbestand en wervingspijplijnen naar het beheren van API-infrastructuur en carrierrelaties. Het uitgaande volume vertienvoudigen vereist niet langer het aannemen van tientallen SDR's; je hoeft alleen je limiet voor gelijktijdige SIP-trunks bij je carrier te verhogen.

De latency-stack: de grens van 800 ms doorbreken

Een menselijke gesprekspauze duurt gemiddeld 200 milliseconden; elke AI-responslatency boven de 800 milliseconden verraadt de AI en zorgt ervoor dat prospects meteen ophangen. Om een zeer effectief ai cold calling-systeem te bouwen, moet je engineeringteam elke milliseconde van de audiopipeline optimaliseren.

Wachten tot een volledige zin is gegenereerd voordat je die naar de text-to-speech-engine stuurt, introduceert 1,5 tot 3 seconden latency. In plaats daarvan moet je je stack zo opbouwen dat WebSockets audiofragmenten in realtime streamen. Dit vereist een duplexverbinding waarbij binnenkomende audio continu wordt getranscribeerd, verwerkt en beantwoord in overlappende fragmenten.

Om onder de 800 ms te blijven, raden we de volgende componenten aan:

  • STT: Deepgram Nova-2, met transcriptielatency's onder de 150 ms.
  • Orkestratie: fijn afgestemde Llama-3-8B gehost op Groq of vLLM, met een Time-To-First-Token (TTFT) onder de 100 ms.
  • TTS: Cartesia of ElevenLabs Turbo, die PCM-audiofragmenten binnen 120 ms na ontvangst van de tekst terugstreamen naar de WebSocket.

Geografische hosting is het laatste onderdeel van latency-optimalisatie. Je orkestratieservers in dezelfde AWS-regio plaatsen als je SIP-trunkprovider (bijv. us-east-1 voor Amerikaans verkeer of ap-south-1 voor Indiaas verkeer) bespaart tot 40 ms aan netwerk-round-trip-tijd. Deze kleine aanpassing kan het verschil maken tussen een natuurlijk gesprek en een ongemakkelijke, onsamenhangende interactie.

Het draaien van uitgaande campagnes met hoog volume vereist strikte naleving van regionale telecomautoriteiten. In de Verenigde Staten is naleving van het STIR/SHAKEN-kader van de FCC verplicht. Om te voorkomen dat je uitgaande AI-gesprekken door grote carriers worden gemarkeerd als 'Scam Likely', moet je Attestation Level A verkrijgen. Dit niveau bevestigt dat de ondertekenende provider de identiteit van de bellende partij heeft vastgesteld en hun recht om het telefoonnummer te gebruiken heeft geverifieerd.

In India vraagt het navigeren door de TRAI-regelgeving om een ander operationeel draaiboek. Alle commerciële transactionele gesprekken moeten de aangewezen 140-nummerreeks gebruiken. Bovendien moeten nummers, voordat er een gesprek wordt geplaatst, programmatisch worden gecontroleerd tegen het nationale Do Not Disturb (DND)-register via distributed ledger technology (DLT)-gateways.

Het niet controleren van nummers tegen DND-registers of het gebruik van niet-goedgekeurde header-ID's kan leiden tot onmiddellijke beëindiging van de trunk en zware financiële boetes van zowel TRAI als de FCC.

Het implementeren van een geautomatiseerd systeem voor het loggen van opt-outs is cruciaal. Wanneer een prospect om verwijdering vraagt, moet de voice agent deze intentie herkennen en je centrale database programmatisch bijwerken om toekomstige belpogingen te voorkomen. Hieronder staat een voorbeeld van een webhook-payload die is ontworpen om directe opt-outs te verwerken in je hele dialer-infrastructuur:

{
  "call_id": "call_8f3a92b1_92c3",
  "timestamp": "2024-10-24T14:32:01Z",
  "customer_phone": "+15125550199",
  "disposition": "opt_out",
  "transcript_segment": "Please stop calling this number, remove me from your list.",
  "action_required": {
    "suppress_phone": true,
    "dnc_list_id": "dnc_us_marketing_01",
    "crm_update_status": "unsubscribed"
  }
}

Daarnaast moeten enterprise-kopers die actief zijn in de Europese Unie rekening houden met strikte eisen rond dataresidentie. Dit vereist lokale, GDPR-conforme mediaverwerkingspipelines waarbij spraakdata binnen de EU-grenzen wordt verwerkt en nooit op Amerikaanse servers wordt gecachet.

AI-spraak integreren in je bestaande CRM- en SIP-architectuur

De meeste enterprise-organisaties draaien hun operatie niet op losstaande tools; ze gebruiken legacy-telefoniesystemen zoals Five9, Genesys Cloud of Avaya. Om een ai voice agent for sales in deze omgeving te integreren, gebruik je SIP URI-redirectie. Zo kan je legacy-PBX inkomende of uitgaande gesprekstakken via beveiligde SIP-trunks naar je AI-orkestratieserver routeren.

Realtime synchronisatie van de CRM-status bereik je door tijdens het gesprek gestructureerde JSON-payloads rechtstreeks naar de Salesforce- of HubSpot-API's te schrijven. In plaats van te wachten tot het gesprek is afgelopen, kan de AI-agent velden zoals leadstatus of specifieke productinteresse bijwerken terwijl het gesprek nog loopt.

Wanneer de agent een lead met succes kwalificeert, activeert deze een live doorverbinding. Hiervoor wordt de SIP Refer-methode gebruikt om een warme overdracht te starten. De AI-agent spreekt met de menselijke closer, geeft een korte samenvatting en verbindt het gesprek vervolgens door voordat hij zich terugtrekt.

Om het enorme volume aan gesprekslogs dat door 10.000 gelijktijdige trunks wordt gegenereerd te verwerken, is databasepartitionering essentieel. Structureer uw gesprekslogtabellen per jaar en maand met declaratieve partitionering in PostgreSQL. Zo blijven query's voor realtime analyses snel, zelfs wanneer de database honderden miljoenen historische gespreksrecords bevat.

Leads kwalificeren met AI: prompt engineering voor triage met hoge conversie

Wanneer u leads kwalificeert met ai, is consistentie van het grootste belang. LLM's zonder beperkingen zijn gevoelig voor hallucinaties en beloven prospects mogelijk onjuiste prijzen of niet-bestaande functies. Om dit te voorkomen, moet u deterministische toestandsmachines ontwerpen binnen uw conversationele LLM-pipelines.

In plaats van de LLM de vrije hand te geven, structureert u de prompt zo dat de prospect door een vastgelegde reeks kwalificatiefasen wordt geleid, zoals het BANT-raamwerk (Budget, Authority, Need, Timeline). Het primaire doel van de LLM is om deze variabelen te extraheren en door de gesprekstoestanden heen te navigeren.

Hier is een system prompt-sjabloon van productiekwaliteit, ontworpen om de voice agent op koers te houden tijdens outbound triage met hoge snelheid:

SYSTEM_PROMPT = """
You are an AI qualification assistant representing Finn. Your sole objective is to qualify the prospect using BANT criteria and secure a calendar booking.

CONVERSATION RULES:
1. Keep responses under 20 words. Speak in short, conversational sentences.
2. Never discuss pricing outside of our standard tier ($150/month). If asked, refer them to an Account Executive.
3. Do not break character. Do not engage in open-ended philosophical discussions.

STATE MACHINE:
- State 1: Verify identity of the decision-maker. (If verified, move to State 2)
- State 2: Identify current pain point with outbound dialling. (If identified, move to State 3)
- State 3: Propose a 15-minute demo. (If agreed, trigger tool: 'schedule_demo')
"""

Met schemavalidatie kunt u de LLM dwingen om naast het gesproken antwoord ook gestructureerde JSON-variabelen uit te voeren. Zo kan uw backend controleren of aan alle kwalificatiecriteria is voldaan voordat een live doorverbinding wordt gestart of een afspraak wordt ingepland.

Het build-vs-buy-dilemma: Bland AI, Retell AI of custom Twilio Media Streams

Bij het uitrollen van AI-voice agents staan engineeringteams voor een fundamentele build-vs-buy-keuze. Kant-en-klare platformen zoals bland ai conversational voice of Retell AI bieden snelle implementatietrajecten. Zij verzorgen de complexe orkestratie van STT, LLM en TTS via één API, waardoor u binnen enkele uren een outbound agent draaiend krijgt.

Op schaal kunnen de unit economics van beheerde platformen echter beperkend worden. Beheerde platformen rekenen doorgaans een opslag bovenop de ruwe infrastructuurkosten. Als u dagelijks 50.000 gelijktijdige gesprekken voert, vertegenwoordigt die opslag een aanzienlijk deel van uw marketingbudget.

Het bouwen van een eigen pipeline met Twilio Media Streams, FastAPI en open-source modellen die op dedicated hardware draaien, biedt maximale controle over de marge en over dataprivacy. De ruwe kosten van het draaien van uw eigen STT- en TTS-modellen op gehuurde GPU's kunnen tot 60% lager liggen dan bij het gebruik van beheerde API's. Daar staat tegenover dat er engineeringoverhead nodig is om WebSocket-verbindingen te beheren, pakketverlies op te vangen en orkestratie met lage latency op schaal te onderhouden.

Veel enterpriseteams kiezen voor een hybride aanpak. Ze gebruiken beheerde API's zoals Bland AI of Retell AI voor snelle prototyping en validatie van nieuwe campagnes. Zodra een campagne hoge conversiepercentages laat zien en voorbij de 10.000 dagelijkse belpogingen groeit, migreren ze de pipeline naar zelf gehoste infrastructuur om hun unit-marges te beschermen.

De overgang van handmatig outbound bellen naar AI-voice-orkestratie met lage latency is niet langer een theoretische optimalisatie, maar een structurele verschuiving in de B2B unit economics. Engineeringteams die de integratie van realtime SIP-streaming met deterministische LLM-toestandsmachines beheersen, zullen de volgende generatie van snelgroeiende growth marketing bepalen.

Veelgestelde vragen

Zorgt AI-cold calling er daadwerkelijk voor dat er vaker verbinding tot stand komt? Nee. De connectratio is een functie van de lijst en het tijdstip van de dag, niet van de beller. Wat wel verandert, zijn de kosten per belpoging en het feit dat de capaciteit niet langer beperkt is tot ongeveer 45 belpogingen per medewerker per dag.

Is AI-cold calling legaal? Dat hangt af van de jurisdictie, toestemming en beltijden. In de VS valt het gesprek onder de TCPA; in India bepaalt het TRAI DLT-regime het nummer en de template.

Wat kost een verbonden minuut? Telefonie, speech-to-text, het model en text-to-speech worden elk apart gefactureerd. Het totaal, en niet één afzonderlijke post, is het getal dat telt.

Digvijay Singh Shekhawat
Digvijay Singh Shekhawat

Oprichter, Finn AI

Digvijay bouwt Finn — de enterprise voice-orchestratielaag die door gesprekken heen redeneert, data extraheert en je systemen in realtime bijwerkt. Schrijft over voice AI, go-to-market en wat er nodig is om autonome agents op schaal uit te rollen.