Skip to main content

Calculateur de coût de l'IA vocale

Choisissez un moteur de reconnaissance vocale, un modèle de langage, une voix et un opérateur télécom. Chaque tarif ci-dessous provient de la grille publiée par le fournisseur lui-même, avec la date de vérification. Le détail montre quelle couche pèse vraiment sur votre facture — rarement celle que l'on imagine.

Cost per minute
$0.0240
All layers combined
Cost per call
$0.072
At 3 minutes
Monthly
$240
10,000 minutes
Annual
$2,879
At the same volume

Where the money goes

Speech to text$0.00480 20.0%
Billed on the full connected minute
LLM — prompt tokens$0.00400 16.7%
4,000 tokens/min (system prompt, tools and history re-sent each turn)
LLM — generated tokens$0.00051 2.1%
101 tokens/min from 75 spoken words
Text to speech$0.00619 25.8%
413 characters/min
Telephony$0.00850 35.4%
Billed on the full connected minute

Rates in this estimate

Comment ce calcul est effectué

Quatre couches, facturées chacune dans une unité différente. La reconnaissance vocale et les télécoms sont déjà à la minute. Le modèle de langage est facturé au million de tokens et la synthèse vocale au millier de caractères : les deux exigent donc une conversion depuis les minutes — et ce sont ces deux conversions qui faussent la plupart des estimations de coût vocal.

Deux des quatre couches sont déjà facturées à la minute. Les deux autres ne le sont pas, et c'est en les convertissant que les estimations de coût vocal dérapent le plus souvent :

spokenWords/min = wordsPerMinute × agentTalkShare
chars/min       = spokenWords/min × charactersPerWord
outTokens/min   = spokenWords/min × tokensPerWord

sttCost         = sttRatePerMinute                       (full connected minute)
llmInputCost    = inputTokensPerMinute × rateIn  / 1e6
llmOutputCost   = outTokens/min        × rateOut / 1e6
ttsCost         = (chars/min / 1000)   × ratePer1kChars
telephonyCost   = telephonyRatePerMinute                 (full connected minute)

total/min       = stt + llmInput + llmOutput + tts + telephony + platform

La reconnaissance vocale et la téléphonie facturent la minute connectée entière — l'agent paie pour écouter autant que pour parler. La synthèse vocale et les tokens générés ne courent que pendant que l'agent parle, soit environ 75 mots par minute pour une part de parole de 50 %.

Exemple chiffré

Une stack légère — Deepgram Nova-3 pour la transcription, Claude Haiku 4.5, Aura-1 pour la voix, Twilio en entrant — revient à environ $0.024 par minute connectée : à peu près 7 cents pour un appel de trois minutes, ou $240 par mois pour 10 000 minutes. La répartition : téléphonie 35 %, synthèse vocale 26 %, reconnaissance vocale 20 %, tokens de prompt 17 %, et tokens générés seulement 2 %.

Passez à un modèle frontier et à une voix premium et le même appel revient à environ $0.062 par minute — et la structure s'inverse. Les tokens de prompt deviennent le premier poste à 32 %, la synthèse vocale 33 %, la téléphonie tombe à 23 %. Quelle couche mérite d'être optimisée dépend entièrement de la stack que vous exploitez réellement, d'où le fait que cet outil affiche la répartition plutôt qu'un simple total.

Pourquoi les tokens de prompt dominent et pas les tokens générés

Le résultat contre-intuitif dans chacune des configurations ci-dessus : les tokens que l'agent génère sont presque gratuits, tandis que ceux qu'il lit coûtent vraiment cher. Une minute de parole de l'agent représente environ 100 tokens de sortie. Le prompt système, les définitions d'outils et l'intégralité de la conversation jusqu'ici sont renvoyés à chaque tour, soit des milliers de tokens d'entrée par minute. C'est ce rapport qui explique que la mise en cache des prompts pèse bien plus sur la facture que le passage à un modèle moins cher — et qu'un prompt système long est un coût récurrent, pas ponctuel.

Ce qui n'est pas inclus

La location du numéro de téléphone, l'enregistrement et le stockage, l'observabilité, et le temps d'ingénierie nécessaire pour assembler une stack à quatre fournisseurs et la maintenir en marche. Une plateforme managée regroupe tout cela dans un tarif unique à la minute — saisissez-le comme frais de plateforme pour comparer ce qui est comparable. Les tarifs indiqués ici sont les prix pay-as-you-go publiés ; les accords de volume et d'engagement les font bouger, généralement à la baisse.

Les prix sont affichés uniquement en dollars américains, car tous les fournisseurs modélisés ici publient en dollars. Convertir reviendrait à inventer un taux de change et à le présenter comme un coût.

Last reviewed July 2026.

Questions fréquentes

Combien coûte un agent vocal IA à la minute ?
Aux tarifs publiés, une stack légère — Deepgram Nova-3, Claude Haiku 4.5, Aura-1 et Twilio en entrant — revient à environ $0.024 par minute connectée, soit à peu près 7 cents pour un appel de trois minutes. Une stack premium avec un modèle de pointe et une voix haut de gamme se rapproche de $0.062 par minute. Sur une stack légère, les télécoms et la synthèse vocale coûtent généralement plus cher que le modèle de langage, ce qui surprend la plupart des gens.
Quelle couche coûte le plus cher ?
Cela dépend de la stack, et c'est tout l'intérêt du détail. Sur une configuration économique, les télécoms constituent souvent le premier poste — autour de 35% — tandis que les tokens générés par le modèle de langage atteignent à peine 2%. Passez à un modèle de pointe et à une voix premium et l'équilibre s'inverse : les tokens de prompt du LLM et la synthèse vocale prennent chacun environ un tiers. Optimiser la couche qui représente déjà 2% de votre facture est un effort perdu.
Pourquoi les tokens de prompt coûtent-ils tellement plus cher que les tokens générés ?
Parce que le prompt système, les définitions d'outils et l'ensemble de la conversation en cours sont renvoyés à chaque tour, alors que l'agent ne génère que les mots qu'il prononce réellement. Une minute de parole représente environ 75 mots prononcés par l'agent — à peu près 100 tokens de sortie — contre des milliers de tokens d'entrée par minute. Le levier qui compte ici, c'est le prompt caching, pas le choix d'un modèle moins cher.
Sur quelles hypothèses ce calcul repose-t-il ?
Une parole à environ 150 mots par minute, un agent qui parle la moitié de l'appel, un mot valant à peu près 5.5 caractères et 1.35 tokens, et environ 4,000 tokens de prompt envoyés par minute de conversation. Les cinq sont modifiables sous « hypothèses de conversion » — le nombre de tokens de prompt est celui qu'il vaut le plus la peine de remplacer par une mesure issue de votre propre trafic.
Pourquoi les prix sont-ils uniquement en dollars ?
Parce que tous les fournisseurs modélisés ici publient leurs tarifs en dollars américains. Convertir dans une autre devise reviendrait à inventer un taux de change et à le présenter comme un coût, ce qui est pire que d'afficher des dollars et de vous laisser convertir avec un taux auquel vous faites confiance.
Sont-ce les tarifs que je paierai réellement ?
Ce sont les tarifs pay-as-you-go publiés, vérifiés à la date indiquée à côté de chacun d'eux. Les engagements de volume, les contrats entreprise et les plans annuels les font tous bouger, généralement à la baisse. Les tarifs signalés comme de seconde main proviennent de sources tierces plutôt que de la page de tarification du fournisseur — vérifiez-les avant toute décision d'achat.
Cela inclut-il la plateforme qui exécute l'agent ?
Seulement si vous en ajoutez une. Les quatre couches de composants représentent ce que coûte une stack assemblée en infrastructure brute. Les plateformes managées regroupent orchestration, téléphonie, supervision et support dans un seul tarif à la minute — saisissez-le comme frais de plateforme pour comparer ce qui est comparable, et rappelez-vous qu'une stack assemblée soi-même implique aussi du temps d'ingénierie que ce modèle ne chiffre pas.

Put this calculator on your site

Free to embed on any site, commercial or not. No signup, no API key, nothing to break when we ship changes — the embed always runs the current version.

<iframe src="https://www.hirefinn.ai/embed/tools/voice-ai-cost-calculator" title="Calculateur de coût de l'IA vocale" width="100%" height="1000" style="border:1px solid #E7DFD0;border-radius:12px;max-width:100%" loading="lazy"></iframe>
<p style="font:14px/1.5 system-ui,sans-serif;margin:8px 0 0">Calculateur de coût de l'IA vocale by <a href="https://www.hirefinn.ai/tools/voice-ai-cost-calculator">Finn</a></p>

The credit line sits outside the iframe on purpose: a link inside a frame belongs to the framed document and does nothing for the page hosting it. Keeping that line is the only thing we ask in return — remove it and the calculator still works.

Default frame height 1000px, responsive to full width.