Kostenrechner für Voice AI
Wählen Sie eine Speech-to-Text-Engine, ein Sprachmodell, eine Stimme und einen Telefonieanbieter. Jeder Preis unten stammt aus dem veröffentlichten Pricing des jeweiligen Anbieters, mit dem Datum der Prüfung. Die Aufschlüsselung zeigt, welche Schicht Ihre Rechnung wirklich treibt — es ist selten die, die man vermutet.
Where the money goes
Rates in this estimate
- Deepgram Nova-3 (streaming)verified 2026-07-26
- Claude Haiku 4.5verified 2026-07-26
- Deepgram Aura-1verified 2026-07-26
- Twilio inbound (US local)verified 2026-07-26
So wird gerechnet
Vier Schichten, jede in einer anderen Einheit abgerechnet. Speech-to-Text und Telefonie sind bereits pro Minute. Das Sprachmodell wird pro Million Token berechnet und Text-to-Speech pro tausend Zeichen, beide brauchen also eine Umrechnung aus Minuten — und genau diese zwei Umrechnungen sind der Punkt, an dem die meisten Kostenschätzungen für Voice danebengehen.
Zwei der vier Ebenen werden bereits pro Minute abgerechnet. Die anderen beiden nicht, und genau bei deren Umrechnung gehen Kostenschätzungen für Voice meistens schief:
spokenWords/min = wordsPerMinute × agentTalkShare chars/min = spokenWords/min × charactersPerWord outTokens/min = spokenWords/min × tokensPerWord sttCost = sttRatePerMinute (full connected minute) llmInputCost = inputTokensPerMinute × rateIn / 1e6 llmOutputCost = outTokens/min × rateOut / 1e6 ttsCost = (chars/min / 1000) × ratePer1kChars telephonyCost = telephonyRatePerMinute (full connected minute) total/min = stt + llmInput + llmOutput + tts + telephony + platform
Speech-to-Text und Telefonie rechnen die gesamte verbundene Minute ab — der Agent zahlt fürs Zuhören genauso wie fürs Sprechen. Text-to-Speech und generierte Tokens fallen nur an, während der Agent spricht, was bei einem Sprechanteil von 50% etwa 75 Wörtern pro Minute entspricht.
Rechenbeispiel
Ein schlanker Stack — Deepgram Nova-3 für die Transkription, Claude Haiku 4.5, Aura-1 für die Stimme, eingehend über Twilio — kommt auf rund $0,024 pro verbundener Minute: etwa 7 Cent für ein dreiminütiges Gespräch oder $240 im Monat bei 10.000 Minuten. Die Aufteilung: Telefonie 35%, Text-to-Speech 26%, Speech-to-Text 20%, Prompt-Tokens 17% und generierte Tokens gerade einmal 2%.
Mit einem Frontier-Modell und einer Premium-Stimme kostet dasselbe Gespräch rund $0,062 pro Minute — und das Verhältnis kehrt sich um. Prompt-Tokens werden mit 32% zum größten Posten, Text-to-Speech 33%, Telefonie fällt auf 23%. Welche Ebene sich zu optimieren lohnt, hängt vollständig vom tatsächlich eingesetzten Stack ab — deshalb zeigt dieses Tool die Aufteilung und nicht nur eine Summe.
Warum Prompt-Tokens dominieren und generierte Tokens nicht
Das kontraintuitive Ergebnis in jeder der obigen Konfigurationen: Die Tokens, die der Agent erzeugt, sind praktisch gratis, während die Tokens, die er liest, echtes Geld kosten. Eine Minute Agentensprache sind etwa 100 Output-Tokens. Der System-Prompt, die Tool-Definitionen und das gesamte bisherige Gespräch werden bei jedem Turn erneut mitgeschickt, also Tausende Input-Tokens pro Minute. Dieses Verhältnis ist der Grund, warum Prompt-Caching die Rechnung weit stärker bewegt als der Wechsel auf ein günstigeres Modell — und warum ein langer System-Prompt ein laufender Kostenposten ist und kein einmaliger.
Was hier nicht enthalten ist
Miete für Rufnummern, Aufzeichnung und Speicherung, Observability sowie die Engineering-Zeit, um einen Stack aus vier Anbietern aufzubauen und am Laufen zu halten. Eine Managed Platform bündelt das in einem Minutenpreis — tragen Sie ihn als Plattformgebühr ein, um Gleiches mit Gleichem zu vergleichen. Die Preise hier sind veröffentlichte Pay-as-you-go-Preise; Volumen- und Commitment-Verträge verschieben sie, in der Regel nach unten.
Die Preise werden ausschließlich in US-Dollar angezeigt, weil alle hier modellierten Anbieter in Dollar veröffentlichen. Eine Umrechnung hieße, einen Wechselkurs zu erfinden und ihn als Kostenwert auszugeben.
Last reviewed July 2026.
Häufige Fragen
- Was kostet ein Voice-AI-Agent pro Minute?
- Zu veröffentlichten Preisen kommt ein schlanker Stack — Deepgram Nova-3, Claude Haiku 4.5, Aura-1 und eingehendes Twilio — auf rund $0.024 pro verbundener Minute, also etwa 7 Cent für einen dreiminütigen Anruf. Ein Premium-Stack mit einem Frontier-Modell und einer hochwertigen Stimme liegt eher bei $0.062 pro Minute. Telefonie und Text-to-Speech kosten in einem schlanken Stack meist mehr als das Sprachmodell, was die meisten überrascht.
- Welche Schicht kostet am meisten?
- Das hängt vom Stack ab, und genau darum geht es in der Aufschlüsselung. In einer günstigen Konfiguration ist Telefonie oft der größte Einzelposten — rund 12% — während die generierten Token des Sprachmodells kaum 2% ausmachen. Wechseln Sie zu einem Frontier-Modell und einer Premium-Stimme, kippt das Verhältnis: Prompt-Token des LLM und TTS nehmen dann je etwa ein Drittel ein. Die Schicht zu optimieren, die schon bei 2% Ihrer Rechnung liegt, ist vergeudete Mühe.
- Warum sind Prompt-Token so viel teurer als generierte Token?
- Weil der System-Prompt, die Tool-Definitionen und die gesamte bisherige Konversation bei jedem einzelnen Turn erneut gesendet werden, während der Agent nur die Wörter erzeugt, die er tatsächlich spricht. Eine Minute Sprache entspricht etwa 75 vom Agenten gesprochenen Wörtern — grob 100 Output-Token — gegenüber Tausenden Input-Token pro Minute. Prompt Caching ist hier der entscheidende Hebel, nicht die Wahl eines günstigeren Modells.
- Welche Annahmen liegen dem zugrunde?
- Dass Sprache mit etwa 150 Wörtern pro Minute läuft, der Agent die Hälfte des Anrufs spricht, ein Wort rund 5,5 Zeichen und 1,35 Token umfasst und pro Gesprächsminute etwa 4.000 Prompt-Token gesendet werden. Alle fünf sind unter „Umrechnungsannahmen" editierbar — der Wert für Prompt-Token ist der, den zu ersetzen sich am meisten lohnt, durch eine Messung aus Ihrem eigenen Traffic.
- Warum sind die Preise nur in Dollar? One flag: §§19§§ source say "around 35%" — me typo'd 12%. Correct line: §§19§§ ... ist Telefonie oft der größte Einzelposten — rund 35% — ...
- Weil jeder hier modellierte Anbieter in US-Dollar veröffentlicht. Eine Umrechnung in eine andere Währung würde bedeuten, einen Wechselkurs zu erfinden und ihn als Kosten auszuweisen – und das ist schlimmer, als Dollar zu zeigen und Sie mit einem Kurs umrechnen zu lassen, dem Sie vertrauen.
- Sind das die Preise, die ich tatsächlich zahlen werde?
- Es sind die veröffentlichten Pay-as-you-go-Preise, geprüft zu dem Datum, das neben jedem einzelnen steht. Volumenzusagen, Enterprise-Verträge und Jahrespläne verschieben sie alle, meist nach unten. Preise, die als Second-hand gekennzeichnet sind, stammen aus Berichten Dritter statt von der Preisseite des Anbieters selbst – prüfen Sie diese nach, bevor Sie eine Kaufentscheidung treffen.
- Ist die Plattform, auf der der Agent läuft, darin enthalten?
- Nur wenn Sie eine hinzufügen. Die vier Komponentenebenen sind das, was ein zusammengesetzter Stack an reiner Infrastruktur kostet. Managed Platforms bündeln Orchestrierung, Telefonie, Monitoring und Support in einem einzigen Minutenpreis – tragen Sie diesen als Plattformgebühr ein, um Gleiches mit Gleichem zu vergleichen, und denken Sie daran, dass ein selbst zusammengesetzter Stack außerdem Engineering-Zeit verursacht, die dieses Modell nicht einpreist.
Put this calculator on your site
Free to embed on any site, commercial or not. No signup, no API key, nothing to break when we ship changes — the embed always runs the current version.
<iframe src="https://www.hirefinn.ai/embed/tools/voice-ai-cost-calculator" title="Kostenrechner für Voice AI" width="100%" height="1000" style="border:1px solid #E7DFD0;border-radius:12px;max-width:100%" loading="lazy"></iframe> <p style="font:14px/1.5 system-ui,sans-serif;margin:8px 0 0">Kostenrechner für Voice AI by <a href="https://www.hirefinn.ai/tools/voice-ai-cost-calculator">Finn</a></p>
The credit line sits outside the iframe on purpose: a link inside a frame belongs to the framed document and does nothing for the page hosting it. Keeping that line is the only thing we ask in return — remove it and the calculator still works.
Default frame height 1000px, responsive to full width.
Weiterführende Beiträge
Die Warteschlange zu besetzen ist eine Möglichkeit. Sie mit KI zu beantworten, eine andere.
Finn übernimmt eingehende und ausgehende Anrufe zu Minutenpreisen – ohne Shrinkage und ohne Occupancy-Grenze, die eingeplant werden muss. Buchen Sie eine Demo, und wir rechnen es an Ihrem eigenen Volumen durch.