27 Anbieterprofile mit Quellenangaben

Finden Sie den KI-Sprachagenten für Ihren Anrufablauf.

Vergleichen Sie KI-Sprachagenten, Laufzeitumgebungen und Contact-Center-Plattformen anhand der Details, die eine Einführung beeinflussen: Telefonie, Latenz, Tools, Übergaben, Kontrollen und Abrechnungseinheiten.

27 aktuelle ProfileFür echte Anrufabläufe entwickeltRecherchestandards
01Mit der Aufgabe beginnenEingehend, ausgehend, Unterstützung oder Eigenentwicklung
02Anrufweg nachvollziehenAudio, Tools, Übergabe und Zustand
03Nutzung kalkulierenMinuten, Nutzerplätze, Telefonanbieter und Aufwand

Sprachtechnologie einordnen

Verzeichnis für KI-Sprachagenten

27 Anbieter · 12 angezeigt

Vorschau der Anbieterwebsite von Amazon Connect Customer AI with Nova Sonic

Amazon Connect Customer AI lässt für die Sprach-/Regionseinstellung eines Connect-Bots Nova Sonic Sprache-zu-Sprache wählen, während Connect Orchestrierung, Intents und Abläufe weiterhin steuert.

Contact-Center-KI und natives Sprache-zu-Sprache-Modell
Umfang und Hinweise

Am besten geeignet für: Amazon-Connect-Contact-Center, die native Sprache-zu-Sprache-Funktionen in bestehenden Sprach-/Regionseinstellungen von Bots und Ablaufwerkzeugen prüfen.

Sprachtechnologie: Konfigurierbare Connect-Pipeline mit nativer Nova-Sonic-Option

Telefonie: Amazon-Connect-Telefonie

SprachagentenLaufzeitumgebung für Sprach-APIsContact-Center-KI
Customer AI Voice 0,038 US-Dollar/Min. zuzüglich Telefonie und weiterer AWS-Dienste.
Profil ansehen
Vorschau der Anbieterwebsite von Bland AI

Plattform für Sprachagenten am Telefon und im Web mit per API erstellten Agenten, Gesprächspfaden, dynamischen Daten, Tools, Webhooks und Einstellungen für Unterbrechungen.

Plattform für Sprachagenten
Umfang und Hinweise

Am besten geeignet für: Entwicklungs- und Betriebsteams, die gebündelte eingehende und ausgehende Anrufe mit klaren Tarifstufen für Anrufvolumen, parallele Anrufe und Wissensdatenbanken benötigen.

Sprachtechnologie: Nicht öffentlich dokumentiert

Telefonie: Twilio, SIP, Genesys, Five9, NICE CXone, Amazon Connect, Talkdesk

SprachagentenAusgehende SprachanrufeLaufzeitumgebung für Sprach-APIs
Start 0,14 US-Dollar/Min.; Build 0,12 US-Dollar/Min. plus 299 US-Dollar/Monat; Scale 0,11 US-Dollar/Min. plus 499 US-Dollar/Monat.
Profil ansehen

Cognigy.AI

von Cognigy

Vorschau der Anbieterwebsite von Cognigy.AI

Plattform für Conversational AI mit Webchat, SIP Voice Gateway, Voice Copilot sowie REST-, Socket-, Webhook- und MCP-Endpunkten.

Enterprise-Plattform für Conversational AI
Umfang und Hinweise

Am besten geeignet für: Teams, die denselben Ablauf über Telefon, Web, API und eigene Endpunkte verfügbar machen möchten.

Sprachtechnologie: Kaskadierte Pipeline mit konfigurierbaren STT- und TTS-Anbietern

Telefonie: SIP, Contact-Center-Integrationen, Voice Gateway

SprachagentenContact-Center-KIBuilder für Gesprächsabläufe
Nicht öffentlich dokumentiert.
Profil ansehen
Vorschau der Anbieterwebsite von ConversationRelay

Programmable-Voice-Komponente, die eine TwiML-ConversationRelay-Sitzung über WebSocket mit einer Anwendung verbindet, um STT/TTS, Spracheinstellungen, DTMF und Anrufereignisse zu verarbeiten.

Telefonie-Laufzeit für Sprachagenten
Umfang und Hinweise

Am besten geeignet für: Entwickler, die eigene Sprachagentenlogik erstellen und Telefonie, Medienverarbeitung sowie Anrufsteuerung bei Twilio belassen möchten.

Sprachtechnologie: Kaskadierte Sprachschnittstelle mit vom Entwickler bereitgestelltem LLM

Telefonie: Twilio Programmable Voice, Telefonnummern, SIP

Laufzeitumgebung für Sprach-APIsSprachagenten
ConversationRelay 0,07 US-Dollar/Min.; lokale US-Anrufe ausgehend 0,014, eingehend 0,0085, SIP 0,004, Rufnummer 1,15 US-Dollar/Monat.
Profil ansehen
Vorschau der Anbieterwebsite von Copilot Studio Voice

Copilot Studio stellt Echtzeitagenten für Sprach- und Digitalkanäle bereit, wahlweise im nativen GPT-Realtime-Modus oder mit GPT-5-Chat in der Vorschauphase plus Neural TTS.

Enterprise-Agent-Builder und Contact-Center-KI
Umfang und Hinweise

Am besten geeignet für: Microsoft-Teams, die Copilot-Studio-Themen, Tools, Wissen, Übergaben und ausdrückliche Sprachkonfiguration über mehrere Kanäle benötigen.

Sprachtechnologie: Nativer GPT-Realtime-Modus oder kaskadierter GPT-5-Chat-Modus

Telefonie: Integrationswege für Dynamics 365 Contact Center und Azure

Builder für GesprächsabläufeSprachagentenContact-Center-KI
Dynamics Voice 95 US-Dollar/Nutzer/Monat, Contact Center 110, Premium 195, zuzüglich Azure/Copilot und Telefonie.
Profil ansehen

Decagon Voice

von Decagon

Vorschau der Anbieterwebsite von Decagon Voice

Sprachagent für den Kundenservice mit konfigurierbaren Stimmprofilen, ausgehenden Anrufen, Zusammenfassungen für die Übergabe an Menschen, Schutzmechanismen und Integrationen für Supportsysteme.

Enterprise-Plattform für Kundenservice-Agenten
Umfang und Hinweise

Am besten geeignet für: Supportteams, die Telefonautomatisierung mit CRM-, Helpdesk-, Wissensdatenbank- oder CPaaS-Systemen verbinden möchten.

Sprachtechnologie: Nicht öffentlich dokumentiert

Telefonie: Nicht öffentlich dokumentiert

SprachagentenContact-Center-KI
Nicht öffentlich dokumentiert.
Profil ansehen

ElevenLabs Agents

von ElevenLabs

Vorschau der Anbieterwebsite von ElevenLabs Agents

Auf Sprache ausgerichtete Agentenplattform mit visuellen Workflows, wählbaren eigenen Modellen, Bereitstellung für Telefon, Web und Mobilgeräte sowie integrierten Tests und Bewertungen.

Plattform für Sprachagenten und Sprach-API
Umfang und Hinweise

Am besten geeignet für: Teams, die eine verwaltete Stimmenbibliothek und Agenten-Workflows für Telefonie, Web und Mobilgeräte benötigen.

Sprachtechnologie: Kaskadierte STT-LLM-TTS-Pipeline mit ElevenLabs-Stimmen

Telefonie: Nicht öffentlich dokumentiert

Sprachagenten
Kostenlos 15 Min.; 6 US-Dollar/75 Min., 22/275, 99/1.238, 299/3.738, 990/12.375; Mehrnutzung 0,08 US-Dollar/Min., Lastspitzen 0,16; LLM/Telefonie zum Selbstkostenpreis.
Profil ansehen
Vorschau der Anbieterwebsite von Empathic Voice Interface

EVI ist eine Sprache-zu-Sprache-WebSocket-API, die Transkripte, Messwerte des stimmlichen Ausdrucks, Assistententext und Antwortaudio streamt.

API für ein natives ausdrucksstarkes Sprachmodell
Umfang und Hinweise

Am besten geeignet für: Entwickler, die gesprochene Interaktionen mit Berücksichtigung der Prosodie, konfigurierbaren Stimmen und optionalen ergänzenden LLMs prüfen.

Sprachtechnologie: Native Sprache-zu-Sprache-Verarbeitung mit Berücksichtigung der Prosodie

Telefonie: Nicht öffentlich dokumentiert

Laufzeitumgebung für Sprach-APIsSprachagenten
EVI 3: Pro 70 US-Dollar/Monat mit 1.200 Minuten und zusätzlich 0,06 US-Dollar/Min.; Scale 200 mit 5.000 und 0,05; Business 500 mit 12.500 und 0,04.
Profil ansehen

Gemini Live API

von Google

Vorschau der Anbieterwebsite von Gemini Live API

Die Gemini Live API von Google streamt multimodale Sitzungen über WebSockets; ihre stabilen nativen Sprachagentenmodelle sind Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking.

Native multimodale Echtzeit-Modell-API
Umfang und Hinweise

Am besten geeignet für: Entwickler, die latenzarme Konversationsagenten mit nativem Audio, multimodaler Eingabe und Funktionsaufrufen in einer persistenten WebSocket-Sitzung entwickeln.

Sprachtechnologie: Native Audioagenten: Gemini 3.8 Live (gemini-3.8-live) und Gemini 3.8 Live Extended Thinking (gemini-3.8-live-extended-thinking)., Separate TTS-Modelle: gemini-3.8-flash-tts und gemini-3.8-flash-lite-tts erzeugen Sprache; keines davon ist ein Live-Agent., Separate Transkriptionsendpunkte: gemini-3.5-transcribe verarbeitet Audiodateien; gemini-3.5-transcribe-live ist ein Speech-to-Text-Modus der Live API, kein Konversationsagent., Separater Übersetzungsmodus: gemini-3.5-live-translate-preview ist ein Dolmetschermodus der Live API für 70+ Sprachen, kein Konversationsagent; er befindet sich in der Vorschau.

Telefonie: Nicht öffentlich dokumentiert

Laufzeitumgebung für Sprach-APIsSprachagenten
Die Standardtarife für die Nutzung betragen $0,005/Min. als Gegenwert für Audioeingabe und $0,018/Min. für Audioausgabe; beides wird separat zuzüglich Texttokens abgerechnet. Google führt außerdem eine kostenlose API-Stufe auf.
Profil ansehen
Vorschau der Anbieterwebsite von Goodcall AI Phone Agent

KI-Telefonempfang mit Preis pro Agent und konfigurierbaren Fähigkeiten, Formularen, Logikabläufen, Verzeichniskontakten und Anrufweiterleitungen.

KI-Telefonempfang
Umfang und Hinweise

Am besten geeignet für: Kleine Unternehmen oder Unternehmen mit mehreren Standorten, die eine planbare Monatsrechnung nach eindeutigen Kunden statt nach Anrufminuten wünschen.

Sprachtechnologie: Nicht öffentlich dokumentiert

Telefonie: Nicht öffentlich dokumentiert

SprachagentenKI-Telefonempfang
79/129/249 US-Dollar pro Agent und Monat; Jahresvertragswerte 66/108/208 US-Dollar; der Anbieter nennt unbegrenzte Minuten und Token vorbehaltlich der Bedingungen.
Profil ansehen
Vorschau der Anbieterwebsite von Kore.ai AI for Service

Enterprise-Plattform für Gespräche, deren Oberfläche Talk to Bot es Teams ermöglicht, Sprach- oder Chataufgaben zu testen und Ausführungsprotokolle zu prüfen.

Enterprise-Plattform für Conversational AI
Umfang und Hinweise

Am besten geeignet für: Teams, die einen auf Aufgaben ausgerichteten Builder mit gezielten Tests für Erkennung, Synonyme und Ablauf-Debugging möchten.

Sprachtechnologie: Kaskadierte Sprachpipeline

Telefonie: Nicht öffentlich dokumentiert

SprachagentenContact-Center-KIBuilder für Gesprächsabläufe
Nicht öffentlich dokumentiert.
Profil ansehen

Mit dem Betriebsmodell beginnen

Sprachtechnologie erkunden

Alle Anwendungsfälle

Aussagekräftige Merkmale statt der Demo vergleichen

Bei der Auswahl eines Sprachsystems greifen viele Teile ineinander.

Zwei Agenten können gleich flüssig klingen und sich dennoch bei Telefonieabdeckung, Umgang mit Unterbrechungen, Tool-Berechtigungen und dem Kontext für Mitarbeitende nach einer Übergabe unterscheiden. Prüfen Sie diese Punkte getrennt.

Gesprächskanal

Telefon, Browser, SIP und Messaging bringen jeweils andere Anforderungen an Audio und Routing mit sich.

Laufzeitverhalten

Prüfen Sie Latenz, Dazwischenreden, Gesprächswechsel, Wiederholungsversuche und den Umgang mit unbekannten Anliegen.

Tool-Grenze

Verfolgen Sie jeden Lese- und Schreibvorgang einschließlich Identität, Berechtigung, Bestätigung und Fehlerbehandlung.

Nachweiskette

Halten Sie Aufzeichnungen, Transkripte, Traces, Aufbewahrungsregeln und Kostenannahmen im Pilotprotokoll fest.

Native Echtzeitverarbeitung

Mehr Gesprächssignale erhalten.

Native Audiomodelle vermeiden obligatorische Übergänge von Sprache zu Text und zurück. So bleiben mehr Informationen zu Tempo, Pausen, Betonung, Unterbrechungen und nonverbalen Signalen erhalten. Vergleichen Sie den gesamten Telefoniepfad einschließlich Anbieter, Tools und Übergabe mit denselben echten Anrufszenarien.

Architekturen vergleichen

Recherche geprüft am 4. September 2026

Vergleichen Sie Anbieter anhand der entscheidenden Details.

Jedes Profil enthält Primärquellen, aktuelle Preisangaben, Anrufkanäle, Spracharchitektur, Integrationen und praktische Fragen für ein Pilotprojekt.

Nach Team erkunden

Engere Auswahl passend zu Ihrer Arbeitsweise

Praxisnotizen

Hilfsmittel für das Kaufgespräch

Alle Notizen

Fundiert entscheiden

Machen Sie aus einem unübersichtlichen Markt eine gezielte engere Auswahl.

Speichern Sie die am besten geeigneten Optionen, vergleichen Sie sie direkt und testen Sie mit jedem Finalisten dieselben repräsentativen Anrufe.

Ihre engere Auswahl erstellen

Sprachunterstützung in echten Anrufen bewerten

Testen Sie Erkennung, Sprachqualität, Unterbrechungen, Sprachwechsel, Tool-Nutzung und menschliche Übergabe anhand eigener Anrufe in der benötigten Sprache. Die Verfügbarkeit kann je nach Modell, Tarif und Telefonroute variieren.

DocsBot dokumentiert mehrsprachige Sprachabläufe und Unterstützung für Japanisch. Prüfen Sie Stimme, Telefoniepfad und Übergabeverhalten in Ihrem Pilotprojekt genau. Sprachinformationen von DocsBot prüfen ↗

Sprachangaben anderer Anbieter beruhen auf zitierten Anbieterunterlagen. Bestätigen Sie Japanisch und andere benötigte Sprachen direkt bei jedem Anbieter.

Fragen von Käufern

Einen KI-Sprachagenten auswählen

Was ist ein KI-Sprachagent?

Ein KI-Sprachagent führt ein gesprochenes Live-Gespräch, nutzt freigegebenes Wissen, kann erlaubte Tools aufrufen und gegebenenfalls an eine Person übergeben. Das Spektrum reicht von fertigen Empfangslösungen über Enterprise-Contact-Center-Systeme und Orchestrierungs-APIs bis zu Echtzeit-Modelllaufzeiten auf niedriger Ebene.

Wie sollte ich einen KI-Sprachagenten auswählen?

Beginnen Sie mit einer Anrufaufgabe, den benötigten Systemen, erlaubten Aktionen und einem sicheren Ausweichweg zu einem Menschen. Testen Sie bei jedem Kandidaten dieselben realen Anrufszenarien und vergleichen Sie Aufgabenerledigung, Tool-Genauigkeit, Umgang mit Unterbrechungen, Übergaben, Betriebsaufwand und Gesamtkosten.

Was bedeutet native Sprache-zu-Sprache-Verarbeitung?

Ein natives Sprache-zu-Sprache- oder Echtzeit-Audiomodell nimmt Audio direkt entgegen und erzeugt es direkt. So bleiben mehr Informationen über Tonfall, Sprechtempo, Unterbrechungen und nonverbalen Kontext erhalten. Ein kaskadierter Stack verbindet Spracherkennung, ein textbasiertes Sprachmodell und Sprachsynthese und erlaubt mehr modulare Kontrolle.

Was sollte ich zuerst vergleichen?

Beginnen Sie mit der Anrufaufgabe, den nötigen Kanälen, Geschäftstools, dem Übergabeweg, Sicherheitskontrollen und den Gesamtkosten. Testen Sie anschließend mit jedem Finalisten dieselben repräsentativen Anrufe.

Ihr Unternehmen. Ihre engere Auswahl.

Finden Sie das passende KI-Sprachsystem.

Beginnen Sie mit Ihrer Website. Beantworten Sie einige gezielte Fragen und erhalten Sie ein persönliches PDF mit Eignung, Abwägungen, Alternativen und einem Pilotplan für Ihren Anrufablauf.

Datenschutzerklärung ↗

Verzeichnis für KI-Sprachagenten

Ihre persönliche Empfehlung

Anbieterrecherche → kurzes Interview → Ihr PDF.