Self-Hosted Voice AI: Technische Validierung und Integrationsentwurf
Status: Infrastruktur und lokale Inferenz sind dokumentiert. Orchestrierung, Kundenkontext und Writeback müssen noch als zusammenhängender Workflow nachgewiesen werden. Die Browser-Demo ist ein separater Aufbau.
Problem: Für einen Voice-Agenten müssen Inferenz, Gesprächssteuerung und Geschäftssysteme zuverlässig zusammenspielen.
Lösung: Dokumentierte lokale Inferenz und ein Entwurf für Orchestrierung, Kundenkontext und strukturierte Ergebnisse.
Geschäftswert: Der Aufbau macht technische Bausteine und offene Integrationsarbeit sichtbar. Ein Kundennutzen ist erst im vollständigen Workflow zu messen.
Rahmen: Technisches Projekt. Ein Kundeneinsatz braucht vereinbarte Abnahmekriterien und separat beauftragte Umsetzungsschritte auf Stundenbasis.
Separate Browser-Demo mit Pipecat WebRTC und Mistral-Sprachdiensten. Sie demonstriert nicht die vollständige Integration des im Entwurf beschriebenen selbst gehosteten GPU-Stacks. Separate browser demo using Pipecat WebRTC and Mistral speech services. It does not demonstrate the full self-hosted GPU integration described in the design.
Was dieses technische Projekt belegt
Dieses Projekt dokumentiert lokale Spracherkennung, Sprachmodell-Inferenz und Sprachausgabe sowie einen Entwurf zur Einbindung in einen Voice-Workflow. Abgeschlossen ist der Nachweis für Infrastruktur und lokale Inferenz. Die vollständige Orchestrierung, der Abruf von Kundenkontext und das Zurückschreiben in Geschäftssysteme bleiben gesondert nachzuweisende Integrationsschritte.
Diese Grenze ist für eine Aufwandsschätzung relevant. Ein erfolgreicher Komponenten-Benchmark belegt noch keinen verlässlichen Telefondienst, keine Kapazität für parallele Gespräche und keine vollständige Auslieferung beim Kunden.
Die dokumentierte Validierungsumgebung
Der dokumentierte Aufbau verwendete STACKIT in DE-Frankfurt, eine NVIDIA L40S für ASR und LLM, eine NVIDIA L4 für TTS und ein persistentes Modell-Volume mit 300 GB. Die lokale Inferenz war über OpenAI-kompatible Endpunkte erreichbar. Die dokumentierten Prüfungen umfassten Transkription, Antwortgenerierung, Audioerzeugung und den Zustand der Dienste.
Das Projekt berichtete 0,3 Sekunden kombinierte Latenz im warmen Inferenzpfad, einschließlich eines TTS-Streaming-Werts unter 200 ms. Diese Werte beziehen sich auf die Validierungsumgebung. Sie sind keine Zusage für die Antwortzeit eines Telefongesprächs und belegen kein Verhalten bei Kaltstarts, Netzwerkverzögerungen, Unterbrechungen oder parallelen Anrufen. Ein Zieleinsatz braucht eigene Messungen der gesamten Antwortzeit und Lasttests.
Integrationsentwurf und offene Schritte
Der Entwurf verwendet Dograh zur Orchestrierung und getrennte Inferenzdienste, deren Endpunkte austauschbar bleiben. Folgende Schritte müssen noch als zusammenhängender Workflow nachgewiesen werden:
- Die Orchestrierung mit den lokalen Inferenz-Endpunkten verbinden und ein vollständiges Gespräch testen.
- Zulässigen Kundenkontext vor dem Gespräch abrufen, mit klaren Regeln für Quellen und Aktualität.
- Unterbrechungen, Dienstausfälle und Übergaben an eine Person behandeln.
- Die vorgesehenen Session-, Event-, Outcome-, Handoff- und Learning-Datensätze mit Geschäftssystemen verbinden.
- Berechtigungen, Wiederholungen, Dublettenbehandlung, Monitoring und Rollback vor einem Produktivstart prüfen.
Der Writeback-Vertrag beschreibt mögliche Gesprächsergebnisse: einen Ausgang, eine offene Frage, einen vorgeschlagenen Folgeschritt und den Kontext für eine menschliche Übergabe. Er ist ein Entwurfsartefakt. Er belegt nicht, dass bereits jeder Anruf CRM oder Support-Systeme aktualisiert.
Öffentliche Demo und Grenzen des Deployments
Die Browser-Demo verwendet Pipecat WebRTC und Mistral-Sprachdienste. Sie ist eine separate Demonstration neben dem lokalen GPU-Benchmark. Ihre Verfügbarkeit belegt weder die vollständige Integration des selbst gehosteten Workflows noch den Betrieb aller Komponenten innerhalb einer Region.
Für einen vorgesehenen Einsatz müssen Audio-Routing, Modell-Endpunkte, Logs, Backups und externe Dienste einzeln geprüft werden. Daraus folgt die Hosting-Wahl. Diese Fallbeschreibung belegt keine feste Migrationsdauer, universelle GPU-Konfiguration oder Anrufmenge, ab der Self-Hosting immer günstiger wäre.
Bezug zu meiner heutigen Kundenarbeit
Dieses Projekt ergänzt meine Erfahrung mit Inferenzintegration, Betriebsumgebungen und strukturierten Workflow-Ergebnissen. Mein aktuelles Angebot konzentriert sich auf Kontextschichten für KI-Agenten: aktuelle Fakten mit Quellen, Zugriffsrechten und autorisierten Aktionen, umgesetzt in vereinbarten Phasen und nach Stunden abgerechnet.
Als Nachweis aus der Kundenarbeit dient die Fallstudie zur operativen Kontextschicht. Die öffentliche Aufnahme stellt den Ablauf mit fiktiven Datensätzen nach.
Häufige Fragen
Ist der vollständige Voice-Workflow produktiv nachgewiesen?
Der dokumentierte Nachweis umfasst Infrastruktur und lokale Inferenz. Orchestrierung, Kundenkontext und Writeback müssen noch als vollständige Integration nachgewiesen werden.
Was bedeutet die Latenz von 0,3 Sekunden?
Sie ist der berichtete Wert des warmen Inferenzpfads im Validierungsaufbau. Sie ist keine Zusage zur Antwortzeit eines Telefongesprächs oder unter Last.
Verwendet die Browser-Demo denselben Stack?
Die Browser-Demo verwendet Pipecat WebRTC und Mistral-Sprachdienste. Sie ist vom dokumentierten lokalen GPU-Benchmark zu unterscheiden.
Stack Stack
- Dokumentierte Inferenz: NVIDIA L40S + L4 auf STACKIT
- Persistentes Modell-Volume: 300 GB
- Vorgesehene Orchestrierung: Dograh
- Entwurf: Kundenkontext, strukturierte Ergebnisse und Writeback
- Separate Browser-Demo: Pipecat WebRTC und Mistral-Sprachdienste
Ähnliches Projekt auf dem Tisch? Similar project on your desk?
Am schnellsten klärt das ein Gespräch. Termin direkt hier wählen: The fastest way to scope it is a conversation. Pick a slot right here:
Ihre Agenten antworten aus dem, was die Suche gerade findet, und oft ist das der Stand vom letzten Quartal. Ich baue die Kontextschicht, aus der sie antworten und handeln: einen temporalen Wissensgraphen, der jeden Fakt mit Quelle und Gültigkeitszeitraum hält, mit den Rechten der jeweiligen Person liest und nichts ohne Freigabe einer Person schreibt. Auf Ihrem eigenen Tenant, nach Stunden abgerechnet, Schritt für Schritt.