Zum Inhalt springen
Beschreiben Sie einen Workflow. DRING ruft in zwei Minuten an und qualifiziert den Bedarf. Anruf in zwei Minuten erhalten
Anruf in 2 Minuten Agent Factory ansehen
Qualität

Getestet, bevor der erste Anruf kommt

Sie schreiben nie einen Prompt. Wir sammeln das Material, bauen daraus die Tests und geben nur frei, was besteht.

DRING Testsuite

Die Tests entstehen aus Ihrem eigenen Material

Prompts zu schreiben ist nicht Ihre Aufgabe. Sich die schwierigen Anrufe auszumalen, die Ihr Agent bekommen wird, auch nicht.

Sie schreiben nie einen Prompt

Ihr Team erklärt die Arbeit und prüft, was der Agent sagt. Den Prompt selbst schreiben und pflegen wir.

Tests aus dem, was wir sammeln

Dokumente, Aufzeichnungen, Richtlinien und Ihre Kommentare aus der Prüfung werden zum Testset für diesen Agenten.

Von DRING freigegeben, dann live

Ein Agent geht erst in den Produktivbetrieb, wenn er dieses Set besteht. Bis dahin bleibt er auf einer privaten Leitung.

1.000 bis 10.000 simulierte Gespräche, eigens für Ihr Unternehmen erstellt, vor dem ersten echten Anruf. Die Zahl der simulierten Gespräche hängt vom Agenten ab. Jedes einzelne wird aus Ihrem eigenen Workflow, Ihren Dokumenten und Gesprächsaufzeichnungen erzeugt, nicht aus einem allgemeinen Benchmark-Set.

Dieselbe Disziplin gilt für Änderungen. Jede Regel, die Sie uns geben, kommt in das eine Testset dieses Agenten, und eine neue Regel geht erst live, wenn alle bestehenden Regeln daneben weiterhin bestehen. So wird der Agent gebaut

Vor dem Start

Was passiert, bevor ein Agent live geht

Für jeden Agenten läuft dieselbe Pipeline, egal wie einfach der Anwendungsfall von außen wirkt.

  1. Personas aus Ihrem Alltag

    Verärgerte Anrufer, falsche Bestellungen, Richtlinienfallen, Stille und Unterbrechungen, abgeleitet aus Ihrem eigenen Workflow.

  2. Simulierte Gespräche

    Jede Persona führt ein vollständiges Gespräch mit dem Agenten, nicht nur eine einzelne vorgegebene Frage.

  3. Unabhängige Evaluierung

    Automatisierte Prüfinstanzen bewerten jedes Gespräch. Wo sie sich nicht einig sind, prüft ein Mensch den Anruf.

  4. Regressionstest

    Die Ergebnisse werden vor jedem Release mit der vorherigen Version verglichen. So kann eine Korrektur nicht unbemerkt etwas anderes beschädigen.

  5. Übergabewege geprüft

    Die Eskalation an einen Menschen wird ausdrücklich geprüft, nicht einfach vorausgesetzt.

  6. Stufenweiser Rollout

    Der Live-Verkehr steigt in kontrollierten Stufen. Die Werte werden bei jedem Schritt beobachtet, und das vorherige Release steht bereit.

Automatisierte Evaluierung kann abdriften oder eine Nuance übersehen. Unabhängige Prüfungen und die menschliche Kontrolle jeder Abweichung machen das Signal aussagekräftiger als ein einzelner Wert.

Nach dem Start

Die Qualitätskontrolle läuft weiter

Die Tests enden nicht mit dem Start. Live-Agenten durchlaufen eine regelmäßige Qualitätskontrolle, solange sie im Einsatz sind.

Jeder Anruf bewertet

Sobald ein Anruf endet, werden Lösung, Richtlinientreue und Antwortzeit bewertet, und die Stimmung wird als Label erfasst.

Regelmäßige Prüfläufe

Jeder Live-Agent wird planmäßig erneut gegen das vorherige Release getestet. So fällt eine stille Verschlechterung auf, bevor ein Kunde sie bemerkt.

Drift-Warnungen

Verlässt ein Wert seinen erwarteten Bereich, wird automatisch eine Warnung ausgelöst, ohne auf den nächsten Prüflauf zu warten.

Erkennungsfehler im Blick

Fehler der Spracherkennung werden nach Name, Ort und Produktbegriff erfasst und dann im Wörterbuch des Agenten korrigiert.

KennzahlDefinitionWarum sie zählt
LösungsquoteOb das Anliegen des Kunden tatsächlich bearbeitet wurde.Die zentrale Kennzahl dafür, ob der Agent seine Aufgabe erfüllt hat.
StimmungWie sich der Ton des Kunden vom Anfang bis zum Ende des Anrufs verändert hat.Erkennt Anrufe, die auf dem Papier gelöst waren, den Kunden aber frustriert haben.
RichtlinientreueOb die Aktionen des Agenten innerhalb der für ihn konfigurierten Regeln blieben.Hält den Agenten in den Grenzen, die das Unternehmen gesetzt hat.
AntwortzeitDie Pause zwischen dem Ende der Kundenäußerung und der Antwort des Agenten.Eine langsame Antwort wirkt wie eine schlechte Verbindung, selbst wenn sie inhaltlich stimmt.
Treffsicherheit der ÜbergabeOb der Agent an einen Menschen eskaliert hat, wenn er es sollte.Eine verpasste Eskalation ist schlimmer als eine unnötige.
RegressionsdeltaDie Veränderung des Werts gegenüber dem vorherigen Release auf demselben Testset.Erkennt ein Release, das den Agenten unbemerkt verschlechtert.
Outbound A/B

Der bessere Einstieg gewinnt nach Ergebnissen, nicht nach Meinungen

Welcher Einstiegssatz, welcher Ton oder welche Stimme funktioniert, entscheidet sich in echten Outbound-Anrufen, nicht in einer Besprechung.

Beispieltest · EinstiegsvariantenPhase 1 · gleichmäßiger Traffic
Variante A„Guten Tag, ich rufe vom Logistikteam wegen Ihrer Versandanfrage an.“
Traffic33 %
grüne Ergebnisse0 %
0 Anrufe
Variante B„Hallo, Sie hatten uns letzten Monat um ein Frachtangebot gebeten. Passt es gerade für zwei kurze Fragen?“
Traffic33 %
grüne Ergebnisse0 %
0 Anrufe
Variante C„Schönen guten Tag. Ein kurzer Anruf zum Thema internationale Versandtarife.“
Traffic34 %
grüne Ergebnisse0 %
0 Anrufe
Mindeststichprobe noch nicht erreicht. Traffic weiter aufteilen.

Was getestet wird

Der Einstiegssatz, der Ton, die Stimme, das Tempo, die Reihenfolge der Fragen, der Umgang mit einem Einwand. Eine Variable pro Variante, damit sich das Ergebnis eindeutig zuordnen lässt.

Wie der Gewinner bestimmt wird

Anhand des Kampagnenergebnisses selbst, mit einer vereinbarten Mindeststichprobe je Variante. Stimmung und Übergabequote dienen als Leitplanken: Eine Variante, die beim Ergebnis gewinnt, aber schlechter ankommt, geht nicht live.

Wie er live geht

Der Gewinner wird in kontrollierten Stufen ausgerollt, die anderen Varianten werden beendet, und die Änderung wird dokumentiert. So startet der nächste Vergleich von einer bekannten Basis.

Auch eine ausgerollte Variante muss das Regressionsset bestehen, bevor sie die ganze Kampagne erreicht.

Leitplanken

Was ein Agent niemals tut

  • Er lehnt ab, was außerhalb seines Umfangs liegtEine Anfrage außerhalb dessen, wofür der Agent gebaut wurde, wird abgelehnt, nicht mit Improvisation umschifft.
  • Er erfindet keine RichtlinienHat er keine Regel bekommen, rät er keine und macht keine Zusagen in Ihrem Namen.
  • Er eskaliert heikle ThemenHeikle Anliegen gehen an einen Menschen, statt nach eigenem Ermessen des Agenten bearbeitet zu werden.
  • Er bietet immer einen Menschen anDer Weg zu einem Menschen bleibt für den Anrufer offen, unabhängig davon, was der Agent selbst erledigen kann.
FAQ

Fragen zu den Tests

Müssen wir den Prompt schreiben oder pflegen?+

Nein. Sie erklären die Arbeit, teilen Dokumente und Aufzeichnungen und prüfen, was der Agent sagt. Den Prompt zu schreiben und zu pflegen ist unsere Aufgabe. Die Tests entstehen aus dem Material, das Sie uns gegeben haben, nicht aus einer allgemeinen Vorlage.

Wird vor jedem Release getestet, nicht nur vor dem Start?+

Ja. Regressionsläufe gegen das vorherige Release finden regelmäßig statt, und jede Änderung durchläuft denselben stufenweisen Rollout wie der erste Start.

Was passiert, wenn sich zwei Evaluierungen widersprechen?+

Das Gespräch geht an eine menschliche Prüfung und wird auditiert, bevor das Ergebnis feststeht. Wiederholte Widersprüche sind ein Signal, das Evaluierungsset selbst zu verfeinern.

Können wir die Testszenarien für unseren Agenten einsehen?+

Ja. Personas und Szenarien entstehen auf Basis Ihrer eigenen Richtlinien und Grenzfälle, und Sie können sie während des Onboardings einsehen.

Was passiert, wenn die Werte eines Live-Agenten abdriften?+

Eine Drift-Warnung wird automatisch ausgelöst, die betroffenen Anrufe werden geprüft, und die Korrektur durchläuft erneut das Testset, bevor der Agent diesen Anruftyp wieder übernimmt.

Alle FAQ anzeigen

Die Testsuite an Ihrem eigenen Anwendungsfall sehen

Gehen Sie mit uns durch, wie ein gemessener Start aussehen würde, vom ersten Workflow-Briefing bis zur Prüfschleife nach dem Livegang.