Aucun prompt à écrire
Votre équipe explique le travail et relit ce que dit l'agent. Le prompt, nous l'écrivons et le maintenons nous-mêmes.
Laissez un workflow et votre numéro. L’IA se présente, pose quelques questions ciblées et prépare un brief structuré.
Vous n'écrivez jamais de prompt. Nous recueillons la matière, en tirons les tests et ne mettons en service que ce qui les réussit.
Écrire des prompts n'est pas votre métier. Imaginer les appels délicats que recevra votre agent non plus.
Votre équipe explique le travail et relit ce que dit l'agent. Le prompt, nous l'écrivons et le maintenons nous-mêmes.
Documents, enregistrements, règles et commentaires laissés pendant la relecture deviennent la batterie de tests de cet agent.
Un agent ne passe en production qu'après avoir franchi cette batterie. D'ici là, il reste sur une ligne privée.
De 1 000 à 10 000 conversations simulées, construites pour votre entreprise, avant le premier appel réel. Le nombre de conversations simulées dépend de l'agent, et chacune est générée à partir de votre parcours, de vos documents et de vos enregistrements d'appels, pas d'un jeu de tests générique.
La même rigueur s'applique à chaque modification. Chaque règle que vous nous donnez rejoint la batterie de tests unique de cet agent, et une nouvelle règle n'est mise en service que si toutes les règles existantes passent encore à ses côtés. Voir comment l'agent est construit
Le même processus s'applique à chaque agent, aussi simple que paraisse le cas d'usage vu de l'extérieur.
Appelants en colère, commandes erronées, pièges liés aux règles, silences et interruptions, tirés de votre propre parcours.
Chaque persona mène une conversation complète avec l'agent, pas une simple question scriptée.
Des évaluateurs automatiques notent chaque conversation. En cas de désaccord, une personne audite l'appel.
Les résultats sont comparés à la version précédente avant toute mise en service : une correction ne peut pas casser autre chose en silence.
Le transfert vers un conseiller est vérifié explicitement, pas supposé fonctionner.
Le trafic réel augmente par paliers maîtrisés, avec un suivi des scores à chaque étape et la version précédente prête à reprendre la main.
L'évaluation automatique peut dériver ou manquer une nuance. Des contrôles indépendants, complétés par une revue humaine de chaque désaccord, donnent un signal plus utile qu'un score unique.
Les tests ne s'arrêtent pas au lancement. Les agents en production passent par un contrôle qualité régulier, aussi longtemps qu'ils sont en service.
Dès la fin de l'appel, résolution, respect des règles et temps de réponse sont notés, et le ressenti client est étiqueté.
Chaque agent en production est rejoué face à la version précédente selon un calendrier défini, pour repérer une régression discrète avant qu'un client ne la remarque.
Un score qui sort de sa plage attendue déclenche une alerte de lui-même, sans attendre le contrôle suivant.
Les erreurs de reconnaissance vocale sont suivies par nom, lieu et terme produit, puis corrigées dans le dictionnaire de l'agent.
| Indicateur | Définition | Enjeu |
|---|---|---|
| Résolution | Le motif d'appel du client a-t-il vraiment été traité ? | La mesure clé : l'agent a-t-il fait son travail ? |
| Ressenti client | L'évolution du ton du client entre le début et la fin de l'appel. | Repère les appels résolus sur le papier qui ont pourtant agacé le client. |
| Respect des règles | Les actions de l'agent sont-elles restées dans les règles configurées pour lui ? | Maintient l'agent dans les limites fixées par l'entreprise. |
| Temps de réponse | Le délai entre la fin de la phrase du client et la réponse de l'agent. | Une réponse lente donne l'impression d'une mauvaise connexion, même quand elle est juste. |
| Justesse des transferts | L'agent a-t-il transféré vers un conseiller quand il le fallait ? | Un transfert manqué est plus grave qu'un transfert inutile. |
| Écart de régression | La variation de score par rapport à la version précédente, sur la même batterie de tests. | Repère une version qui dégrade discrètement l'agent. |
L'accroche, le ton ou la voix qui fonctionnent se décident sur de vrais appels sortants, pas en réunion.
L'accroche, le ton, la voix, le rythme, l'ordre des questions, la manière de répondre à une objection. Une seule variable par variante, pour que le résultat soit attribuable.
Sur le résultat propre à la campagne, avec un échantillon minimal convenu par variante. Le ressenti client et le taux de transfert servent de garde-fous : une variante qui gagne sur les résultats mais perd sur l'accueil n'est pas retenue.
La gagnante est déployée par paliers maîtrisés, les autres variantes sont retirées, et le changement est consigné pour que la comparaison suivante parte d'une référence connue.
Une variante promue passe encore la batterie de non-régression avant d'atteindre toute la campagne.
Non. Vous expliquez le travail, partagez les documents et les enregistrements, et relisez ce que dit l'agent. Écrire et maintenir le prompt, c'est notre travail, et les tests sont construits à partir de la matière que vous nous avez confiée, pas d'un modèle générique.
Oui. Des contrôles de non-régression sont menés face à la version précédente selon un calendrier régulier, et chaque modification suit le même déploiement progressif que le lancement initial.
La conversation est confiée à un relecteur humain et auditée avant que le résultat soit arrêté. Des désaccords répétés indiquent qu'il faut affiner le jeu d'évaluation lui-même.
Oui. Les personas et les scénarios sont construits autour de vos propres règles et cas limites, et vous y avez accès pendant la mise en place.
Une alerte de dérive se déclenche automatiquement, les appels concernés sont examinés, et la correction repasse par la batterie de tests avant que ce type d'appel ne soit de nouveau confié à l'agent.
Parcourez avec nous ce que serait un lancement mesuré, du premier brief de parcours jusqu'à la boucle de revue après la mise en service.