Ghost Evaluation

Ghost Evaluation est la machinerie « un autre modèle aurait-il fait aussi bien ? » d'ARDS. Utile quand vous décidez quel modèle épingler à un point d'appel et que vous voulez des preuves, pas des intuitions.

Ce qu'il fait

Ghost rejoue des appels LLM contre un ou plusieurs modèles fantômes et compare la réponse de chaque fantôme avec la réponse que le produit a réellement utilisée (la réponse de référence). Deux choses l'alimentent :

  • Les évaluations fantômes, automatiques. Des appels réels issus des points d'appel de la plateforme — dialogue, research, critic, decomposition, classification, coder — sont rejoués en arrière-plan contre les modèles fantômes configurés. Vous ne les lancez pas ; elles s'accumulent toutes seules.
  • Les évaluations à la demande. Vous pouvez en mettre une en file vous-même depuis le tableau de bord (voir plus bas).

Les runs Ghost sont fantômes : ils ne changent jamais l'état produit. La conversation d'origine est intacte ; les résultats vivent sur le tableau de bord Évaluations fantômes, scorés et comparables. Chaque évaluation compare un modèle fantôme côte à côte avec la réponse de référence — il n'y a pas de matrice à N modèles.

Quand c'est utile

  • « Un modèle moins cher tiendrait-il le point d'appel de planification ? Le classement porte des semaines de preuves. »
  • « Un modèle open-weight répond-il au dialogue aussi bien que le défaut, pour une fraction du coût ? »
  • « Nous avons changé le modèle par défaut — le caractère des réponses a-t-il vraiment bougé ? »

Le tableau de bord

Deux onglets principaux :

  • Statistiques — filtrez par type de source, lisez les compteurs (Total / Terminé / Échoué / Délai dépassé) et le Classement des modèles : par modèle fantôme, ses évaluations terminées, la concordance moyenne, le score du juge, la latence, les tokens et les échecs. Les lignes surlignées en vert sont les candidats à la promotion — modèles avec ≥ 90 % de concordance sur ≥ 50 évaluations.
  • Evaluations — les runs individuels, filtrables par source, statut et modèle. Cliquez une ligne pour ouvrir le détail : la décomposition de la concordance, les scores du juge quand il est activé, une comparaison latence et tokens, et une Comparaison côte à côte de la réponse fantôme et de la réponse de référence. Un bouton Relancer remet le même prompt en file.

En lancer une vous-même

Cliquez Nouvelle évaluation sur le tableau de bord :

  1. Sur l'onglet Manual, tapez un prompt (plus un system prompt optionnel) — ou passez sur From History et choisissez un seul message d'une conversation passée (avec options pour inclure son contexte et son system prompt).
  2. Cochez éventuellement Activer le scoring par juge LLM.
  3. Cliquez Lancer l'évaluation. Le prompt est mis en file contre chaque modèle fantôme configuré.

Vous ne choisissez pas les modèles dans la boîte de dialogue. Quels modèles fantômes tournent — et quel modèle juge — relève de la configuration du tenant, résolue côté serveur depuis la Config LLM (le point d'appel des modèles fantômes prend une liste de modèles séparés par des virgules).

Scoring

Chaque évaluation terminée reçoit un score de concordance calculé sans LLM : ratio de longueur, recouvrement de mots-clés et similarité structurelle par rapport à la réponse de référence.

Si le juge est activé, un modèle juge compare aussi les deux réponses sur des dimensions fixes — similarité sémantique, exactitude factuelle, complétude — plus un score global et un court raisonnement écrit. Les dimensions sont fixes ; il n'y a pas de grille par run ni de mode multi-juges. (Les instructions du juge peuvent être surchargées au niveau du tenant sur l'onglet Invites de Config LLM, comme les autres prompts système.) Le juge est lui-même un appel LLM avec ses propres biais — lisez le raisonnement, pas seulement le chiffre.

Considérations de coût

Chaque prompt évalué tourne une fois par modèle fantôme configuré, et le juge ajoute un appel LLM de plus par évaluation. La dépense Ghost croît avec la taille de la liste de modèles fantômes — gardez-la courte. Il n'y a pas d'affichage de coût projeté ; surveillez le tableau de bord Costs si vous doutez de ce que Ghost dépense.

Ce que Ghost ne fait pas

  • Ne rejoue pas les appels d'outils. Quand le travail d'origine impliquait des éditions de fichiers et des commandes, Ghost ne peut pas ré-exécuter les effets de bord. Il ne rejoue que l'échange au niveau LLM.
  • Ne change rien en production. Même quand un modèle fantôme surclasse le modèle de référence, rien ne bascule automatiquement. Servez-vous des preuves pour mettre à jour la Config LLM, puis lancez du nouveau travail.