Un agent appelle des outils, modifie l’environnement et termine une tâche en plusieurs étapes. Évaluer seulement le texte final ne suffit donc jamais.
Définissez d’abord une tâche vérifiable ; conservez d’abord les trajectoires d’échec ; optimisez ensuite.
01 / ENVIRONMENTConstruire d’abord un environnement réinitialisable
Les tâches avec outils doivent simuler interfaces et effets réels ; les tâches interactives ont aussi des états intermédiaires. Chaque exécution part d’un point contrôlé, rend les faits observables et se juge sur l’environnement final, non sur le résumé de l’agent. Sans réinitialisation, observation et notation, on ne distingue pas une capacité répétable d’un coup de chance.
02 / TASK SETRendre le jeu de tâches précis et représentatif
Un jeu de données doit couvrir chemins courants, limites et échecs. Chaque tâche demande un résultat objectif et vérifiable ; les échantillons ambigus, divulgués ou périmés doivent disparaître. Répartissez travail simple, composé et long ; couvrez outils, volumes et permissions réels ; empêchez les réponses de passer dans prompts ou entraînement ; versionnez les tâches pour garder des comparaisons honnêtes.
03 / METRICSMesurer coût et processus autant que le succès
Relevez réussite, étapes, erreurs d’outil, latence, tokens et coût monétaire ensemble. Un LLM-as-a-Judge peut aider pour la qualité subjective, mais son barème, son biais de position et sa version doivent être contrôlés. Les comparaisons par paires sont souvent plus stables que les notes absolues. Avec assez d’échantillons, rapportez intervalles de confiance et significativité au lieu de proclamer gagnant un petit écart.
04 / OBSERVE & IMPROVEUtiliser les trajectoires pour expliquer et améliorer
Un score total dit si quelque chose a bougé ; la trajectoire explique pourquoi. L’observabilité doit conserver entrées, appels d’outils, erreurs, durée et état clé. Ablations et tests A/B montrent ensuite quel changement a vraiment produit l’effet. Premier exercice : donnez à un agent de dossiers 20 tâches vérifiables et notez complétude, exactitude des citations, temps et corrections humaines. Gardez les échecs : ils dessinent la prochaine amélioration.
Sources
- bojieli/ai-agent-book.
- Chapter 6 — Evaluation and observability.
- Cette page réorganise la pratique sans remplacer le livre source ; utilisez texte et code sources pour les formulations exactes.

COMMENTAIRES DES LECTEURS
Notez l’idée que cet article vous a laissée.
Aucun commentaire. Vous pouvez laisser le premier.