George HuRULES & BEYONDNOTE D’APPRENTISSAGE 06 / 2026

AI AGENT / EVALUATION & OBSERVABILITY

Sans évaluation, impossible de savoir si l’agent progresse ou triche mieux.

Une belle démonstration ne prouve pas la fiabilité. L’évaluation transforme tâches, environnement, coût, critère de succès et trajectoires d’échec en signaux comparables.

Un agent appelle des outils, modifie l’environnement et termine une tâche en plusieurs étapes. Évaluer seulement le texte final ne suffit donc jamais.

Définissez d’abord une tâche vérifiable ; conservez d’abord les trajectoires d’échec ; optimisez ensuite.

01 / ENVIRONMENTConstruire d’abord un environnement réinitialisable

Les tâches avec outils doivent simuler interfaces et effets réels ; les tâches interactives ont aussi des états intermédiaires. Chaque exécution part d’un point contrôlé, rend les faits observables et se juge sur l’environnement final, non sur le résumé de l’agent. Sans réinitialisation, observation et notation, on ne distingue pas une capacité répétable d’un coup de chance.

02 / TASK SETRendre le jeu de tâches précis et représentatif

Un jeu de données doit couvrir chemins courants, limites et échecs. Chaque tâche demande un résultat objectif et vérifiable ; les échantillons ambigus, divulgués ou périmés doivent disparaître. Répartissez travail simple, composé et long ; couvrez outils, volumes et permissions réels ; empêchez les réponses de passer dans prompts ou entraînement ; versionnez les tâches pour garder des comparaisons honnêtes.

03 / METRICSMesurer coût et processus autant que le succès

Relevez réussite, étapes, erreurs d’outil, latence, tokens et coût monétaire ensemble. Un LLM-as-a-Judge peut aider pour la qualité subjective, mais son barème, son biais de position et sa version doivent être contrôlés. Les comparaisons par paires sont souvent plus stables que les notes absolues. Avec assez d’échantillons, rapportez intervalles de confiance et significativité au lieu de proclamer gagnant un petit écart.

04 / OBSERVE & IMPROVEUtiliser les trajectoires pour expliquer et améliorer

Un score total dit si quelque chose a bougé ; la trajectoire explique pourquoi. L’observabilité doit conserver entrées, appels d’outils, erreurs, durée et état clé. Ablations et tests A/B montrent ensuite quel changement a vraiment produit l’effet. Premier exercice : donnez à un agent de dossiers 20 tâches vérifiables et notez complétude, exactitude des citations, temps et corrections humaines. Gardez les échecs : ils dessinent la prochaine amélioration.

Sources

  • bojieli/ai-agent-book.
  • Chapter 6 — Evaluation and observability.
  • Cette page réorganise la pratique sans remplacer le livre source ; utilisez texte et code sources pour les formulations exactes.

Suite : quand le post-entraînement devient nécessaire.

Continuer vers le post-entraînement

COMMENTAIRES DES LECTEURS

Notez l’idée que cet article vous a laissée.

0 / 300

Aucun commentaire. Vous pouvez laisser le premier.