George HuRULES & BEYONDNOTE D’APPRENTISSAGE 07 / 2026

AI AGENT / POST-TRAINING

Demandez s’il faut entraîner avant de demander comment.

Beaucoup de problèmes d’agent se résolvent par contexte, outils et harness. Le post-entraînement ne mérite son coût que lorsqu’un comportement stable doit vraiment entrer dans les paramètres et que données et évaluation sont prêtes.

L’algorithme d’entraînement n’est pas le début : données de qualité, environnement interactif et récompense crédible déterminent ce que le modèle apprend.

Réparez d’abord le contexte et les outils ; entraînez seulement le comportement qui doit vraiment devenir paramètre.

01 / CHOICEChoisir d’abord le problème à résoudre

Le post-entraînement passe facilement pour une mise à niveau universelle. Inversez l’ordre : stabilisez prompts, contexte, outils et évaluation, puis demandez si le problème exige vraiment de changer les paramètres. Si une recherche de connaissance, une instruction claire ou une validation déterministe règle le comportement, l’entraînement ajoute coût et incertitude sans traiter la contrainte réelle.

02 / STAGESPré-entraînement, SFT et RL répondent à des rôles différents

Le pré-entraînement construit langage général et connaissance du monde. Le fine-tuning supervisé (SFT) emploie des exemples de qualité pour façonner comportement et format. L’apprentissage par renforcement (RL) optimise une stratégie à partir d’une récompense en environnement. Une base SFT stable précède normalement le RL ; confondre ces rôles produit des projets de données sans cible mesurable.

03 / SFT OR RLEmployer SFT pour les démonstrations et RL pour les récompenses fiables

Quand des experts peuvent montrer le bon comportement et que le format est clair, le SFT est direct. Le RL devient utile lorsque plusieurs solutions existent, que les résultats se vérifient automatiquement et que le système doit dépasser les exemples. Une récompense peu fiable enseigne à jouer l’indicateur ; un environnement irréel produit une stratégie qui ne se transfère pas. Dans un travail à plusieurs tours, l’échec final peut venir d’un choix d’outil précoce : la récompense de résultat est objective mais rare, celle de processus dense mais restrictive.

04 / READINESSPréparer l’entraînement avant de régler les paramètres

Avant d’entraîner, confirmez évaluation de base, provenance des données, autorisation de confidentialité, environnement réinitialisable, récompense anti-triche, retour arrière et budget. Sans cela, régler les paramètres amplifie seulement l’incertitude. Premier exercice : prenez un échec et écrivez réparation de prompt, réparation d’outil, SFT et RL ; expliquez pourquoi l’une vient d’abord. La réponse doit suivre preuve et réversibilité, non la mode.

Sources

  • bojieli/ai-agent-book.
  • Chapter 7 — Post-training.
  • Cette page réorganise la pratique sans remplacer le livre source ; utilisez texte et code sources pour les formulations exactes.

Suite : comment un agent évolue continuellement.

Continuer vers l’apprentissage continu

COMMENTAIRES DES LECTEURS

Notez l’idée que cet article vous a laissée.

0 / 300

Aucun commentaire. Vous pouvez laisser le premier.