George HuRULES & BEYONDDÉBUTANT 09 / 2026

AI AGENT / TOKENS & CONTEXT

L’IA travaille en tokens, non en nombre de mots

Limites et prix API affichent souvent 8K, 128K ou 1M tokens. Ce ne sont ni des nombres fixes de caractères ni seulement votre dernière question.

01Distinguer d’abord token, entrée et sortie

Un token est un segment converti en ID avant calcul ; il n’est ni caractère ni mot. Ponctuation, espaces, code, nombres et langues modifient le découpage. L’entrée peut inclure règles système, historique, question, texte joint et retours d’outil. La sortie est le contenu généré, et les modèles de raisonnement peuvent aussi employer des tokens invisibles ou facturés séparément. La fenêtre de contexte est la capacité totale pour entrée et sortie réservée ; la sortie maximale est une limite distincte. Pour compter précisément, utilisez tokenizer ou champ usage de l’API.

02Une fenêtre 128K ne peut pas toujours sortir 128K

Si le contexte total est 128K et que règles, historique et matériaux occupent déjà 110K, aucune sortie complète de 128K n’est possible. Un produit peut fixer des limites de pièces, conversation ou sortie inférieures au maximum théorique. Plus de contexte n’est pas toujours mieux : coût, délai et bruit augmentent. Recherche, résumé et compression doivent envoyer seulement ce dont l’étape a besoin.

03La génération est limitée de quatre manières

La sortie dépend du maximum modèle, du forfait ou paramètres API, du contexte restant, et des politiques de temps, coût et sécurité. Compteur de messages web et facturation API ne sont pas le même concept. Pour un long texte, structurez puis générez et vérifiez par section ; pour de longs fichiers, cherchez des fragments pertinents. Consultez usage et prix officiels, ou contexte local, mémoire et vitesse. Devant 1M, 256K ou 128K, contrôlez aussi sortie maximale et limite réelle du produit.

04Les tokens sont capacité, coût et vitesse

Les API cloud distinguent souvent entrée, entrée cachée et sortie ; la sortie coûte souvent plus et le raisonnement long attend davantage. Le local n’a pas de facture token, mais un contexte long consomme mémoire et ralentit. L’optimisation utile n’est pas de raccourcir chaque phrase : retirez l’historique répété, ne récupérez que le pertinent, fixez les règles stables, clarifiez le format et arrêtez la boucle une fois la tâche finie.

Revenez au laboratoire d’interaction pour relier les concepts.

Ouvrir le laboratoire

COMMENTAIRES DES LECTEURS

Notez l’idée que cet article vous a laissée.

0 / 300

Aucun commentaire. Vous pouvez laisser le premier.