La multimodalité n’ajoute pas simplement un type d’entrée : elle redessine toute la boucle perception, décision et action.
La capacité d’un système temps réel est le résultat commun de compréhension, moment de réponse et sécurité de l’action.
01 / VOICEChoisir d’abord l’architecture vocale
Une chaîne en cascade sépare reconnaissance, modèle de langage et synthèse : elle se contrôle bien mais la latence s’additionne. Un modèle multimodal de bout en bout peut être plus naturel. Un système full-duplex peut écouter en parlant et gérer l’interruption, mais il est le plus complexe. Choisissez selon besoin de temps, interruptions, audit et reprise, non selon une seule démonstration.
02 / FAST & SLOWCoordonner réponse rapide et raisonnement lent
Un système temps réel peut employer une voie rapide pour confirmer, clarifier ou maintenir la conversation pendant qu’une voie lente prépare la réponse complète. L’interface ne porte pas que du texte : ton, intention et incertitude peuvent compter. Un agent textuel peut attendre ; un agent temps réel décide pendant que le monde change, donc qualité de compréhension et moment de réponse se conçoivent ensemble.
03 / COMPUTER USEUtiliser l’ordinateur seulement avec observation et vérification
Computer Use a besoin d’un espace d’actions, d’une localisation visuelle et d’une reprise après échec. Animation, pop-up et disposition de l’appareil changent l’environnement : observez donc à nouveau après chaque action. Préférez une API stable, n’utilisez le GUI qu’en l’absence d’interface. Vérifiez séparément clic, saisie et envoi. Gardez aperçu et confirmation pour les gestes risqués, et conservez captures et trajectoires.
04 / EMBODIED AGENTSéparer planification et contrôle pour le monde incarné
Un modèle haut niveau porte objectifs et plan long ; un contrôleur bas niveau produit une action stable en temps réel. La simulation rencontre aussi l’écart Sim2Real, et les limites de sécurité réelles dépassent celles d’un écran. Premier exercice : choisissez une tâche mobile ou bureau, notez observation, localisation, action et vérification à chaque étape, puis mesurez latence totale et récupérations.
Sources
- bojieli/ai-agent-book.
- Chapter 9 — Multimodality and real-time interaction.
- Cette page réorganise la pratique sans remplacer le livre source ; utilisez texte et code sources pour les formulations exactes.

COMMENTAIRES DES LECTEURS
Notez l’idée que cet article vous a laissée.
Aucun commentaire. Vous pouvez laisser le premier.