文本 Agent 可以等待几秒再回答,实时 Agent 却必须在世界继续变化时做决定。它要听见、看见、定位并行动,还要理解用户什么时候在打断。
多模态不是简单增加输入类型,而是重新设计整条感知—决策—行动链路。
实时系统的能力等于理解质量、响应时机和动作安全的共同结果。
01 / VOICE PARADIGMS语音有三条主要架构路线。
级联方案把识别、语言模型和合成拆开,易控制但延迟累积;端到端全模态模型更自然;全双工系统还能边听边说、处理中断,但工程复杂度最高。
02 / FAST & SLOW快反应与慢思考要协同。
实时交互可以先用快速通道确认、追问或保持对话,再让慢速推理生成完整答案。接口不一定只有文字,还可能传递语气、意图和不确定性。
03 / COMPUTER USEGUI 操作的难点是看准和点准。
Computer Use 要定义动作空间、视觉定位与失败恢复。屏幕动画、弹窗和不同设备布局都会改变环境,因此每一步操作后都应重新观察。
- 优先使用稳定 API;只有缺少接口时再操作 GUI。
- 点击、输入与提交分开验证。
- 高风险界面动作保留预览与确认。
- 记录截图和动作轨迹便于复盘。
04 / EMBODIED AGENT机器人需要把规划与控制分层。
高层模型负责目标与长程计划,低层控制器负责稳定、实时的动作。仿真训练还要面对 Sim2Real 差距,真实环境中的安全边界远高于屏幕操作。
第一道练习:选择一个手机或桌面任务,记录每一步观察、定位、动作和验证,并统计总延迟与错误恢复次数。
原书与章节来源
- bojieli/ai-agent-book:开源主仓库与全书目录。
- 第 9 章正文:本页概念主线与术语来源。
- 第 9 章实验:配套代码、复现说明与读者练习。
- 本页是面向应用的学习整理与转述,不替代原书;准确表述以原文和代码为准。
下一篇:多 Agent 协作
继续沿着“理解结构—动手改变—观察结果—形成判断”的方式学习。
继续学习 →

读者评论
把这篇文章留给你的想法写下来。
还没有评论。你可以留下第一条。