胡泽贤 律师RULES & BEYONDLEARNING NOTE 09 / 2026

AI AGENT / 第 9 章应用笔记

当 Agent 开始听、看与操作,延迟也成了能力的一部分。

进入语音、GUI 和物理世界后,准确不再是唯一指标。响应时机、动作延迟、打断处理和感知误差会直接改变用户体验与安全。

语音、视觉与动作通过实时反馈形成感知回路的编辑视觉
VISUAL METAPHOR / 主题隐喻感知回路 · 语音、视觉、动作与实时反馈

文本 Agent 可以等待几秒再回答,实时 Agent 却必须在世界继续变化时做决定。它要听见、看见、定位并行动,还要理解用户什么时候在打断。

多模态不是简单增加输入类型,而是重新设计整条感知—决策—行动链路。

实时系统的能力等于理解质量、响应时机和动作安全的共同结果。

01 / VOICE PARADIGMS语音有三条主要架构路线。

级联方案把识别、语言模型和合成拆开,易控制但延迟累积;端到端全模态模型更自然;全双工系统还能边听边说、处理中断,但工程复杂度最高。

02 / FAST & SLOW快反应与慢思考要协同。

实时交互可以先用快速通道确认、追问或保持对话,再让慢速推理生成完整答案。接口不一定只有文字,还可能传递语气、意图和不确定性。

03 / COMPUTER USEGUI 操作的难点是看准和点准。

Computer Use 要定义动作空间、视觉定位与失败恢复。屏幕动画、弹窗和不同设备布局都会改变环境,因此每一步操作后都应重新观察。

  • 优先使用稳定 API;只有缺少接口时再操作 GUI。
  • 点击、输入与提交分开验证。
  • 高风险界面动作保留预览与确认。
  • 记录截图和动作轨迹便于复盘。

04 / EMBODIED AGENT机器人需要把规划与控制分层。

高层模型负责目标与长程计划,低层控制器负责稳定、实时的动作。仿真训练还要面对 Sim2Real 差距,真实环境中的安全边界远高于屏幕操作。

第一道练习:选择一个手机或桌面任务,记录每一步观察、定位、动作和验证,并统计总延迟与错误恢复次数。

原书与章节来源

  • bojieli/ai-agent-book:开源主仓库与全书目录。
  • 9 章正文:本页概念主线与术语来源。
  • 9 章实验:配套代码、复现说明与读者练习。
  • 本页是面向应用的学习整理与转述,不替代原书;准确表述以原文和代码为准。

下一篇:多 Agent 协作

继续沿着“理解结构—动手改变—观察结果—形成判断”的方式学习。

继续学习

读者评论

把这篇文章留给你的想法写下来。

0 / 300

还没有评论。你可以留下第一条。