AI AGENT从零到一
M5 · 真实行动结构化导览30 分钟导览

AI Agents for Beginners · Lesson 15

计算机使用 Agent:在动态 UI 中行动

理解浏览器自动化、动态 UI、类型化提取,以及怎样根据可预测性选择 Agent 模式或执行者模式。

Learning objectives

完成后你应能证明
目标描述的是可观察行为,不是“了解”或“看完”。
  1. 01理解 Browser-Use、Azure OpenAI 与 Playwright 的集成方向。
  2. 02设计导航真实网站并处理动态 UI 的自动化工作流。
  3. 03从可见页面提取类型化结果并连接下游逻辑。
  4. 04根据任务可预测性选择 Agent 模式或执行者模式。

完整示例与概念桥接

本课讲解

浏览器把 Agent 放进最复杂的工具之一

网页会异步更新、改变布局、弹出确认并携带不可信内容。可预测页面适合明确脚本;路径会随观察变化时才考虑 Agent。

无论采用哪种方式,发送、购买、删除、授权等高影响动作都应在执行前向用户展示并确认。页面文字也不能获得修改系统规则或扩大工具权限的能力。

打开锁定版本的计算机使用 Agent 官方课程继续学习。

07–18 制作状态

本课当前提供结构化导览
学习目标、概念位置、建议预习和官方锁定来源已就绪;完整 Trace、实验与项目增量将在后续版本制作。

Source record

本课上游记录
路径
15-browser-use/README.md
Commit
b7f34fd824767162f484e03cc500e23c0966372f
许可
MIT
查看官方原文