WebAgent — 多模态浏览器智能体与评测框架
面向网页检索、表单填写与跨页面操作,独立开发浏览器智能体。系统接收自然语言任务,循环读取截图与 DOM、规划步骤并调用工具,输出结果与轨迹;配套检查点恢复和独立评测,支持长程执行与结果复核。
- 规划与执行校验:以 Planner、Tool 与 AgentHook 协议解耦规划、工具执行及生命周期扩展,支持替换规划模型;执行前校验工具参数与页面元素引用,将错误反馈给规划器限次修正,分离规划尝试与实际动作记录。
- 观察一致性与执行约束:基于 Playwright/CDP 联合采集截图与 DOM,检查页面变化,将控件引用绑定观察批次并拒绝过期引用;依据规划器可见的页面与工具证据校验导航、下载地址来源,限制无依据操作。
- 长程执行与恢复:以限次重规划、循环检测与原子检查点控制执行,保存进度及受支持的浏览器状态;执行前记录待完成动作,恢复时阻断结果不明的副作用操作自动重放,避免重复执行。
- 文档解析与证据追踪:通过图注定位 PDF 图表,以质量门控的 OCR/解析级联读取文档;关联可见搜索、来源与下载记录,支持原文证据核验。
- 评测设计与失败诊断:为网页任务定义独立终态断言,以强制中断场景验证恢复结果;对照 DOM 与工具历史定位规划偏航、状态残留及动作执行问题,结合 URL 来源、执行连续性与产物完整性约束,分别核验任务结果与过程是否符合要求。
交付与验证:固定任务集与版本开展项目内评测,两个模型在相同的 36 项任务上共通过 71/72 次执行,保留失败样本与完整执行轨迹。