1. 项目概述:VLM驱动的智能浏览器Agent
传统企业自动化面临的最大痛点,莫过于业务系统缺乏API接口。我曾参与过一个零售企业的库存自动化项目,供应商门户没有任何开发文档,前端代码每周都会更新class名。我们尝试过各种XPath和CSS选择器方案,最终维护成本超过了项目预算的40%。这种困境正在被一种全新的技术范式打破——基于视觉语言模型(VLM)的智能浏览器Agent。
这种技术的革命性在于,它不再依赖脆弱的DOM选择器,而是像人类一样"看懂"网页。当按钮从页面左侧移到右侧,或者class名从.btn-submit变成.primary-action时,传统RPA会立即崩溃,而VLM Agent却能通过理解"提交订单"的语义意图继续工作。根据UiPath 2023年度报告,企业RPA项目平均有60%的维护工作源于UI变更导致的选择器失效,这正是VLM方案要解决的核心问题。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心技术解析
2.1 Accessibility Tree:语义化的网页结构
大多数开发者对Accessibility Tree(a11y tree)的认知停留在无障碍支持层面,但实际上它是连接视觉元素与语义信息的金矿。与包含数千节点的完整DOM树不同,Accessibility Tree是浏览器生成的精简语义结构,只保留对用户有意义的交互元素。
通过Playwright获取的典型Accessibility Tree结构如下:
javascript复制{
role: 'WebArea',
name: 'Amazon Shopping Cart',
children: [
{ role: 'button', name: 'Proceed to Checkout', focused: true },
{ role: 'link', name: 'Continue Shopping' }
]
}
这种结构的优势在于:
- 信息密度提升10-50倍(电商页面通常从3000+ DOM节点精简到100-300个语义节点)
- 自动过滤掉装饰性元素和嵌套div
- 每个节点自带明确的ARIA角色和名称属性
2.2 Set-of-Mark (SoM) 视觉标注技术
微软研究院在2023年提出的Set-of-Mark方法,通过在页面截图上叠加数字标记,实现了视觉元素与语言描述的精准对应。这种方法相比传统方案有显著优势:
| 方法 | 定位精度 | 多元素区分 | 成本 | 鲁棒性 |
|---|---|---|---|---|
| 纯文本描述 | 低 | 差 | 低 | 中 |
| Bounding Box坐标 | 高 | 中 | 高 |
