1. 项目概述:当大模型遇见Web自动化
去年在为一个金融客户设计自动化报表系统时,我遇到了传统自动化工具的瓶颈——动态加载的图表元素、频繁变更的DOM结构让常规脚本变得异常脆弱。正是这次经历让我开始探索将大语言模型(LLM)引入Web自动化领域的新方案。不同于传统基于XPath或CSS选择器的自动化工具,这种融合方案在处理现代Web应用时展现出惊人的适应性。
核心思路是利用LLM的语义理解能力来弥补传统自动化的刚性缺陷。当面对一个不断迭代的电商网站时,我们的系统可以理解"找到用户评价超过4星的商品卡片"这样的自然语言指令,而不需要针对每次页面改版重新编写选择器。这种能力在最近半年快速成熟的开源大模型生态(如Llama 3、Mistral等)支持下变得尤为实用。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 技术架构设计解析
2.1 三层协作架构
我们采用的解决方案包含三个关键层级:
- 视觉感知层:通过Playwright等现代浏览器自动化工具获取页面完整快照,包括DOM结构、可访问性树和视觉渲染信息
- 语义理解层:使用量化后的7B参数级本地化大模型(如Nous-Hermes-2)分析页面语义结构
- 执行决策层:结合预设工作流和实时模型输出来生成操作序列
实践发现,将屏幕截图与DOM树同时输入模型时,操作准确率比单独使用DOM数据提升37%。这是因为现代前端框架生成的DOM往往与视觉呈现存在差异。
2.2 关键组件选型对比
| 组件类型 | 候选方案 | 选择理由 |
|---|---|---|
| 浏览器自动化 | Playwright vs Selenium | Playwright的多浏览器支持和对动态内容的内置等待机制更可靠 |
| 本地化LLM | Llama 3 vs Mistral |
