1. 论文背景与研究动机
这篇由西安电子科技大学与中国联通研究院联合团队发表的论文,聚焦于当前AI智能体(Agent)领域一个亟待解决的核心问题:当大模型被赋予工具调用权限后,其安全风险呈现指数级增长的现象。传统的大模型安全评估主要关注文本生成层面的内容安全(如有害信息生成、偏见输出等),而忽视了智能体在执行多步工具调用时的系统性风险。
研究团队选取了六款主流的OpenClaw变体架构(包括OpenClaw、KimiClaw、AutoClaw等)作为评估对象。这些架构的共同特点是采用"大模型+工具库"的设计范式,允许AI通过API调用执行文件操作、代码执行、网络访问等敏感操作。论文中那个"全能管家"的比喻非常精妙——当AI不仅能回答问题,还能实际操作企业系统时,其安全隐患就从"说错话"升级为"做错事",且后果可能更为严重。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 研究方法与评估框架
2.1 测试基准构建
研究团队设计了一套包含205个测试用例的安全基准,这些用例覆盖了13类典型攻击行为,包括:
- 信息侦察(如端口扫描、文件目录枚举)
- 权限提升(如利用漏洞获取更高权限)
- 数据泄露(如窃取数据库内容)
- 持久化攻击(如植入后门程序)
- 横向移动(如内网渗透)
每个测试用例都模拟了真实业务场景中的合法请求,但实际包含恶意意图。例如,一个看似正常的"请整理公司网络拓扑图"的请求,可能被攻击者用于获取内部网络结构信息。
2.2 四阶段风险评估模型
论文创新性地提出了智能体操作的四个关键阶段,并分别评估安全风险:
- 输入摄取阶段:检测智能体是否会对明显恶意的输入(如包含SQL注入的查询)进行过滤
- 规划推理阶段:分析智能体在分解复杂任务时,是否会识别出潜在危险的子步骤
- 工具执行阶段:评估智能体在执行API调用时,是否会对高危操作(如rm -rf)进行二次确认
- 结果返回阶段:检查智能体在返回结果前,是否会对敏感信息(如密码、密钥)进行脱敏处理
这种分阶段评估方法能够精确定位安全防御的薄弱环节。例如,某些智能体可能在输入阶段能识别简单恶意指令,但在多步推理中却会被社会工程学攻击绕过。
3. 关键研究发现与漏洞分析
3.1 跨架构的通用漏洞
研究发现所有被测系统都存在以下两类高危漏洞:
