1. 大语言模型智体技能概述
2026年2月,浙江大学研究团队发表了一篇开创性论文《Agent Skills for Large Language Models: Architecture, Acquisition, Security, and the Path Forward》,系统性地阐述了大语言模型(LLM)从整体式架构向模块化、技能型智体的转变。这一转变标志着LLM在实际应用中的重大范式革新,为人工智能领域带来了全新的发展路径。
智体技能(Agent Skills)本质上是由指令、代码和资源组成的可组合包,智体可以根据任务需求动态加载这些技能包。与传统LLM将所有知识编码到模型权重中的做法不同,技能型智体通过外部技能包实现能力扩展,无需进行模型重训练。这种架构创新带来了三个显著优势:渐进式信息披露、技能定义的可移植性,以及与模型上下文协议(MCP)的无缝集成。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 智体技能的核心架构
2.1 SKILL.md规范与渐进式加载机制
智体技能的核心是SKILL.md规范,这是一个包含YAML元数据的Markdown文件。这种设计实现了信息的三级渐进式披露:
- 元数据层:仅包含技能名称和简短描述,智体启动时预加载这部分信息(约几十个token)
- 指令层:完整的程序指导内容,仅在技能被触发时加载
- 资源层:脚本、参考文档等辅助资源,按需动态加载
这种分级加载机制有效解决了上下文窗口有限的问题。根据Zhang等人的研究,典型技能的三级加载token消耗分别为:元数据层约50tokens,指令层约500tokens,资源层约2000tokens(视具体内容而定)。
2.2 技能执行生命周期
技能执行采用两阶段流程:
- 上下文注入阶段:将技能指令和相关资源以隐藏消息形式注入对话上下文
- 执行修改阶段:激活预先批准的工具权限,修改智体的执行环境
与传统的函数调用不同,技能执行不直接产生结果,而是重塑智体的认知和执行能力。这种机制使得智体能够更灵活地适应各种专业场景。
2.3 模型上下文协议(MCP)集成
MCP作为智体技术栈的另一个关键组件,于2024年11月发布,2025年12月捐赠给Linux基金会的智体人工智能基金会。MCP通过JSON-RPC
