1. 手机Agent技术演进背景
2025年成为手机Agent技术发展的关键转折点。在这一年里,我们见证了从实验室研究到实际应用的跨越式发展。作为长期关注人机交互领域的技术从业者,我清晰地记得12月初那场令人振奋的技术发布:智谱科技将其核心手机Agent系统AutoGLM正式开源,命名为OpenAutoGLM。
这个开源决策来得恰逢其时。就在一周前,字节跳动刚刚发布了"豆包手机助手技术预览版",展示了令人惊艳的跨应用操作能力。但很快,各大应用平台开始对这类自动化操作实施限制。这种背景下,OpenAutoGLM的开源为开发者社区提供了一个可自由探索的技术基础。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. OpenAutoGLM技术架构解析
2.1 系统整体设计
OpenAutoGLM的技术架构体现了对手机Agent本质的深刻理解。系统采用"感知-决策-执行"的闭环设计,这与人类操作手机的认知过程高度相似。在实际测试中,我发现这种设计能够有效应对手机界面的动态变化。
系统运行需要三个关键组件协同工作:
- 运行在PC端的Agent控制程序
- 本地或云端部署的模型服务(基于开源的AutoGLM-Phone-9B模型)
- 通过ADB/HDC协议连接的手机设备
这种架构设计虽然当前还不能完全在手机端离线运行,但已经能够支持安卓、鸿蒙和iOS三大移动平台。
2.2 核心技术模块
2.2.1 多模态感知系统
感知层是手机Agent的基础。OpenAutoGLM采用屏幕截图作为主要输入源,配合系统API获取前台应用信息。在实际使用中,我发现截图分辨率对模型理解能力有显著影响。建议开发者将截图质量设置为720p以上,同时注意控制传输延迟。
系统会构建包含以下要素的多模态上下文:
- 系统提示词(定义Agent角色和能力边界)
- 用户指令(自然语言形式的任务描述)
- 当前屏幕截图(Base64编码)
- 屏幕元素解析结果(通过OCR和UI分析获得)
- 历史操作记录(用于长任务上下文维护)
2.2.2 决策与执行解耦
OpenAutoGLM最精妙的设计在于将决策(Planning)和执行(Grounding)明确分离。模型只需要输出结构化动作描述,由专门的执行模块负责转换为具体操作。这种设计带来了三个显著优势:
- 模型可以专注于理
