1. 医疗GUI自动化的痛点与挑战
医疗软件的操作界面(GUI)长期以来都是临床工作者的效率瓶颈。想象一下放射科医生的日常:打开3D Slicer加载CT影像,调整窗宽窗位观察组织密度差异,用多边形工具精确标注病灶区域,切换到统计面板记录测量值——这一系列操作往往需要20次以上的精确点击和参数调整。更复杂的是,不同医疗软件(如DICOM查看器Weasis、电子病历系统OpenEMR)有着截然不同的交互逻辑,而临床环境不允许任何操作失误。
传统自动化方案在这里遭遇了三大障碍:
视觉复杂度:医疗软件的界面元素密度是普通软件的3-5倍。一个典型的3D Slicer界面包含200+个可交互控件,且大量使用专业图标和缩写(如"WW/WL"表示窗宽/窗位)。通用视觉模型很难理解这种高度专业化的界面语义。
操作容错率:在电商网站点错按钮可以后退重来,但在PACS系统里误删DICOM序列可能导致诊断延误。我们的实验显示,即使是当前最强的GPT-5模型,在医疗GUI操作中的错误率也达到63.81%,这意味着每3次操作就有近2次可能出错。
长流程依赖:临床工作流的特点是步骤间存在强逻辑关联。比如必须先加载DICOM文件才能进行窗宽调整,完成测量后才能生成报告。这种链式依赖使得早期步骤的微小错误会像多米诺骨牌一样影响后续所有操作。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. CarePilot框架设计原理
2.1 核心架构:Actor-Critic双智能体协同
CarePilot的创新在于将传统强化学习中的Actor-Critic范式适配到GUI自动化场景。具体实现上:
**Actor Agent**扮演"操作执行者",其决策过程分为四个阶段:
- 通过工具接地模块解析当前屏幕(后文详述)
- 结合任务指令和记忆上下文生成候选动作
- 计算每个动作的置信度分数
- 输出最高置信度的语义动作(如
CLICK[Measurement Tool])
Critic Agent则如同"临床督导",在三个层级进行质量把控:
- 动作级校验:检查当前动作是否符合医疗操作规范(如"在未加载影像时禁止标注操作")
- 轨迹级监控:检测重复/循环操作模式(如在同一菜单项反复点击超过3次)
- 任务级验证:比对当前状态与任务目标的关键指标(如
