1. 项目背景与核心价值
医疗影像诊断领域长期面临两个关键痛点:高质量标注数据获取成本高昂,以及AI模型决策过程缺乏可解释性。传统监督学习需要大量专家标注,而在医疗领域,专业医师的标注时间尤为宝贵。同时,黑箱模型给出的诊断结果往往难以获得临床医生的信任。
厦门大学洪少华团队在CVPR26发表的这项研究,提出了一种创新解决方案:通过"相似度即证据"(Similarity-as-Evidence)框架,将视觉语言模型(VLM)的预测置信度与特征空间中的样本相似度直接关联。这种方法实现了三大突破:
- 标注效率提升:在乳腺X光片和皮肤病变数据集的实验中,仅需30%的传统标注量就能达到同等诊断准确率
- 决策可解释增强:每个预测结果都附带最相似病例的可视化证据,临床医生可直观理解模型推理过程
- 置信度校准:解决了VLM在医疗场景中常见的过度自信问题,AUROC指标平均提升12.7%
关键洞见:医疗影像的特征空间局部一致性比全局统计特性更能反映真实病理关联
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 技术框架解析
2.1 整体架构设计
系统采用双分支混合架构:
- 视觉分支:基于DenseNet-121的改进架构,加入注意力门控机制
- 文本分支:临床报告编码器采用BioClinicalBERT微调
- 相似度度量:在联合嵌入空间使用改进的余弦相似度(加入可学习的温度参数τ)
创新性地将相似度分数转换为证据理论中的mass函数:
code复制m(y_i) = σ(s_i/T) / Σ_j σ(s_j/T)
其中T是动态调整的温度参数,s_i是第i个支持样本的相似度得分。
2.2 主动学习策略
提出基于证据不确定性的采样准则:
- 认知不确定性:1 - max(m(y_i))
- 支持证据一致性:熵(m(y_1),...,m(y_k))
- 分布偏移检测:‖z_query - z_support‖₂
标注优先级分数 = α×认知不确定性 + β×证据一致性 + γ×分布偏移
在乳腺X光片数据集上的实验表明,该策略比随机采样效率提升3.2倍,比传统熵采样提升41%。
3. 医疗场景适配优化
3.1 领域特定改进
针对医疗影像特点进行了多项优化:
- 多尺度特征融合:在4个不同尺度提取并融合特征
- 病变区域增强:通过可解释性
