1. 项目概述
MadCLIP是MICCAI 2025会议上发表的一项突破性研究,它重新定义了少样本医疗异常检测的范式。作为一名长期关注医学影像分析的从业者,我不得不说这项工作的创新点非常扎实——它巧妙地利用了CLIP模型的跨模态理解能力,同时通过双分支适配器架构解决了医疗领域最头疼的小样本学习问题。
医疗异常检测一直面临两大难题:一是标注数据稀缺(特别是异常样本),二是模型泛化能力不足。传统方法要么依赖大量合成数据,要么需要维护庞大的记忆库,这些都严重制约了临床落地。MadCLIP的聪明之处在于,它仅需少量真实样本(k-shot)就能建立强大的检测模型,而且完全摆脱了对合成数据和记忆库的依赖。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 方法核心设计
2.1 双分支适配器架构
MadCLIP的核心创新是其双分支设计。与直接使用CLIP的原始视觉编码器不同,作者在CLIP的四个层级(具体是哪些层级论文中有详细说明)分别插入了一对可学习适配器——一个专注于捕捉正常特征,另一个专门处理异常模式。
这种设计背后的洞见非常精妙:医疗异常往往表现为局部特征的微妙变化(比如CT图像中的微小结节),全局特征可能仍然保持正常。通过独立建模两种特征分布,模型能够更敏感地捕捉这些细微差异。我在复现时发现,这种设计对乳腺X光片中的微钙化点检测特别有效。
适配器的具体实现采用了轻量级的MLP结构,参数效率很高。实际部署时,每个适配器仅增加约0.3M参数,这对计算资源有限的医疗场景至关重要。
2.2 可学习文本提示
文本端的设计同样精彩。传统CLIP使用固定提示(如"a photo of [class]"),但医疗异常的描述需要更专业的语义。MadCLIP引入了可学习的文本提示,通过反向传播自动优化出最适合描述"正常"和"异常"的文本嵌入。
在心脏MRI的实验中,模型自动学习到的异常提示包含"irregular","asymmetrical"等医学术语,而正常提示则强调"uniform","symmetric"等特征。这种动态的文本表征比固定模板灵活得多。
2.3 SigLIP损失函数
SigLIP损失的引入是另一个关键创新。与标准CLIP使用的softmax交叉熵不同,SigLIP直接用sigmoid处理每个图像-文本对的相似度,更适合处理医疗场景中的多对多关系(比如
