1. 医学AI领域的重大突破:知识增强病理大模型KEEP
2026年2月,上海交通大学医工交叉团队在国际顶级期刊《Nature》和《Cancer Cell》连续发表两篇重磅论文,聚焦罕见病诊断这一世界性难题。其中发表在《Cancer Cell》上的KEEP(KnowledgE-Enhanced Pathology)模型尤为引人注目,它开创性地将层级化医学知识系统融入视觉语言预训练,在病理AI领域实现了质的飞跃。
作为一名长期关注医学AI发展的从业者,我深知病理诊断的特殊地位——它被称为癌症诊断的"金标准",但同时也面临着标注成本高、专家资源稀缺、罕见病诊断困难等现实挑战。KEEP模型的出现,为解决这些痛点提供了全新的技术路径。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 病理AI的行业痛点与KEEP的创新思路
2.1 传统病理AI的两大死穴
在深度学习技术应用于病理诊断的十年间,行业始终被两个核心问题所困扰:
标注成本瓶颈:一张标准的病理全切片图像(WSI)通常包含数十亿像素,资深病理医生完成一张切片的精确标注需要数小时。以乳腺癌HER2评分标注为例,需要医生在显微镜下逐个细胞评估染色强度,这种精细工作难以大规模复制。
泛化能力局限:现有模型大多采用"端到端"的数据驱动方式,本质上是在记忆训练数据中的模式。当面对训练集中未出现的癌症亚型时(尤其是罕见病例),模型性能会断崖式下降。我们在实际项目中测试发现,某主流模型在常见肺癌亚型上准确率可达85%,但对发病率低于1%的肉瘤样癌,准确率骤降至随机猜测水平。
2.2 KEEP的范式革新:从数据驱动到知识引导
KEEP模型最革命性的突破在于改变了病理AI的训练范式。传统方法如同让AI"死记硬背"病例图片和病名标签,而KEEP则是先让AI系统学习完整的医学知识体系,再结合图像数据进行诊断。这种"先理解后诊断"的思路,更接近人类病理医生的培养过程。
具体而言,KEEP通过三个关键步骤实现这一革新:
- 构建覆盖11454种疾病的权威知识图谱
- 基于知识引导清洗和重组训练数据
- 设计知识增强的预训练目标函数
3. KEEP模型的技术架构详解
3.1 疾病知识图谱的构建与编码
3.1.1 知识来源与整合
研究团队整合了疾病本体库(DO)和统一医学语言系统(UMLS
