1. TCR与HLA预测技术概述
在免疫学研究领域,T细胞受体(TCR)与人类白细胞抗原(HLA)的相互作用一直是理解适应性免疫应答的核心问题。TCR作为T细胞表面的特异性识别分子,能够识别由HLA分子呈递的抗原肽段,这一过程构成了细胞免疫应答的基础机制。然而,由于HLA系统的高度多态性(目前已发现超过20,000种HLA等位基因)以及TCR的极端多样性(估计可达10^15-10^20种不同克隆型),全面解析TCR-HLA-抗原肽这三者间的对应关系一直是免疫学研究的重大挑战。
传统上,确定TCR特异性需要耗费大量时间和资源的实验方法,如肽-MHC多聚体染色或T细胞功能分析。这些方法通常一次只能分析少数几个TCR-抗原对,难以满足大规模研究的需求。随着高通量测序技术的发展,我们现在能够对数以百万计的TCR序列进行并行分析,这为应用机器学习方法解决TCR-HLA预测问题提供了前所未有的机会。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 研究设计与方法创新
2.1 数据集构建与特征
本研究最关键的创新点之一是构建了迄今为止最大的配对TCR组库-HLA单体型数据集,共包含6,794个个体的完整免疫组库数据。这个数据集的规模比先前类似研究大一个数量级,为机器学习模型训练提供了充分的统计效力。数据集包含两个主要组成部分:
- TRB数据集:5,554个配对的TRB(T细胞受体β链)组库和HLA基因型,使用ImmunoSEQ检测平台生成
- TRA数据集:1,240个配对的TRA(T细胞受体α链)组库和HLA基因型,分别使用ImmunoSEQ和MiLaboratories的αβ TCR分析检测平台生成
值得注意的是,数据集涵盖了三个不同人群(德国、挪威和美国)的样本,增加了结果的普遍性。研究中采用的HLA基因型数据并非直接测序获得,而是通过高密度SNP芯片结合先进的推算算法(HIBAG)获得,这种方法在常见HLA等位基因上具有与直接测序相当的准确性。
2.2 技术路线与算法框架
研究团队开发了一套完整的分析流程,主要包含以下几个关键步骤:
- HLA相关克隆型发现:对于每个HLA等位基因,使用单侧Fisher精确检验比较携带者与非携带者之间公共克隆型(在≥2个个体中出现的克隆型)的频率差异。设定严格的显著性阈值(P<1×10^-4)来控制假
