1. 虚拟筛选技术概述
在药物研发领域,寻找能够有效调节疾病靶点功能的小分子化合物是一个耗时耗力的过程。传统的高通量筛选方法虽然可以直接测试数百万种化合物,但面临着成本高昂(单个筛选项目可达数十万美元)、周期长(通常需要数月)以及化合物库覆盖范围有限等挑战。虚拟筛选技术应运而生,通过计算方法对化合物库进行预筛选,仅选取少量潜在活性分子进行实验验证,将实验验证量级从百万级降至百级,显著提高了药物发现的效率。
虚拟筛选的核心价值在于其"先计算后实验"的理念。以CDK2激酶抑制剂的发现为例,传统方法筛选200万种化合物需要约3个月时间和50万美元成本,而采用虚拟筛选技术后,只需对计算筛选出的200种候选化合物进行实验验证,时间和成本均降低90%以上。这种效率提升使得虚拟筛选成为现代药物发现流程中不可或缺的关键环节。
目前主流的虚拟筛选技术可分为三大类:
-
分子对接技术:基于靶点蛋白的三维结构,预测小分子在结合口袋中的最优构象和结合亲和力。这种方法能够提供原子级别的相互作用细节,但计算成本相对较高。常用的AutoDock Vina软件在普通工作站上处理一个分子需要约30秒,筛选百万级库需要大量计算资源。
-
药效团模型:抽象描述活性分子与靶点间的关键相互作用特征,如氢键供体/受体、疏水区域等。这种方法计算速度快(每秒可处理数百个分子),适合大规模初筛,但会丢失一些结构细节信息。
-
机器学习筛选:利用已知活性数据训练预测模型,可快速评估新化合物的潜在活性(毫秒级预测)。这种方法高度依赖训练数据质量,但对新颖结构的预测能力有限。
在实际应用中,这三种方法各有所长也各有所短。分子对接精度较高但速度慢;药效团模型速度快但精度有限;机器学习筛选需要大量训练数据。因此,将多种方法有机融合,发挥各自优势,已成为提高虚拟筛选成功率的主流策略。
关键提示:虚拟筛选不是要完全取代实验筛选,而是通过计算手段大幅缩小需要实验验证的化合物范围,提高药物发现的效率和成功率。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 分子对接技术详解
2.1 分子对接的基本原理
分子对接技术的核心是模拟小分子配体与生物大分子受体(通常是蛋白质)的结合过程。这个过程涉及两个关键科学问题:一是预测配体在受体结合位点中的最优三维构象(构象搜索问题);二是评估该结合构象的稳定性和亲和力(打分函数问题)。
在构象搜索方面,需要考虑配体的柔性(可旋转键的自由度)和受体的柔性。完全柔性的对接计算量巨大,因此大多数工具采用"半柔性对接"策略:保持受体刚性,仅允许配体构象变化。以AutoDock Vina为例,它采用迭代局部搜索算法,通过不断调整配体的平移、旋转和扭转角来探索结合模式空间。
打分函数是决定对接结果可靠性的关键因素。目前主流的打分函数可分为三类:
-
力场类打分:基于分子力学力场(如AMBER、CHARMM)计算相互作用能。这类方法物理意义明确,但计算量大,且难以准确处理溶剂效应。
-
经验类打分:通过回归实验测得的结合常数来参数化能量项。如AutoDock使用的打分函数包含范德华力、氢键、静电等项。这类方法计算速度快,但可移植性较差。
-
知识类打分:基于已知蛋白质-配体复合物结构统计相互作用频率。如DrugScore、PMF等。这类方法对常见相互作用模式预测较好,但对罕见结合模式效果欠佳。
2.2 分子对接的标准流程
一个完整的分子对接流程通常包含以下步骤:
-
受体准备:
- 从PDB数据库获取靶点蛋白晶体结构(如CDK2的1AQ1结构)
- 处理缺失残基、添加氢原子、分配电荷(使用pdb2gmx等工具)
- 确定结合位点(可通过共结晶配体或活性位点预测工具如CASTp)
-
配体准备:
- 从化合物库(如ZINC、PubChem)获取小分子结构
- 生成三维构象(使用OpenBabel、CORINA等)
- 分配Gasteiger电荷和原子类型
-
对接计算:
- 设置搜索空间(通常为结合位点周围20Å立方体)
- 配置对接参数(如exhaustiveness值控制搜索强度)
- 运行对接程序(AutoDock Vina命令行示例:vina --receptor 1aq1.pdbqt --ligand ligand.pdbqt --center_x 15 --center_y 20 --center_z 25 --size_x 20 --size_y 20 --size_z 20)
-
结果分析:
- 检查top构象的结合模式合理性(氢键、疏水相互作用等)
- 聚类分析相似构象
- 可视化分析(使用PyMOL、Chimera等)
2.3 分子对接的实践技巧
在实际应用中,提高分子对接结果可靠性的关键技巧包括:
-
受体构象选择:
- 优先选择高分辨率(<2.0Å)的晶体结构
- 对于柔性较大的结合位点,可考虑使用分子动力学模拟获得的多个构象进行对接
- 注意处理晶体结构中的缺失环区和突变残基
-
打分函数优化:
- 对重要靶点可尝试多种打分函数并比较结果
- 考虑使用共识打分策略(如同时使用Vina、Glide和GOLD的打分)
- 对关键化合物可进行MM/PBSA自由能计算验证
-
后处理策略:
- 对接结果通常需要结合药效团过滤(如确保关键氢键形成)
- 对top化合物建议进行分子动力学模拟验证结合稳定性
- 考虑合成可行性(如检查商业可得性或合成路线)
注意事项:分子对接结果不能直接作为活性判断的唯一依据。实验发现,对接打分与实验测得的亲和力之间的相关系数通常仅在0.5-0.7范围内,因此需要结合其他方法交叉验证。
3. 药效团模型技术解析
3.1 药效团的基本概念
药效团(pharmacophore)是指药物分子中与靶标产生关键相互作用的特征元素及其空间排列方式。这些特征元素包括:
- 氢键供体(HBD):如羟基、氨基等能提供质子的基团
- 氢键受体(HBA):如羰基氧、杂环氮等能接受质子的原子
- 疏水中心(H):如芳环、脂肪链等疏水性区域
- 正/负电荷中心:如质子化氨基、羧酸根等带电基团
- 芳环平面:参与π-π堆积或阳离子-π相互作用的芳香体系
一个典型的药效团模型可能描述为:"一个氢键供体距离氢键受体4.5-5.5Å,两者与一个疏水中心形成三角形,公差±1.0Å"。这种抽象表示可以捕捉活性分子共有的关键特征,同时允许一定的结构变化。
3.2 药效团模型的构建方法
3.2.1 基于配体的药效团建模
当靶点结构未知时,可从一组已知活性分子中提取共同特征构建药效团。具体步骤:
-
数据准备:
- 收集至少5-10个结构多样的活性分子(IC50/Ki<1μM)
- 确保分子具有共同的作用机制
- 排除结构过于相似的分子(Tanimoto系数>0.85)
-
构象分析:
- 对每个分子生成多个低能构象(如使用OMEGA软件生成50-100个构象)
- 注意保留生物活性构象(可通过NMR或计算预测验证)
-
分子叠合:
- 选择活性最高的分子作为模板
- 使用柔性叠合算法(如Phase)将其他分子与模板对齐
- 确保关键药效特征在空间上重叠
-
模型生成:
- 识别所有分子共有的特征及其空间关系
- 设置适当的距离和角度公差(通常1.0-1.5Å)
- 使用HipHop或HypoGen算法优化模型参数
3.2.2 基于受体的药效团建模
当靶点三维结构已知时,可直接从结合位点提取药效团特征:
-
结合位点分析:
- 识别结合口袋中的关键残基
- 标记潜在的相互作用位点(如氢键形成位、疏水口袋)
-
特征提取:
- 将受体特征映射为对应的配体特征
- 如受体羧基对应配体正电荷中心
- 考虑溶剂可及性和方向性约束
-
模型优化:
- 调整特征权重(如关键氢键赋予更高权重)
- 添加排除体积约束(避免空间冲突)
3.3 药效团模型的应用技巧
在实际药物发现项目中,药效团模型可应用于多个环节:
-
虚拟筛选:
- 先用药效团模型快速过滤百万级化合物库(保留约5-10%)
- 再进行分子对接等精细计算
- 典型流程:ZINC库→药效团过滤→分子对接→实验验证
-
骨架跃迁:
- 用药效团模型搜索具有相同特征但不同骨架的分子
- 可突破专利限制发现新颖结构
- 案例:从三环类抗抑郁药到选择性5-HT再摄取抑制剂的设计
-
先导化合物优化:
- 分析现有化合物与药效团模型的匹配情况
- 识别缺失或弱化的药效特征
- 指导结构修饰(如添加特定官能团)
实用技巧:构建高质量药效团模型的关键是选择具有结构多样性的活性分子。建议使用至少3种不同骨架的活性分子,且活性最好相差不超过100倍。同时,加入一些非活性分子作为诱饵可以帮助验证模型的特异性。
4. 机器学习筛选方法实践
4.1 机器学习筛选的基本流程
机器学习在虚拟筛选中的应用主要分为三个步骤:特征工程、模型训练和预测评估。
4.1.1 特征工程
分子表征是机器学习筛选的关键环节。常用的分子描述符包括:
-
分子指纹:
- ECFP(扩展连通性指纹):通过原子环境迭代生成,捕捉局部结构特征
- MACCS密钥:166位二进制指纹,表示特定子结构存在与否
- 药效团指纹:将分子表示为药效团特征的组合
-
物理化学性质:
- 脂水分配系数(clogP)
- 分子量、可旋转键数
- 极性表面积(TPSA)
- 氢键供体/受体数量
-
三维描述符:
- 分子形状参数
- 静电势分布
- 表面曲率特征
4.1.2 模型训练
根据数据量和问题特点选择合适的算法:
-
小数据集(<1000样本):
- 随机森林(RF):对噪声和特征相关性鲁棒
- 支持向量机(SVM):适合高维特征空间
- 梯度提升树(XGBoost):预测精度高,需调参
-
大数据集(>10000样本):
- 图神经网络(GNN):自动学习分子结构特征
- 深度神经网络(DNN):处理高维特征组合
- Transformer模型:处理分子序列数据
4.1.3 模型评估
采用严格的评估策略确保模型可靠性:
-
数据划分:
- 按时间划分(模拟真实场景)
- 按骨架划分(测试模型对新骨架的预测能力)
- 按靶点划分(测试跨靶点泛化能力)
-
评估指标:
- 分类任务:AUC-ROC、平衡准确率、F1分数
- 回归任务:RMSE、R²、Pearson相关系数
- 排序任务:Enrichment Factor、BEDROC
4.2 深度学习在虚拟筛选中的应用
4.2.1 图神经网络模型
图神经网络(GNN)将分子表示为原子(节点)和键(边)组成的图,通过消息传递机制学习分子表示。典型架构包括:
-
图卷积网络(GCN):
- 通过邻域聚合更新节点特征
- 适合捕捉局部化学环境
-
图注意力网络(GAT):
- 引入注意力机制区分不同邻域的重要性
- 可识别关键原子和子结构
-
消息传递神经网络(MPNN):
- 通用框架,包含消息、更新和读出函数
- 灵活支持多种分子特性学习
4.2.2 三维GNN模型
结合分子三维结构信息的GNN模型:
-
SchNet:
- 考虑原子间距离
- 使用连续滤波器卷积
-
DimeNet:
- 进一步考虑键角信息
- 方向性消息传递
-
SphereNet:
- 全面考虑距离、角度和二面角
- 高阶几何特征学习
4.2.3 多任务学习
同时预测多个相关性质,提高数据利用效率:
-
硬参数共享:
- 底层共享表示层
- 顶层任务特定层
-
交叉stitch网络:
- 学习任务间特征交互
- 自动调整共享程度
-
不确定性加权:
- 根据任务噪声自动调整损失权重
- 平衡不同性质的学习
实践建议:对于初学者,可以从经典的随机森林+ECFP指纹组合开始,这种组合实现简单且通常能获得不错的效果。当数据量较大(>10k样本)时,再考虑使用图神经网络等深度学习模型。重要的是要确保训练集和测试集的划分方式能够反映实际应用场景。
5. 多方法融合策略与实践
5.1 串联筛选策略设计
串联筛选采用分阶段逐步过滤的策略,将计算成本高的方法应用于经过初筛的较小分子集。一个典型的四级串联筛选流程如下:
-
一级筛选:类药性过滤
- 应用Lipinski五规则(分子量≤500,clogP≤5,HBD≤5,HBA≤10)
- 过滤掉明显不符合口服药物要求的分子
- 通常可过滤掉约20-30%的化合物
-
二级筛选:药效团模型
- 使用预先构建的高质量药效团模型
- 匹配关键相互作用特征
- 典型保留率:5-10%(从百万级降至十万级)
-
三级筛选:快速分子对接
- 使用快速对接方法(如Vina在低exhaustiveness模式)
- 初步评估结合模式和亲和力
- 保留top 1-5%的分子(降至千级)
-
四级筛选:精细对接+机器学习重打分
- 使用高精度对接方法(如Glide XP)
- 结合机器学习模型校正打分偏差
- 最终选出50-100个候选分子
这种串联策略的计算资源分配示例如下:
- 药效团筛选:100万分子×0.01秒=2.8小时(单核)
- 快速对接:10万分子×30秒=35天(单核,可并行)
- 精细对接:1000分子×300秒=8小时(多核并行)
5.2 并联集成方法实现
并联集成通过组合多个独立模型的预测结果来提高整体性能。常见的集成方式包括:
-
共识打分:
- 对同一分子使用多个对接软件(如Vina、Glide、GOLD)
- 对各软件的打分进行标准化(Z-score)
- 计算平均排名或加权平均分
- 示例权重:Vina(0.4)+Glide(0.4)+GOLD(0.2)
-
多模型投票:
- 训练多个不同类型的机器学习模型(如RF、SVM、GNN)
- 每个模型对分子进行活性预测
- 采用多数投票或加权投票决定最终预测
- 可设置置信度阈值(如至少2个模型预测为活性)
-
堆叠集成(Stacking):
- 使用基础模型(如RF、SVM)生成预测概率
- 将预测概率作为新特征训练元模型(如逻辑回归)
- 通过交叉验证防止数据泄露
5.3 融合策略的优化技巧
在实际项目中优化融合策略的关键点:
-
资源分配优化:
- 根据各阶段过滤效率动态调整计算资源
- 对高价值分子集(如top 1%)分配更多计算资源
- 示例:对初筛后的分子进行多构象对接
-
结果一致性检查:
- 检��不同方法预测结果的一致性
- 优先选择被多种方法共同预测为活性的分子
- 对矛盾结果进行人工审查或进一步验证
-
反馈循环建立:
- 将实验验证结果反馈至筛选流程
- 调整各阶段参数和权重(如优化药效团特征权重)
- 迭代优化筛选策略
专业建议:在设计融合策略时,建议先进行小规模测试(如1000个分子的完整流程),评估各阶段的过滤效率和计算成本,再根据测试结果调整策略。同时,保留完整的筛选记录(包括被过滤掉的分子),以便后续分析和策略优化。
6. 虚拟筛选实践案例解析
6.1 案例一:EGFR激酶抑制剂的发现
6.1.1 项目背景
表皮生长因子受体(EGFR)是癌症治疗的重要靶点。我们针对EGFR T790M突变体(导致耐药性的常见突变)开展虚拟筛选,目标是发现新型选择性抑制剂。
6.1.2 筛选流程
-
化合物库准备:
- 从ZINC15库中选取类药分子(MW 300-500,clogP 1-4)
- 共约150万个小分子
-
药效团初筛:
- 基于已知EGFR抑制剂(如奥希替尼)构建药效团模型
- 关键特征:氢键受体(与Met793主链NH)、疏水中心(指向疏水口袋)
- 筛选保留约8万分子(过滤率~95%)
-
分子对接:
- 使用Glide SP模式进行初步对接(保留5万分子)
- 对top 1万分子进行Glide XP精细对接
- 结合模式分析:确保与Met793形成关键氢键
-
机器学习重打分:
- 训练随机森林模型(基于200个已知EGFR抑制剂活性数据)
- 特征包括:对接打分、分子指纹、物化性质
- 对对接结果进行重新排序
-
实验验证:
- 选取top 50分子进行酶活性测试
- 发现3个IC50<100nM的化合物
- 最佳化合物显示出对T790M突变体的选择性(WT/Mut IC50比>10)
6.1.3 关键发现
- 融合策略的命中率(6%)显著高于单独对接(2%)或单独机器学习(3%)
- 最佳化合物具有新颖骨架,突破了现有专利限制
- 晶体结构证实了预测的结合模式(与Met793氢键)
6.2 案例二:天然产物抗菌剂筛选
6.2.1 项目背景
针对日益严重的抗生素耐药性问题,我们从天然产物中筛选新型抗菌剂。目标靶点为细菌DNA旋转酶。
6.2.2 筛选特点
- 天然产物结构复杂,传统对接挑战大
- 活性数据稀缺,机器学习训练集小
- 需要兼顾抗菌活性和选择性(避免人体毒性)
6.2.3 创新方法
-
多靶点药效团模型:
- 针对DNA旋转酶和人类topoII构建双重药效团
- 筛选能匹配细菌靶点但避开人类靶点的分子
-
3D形状相似性筛选:
- 使用已知活性分子作为形状模板
- 通过ROCS软件计算3D形状相似性
-
活性预测模型:
- 收集约500个天然产物的抗菌活性数据
- 训练图注意力网络(GAT)模型
- 结合分子指纹和物化性质
-
类药性评估:
- 计算类药性评分(QED)
- 预测ADMET性质(使用ADMET Predictor)
6.2.4 筛选结果
- 从2万个天然产物中筛选出200个候选
- 实验验证发现5个具有抗菌活性的化合物
- 最佳化合物对金黄色葡萄球菌MIC=4μg/mL,且细胞毒性低(CC50>100μg/mL)
6.3 案例三:GPCR变构调节剂发现
6.3.1 技术挑战
G蛋白偶联受体(GPCR)变构调节剂的发现面临特殊挑战:
- 变构位点定义不明确
- 缺乏高质量活性数据
- 传统对接方法效果不佳
6.3.2 解决方案
-
变构位点预测:
- 使用分子动力学模拟识别潜在的变构口袋
- 基于序列共进化分析预测变构网络
-
特殊对接策略:
- 对变构口袋进行柔性对接
- 使用专门开发的变构打分函数
-
药效团模型:
- 从已知变构剂中提取特征
- 强调与变构位点的特殊相互作用
-
机器学习模型:
- 收集文献报道的变构活性数据
- 训练针对变构剂的分类模型
- 使用迁移学习弥补数据不足
6.3.3 项目成果
- 发现首个mGluR5的新型变构抑制剂
- 晶体结构证实了变构结合模式
- 建立了GPCR变构剂筛选的标准流程
案例启示:这些案例表明,成功的虚拟筛选项目需要根据靶点特点和项目需求定制筛选策略。对于难成药靶点(如GPCR变构位点),往往需要开发专门的计算方法和流程。同时,实验验证环节至关重要,计算预测必须通过实验确认。
