- Docking score 是协议内的代理目标,不是实验结合自由能。
- 构象生成、亲和力预测、同系列排序与虚筛富集必须分别验证。
- 可信用途是生成可证伪姿势与实验优先级,而不是由原始分数换算 Kd。
1. 相同单位,不代表相同物理量
标准结合自由能与平衡解离常数的关系可写为 \Delta G^\circ = RT\ln(K_d/C^\circ)。这里的 \Delta G^\circ 是结合前后完整热力学系综的自由能差,包含溶剂重排、蛋白和配体构象变化、平动/转动与构象熵,以及可能耦合的质子化变化。[6] Docking score 则是为快速搜索与排序设计的代理目标:例如 Vina 使用简化评分函数配合随机全局搜索和局部优化;官方文档虽把输出列为 predicted binding affinity(kcal/mol),同时也明确其基础是一个 simple scoring function。[1,2] 因而,数值标签和真实 \Delta G^\circ 同单位,并不意味着两者可逐值等同,更不意味着不同软件的分数可直接横向换算。
2. “找到姿势”与“预测亲和力”是两项任务
对接流程先采样构象,再用评分函数选择或重排构象;采样失败时,再好的评分也看不到正确答案,评分失败时,近天然构象也可能排不到第一。CASF-2016 因此把性能拆成 docking power(识别近天然姿势)、scoring power(预测绝对亲和力)、ranking power(同靶点系列排序)和 screening power(区分活性物与非活性物)。在 285 个高质量复合物、25 个评分函数的评估中,构象识别总体比亲和力预测、同系列排序和虚筛判别更有希望。[7] 早期跨靶点基准也没有找到对所有靶点都稳定领先的单一程序。[3] 所以“晶体配体回对接 RMSD 合格”只验证了某个构象重现环节,不能顺带证明绝对亲和力准确。
3. 输入状态会改变分数,也会改变问题本身
蛋白是否采用 apo、holo 或不同构象,口袋侧链朝向、缺失残基、金属/辅因子与结构水是否保留,都会改变可用相互作用。配体的质子化、互变异构、立体化学和电荷模型同样关键。系统研究显示,常用对接程序可能无法在多个 protomer 或 stereoisomer 中可靠选出正确状态。[4] 现代基准最佳实践也强调核对键级、立体化学、离子化/互变异构状态、口袋残基质子化、辅因子和结晶水。[8] 因此,两个分数若来自不同输入状态,即使软件与参数相同,也不一定是在回答同一个化学问题;在金属配位、共价结合、显著诱导契合或水桥主导体系中,这一风险更高。
4. 实验标签本身也有条件和噪声
Kd、Ki 或其他活性读数来自具体实验体系,不是脱离条件的化合物常数。公共数据库汇集不同实验室、构建体、底物浓度、温度与分析方法时,会引入异质性;对公共 Ki 数据的研究直接观察到这种实验不确定性。[5] 因而,用混杂来源的标签训练或评估评分函数,可能同时学习实验差异、配体大小等数据偏差。较可靠的靶点内校准应尽量使用同一实验类型、相近条件、明确单位与检测上下限的数据,并报告重复与误差,而不是把不等价的 Kd、Ki 和功能读数无条件并表。[5,8]
5. AI 评分提高速度或基准成绩,却没有取消适用域
机器学习评分函数能从大规模复合物数据中学习有用规律,但随机划分容易让相似配体、相似蛋白或相似口袋同时出现在训练与测试集。2022 年对 12 类模型的评估显示,从随机划分到序列划分、再到口袋 Pfam 划分,性能依次下降,提示跨新靶点泛化不足。[9] 2023 年的工作进一步指出,模型可能依赖数据集捷径而非真正的原子相互作用,并通过严格过滤训练/测试相似性来检验这一问题。[10] 2025 年一个同时考察 CASF、低配体偏差、真实同系系列和分布外集合的研究中,两个代表模型的 Pearson 相关系数分别从 0.83 降至 0.57、从 0.76 降至 0.55;作者强调单一基准会给出过于乐观的能力估计。[12] 这些结果不等于“AI 对接无用”,而是要求报告训练数据邻近性、严格拆分、外部靶点和不确定性。
6. 高分姿势仍需化学与实验复核
PoseBusters 对经典与深度学习对接方法的比较表明,只看配体 RMSD 仍会漏掉异常键长、内部碰撞、严重位阻或高应变等物理问题;对训练集低序列相似目标,部分深度学习方法的泛化尤其不稳。[11] 因此,候选排序前应检查配体内部几何、蛋白–配体碰撞、关键相互作用、未满足的极性基团、配体应变及口袋环境,并观察不同随机种子、受体构象或评分函数下结论是否稳健。最终需要用正交实验确认:生化/生物物理结合测定回答是否结合及亲和力,结构实验回答姿势,细胞实验回答功能效应;三者不能由一个 docking score 同时替代。
常见误区
- “−10 kcal/mol 比 −8 kcal/mol 强很多,所以能直接换算 Kd。” 只有经过针对该靶点、该协议和同质实验数据的外部校准,才可以讨论经验映射;原始 score 不是热力学测量。
- “不同软件都输出 kcal/mol,所以可以合并排名。” 各评分函数的项、权重、零点、构象搜索和预处理不同;合并前必须在同一验证集上重标定。
- “回对接成功就证明能筛新骨架。” 回对接利用已知 holo 口袋,验证范围窄;新骨架、apo 结构或新口袋属于更强的分布外检验。
- “AI 模型的 confidence/affinity head 已解决物理问题。” 模型输出仍受训练集相似性、标签噪声和几何有效性影响,应与物理检查及前瞻实验共同评估。[9–12]
结论
Docking score 最有价值的角色是“低成本、可审计的假设排序器”,而不是“无需校准的亲和力仪器”。可信流程把分数放在输入质控、适用域、对照、重复、姿势检查和实验验证之间:它可以帮助决定先做什么,却不能单独证明分子一定结合、以何种强度结合,更不能证明细胞或临床有效。
决策清单:什么时候可以相信“排序”,而不是相信“数值”
先写明任务
构象生成、虚筛富集、同系物排序,还是绝对亲和力预测;不要混用评价指标。
固定并记录受体构象、口袋边界、配体 protomer/tautomer、辅因子、金属、结构水和共价假设
用共晶配体做回对接,并以已知活性物、弱活性物/诱饵检验富集或排序,而不只报告一个 RMSD
重复随机种子并扰动关键设置;查看名次、关键相互作用与姿势是否稳定,而不只看最优一次
只在同一靶点、相近化学系列、同一协议和同质实验数据内做经验校准,并用留出的外部化合物验证
对高分候选执行几何、碰撞、应变、质子化与人工化学审查;保留结构多样的备选,而非只取前 N 名
实验队列同时包含阳性、阴性和机制对照;把 docking 结论表述为待验证的优先级或结合模式假设
需要保留的解释边界
- 结论类型: 为同一协议下的候选生成初步优先级 · 合理强度: 可用 · 需要的最低证据: 质控合格输入、内部对照、重复运行、姿势审查
- 结论类型: 推断可能的结合模式或关键残基 · 合理强度: 假设级 · 需要的最低证据: 多构象/多方法一致性,突变或结构实验可证伪
- 结论类型: 排序同一靶点的近邻同系化合物 · 合理强度: 条件性可用 · 需要的最低证据: 同质实验校准、严格留出集与适用域说明
- 结论类型: 报告绝对 Kd/Ki、跨靶点比较或给出确定效力 · 合理强度: 不应仅靠 docking · 需要的最低证据: 经验证的定量模型或自由能流程,并由实验测定确认
- 结论类型: 推断细胞效应、选择性、安全性或临床获益 · 合理强度: 超出范围 · 需要的最低证据: 额外的生化、细胞、药代/毒理与临床证据链
核验来源
- AutoDock Vina project. AutoDock Vina documentation: Molecular docking program. Official documentation, release 1.2.x. Accessed 2026-08-16.2026
- Eberhardt J, Santos-Martins D, Tillack AF, Forli S. AutoDock Vina 1.2.0: New Docking Methods, Expanded Force Field, and Python Bindings. *J Chem Inf Model.* 2021;61:3891–3898. DOI: [10.1021/acs.jcim.1c00203](2021 · DOI 10.1021/acs.jcim.1c00203
- Warren GL, Andrews CW, Capelli A-M, et al. A Critical Assessment of Docking Programs and Scoring Functions. *J Med Chem.* 2006;49:5912–5931. DOI: [10.1021/jm050362n](2006 · DOI 10.1021/jm050362n
- ten Brink T, Exner TE. Influence of Protonation, Tautomeric, and Stereoisomeric States on Protein–Ligand Docking Results. *J Chem Inf Model.* 2009;49:1535–1546. DOI: [10.1021/ci800420z](2009 · DOI 10.1021/ci800420z
- Kramer C, Kalliokoski T, Gedeck P, Vulpetti A. The Experimental Uncertainty of Heterogeneous Public Ki Data. *J Med Chem.* 2012;55:5165–5173. DOI: [10.1021/jm300131x](2012 · DOI 10.1021/jm300131x
- Pantsar T, Poso A. Binding Affinity via Docking: Fact and Fiction. *Molecules.* 2018;23:1899. DOI: [10.3390/molecules23081899](2018 · DOI 10.3390/molecules23081899
- Su M, Yang Q, Du Y, et al. Comparative Assessment of Scoring Functions: The CASF-2016 Update. *J Chem Inf Model.* 2019;59:895–913. DOI: [10.1021/acs.jcim.8b00545](2016 · DOI 10.1021/acs.jcim.8b00545
- Hahn DF, Bayly CI, Boby ML, et al. Best Practices for Constructing, Preparing, and Evaluating Protein-Ligand Binding Affinity Benchmarks [Article v1.0]. *Living J Comput Mol Sci.* 2022;4:1497. DOI: [10.33011/livecoms.4.1.1497](2022 · DOI 10.33011/livecoms.4.1.1497
- Zhu H, Yang J, Huang N. Assessment of the Generalization Abilities of Machine-Learning Scoring Functions for Structure-Based Virtual Screening. *J Chem Inf Model.* 2022;62:5485–5502. DOI: [10.1021/acs.jcim.2c01149](2022 · DOI 10.1021/acs.jcim.2c01149
- Scantlebury J, Vost L, Carbery A, et al. A Small Step Toward Generalizability: Training a Machine Learning Scoring Function for Structure-Based Virtual Screening. *J Chem Inf Model.* 2023;63:2960–2974. DOI: [10.1021/acs.jcim.3c00322](2023 · DOI 10.1021/acs.jcim.3c00322
- Buttenschoen M, Morris GM, Deane CM. PoseBusters: AI-based Docking Methods Fail to Generate Physically Valid Poses or Generalise to Novel Sequences. *Chem Sci.* 2024;15:3130–3139. DOI: [10.1039/D3SC04185A](2024 · DOI 10.1039/D3SC04185A
- Valsson Í, Warren MT, Deane CM, et al. Narrowing the Gap between Machine Learning Scoring Functions and Free Energy Perturbation Using Augmented Data. *Commun Chem.* 2025;8:41. DOI: [10.1038/s42004-025-01428-y](2025 · DOI 10.1038/s42004-025-01428-y
检索更新于 2026-08-16。本文为证据导向的叙述性方法综述,不是注册系统综述或荟萃分析;引用优先采用一手论文、官方文档和标准。
