清华大学药学院田博学课题组基于蛋白质-小分子互补配对规则进行药物设计
碱基互补配对是生物体复制DNA所需的一种简单识别方式。蛋白质与小分子之间是否存在类似的识别规则?基于这些规则,能否更好地理解生命活动并辅助药物设计?近日,清华大学药学院田博学课题组在《Chemical Science》上发表题为“An Interpretable Framework Applying Protein Words to Predict Protein–Small Molecule Complementary Pairing Rules”的研究论文。该研究提出可解释框架 PWRules,从大规模结合亲和力数据中自动学习蛋白质与小分子的互补配对规则,并基于规则建立了虚拟筛选评分函数 PWScore用于药物发现。这项工作以团队2026年初发表于《Advanced Science》的蛋白词表技术为基础,将蛋白质序列解析为可复用的基本知识单元(单词)。
蛋白-小分子结合亲和力预测是药学的核心问题。传统物理模型长期指导药物化学实践,但准确率不足;深度学习的发展带来了新的机遇,但模型泛化能力差,对未见过的蛋白预测准确率有限。能否跳出这两类框架,寻找新的可解释、可迁移、能泛化的蛋白-小分子结合亲和力预测方法,是一个值得探索的问题。
从亲和力数据中学习互补配对规则
PWRules 框架首先利用蛋白词表技术将蛋白序列解析为“蛋白词”——具有功能含义的基本知识单元,并将小分子拆分为药物化学常用片段;随后整合覆盖 9,661 种蛋白质、约 164 万个小分子的约 344 万条结合亲和力记录,识别在特定蛋白活性配体中频繁出现的优势片段,再通过深度学习模型与积分梯度归因分析,提取蛋白词与优势片段的配对关系,最终构建包含约 252 万条规则的规则库,涉及 80,468 个蛋白词和 4,876 种小分子片段,每条规则都可追溯至具体的序列单元与分子结构。
尽管训练完全基于序列与亲和力数据、未使用任何三维结构信息,所学配对规则仍显著富集于配体结合口袋附近:测试集约半数规则的蛋白词与片段质心距离在 15 Å 以内,比例显著高于随机配对。在 HIV-1 蛋白酶与抑制剂的复合物中,配对规则准确对应了已知的氢键与静电相互作用,例如蛋白词 DTGAD 与片段 frag_2565 的配对质心距离仅 5.63 Å,恰对应晶体结构中的关键氢键,表明配对规则具有明确的物理结构基础。
图1 配对规则与已知复合物结构的对应关系。PWRules 识别的蛋白词与小分子片段在空间中相互邻近,并对应 HIV-1 蛋白酶与抑制剂之间的氢键和静电相互作用。
基于配对规则,团队进一步建立评分函数 PWScore,根据候选分子与靶标优势片段的匹配情况对化合物库打分排序。在两个虚拟筛选基准数据集上,PWScore 的活性分子富集能力与基于物理的对接方法 Glide、深度学习方法 PSICHIC 相当,且在排名最前的区间表现最优;由于提供了不同于能量计算与模式识别的互补信息,与现有方法联用可进一步提高富集能力。在针对新冠病毒主蛋白酶 Mpro(未纳入训练集)的独立筛选中,Glide 与 PWScore 联合排序后,排名前 0.5% 的化合物中已知活性分子占比达 86.3%。
图2 基于互补配对规则的虚拟筛选。a,PWScore 工作流程;b-c,PWScore 与 Glide、PSICHIC 及联合策略在两个基准数据集上的富集因子比较。
蛋白词表技术定义蛋白的“官能团”
建立互补配对规则的前提,是将蛋白质解析为可识别、可复用的基本知识单元。团队发表于《Advanced Science》的工作为此提供了技术基础:研究提出 Protein Wordwise,通过分析蛋白语言模型 ESM-2 的注意力矩阵并结合社区发现算法,无需预先给定功能注释或三维结构,即可将蛋白序列自动解析为通常由 5 至 20 个残基组成的蛋白词——这些残基可在序列上连续,也可分布在不相邻位置;结合蛋白家族与通用序列库构建的蛋白词典,蛋白词得以跨蛋白识别与复用,对功能残基的覆盖率中位数达 90.0%。
在此基础上,研究进一步开发 Word2Function 模型,学习蛋白词与基因本体功能条目之间的关系,并通过归因分析建立“蛋白词—功能”对应表 WordTableGO65。在核酸结合、小分子结合、催化等十类功能任务上,该方法的注释准确性显著优于国际通用的模体数据库 PROSITE;在多个蛋白实例中,识别出的功能词准确对应已知的催化位点及 DNA、RNA、ATP 结合位点,为理解模型预测依据提供了可检索的线索。
图3 从蛋白词到功能注释。Word2Function 学习蛋白词与基因本体功能条目的关系,通过归因分析生成功能注释词表 WordTableGO65,注释性能优于传统模体方法 PROSITE。
上述系列研究形成了从解析蛋白序列、注释蛋白功能到提取蛋白—小分子互补配对规则的完整技术路线,为可解释的药物发现提供了新思路与新工具。田博学研究员为两篇论文的独立通讯作者;Chemical Science 论文共同第一作者为陈靖轲、钟憬锐、Tazneen Hossain Tani、苏子栋、张孝春,Advanced Science 论文共同第一作者为陈和地、钟憬锐、张孝春、陈靖轲、郭林、熊晓亮。两项研究得到北京市自然科学基金、CCF—百度开放基金、北京生物结构前沿研究中心、清华—北大生命科学联合中心等资助。
田博学博士,清华大学药学院研究员、博士生导师。本科毕业于华东理工大学,硕士毕业于瑞典厄勒布鲁大学,博士毕业于爱尔兰国立大学(高威),随后于美国加州大学旧金山分校从事博士后研究。主要致力于计算化学与计算生物学研究,开发 AI 辅助酶设计、分子性质预测及化学合成等关键技术。近年来,在蛋白词表技术、物理启发式蛋白语言模型、结合位点预测及复杂反应机理模拟等方面取得系列原创成果,在 Nature、Neuron、Angew. Chem. Int. Ed.、Adv. Sci.、Chem. Sci.、ACS Catal. 等期刊发表多篇研究论文,为 AI 制药与智能生物合成等领域提供了新思路与新工具。
Chemical Science | DOI 10.1039/d6sc03365b
Advanced Science | DOI 10.1002/advs.202521970