AI预测蛋白质结构的声浪持续了几年,但一旦把问题推进到"药物分子与靶点如何结合",整个领域就撞上同一道墙:公开数据远远不够。9月14日,Nature官网以头条形式报道了一项新进展。由艾伯维、Astex、百时美施贵宝、强生、武田五家跨国药企组成的AISB网络,动用超过两万个私有的蛋白-配体结构,对开源版AlphaFold3即OpenFold3进行联邦学习微调,训练出AISB-1-Fed,在蛋白-药物复合物预测上显著优于仅用公开数据训练的版本。这件事的意义不只是准确率提高,而是它验证了一条路径:药企不交出原始数据,也能联合把模型训练得更好。
问题的起点是数据规模。AlphaFold2能拿下诺贝尔化学奖,仰仗的是蛋白质数据库PDB里二十余万例实验结构。但PDB打的是学术底色,不是制药底色。目前PDB超过24万例结构中,与已上市或在研药物直接相关的仅约1.06万例,AlphaFold3训练截止后新增的此类结构也不过三千例上下。Astex公司计算化学与信息学副总裁保罗·莫滕森的保守估计是,同时符合"实验解析"与"类药分子"两个条件的蛋白结构,大约只有一万个。
数据不足的后果已经被测出来。AlphaFold3、Boltz、OpenFold3这类共折叠模型,遇到与训练集相似的蛋白-配体对时表现尚可,一旦配体的化学类型、靶点构象偏离训练分布,准确率便骤降。2026年FoldBench等基准测试重复了同一结论:配体与训练集的相似度越低,对接精度越差,抗体与抗原这类复杂界面同样是难啃的骨头。而对药企来说,最棘手之处恰恰在这里:新靶点、新骨架、新构象,天生就不像公开数据。另一边,大型药企数十年研究积累的蛋白-配体复合物专有数据,因知识产权、保密义务与监管限制,始终锁在各自内网。艾伯维计算药物发现负责人约翰·卡拉尼科拉斯对Nature的说法很直接,PDB缺的数据,恰好是我们内部就有的数据。
让五家竞品公司直接交换原始结构并不现实,折中方案在2025年逐步成形:先由艾伯维和强生发起AI Structural Biology网络,同年10月Astex、百时美施贵宝与武田加入。联盟与哥伦比亚大学穆罕默德·阿尔库莱希实验室直接合作,OpenFold系列正是该实验室主导的开源项目,联邦计算平台则由柏林公司Apheris提供。技术路线很明确:联邦学习加OpenFold3微调。
训练被搬到数据所在的地方。OpenFold3的模型权重进入各公司的防火墙,在本地数据上训练;每轮结束后,参与方只回传约2GB的模型更新给Apheris,聚合成全局模型后再发回各家。原始结构始终留在公司内部,流动的只有模型参数。公开披露口径下,训练集共20167个蛋白-配体结构,全部出自这五家公司的药物发现项目,解析手段覆盖X射线晶体学与冷冻电镜等方法。工程投入也不小:整套训练在80张H100 GPU上连续跑了近一个月。同步联邦对节奏的要求也更严:每轮必须五家全部完成才能推进,最慢的一家决定了整体速度,这也是工程上最容易被低估的一笔成本。
关键问题是,凑在一起训练真的比各练各的更强吗。答案看起来是肯定的,而且对照做得比较完整。在五家公司共同留出的1056个未参与训练的蛋白-配体测试结构上,AISB-1-Fed的高质量预测占比达到52.1%,公开版OpenFold3约为35.6%,另一个开源模型Boltz-2为40.9%。在配体姿态误差达标这一项上,新模型在46.8%的结构上取得正确构象,而OpenFold3预览版2为28.9%。
更有说服力的是第三组对照:AISB-1-Fed还跑赢了每家公司单独用自家数据微调的版本。各家的数据增量解释不了联邦版为何更强,官方材料给出的解释是数据互补。一家药企即便有几千个结构,也只覆盖自己的靶点与化合物偏好;五家加起来,化学空间、靶点类型与实验条件才更完整。换句话说,数据多样性比单纯堆量更关键。Apheris联合创始人兼首席执行官罗宾·勒姆对媒体表示,聚合后的模型掌握了约两万种相互作用的知识,却不包含任何一份原始数据。
需要保持清醒的是证据强度。这项结果以博客形式公布,尚未经过同行评审,评测细表未公开,模型也不对外开放,外部无法复现。Boltz公司首席执行官加布里埃莱·科尔索提出保留意见,认为AISB的结果尚未在广泛公开基准上、与最新前沿共折叠模型做全面对比,只看自有测试集说服力不够。这一批评是合理的:药企内部测试集再好,也需要PoseBusters、FoldBench与跨靶点交叉对接等第三方基准来复现。
补数据的路线也已经分叉。一条是AISB代表的私有存量路线,用联邦学习把各家保险柜里的历史结构换成模型能力,模型只归参与方,局外人拿不到入场券;另一条是公开造数据路线,例如由英国同步辐射光源牵头的OpenBind项目,直接新造结构并公开,2026年5月已释放首批数据,长期目标达到数十万级并回灌PDB,英国政府最高资助800万英镑;还有辉瑞等牵头的LIGAND-AI,不只做结构,还做千级、亿级小分子与蛋白的结合强度,形成结构与亲和的双信号。对国内AI制药的启发比较明确:共折叠模型不能只刷PDB,药物项目需要补上内部晶体、表面等离子共振、等温滴定量热、冷冻电镜与氢氘交换数据,形成自有基准;多家药企、CRO与AI公司若共建模型,联邦加隐私计算比"建一个共享数据库"更现实。此外还要区分结构预测与找药,共折叠模型提升的是结构判断,后面仍要靠对接、自由能与活性排序,最后落到湿实验。