昌平实验室与华为发布TorchX,抗体设计成功率从34%提到70%

首页 / AI资讯 / AI4S

0:00
0:00
1x
定时

AI做生物分子设计这件事,长期卡在两个地方:一是模型能力,二是算力归属。前者决定能不能算出有用的结果,后者决定谁能用得起。9月17日,昌平实验室与华为联合发布TorchX全原子生物分子模型体系,一次性回应了这两个问题:模型侧给出三个核心模块,算力侧做到昇腾NPU原生,同时把推理代码、训练代码、模型权重与训练数据全部开放。

三个模块拼出一条完整链路

TorchX由三个核心功能模块组成。TorchFold负责抗体与抗原复合物的结构预测,TorchScore负责候选复合物的结构评价,TorchCraft则通过预测器反演开展分子设计。三者串起来,构成从结构预测到质量评价再到反向设计的完整链条,而不是各自独立的单点工具。

分工的意义在于闭环。只做预测,用户拿到结构后仍要判断好坏;只做评价,前提是有结构输入;只有把预测、评价与设计打通,才能形成设计、评估、迭代的循环。对药物研发来说,这个循环的效率决定了候选分子的筛选速度。

TorchCraft的能力边界也做了明确设计,它实现了跨分子类型的统一全原子设计,可同时用于微型蛋白结合体、框架约束的VHH、环肽以及小分子结合口袋设计。针对IFNAR2、IL-7Rα等靶点的微型蛋白及VHH设计均经过生物层干涉法验证,达到纳摩尔亲和力,且实验候选直接取自TorchCraft的输出,而不是人工挑选后的结果。

成功率从34.0%到70.1%:训练样本扩了5倍之后发生了什么

TorchFold保留AlphaFold3的网络架构,但通过三项创新训练策略做了改造:界面特异性坐标损失、高噪声扩散调度策略,以及两轮置信度筛选蒸馏。这些改动的直接结果是训练数据规模的变化,非冗余抗体抗原训练样本由约5000个扩展到24500个。

数据规模带来的提升相当明显。在FoldBench基准上,TorchFold的成功率由34.0%提升至70.1%,提升超过一倍。在五项来源不同、时间范围不同、抗原组成也不同的抗体抗原基准上,模型都表现出稳定的高质量界面恢复能力,说明提升不是针对某个测试集的过拟合。

抗体抗原复合物的结构预测难度高于通用蛋白结构预测,原因是界面区域小、构象变化大、可用的高质量训练数据稀缺。把训练样本扩到接近五倍,本质上是在用数据规模补偿这一领域的结构性数据缺口。这也是国产团队在这个方向上的现实突破口:不一定要在架构上另起炉灶,把数据组织与训练策略做扎实同样能拿到结果。

NPU原生:国产算力从能跑推理到能训模型

TorchX更受关注的部分是算力侧的定位。官方称其为业界首个NPU原生的开源全原子生物分子模型体系,推理与训练代码全面适配昇腾NPU。华为与昌平实验室通过蛋白质序列残基注意力算子融合、流水调度以及昇腾亲和性优化等方式,提升了推理训练速度并降低显存占用。

工程细节里能看到适配的深度。在TorchCraft中使用了可重入式梯度重计算,期间双方联合修复了PyTorch原生梯度重计算在当前模型下的显存泄漏问题;针对长序列场景,华为团队补齐了注意力算子的反向计算功能,使该算子在当前模型下可以正常使能。这类工作不会出现在论文标题里,却决定了模型能不能真正跑在大规模训练任务上。

把这件事放回9月的国产算力脉络看,意义更清楚。9月中旬中电信开源星辰Xing4.0-29B-A4B,全程基于昇腾910C与国产框架训练,训练吞吐较开箱状态提升约96%;9月19日华为披露昇腾已跨越生态拐点,基于昇腾完成预训练的大语言模型与多模态模型超过40个,CANN开源社区月均活跃开发者超5200人。从只能跑推理到能完成训练,是国产算力生态最关键的一步,而TorchX补上的是科研这一侧的场景验证。

开放训练数据:比开源权重更关键的一步

TorchX的开源范围值得单独拆开看。除了推理代码与训练代码,昌平实验室还开放了模型权重与训练数据,权重按MIT许可发布。对科研工具而言,开放训练数据比开放权重更难,也更稀缺,因为它涉及数据来源、清洗流程与标注标准这些通常被视为核心资产的环节。

开放训练数据的直接效果是可复现性。其他团队可以用同一份数据验证结果、在此基础上继续训练,而不是只能接受官方给出的评测分数。对生物医药这类对结论严谨性要求极高的领域,可复现是成果被采信的前提。

另一层效果是降低使用门槛。生命科学领域的研究者往往算力有限,如果模型必须依赖特定商业平台,能力再强也难以普及。代码、权重与数据三者齐备,加上对国产算力的适配,等于把整条链路交给科研机构自己掌握,这对上百万科研工作者来说意义直接。

AI4S的竞争,正在从模型转向闭环

把TorchX放回9月的AI for Science进展里,能看到一个共同趋势:从单点突破走向闭环验证。五家跨国药企用联邦学习训练出蛋白预测模型,证明竞争企业可以在不共享原始数据的前提下共建模型;分子之心的反应性力场框架把分子模拟推进到动态反应层面;Periodic Labs用自家高通量实验室产出的湿实验数据训练材料分析模型。这些工作的共同点是,模型不再只是分析工具,而是嵌入了设计、实验与验证反馈的完整链条。

对国内团队来说,闭环的构建方式还多了一层考虑:算力与工具链的自主性。当模型训练、推理与实验验证的每一环都能在自主技术栈上跑通,科研效率的提升才不会被外部供给波动打断。TorchX把这三个环节都做了适配与开放,指向的正是这个目标。

素材来源:科技日报、凤凰网科技、昌平实验室、华为计算 发布时间:2026-09-21