腾讯AI虚拟细胞模型登顶《Cell》主刊,4994个基因7860种化合物统一建模,破解癌症耐药难题

首页 / AI资讯 / AI4S

0:00
0:00
1x
定时

7月31日,国际顶级学术期刊《Cell》主刊在线发表了一项来自中国团队的突破性研究。腾讯生命科学实验室与中南大学联合提出AI虚拟细胞模型UniPert-G2CP,首次将基因扰动与化学药物扰动映射至统一语义空间,解决了化学扰动与细胞特异性响应这一长期难题。这是国内首个登上《Cell》主刊的AI虚拟细胞研究,标志中国团队在计算生物学领域实现了零的突破。

这项研究的规模令人瞩目。UniPert-G2CP覆盖4994个基因、7860个化合物和5种癌症细胞系,构建了超过8200万个干预与响应配对,是目前该方向规模最大、数据模态最丰富的公开建模工作之一。研究团队以乳腺癌内分泌治疗中的耐药问题为案例,完成了从算法预测到机制解释的完整闭环验证,核心模块UniPert已在GitHub开源。

基因与药物为何必须放在同一坐标系里

同一种药,对不同人效果却不同,一个重要原因是细胞背景存在差异。研究中,同一种化合物作用于两种乳腺癌细胞,一种几乎没有反应,另一种却产生明显响应。然而在过去,基因和药物是两套完全不同的数据:基因由生物序列描述,药物由分子结构描述,很难被AI放在一起理解。这正是UniPert要解决的第一件事:给两类数据建立一套共同的坐标系。

研究团队利用53963对已知的药物与靶点相互作用作为桥梁,让AI不只判断两者结构像不像,更能学习它们在功能上是否相近。结果显示,在18类药物作用机制分类中,UniPert相较传统方法准确率平均提升14.4%。在没见过的单个基因、没见过的基因组合、没见过的药物等多项任务中,UniPert整体优于七种主流方案。在药物与蛋白结合关系预测中,其给出的前0.5%候选,命中概率达到随机筛选的19倍。

G2CP只用20%药物数据,预测性能提升3.7倍

打通两类数据之后,第二个难题是药物实验数据远远不够。理论上可能成为药物的分子超过10的60次方,而全球最大的药物扰动数据库也只覆盖约2万个化合物。相比之下,人类基因约2万个,利用基因编辑技术一次就可以并行测试数千个基因。团队因此提出一个关键思路:先学基因,再学药物。G2CP先利用规模更大的基因实验数据,让AI学习不同细胞面对干预时的响应规律,再把这些知识用于药物预测。

这一迁移学习策略的效果超出预期。在5种癌症细胞系上,仅使用20%的药物训练数据,整体预测性能就提升了3.7倍,意味着仅用约2500个基因的数据就能获得大部分收益。研究还发现,选择哪些基因比单纯增加基因数量更重要,而把不同细胞的数据混在一起训练,效果反而可能下降,进一步验证了细胞背景是预测药物响应必须保留的信息。这些发现为数据稀缺的药物响应建模提供了全新的方法论。

8200万个干预响应配对,数据工程如何托底

UniPert-G2CP能登上《Cell》主刊,扎实的数据工程功不可没。研究覆盖4994个基因、7860种化合物和5种癌症细胞系,构建了超过8200万个干预与响应配对,是目前该方向规模最大、数据模态最丰富的公开建模工作之一。如此大规模的数据整合并非简单拼接,而是需要统一不同实验平台的测量口径,处理噪声与批次效应,并将基因编辑与化学扰动两类实验数据对齐到可比的语义空间,这本身就是一项高难度的系统工程。

更值得关注的是研究团队对数据价值的深度挖掘。他们没有止步于堆砌更多数据,而是通过实验设计证明:基因筛选数据可以作为化学数据的预训练语料,让模型在接触少量药物数据之前就建立对细胞响应规律的基本认知。这种先学基因、再学药物的思路,本质上是在回答AI4S领域的一个核心问题,即如何在数据稀缺的条件下获得足够的预测能力。腾讯与中南大学用一篇顶刊论文给出了答案,也为整个计算生物学社区提供了一套可复制的方法论,这正是UniPert-G2CP超越单篇论文的长期价值所在。

从一篇论文到数字孪生诊室,AI虚拟细胞的落地路径

这项研究最直接的应用价值,体现在乳腺癌内分泌耐药的机制解析上。团队利用UniPert-G2CP分析ESR1耐药问题,AI识别出不同细胞的药物响应差异,并关联到两个临床已知的耐药突变,相关结果通过实验得到验证。腾讯生命科学实验室表示,后续将把UniPert-G2CP沉淀为Skill,集成到腾讯AI生命科学智能体平台,以更加智能体友好的形式进入科研工作流,服务虚拟药物筛选、候选化合物评估与耐药机制分析等任务。

更长远来看,UniPert-G2CP提供的是虚拟细胞的基本计算单元,其意义如同GPU之于深度学习。当此类计算单元被规模化、模块化并智能体化后,数字孪生诊室将不再停留在实验室层面:医生面对真实患者时,可在云端实时构建该患者的数字孪生细胞群,对多种候选治疗方案进行虚拟试验,再基于反馈结果制定最优治疗方案。研究团队在论文中同时公开了模型细节与评测方法,为全球同行提供了可直接比对的基准。从实验室里的一行代码到未来诊室里的一次医疗决策,中国团队用一篇《Cell》主刊论文,为AI深入精准医疗内核写下了注脚。

来源:腾讯云 发布时间:2026-08-02