化学家认识一个分子,看的远不止一串字符——原子如何连接、分子呈现怎样的二维拓扑和三维构象、包含哪些官能团与结构片段,都会影响其性质和功能。然而,现有化学语言模型大多将分子表示为SMILES等一维字符串,虽然便于大语言模型处理,却难以完整呈现分子的多层次结构。北京大学深圳研究生院科学智能学院田永鸿、袁粒团队的最新研究,彻底改变了这一局面。
该研究以Navigating Chemical-Linguistic Sharing Space with Heterogeneous Molecular Encoding为题,于7月在线发表于国际顶级期刊Nature Communications。团队提出的异质分子编码框架HME,首次实现了将分子的四种不同维度结构信息统一接入大语言模型,让AI从"只看一串字母"升级为"全面感知分子"。这一突破有望加速药物发现和材料设计领域的人工智能应用进程。
传统化学语言模型依赖SMILES或SELFIES格式处理分子,相当于让一位画家只通过一串数字编码来想象一幅画——丢失的信息量是巨大的。一个分子的一维序列可以告诉你原子是如何相连的,但无法呈现分子的三维空间构象;二维分子图能展示原子间的键连关系,但看不出官能团分布;三维坐标能表达分子的立体结构,但计算开销巨大。
HME框架的核心理念是:让AI大语言模型直接从四个互补视角同时读取同一个分子。一维SMILES呈现分子序列,二维分子图描述原子与化学键的连接,三维坐标提供空间构象,分子片段则突出芳环、杂环和官能团等具有明确化学意义的结构单元。研究团队设计了专用的查询学习模块,将二维和三维结构信息提取为大语言模型能够直接处理的"软标记",并通过交叉注意力机制融合拓扑与几何信息。
这意味着,分子结构和自然语言能够进入同一个自回归模型进行统一建模。描述分子、回答化学性质问题、预测量子化学指标,以及生成满足特定设计目标的新分子,都被纳入了一个统一的框架之内。更换不同的大语言模型作为骨干后,这一框架仍能带来稳定的性能增益。
许多基于化学语言模型的方法直接按照SMILES标记逐步生成分子。当生成序列较长时,累积误差可能使最终产物与目标大相径庭。HME的"片段链"机制从根本上改写了这一过程:模型先预测目标分子应包含的关键结构片段,形成高层次的"化学蓝图",再据此生成完整的SMILES序列。
这种先规划后执行的方式,把高层结构规划与原子级生成衔接起来,使模型不再只是逐字符"拼写"分子,而是学习片段之间以及片段与完整原子结构之间的统计关联。在文本引导的分子生成任务中,HME的精确匹配率达到0.334,Levenshtein距离降至14.25。消融实验显示,去除CoF机制后多项指标出现明显下降,充分验证了这一机制的有效性。
在产品级验证中,HME的表现更加令人信服。以一个、两个和三个片段作为约束进行分子生成测试时,生成分子完整包含所有指定片段的比例分别达到92.64%、78.84%和62.59%。更值得注意的是,模型表现出一定的零样本组合泛化能力,对训练中未出现的条件组合也能进行一定程度的泛化。
HME的实际应用场景广阔。真实的分子设计往往需要同时兼顾多项要求:候选分子不仅要具有合适的脂溶性和类药性,还必须包含指定的官能团或核心骨架。HME能够将这些数值和结构要求统一写入自然语言提示,让模型同时响应性质目标与片段约束。
研究团队还探索了基于蛋白结合口袋的分子设计任务,HME能够在已知靶点结构的前提下,设计出可与之特异性结合的新型候选分子。对于制药行业而言,这意味着先导化合物优化和结构改造的效率将跃升一个数量级。目前,HME生成的分子仍以已知化学空间附近的渐进式衍生结构为主,更适合先导化合物优化和明确约束下的结构改造。但研究团队表示,未来将进一步探索多构象集合、分子动力学轨迹、药效团与反应信息的融合,推动模型向新骨架发现和更复杂的分子设计任务拓展。
HME的突破性还在于其方法论上的普适性。融合多源异构数据的能力比单纯扩大模型规模更为关键,这一发现对于整个AI4S领域都具有指导意义。未来基于HME框架的二次开发将加速AI制药从试错模式转向设计模式,深刻改变药品研发的成本结构和周期。它证明了一个核心观点:在AI for Science领域,融合多源异构数据的能力比单纯扩大模型规模更为关键。对于制药行业而言,HME提供了从"大海捞针"到"精准制导"的方法论升级。未来,AI制药将从依赖专家经验的"试错模式"转向数据驱动的"设计模式"。这一转变将深刻改变药品研发的成本结构和周期,最终惠及全球患者。从产业应用来看,HME框架能够大幅缩短候选分子的筛选周期,让制药企业从数月的分子设计周期缩短到数周甚至数天。这一技术突破对于正在快速发展的中国AI制药产业来说意义重大,有望加速国产创新药的研发进程并降低研发成本。