UniPert–G2CP团队 投稿 

量子位 | 公众号 QbitAI

近日,国际顶级学术期刊《Cell》主刊,刊出了一篇来自中国的AI生命科学研究论文《UniPert–G2CP》。

论文承载首个解决「化学扰动×细胞特异性响应」难题的AI虚拟细胞算法,也是国内首个在《Cell》主刊发表AI虚拟细胞相关研究的成果。

该成果直面并回答了一个困扰药物研发数十年的核心问题:为何同一种药物,在不同遗传背景和不同细胞中的效果会存在较大差异?

这一问题的答案,直接关系到临床二期高达70%以上的失败率,关系到平均26亿美元的药物研发沉没成本。

该工作由腾讯生命科学实验室与中南大学联合攻关。论文成功登上《Cell》主刊,也标志着我国在精准医疗与虚拟试药方向开辟了一条全新路径。

UniPert-G2CP整体框架的图形摘要打破化学建模的通用性陷阱

过去几十年里,药物研发与化学建模一直受制于一个隐形的天花板:模型越通用,往往离真实的病人需求越远。

尽管AlphaFold解决了蛋白结构预测问题,分子对接AI解决了化合物与靶点的结合问题,QSAR解决了类药性问题……它们共同将化学分子这一端的建模做得愈发精细,但几乎都还停留在分子本身好不好的层面。对于该药物对特定细胞、特定突变背景的患者是否有效这一关键痛点,始终未能给出理想的解答。

这一局限带来的代价也是比较高昂的:平均26亿美元的投入、十余年的研发周期、临床二期高达70%以上的失败率,以及无数在分子层面表现优异却在真实细胞与患者身上失效的化合物。

这也正是化学分子建模长期未能突破的通用性困境:脱离了特定的细胞背景,再先进的化学分子AI也仅仅是在解答半道题。

更为棘手的是数据本身的不对等。理论上的类药化学分子空间(可能成为药物的分子集合)超过10的60次方个分子,而目前全球最大的化学扰动图谱LINCS L1000仅覆盖约2万个化合物;相比之下,利用CRISPR(基因编辑)技术进行一次筛选实验即可平行测试数千个基因,单位成本远低于化合物筛选。

化合物层面存在的数据稀缺、空间巨大且高度依赖细胞背景问题,构成了计算建模最难啃的三重困境。

用基因扰动知识撬动化学扰动预测

该论文中的G2CP(Genotype to Cellular Phenotype,从基因型到细胞表型)正是解决上述困境的主线。其核心逻辑在于:从基因层面的扰动信息出发,去预测化合物在特定细胞背景下的表型响应。

《UniPert–G2CP》首次成功解答了药物研发的「另外半道题」。该算法不再将化合物和细胞割裂对待,而是利用AI技术将基因层面的扰动知识、化合物分子结构以及细胞内的转录组响应(即细胞内所有基因活动状态的整体变化)统一纳入同一个因果空间中。

UniPert-G2CP框架总览

这一创新带来了实质性的行业改变:

第一次让in silico(计算机模拟)化合物筛选具备了细胞特异性,能够准确预测全新化合物在特定癌症细胞系上的扰动响应;

第一次让CRISPR实验积累的密集数据知识,直接服务于数据稀缺且昂贵的化合物预测;

第一次针对ESR1内分泌耐药这类真实的临床问题,完成了从算法预测到机制解释的闭环。

UniPert增强未见遗传和化学扰动效应预测

为实现这一目标,研究团队精心设计了两个核心模块:UniPert模块首次让基因扰动剂与化合物扰动剂进入同一个语义空间(同一套语言体系),成功解决了跨模态的统一表征问题;而G2CP模块则采取了先用密集、低成本的遗传扰动数据进行预训练,再用稀疏、昂贵的化学扰动数据进行迁移微调的策略,使AI模型不仅具备了细胞背景(cell context)感知能力,更能有效泛化至全新的化合物上。

G2CP实现具有成本效益且遗传信息辅助的化学扰动建模从通用性陷阱迈向数字孪生诊室

这一突破性成果的诞生源于腾讯持续的研发投入与一以贯之的科学探索。自2022年相关成果发表于《Nature Machine Intelligence》(scBERT)起,腾讯生命科学实验室便确立了用统一语言描述生命系统的科研主线。

从scBERT将单细胞转录组语言化(2022年),到scPROTEIN处理单细胞蛋白质组的图对比学习(2024年,《Nature Methods》),再到scTranslator将中心法则转化为AI任务(2025年,《Nature Biomedical Engineering》),团队以平均每年一篇国际顶刊的节奏将同一核心命题层层向前推进。

《Cell》编辑团队与审稿人高度认可的正是该研究对工业界长期硬骨头的正面攻坚。过去几十年,化学分子建模多脱离细胞背景,只能预测分子好坏,却无法预测临床疗效。

《UniPert–G2CP》首次系统性地将化学扰动重新置于细胞背景之中,并通过ESR1内分泌耐药的真实生物学案例,完成了从算法预测到机制解释的闭环验证。

因果空间揭示ESR1扰动响应与耐药机制

此外,该论文的数据规模也极具代表性:涵盖4994个基因×7860个化合物×5个癌症细胞系,外加53963对CPI(化合物—蛋白相互作用)数据,是目前该研究方向上规模最大、数据模态最全的公开建模工作之一。

UniPert-G2CP揭示PCL细胞敏感性

据悉,该论文由中南大学博士生、腾讯生命科学实验室实习生李一鸣担任第一作者,其研究课题于实习期间开展并完成主要内容。腾讯生命科学实验室杨帆作为企业导师,与中南大学李敏教授、腾讯生命科学实验室首席科学家姚建华共同担任通讯作者并指导了该项研究。

面向未来,研究团队计划将UniPert–G2CP作为核心基础能力,集成至即将发布的AI生命科学Agent平台中。这将使虚拟细胞能力以Skill(技能)的形式,直接服务于实验科学家的真实科研工作流——从药物靶点的发现与验证,到候选化合物在特定细胞背景下的疗效评估,再到耐药机制的解析,让药物研发的关键环节获得可计算、可预测的智能支撑,最终打通从靶点发现到效果评估的虚拟药物研发全链路。

更长远而言,UniPert–G2CP提供的是虚拟细胞的基本计算单元,其意义如同GPU之于深度学习。当此类计算单元被规模化、模块化并Agent化后,数字孪生诊室将不再停留在实验室层面:未来,医生在面对真实患者时,可在云端实时构建该患者的数字孪生细胞群,对多种候选治疗方案进行虚拟试验,并基于反馈结果为患者制定最优的组合治疗方案。

论文链接:https://www.cell.com/cell/fulltext/S0092-8674(26)00654-9