2026年9月9日,北京大学前沿交叉学科研究院周沛劼研究员与西湖大学、西湖实验室、北京大学、深势科技、哈尔滨医科大学等单位合作,在《Nature》发表题为“An operational perturbation proteomics-based virtual cell model” [1]的研究论文,提出基于NeuralODE框架针对动态蛋白质组的虚拟细胞模型ProteinTalks,为药物响应预测与耐药相关线索发现提供新方法。北京大学前沿交叉研究院周沛劼研究员、北京科学智能研究院/北京大学温翰研究员与西湖大学郭天南教授、西湖实验室朱怡研究员为共同通讯作者。西湖大学孙瑞、钱鎏佳,深势科技李永歌及哈尔滨医科大学刘通为共同第一作者,鄂维南院士为方法开发提供了重要指导。该研究工作得到了国家自然科学基金委“科学计算与机器学习”基础科学中心(基金号12288101)等项目等资助。
蛋白质是细胞功能的主要执行者,也是许多药物直接作用的对象。药物进入细胞后,信号传递、蛋白网络重塑及细胞死亡或耐药表型的形成,在不同时间尺度上逐步展开。围绕这一动态过程,研究团队构建了大规模时间分辨扰动蛋白质组数据集,并通过ProteinTalks联合学习细胞状态及其在药物作用下的演变轨迹,将分子层面的动态变化与药物效果联系起来。模型由此能够预测单药效果和药物组合协同作用,识别值得进一步研究的耐药相关蛋白,并拓展至患者来源模型中的候选药物筛选。团队进一步通过蛋白表达干预和类器官药敏实验,检验模型提出的线索,展示了动态蛋白质组与AI建模相结合、从药物响应预测走向实验发现的研究路径。
01 为什么需要动态蛋白质组
近年来,基于大规模组学数据训练的基础模型被视为构建AI虚拟细胞的关键路径。蛋白质作为细胞功能的主要执行者,与表型更直接相关。然而,基于蛋白质组的虚拟细胞模型仍处于欠发展状态,主要原因是缺乏大规模、时间分辨的蛋白质组数据集。
02 构建大规模时间分辨扰动蛋白质组资源
研究以三阴性乳腺癌为主要应用场景。研究团队首先对药物处理后的11个时间点进行连续测量,发现细胞反应具有相对清晰的早期、中期和晚期结构,据此选择0、6、24和48小时,分别表征基线及不同阶段的药物反应。进一步,研究团队对16种三阴性乳腺癌细胞系和2种非三阴性乳腺癌细胞系进行了系统研究,使用63种已获美国食品药品监督管理局批准的小分子药物及59种药物组合进行扰动。经过数据质量筛选,最终获得超过3800万项蛋白质丰度测量值及配套细胞毒性数据。
生物学分析表明,这些时间序列数据能够反映药物作用机制:药物作用机制相关通路主要在6小时富集;调控网络、代谢过程和细胞周期逐渐重塑;与细胞死亡相关的通路则在48小时更加突出。这些具有时间特征的蛋白质变化,为模型学习药物作用后细胞状态的演变提供了数据基础。
03 ProteinTalks如何学习细胞未来状态?
在模型学习框架方面,ProteinTalks采用Neural ODE对大规模扰动蛋白质组数据进行预训练。Neural ODE所依托的连续动力系统视角,可追溯至鄂维南院士2017年发表的 A Proposal on Machine Learning via Dynamical Systems[2]。该工作系统地将深度残差网络解释为连续动力系统的离散化形式,并将网络参数表述为随时间变化的控制变量,在最优控制框架下讨论模型训练。论文进一步提出以连续动力系统及其流映射刻画深度模型,讨论了基于反向时间演化的梯度计算,并提出采用自适应时间步长以及高阶、隐式等数值离散方法。这些思想为随后Neural ODE及相关连续深度学习方法的发展提供了重要的理论基础。
已有的虚拟细胞模型大多为静态框架,学习的是细胞状态的分布而非因果。利用NeuralODE的框架,结合时序数据,ProteinTalks显示的建模了药物扰动下蛋白质组演化的规律,进行了动力学基础模型的预训练,因此理论上更高效的表征了蛋白质组的内在规律和演化因果。
模型将预测得到的蛋白质轨迹与药物分子指纹、理化性质等信息结合,用于预测单药疗效及两种药物之间的协同作用。蛋白质组重建与药物响应预测采用联合优化,使模型对分子轨迹的学习直接服务于药物表型预测。

ProteinTalks模型原理。 模型从基线蛋白质组和药物靶点信息出发,学习蛋白质状态的时间演变,并结合药物分子特征预测药物效果及组合协同作用。(截取自原论文Fig. 1的模型流程部分)
04 从药效预测到跨系统迁移
研究团队还考察了模型对训练阶段未见药物的泛化能力。在一个包含4种三阴性乳腺癌细胞系、81种抗癌化合物的独立数据集中,ProteinTalks在未经微调的情况下取得了0.88的准确率。
在少样本迁移实验中,模型进一步应用于来自黑色素瘤、结直肠癌、肺癌和胰腺癌的扰动蛋白质组数据,显示出向乳腺癌之外生物系统迁移的潜力。
05 不只给出预测,还要解释预测依据
对于药物反应预测模型,准确率并不是唯一需要回答的问题。研究人员还需要知道:模型为什么作出这样的判断?
为此,研究团队引入动态SHAP分析,分别计算6、24和48小时各蛋白质对药效预测结果的贡献,为研究药物敏感性和耐药机制提供候选线索。
在抗有丝分裂药物的分析中,AKR1C3被模型识别为重要的药效相关蛋白。研究团队随后在BT20三阴性乳腺癌细胞中利用siRNA敲低AKR1C3,发现细胞对多西他赛的敏感性明显提高,为模型提出的生物学假设提供了实验支持。

AKR1C3相关药物响应的功能验证。 左图为基因敲低及药物处理的实验流程;右图显示,敲低AKR1C3后,BT20细胞对多西他赛的敏感性增强。(截取自原论文Fig. 4c–d)
06 从癌细胞系走向患者来源模型
完成细胞系层面的验证后,研究团队进一步评估了ProteinTalks在患者来源系统中的迁移能力。研究人员先使用乳腺癌患者来源异种移植模型的转录组数据进行适配,随后在140个非乳腺癌模型中开展零样本测试,平均AUROC较所比较的3种转录组基础模型提高24%。
在501名三阴性乳腺癌患者的回顾性研究中,根据基线蛋白质组和治疗方案计算的模型评分,可以将患者划分为具有不同总生存期和无复发生存期的组别。在个体化药物筛选方面,团队利用3个三阴性乳腺癌患者来源类器官的基线蛋白质组,对3000种化合物进行了虚拟筛选。模型筛选出citarinostat、THZ-1和CAY10603等候选药物,在论文报道的类器官实验中表现出比顺铂更低的半数抑制浓度。

基于患者来源类器官的药物筛选与实验验证。 ProteinTalks根据类器官基线蛋白质组筛选候选药物,并通过剂量—反应实验检验筛选结果,顺铂作为对照。(截取自原论文Fig. 5f–i)
07 对虚拟细胞发展的重要启示
该研究为下一代面向动态预测的“AI虚拟细胞”提供了新的技术路径。 面对传统单细胞大模型依赖静态转录组快照、难以捕捉时空动态响应的瓶颈,研究团队创新性地将神经常微分方程(Neural ODE)作为预训练引擎,引入大规模扰动蛋白质组预训练,构建了以连续动力学为核心的“动力学基础模型(Dynamical Foundation Model)”,使模型能够直接学习细胞状态在连续时间中的演化规律及其对外源扰动的响应。该工作同时将动态蛋白质组置于虚拟细胞建模的核心位置。蛋白质直接参与细胞结构维持、信号传导、代谢调控和功能执行,其丰度变化与许多终末功能表型具有更直接的联系。相较于仅依赖转录水平的状态表征,扰动蛋白质组能够进一步捕捉转录后调控、蛋白质降解及信号通路活动等信息,为连接分子状态与细胞功能提供更接近功能层面的观测基础。基于这一信息层级,模型以相对紧凑的参数规模实现了对细胞状态演化和药物扰动响应的连续建模,为构建能够预测动态变化与干预效应的虚拟细胞提供了新的实现方式。