这是描述信息

新闻资讯

新闻资讯
留言咨询
与最新消息保存同步
/
/
《Nature》:空间蛋白组AI模型实现“虚拟组织”解析

《Nature》:空间蛋白组AI模型实现“虚拟组织”解析

【概要描述】AI虚拟组织到来了

《Nature》:空间蛋白组AI模型实现“虚拟组织”解析

【概要描述】AI虚拟组织到来了

  • 分类:华盈视角
  • 作者:
  • 来源:
  • 发布时间:2026-08-07 11:07
  • 访问量:
详情

PCF(CODEX)空间蛋白组等技术,已经能够在完整组织中以亚细胞分辨率同时测量数十到数百种蛋白质,揭示肿瘤微环境中的细胞表型、状态和空间组织。然而,该领域的灵活性也带来了碎片化:每个研究使用定制的抗体组合、实验流程和技术平台,导致数据集间标记物种类和数量不一致,分析工作流难以跨队列迁移。构建一个统一的、可跨异质性队列和平台联合分析的"空间蛋白组图谱"一直是该领域的核心挑战。近期,Nature》发表了一篇题为"The Virtual Tissues foundation model resolves spatial proteomics across scales"的研究论文。该研究提出了VirTues,一个面向空间蛋白组学的通用基础模型,通过蛋白质语言模型嵌入和因子化Transformer架构,将来自不同抗体panel、不同平台的异质数据集映射到统一的"虚拟组织"表征空间,支持从细胞分割分型到临床生物标志物发现的端到端工作流。

VirTues的核心训练语料库总计32个队列,覆盖17种组织来源,超过5100名患者和239种蛋白质标记物,是目前最大规模的开源空间蛋白组数据集。这些数据来源的技术平台包括了PCF(CODEX)、Orion、MIBI和IMC。其中PCF(CODEX)空间蛋白组可以在单张组织切片同时最多检测100+ 蛋白,并且可在全组织尺度上以单细胞分辨率还原肿瘤免疫微环境的完整空间图谱。借助此类技术,VirTues包含的空间信息更丰富,模型能学到的生物学规律就越深刻。VirTues将不再是"看图识字"(H&E 形态学判读),而是"看图识机制"——同时知道谁在组织里(细胞身份)、谁挨着谁(空间互作)、谁在干什么(功能蛋白表达)。

VirTues是一个深度学习基础模型(Foundation Model),和ChatGPT属于同一类技术路线,只不过它"看"的不是文字,而是病理组织图像。训练数据和 ChatGPT 一样,VirTues 不需要人工标注就能学习。方法很巧妙:把病理图像的一部分遮住(遮60%-100%),让模型去"脑补"被遮住的内容。通过反复做这个"完形填空",模型自己学会了理解组织的空间结构、细胞形态和蛋白质之间的关系。这就像让一个学生看了几百万张拼图练习后,给他一张残缺的病理图也能准确补全。

VirTues 的核心是 16 层 Transformer,使用了两种特殊的注意力。一是空间注意力,让模型理解"哪些细胞靠在一起"(比如:这个T细胞旁边是不是有一个肿瘤细胞?)。二是标记物注意力,让模型理解"哪些蛋白经常一起出现"(比如:看到CD3高表达的地方,CD8往往也高)。更巧妙的是,这两种注意力是分开算的。如果像传统方法那样让每个像素和每个通道都互相"看",40种蛋白标记物的图像需要 40×40 倍的计算量。VirTues 通过因式分解把这个开销降到了可承受的范围内。

引入蛋白质语言模型(ESM-2)。这其实是Meta(Facebook)开发的一个 AI 模型。它"阅读"了数亿条蛋白质氨基酸序列,学会了蛋白质之间的进化关系。VirTues 借助 ESM-2,让模型天然知道:CD3E、CD4、CD8A 是"一家人"(都是 T 细胞相关),而CD20、CD38 是"另一家人"(B 细胞相关),PTPRC(CD45)是"大家的远亲"(泛白细胞标记物)。这就是为什么VirTues 即使从没见过某种蛋白,只要它的"家族成员"在训练中出现过,模型就能大概猜出它的表达模式。

研究首先验证了VirTues的组织重建能力。在零样本场景下,对训练中未见过的标记物,重建质量与目标标记物和已知标记物在ESM-2蛋白嵌入空间中的邻近度呈明显正相关。研究还验证了虚拟染色的生物学有效性,依次遮蔽并重建B细胞和T细胞的关键标记物后,细胞类型分类性能基本保持不变。

细胞分型上实现了跨技术泛化能力,仅用IMC数据训练的VirTues在PCF(CODEX)皮肤淋巴瘤数据上达到零样本宏观F1=0.691,接近多技术联合训练的模型。在跨队列细胞分割和分型方面,研究将来自多个数据集的细胞统一标注,并基于VirTues的补丁级表征训练了联合实例分割和语义细胞分型的分割模块。在9个数据集的实例分割中,VirTues在8个上超越Cellpose、InstanSeg和StarDist。在细胞分型上,VirTues超越专用工具MAPS和Astir,且其预测的细胞类别在多个案例中对关键标记物的表达模式与实测数据的一致性甚至优于原始标注。

在组织级临床预测中,研究使用基于注意力的深度多示例学习(ABMIL)在多个诊断和预后任务上评估了VirTues的效能。VirTues最具特色的能力在于自动化空间生物标志物发现。研究在一个三阴性乳腺癌队列(138例患者,67例完全病理缓解者)的治疗前样本中,通过无监督-监督联合流程从VirTues细胞表征中自动识别出两个响应特征(RS1:凋亡细胞+DNA损伤细胞+PD-L1⁺GZMB⁺细胞;RS2:CD4⁺ T细胞+免疫检查点阳性细胞富集)和两个非响应特征(NRS1/NRS2:肿瘤细胞主导,免疫和基质细胞缺失)。邻域分析进一步揭示了两个响应特征的互补机制:RS1的凋亡细胞周围富集CD4⁺ T细胞和PD-L1⁺GZMB⁺细胞,RS2的CD4⁺ T细胞周围富集MHC-I/II⁺细胞和PD-L1⁺GZMB⁺细胞但CD8⁺ T细胞减少。

 

此外,VirTues还支持基于组织相似性的患者检索。通过编码参考队列的生态位摘令构建"虚拟组织数据库",使用2-Wasserstein距离计算新患者与存档病例的组织相似度。在肺癌数据集上,VirTues检索在癌症亚型、分级、淋巴结转移和复发状态四个临床变量上的匹配精度均显著高于随机检索,检索出的最相似病例在细胞类型组成和分子组成上均与查询病例高度一致。

这项研究通过构建VirTues这一面向空间蛋白组的通用基础模型,将来自四个成像平台的32个异质性队列统一为可查询、可比较、可重用的"虚拟组织"图谱。VirTues不仅覆盖了从细胞分割分型到临床预测和生物标志物发现的完整分析流程,更开创性地展示了从治疗前组织活检中自动发现可迁移至独立队列的空间生物标志物的能力,为将空间蛋白组从孤立研究推向系统化、图谱级的诊疗分析和生物标志物发现提供了重要的计算基础设施。

 

| 参考文献

Wenckstern J, Jain E, von Querfurth B, Cheng Y, et al. The Virtual Tissues foundation model resolves spatial proteomics across scales.Nature. 2026. DOI: 10.1038/s41586-026-10884-y.

相关产品

暂时没有内容信息显示
请先在网站后台添加数据记录。
华盈生物

地址:上海市闵行区绿洲环路396弄5幢4层

电话:400-869-2936,021-33938791 

邮箱:support@wayenbiotech.com

传真:021-33938792

QQ:2120485725

战略合作

战略合作

发布时间:2021-08-11 17:21:10

|    Full Moon    |    RayBiotech    |    CDI    |    IZON    |    Bio-Rad    |    R&D Systems     |     Akoya    |     南模生物    |    欧易生物    |     上海实验动物研究中心    |     美吉生物    |    麦特绘谱    | 

 

特别说明:本网所有网页均为华盈生物原创信息,转载必须征求华盈生物同意,并同时注明本网名称及网址。

专利代码

发布时间:2023-06-09 17:38:30
Copyright © 2021 上海华盈生物医药科技有限公司 版权所有
Copyright © 上海华盈生物医药科技有限公司 版权所有 沪ICP备2022031428号-1 电子营业执照
搜索
搜索
关闭
客户留言
验证码