ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

【文献分享】SIMBA:单细胞嵌入与特征共学习

【文献分享】SIMBA:单细胞嵌入与特征共学习

文章介绍

单细胞测序技术的迅猛发展使得研究人员能够在单细胞分辨率下同时或分别测量基因组、表观基因组、转录组和蛋白质组等多个分子层的信息。然而,现有的单细胞数据分析工具大多以细胞嵌入(cell embedding)为核心,高度依赖聚类分析,缺乏显式建模不同特征类型之间交互关系的能力。更重要的是,不同的单细胞分析任务(如差异基因检测、批次效应校正、多组学整合等)往往需要专门开发不同的算法,使得分析流程碎片化、难以扩展。如何用一个统一的框架来应对单细胞数据分析中多样化的任务需求,是该领域亟待解决的根本性问题。

为突破这一瓶颈,Huidong Chen、Jayoung Ryu及其合作者在Nature Methods上发表了题为“SIMBA: single-cell embedding along with features”的研究论文,提出了一个名为SIMBA的图嵌入方法,通过将单细胞及其各类特征(基因、染色质可及区域、转录因子基序、DNA序列等)共同嵌入到一个共享的低维潜在空间中,实现了多种单细胞分析任务的统一化处理。

SIMBA的核心思想是将单细胞数据分析问题重新表述为图嵌入问题。与传统方法仅将细胞作为节点不同,SIMBA将细胞和所有相关特征(如基因、开放染色质区域、转录因子基序、k-mer序列等)均视为图中的节点,将细胞-特征或特征-特征之间的关系编码为不同类型的边(edge)。例如,在scRNA-seq中,如果某个基因在某个细胞中表达,则在基因节点和细胞节点之间建立一条边,边的权重由表达水平决定;在scATAC-seq中,如果某个染色质区域在某个细胞中开放,则建立细胞-峰值边;峰值与转录因子基序或k-mer序列之间的边则通过序列匹配计算推断。一旦图构建完成,SIMBA采用多关系图嵌入算法(源自社交网络技术PyTorch-BigGraph)将节点嵌入到共同的低维空间,并通过Softmax变换使不同类型实体的嵌入具有可比性。在这个共享空间中,细胞和特征之间的距离反映了它们之间的边概率——细胞类型特异的特征(如标记基因、顺式调控元件)被嵌入到相应细胞类型的邻域内,而非信息性特征则被嵌入到远离任何细胞群的中间区域。

SIMBA的灵活性使得它可以被应用于多种单细胞分析任务:(1)降维与可视化——细胞和特征可共同或分别降维展示;(2)无聚类的标记检测——通过计算每个特征到所有细胞的边概率分布的不平衡程度(如基尼系数、最大得分等),无需预先聚类即可识别细胞类型特异性特征;(3)多模态分析——将scRNA-seq和scATAC-seq数据构建为包含细胞、基因、峰值、TF基序和k-mer五种节点类型的图,共同学习细胞异质性和基因调控回路;(4)批次效应校正——通过计算不同批次细胞间的共享近邻(基于截断随机SVD)在细胞节点间添加推断边,强制不同批次的相似细胞在嵌入空间中靠近;(5)多组学整合——将独立测序的scRNA-seq和scATAC-seq数据集通过基因活性分数桥接,实现跨模态细胞整合和跨特征标记检测。

研究者通过大量实验验证了SIMBA的统一性和有效性。在PBMC scRNA-seq数据中,SIMBA成功将MS4A1(B细胞标记)、NKG7(NK/CD8 T细胞标记)等特征嵌入到对应细胞群附近,而GAPDH等持家基因则被嵌入到所有细胞群的中央区域。在人类造血干/祖细胞scATAC-seq数据中,SIMBA不仅准确区分了10种细胞类型,还将GATA1基序和匹配的k-mer序列GATAAG嵌入到红系-巨核祖细胞(MEP)附近,实现了从头基序发现。在SHARE-seq小鼠皮肤多模态数据中,SIMBA正确识别了Lef1和Hoxc13等主调控因子及其靶基因。在跨批次人类胰腺数据整合中,SIMBA在消除批次效应的同时保留了生物学异质性,并同步完成了跨批次标记基因的鉴定。总体而言,SIMBA以**“图构建 + 统一嵌入”**的极简范式,将多个单细胞分析任务收纳于同一框架之下,大幅降低了方法开发的复杂度。

算法原理介绍

SIMBA的算法设计围绕“多关系图构建 → 带类型约束的图嵌入 → Softmax变换与特征特异性度量”三个核心步骤展开。

(一)多关系图构建。SIMBA将单细胞数据编码为一个有向多关系图G=(V,E)G = (V, E)G=(V,E),其中VVV包含所有实体节点(细胞、基因、峰值、TF基序、k-mer等),EEE包含不同类型的关系边。边分为两类:(1)实验测量边——如细胞-基因边(基因在细胞中表达,权重为离散化的表达水平)、细胞-峰值边(染色质区域在细胞中开放,权重为1);(2)计算推断边——如峰值-TF基序边(峰值序列包含该基序)、峰值-k-mer边(峰值序列包含该k-mer),以及用于批次校正的细胞-细胞边(基于截断随机SVD计算的跨批次共享近邻)和用于多组学整合的跨模态细胞-细胞边(基于基因活性分数的相似性)。不同类型的关系可赋予不同的边权重(如scATAC-seq中基序-峰值权重0.2,k-mer-峰值权重0.02)。

(二)带类型约束的图嵌入。SIMBA采用PyTorch-BigGraph框架对图进行嵌入,为每个节点学习D=50D=50D=50维的嵌入向量θv\theta_vθv。对于每条边e=(u,v)e=(u,v)e=(u,v),计算得分se=θu⋅θvs_e = \theta_u \cdot \theta_vse=θuθv,并优化多类对数损失函数Le=−log⁡exp⁡(se)∑e′∈Nexp⁡(se′)we\mathcal{L}_e = -\log \frac{\exp(s_e)}{\sum_{e'\in \mathcal{N}}\exp(s_{e'})} w_eLe=logeNexp(se)exp(se)we,其中N\mathcal{N}N为负采样候选边集,wew_ewe为边权重。关键创新在于类型约束——负采样时只采样与原始边类型兼容的实体(如细胞-基因边只采样细胞和基因节点),避免无效边(如基因-基因)主导训练。同时,针对低数据场景,引入L2正则化Lreg=L+λ∑u∈N∑dθu2\mathcal{L}_{\text{reg}} = \mathcal{L} + \lambda \sum_{u\in N}\sum_{d}\theta_u^2Lreg=L+λuNdθu2防止过拟合。

(三)Softmax变换与特征特异性度量。由于不同类型实体(细胞与特征)的边分布不同,嵌入后可能位于不同流形上,无法直接比较。SIMBA通过Softmax变换实现可比性:对于特征fff,计算其到所有细胞ccc的边概率pc,f=exp⁡(θc⋅θf)∑kexp⁡(θk⋅θf)p_{c,f} = \frac{\exp(\theta_c \cdot \theta_f)}{\sum_{k}\exp(\theta_k \cdot \theta_f)}pc,f=kexp(θkθf)exp(θcθf),然后将特征嵌入重新定义为细胞嵌入的线性组合ψf=∑ipci,fT−1θci∑ipci,fT\psi_f = \frac{\sum_i p_{c_i,f}^{T-1} \theta_{c_i}}{\sum_i p_{c_i,f}^{T}}ψf=ipci,fTipci,fT1θci(温度T=0.5T=0.5T=0.5),使特征嵌入对齐到细胞嵌入空间。基于该概率分布,SIMBA提供四种量化指标评估特征特异性:最大得分(前50个细胞的平均归一化概率)、基尼系数(分布偏离均匀的程度)、标准差和熵(信息含量)。高基尼系数+高最大得分意味着该特征高度细胞类型特异性,可用于无聚类标记基因检测。

总结

SIMBA是一个基于图嵌入的单细胞数据分析统一框架,通过将细胞和多种特征(基因、峰值、TF基序、k-mer等)共同嵌入到共享潜在空间,实现了降维、无聚类标记检测、多模态分析、批次校正和多组学整合等多种任务的统一化处理。其核心创新在于:将“细胞-特征”关系建模为多关系图,通过带类型约束的图嵌入学习节点表示,再通过Softmax变换实现不同类型实体嵌入的可比性,使细胞类型特异性特征自然嵌入到对应细胞群附近。SIMBA不仅在各个任务上表现优异或可比于专用方法,更关键的是提供了一个可扩展的统一范式——只需调整图结构和边类型,即可适应新的单细胞测量模态和分析需求,为未来单细胞多组学数据整合分析奠定了坚实基础。

返回列表