Skip to main content
QUICK REVIEW

[论文解读] scHyena: Foundation Model for Full-Length Single-Cell RNA-Seq Analysis in Brain

Gyutaek Oh, Baekgyu Choi|arXiv (Cornell University)|Oct 4, 2023
Single-cell and spatial transcriptomics被引用 5
一句话总结

scHyena 是一种用于全序列脑组织单细胞RNA测序分析的奠基模型,采用一种新颖的双向Hyena Transformer架构,结合线性适配器和基因嵌入,可直接处理全部基因而无需降维。该模型在细胞类型分类和单细胞RNA测序数据填补任务中优于现有方法,实现了更高的准确率并降低了填补dropout事件的误差。

ABSTRACT

Single-cell RNA sequencing (scRNA-seq) has made significant strides in unraveling the intricate cellular diversity within complex tissues. This is particularly critical in the brain, presenting a greater diversity of cell types than other tissue types, to gain a deeper understanding of brain function within various cellular contexts. However, analyzing scRNA-seq data remains a challenge due to inherent measurement noise stemming from dropout events and the limited utilization of extensive gene expression information. In this work, we introduce scHyena, a foundation model designed to address these challenges and enhance the accuracy of scRNA-seq analysis in the brain. Specifically, inspired by the recent Hyena operator, we design a novel Transformer architecture called singe-cell Hyena (scHyena) that is equipped with a linear adaptor layer, the positional encoding via gene-embedding, and a {bidirectional} Hyena operator. This enables us to process full-length scRNA-seq data without losing any information from the raw data. In particular, our model learns generalizable features of cells and genes through pre-training scHyena using the full length of scRNA-seq data. We demonstrate the superior performance of scHyena compared to other benchmark methods in downstream tasks, including cell type classification and scRNA-seq imputation.

研究动机与目标

  • 解决脑组织单细胞RNA测序分析中dropout事件频发以及全基因表达数据利用不足的挑战。
  • 开发一种可扩展、高效的深度学习模型,能够在不进行基因筛选或降维的情况下处理全序列单细胞RNA测序数据。
  • 通过在全序列单细胞RNA测序数据上进行自监督预训练,实现在多种脑细胞类型间可泛化的特征学习。
  • 利用奠基模型方法提升下游任务的性能,包括细胞类型分类、双细胞检测和数据填补。
  • 提供一种稳健的端到端解决方案,可在填补数据中纠正批次效应并保留生物信号。

提出的方法

  • 设计了一种新型Transformer架构scHyena,引入双向Hyena算子,以高效处理长序列的基因表达数据。
  • 引入线性适配器层,直接编码连续的单细胞RNA测序值,无需离散化或分词,从而完整保留信息。
  • 采用基因嵌入进行位置编码,以建模基因之间的生物顺序关系与关联性。
  • 通过在全序列单细胞RNA测序数据上进行掩码表达建模实现自监督预训练,学习可泛化的表征。
  • 使用较小的标注数据集对预训练模型进行微调,应用于下游任务,包括细胞类型分类和数据填补。
  • 将原始的因果Hyena算子改进为非因果、双向版本,以捕捉基因表达中的长程依赖关系。

实验结果

研究问题

  • RQ1基于Hyena算子的奠基模型是否能有效处理全序列单细胞RNA测序数据,而无需基因筛选或降维?
  • RQ2scHyena在单细胞RNA测序数据填补任务中是否优于现有最先进方法,特别是在恢复真实非零表达值方面?
  • RQ3与基线模型相比,scHyena在细胞类型分类准确率方面提升了多少?
  • RQ4scHyena能否有效纠正单细胞RNA测序数据中的批次效应,同时保持生物聚类结构?
  • RQ5该模型在不同脑组织数据集及亚群中的泛化能力如何?

主要发现

  • 在四个脑组织数据集上,scHyena在数据填补任务中实现了最低的均方误差(MSE)和最高的皮尔逊相关系数,优于MAGIC和DCA。
  • 在真实值与填补值的联合散点图中,scHyena的预测值紧密贴近y=x线,表明其在恢复非零表达水平方面具有高准确性。
  • UMAP可视化显示,scHyena填补后的数据在每种细胞类型中形成了最密集且生物学上最一致的聚类,尤其在不同批次中的少突胶质细胞中表现突出。
  • 该模型显著降低了少突胶质细胞和小胶质细胞中的批次效应,而DCA对此类细胞的纠正效果较差,MAGIC仅部分有效。
  • scHyena在细胞类型分类任务中表现优异,且在所有测试数据集和子群中均保持一致的性能提升。
  • 该模型无需基因筛选或降维即可处理全序列数据,从而保留了HVG方法中丢失的关键生物信息。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。