[論文レビュー] LangCell: Language-Cell Pre-training for Cell Identity Understanding
LangCellは、単一細胞トランスクリプトームデータと細胞のアイデンティティに関する自然言語記述を統合する最初の言語-細胞事前学習フレームワークであり、マスクされた遺伝子モデリング、細胞-細胞対照学習、細胞-テキスト対照学習およびマッチングを共同で事前学習するマルチタスク学習アプローチを採用している。ゼロショット、フェイントショット、ファインチューニングの状況において、細胞アイデンティティ理解の分野で最先端の性能を達成し、複数のベンチマークで既存のモデルを上回っている。
Cell identity encompasses various semantic aspects of a cell, including cell type, pathway information, disease information, and more, which are essential for biologists to gain insights into its biological characteristics. Understanding cell identity from the transcriptomic data, such as annotating cell types, has become an important task in bioinformatics. As these semantic aspects are determined by human experts, it is impossible for AI models to effectively carry out cell identity understanding tasks without the supervision signals provided by single-cell and label pairs. The single-cell pre-trained language models (PLMs) currently used for this task are trained only on a single modality, transcriptomics data, lack an understanding of cell identity knowledge. As a result, they have to be fine-tuned for downstream tasks and struggle when lacking labeled data with the desired semantic labels. To address this issue, we propose an innovative solution by constructing a unified representation of single-cell data and natural language during the pre-training phase, allowing the model to directly incorporate insights related to cell identity. More specifically, we introduce $ extbf{LangCell}$, the first $ extbf{Lang}$uage-$ extbf{Cell}$ pre-training framework. LangCell utilizes texts enriched with cell identity information to gain a profound comprehension of cross-modal knowledge. Results from experiments conducted on different benchmarks show that LangCell is the only single-cell PLM that can work effectively in zero-shot cell identity understanding scenarios, and also significantly outperforms existing models in few-shot and fine-tuning cell identity understanding scenarios.
研究の動機と目的
- ラベルなしデータでの細胞アイデンティティ理解ができない単一モダリティ事前学習言語モデルの限界を解消すること。
- 細胞タイプ、疾患、経路情報などの人間がアノテートした細胞アイデンティティの意味的知識を、単一細胞データの表現学習に統合すること。
- 直接ゼロショット推論が可能な統合的クロスモダリティフレームワークを構築すること。
- 細胞タイプアノテーションやバッチ統合などの下流タスクにおける高コストで希少なラベル付きデータへの依存を低減すること。
- 共同事前学習を支援するため、2750万件のエントリを有する大規模かつ高品質な細胞-テキストデータセット(scLibrary)を構築すること。
提案手法
- OBOフォンダリーの細胞アイデンティティ関連情報から得た自然言語記述とペairedされた、2750万件の単一細胞RNA-seqエントリからなる大規模データセットであるscLibraryを構築した。
- 4つのタスク(マスク遺伝子モデリング(MGM)、細胞-細胞対照学習(C-C)、細胞-テキスト対照学習(C-T)、細胞-テキストマッチング(CTM))を統合したマルチタスク事前学習目的を設計した。
- 変換器ベースのアーキテクチャを用いて、scRNA-seqデータとテキスト記述を共有表現空間に同時にエンコードした。
- マスクされた遺伝子モデリングにより、遺伝子の共発現パターンを学習し、トランスクリプトーム表現を向上させた。
- モダリティ間の表現を整えるために、細胞同士(C-C)および細胞とテキスト(C-T)の間で対照学習を適用した。
- 限定的なラベル付きデータを用いて下流タスクでモデルをファインチューニングした一方で、ファインチューニングなしのゼロショット性能の評価も行った。

実験結果
リサーチクエスチョン
- RQ1事前学習モデルが単一細胞トランスクリプトームデータと自然言語記述を共同で学習することで、ゼロショットでの細胞アイデンティティ理解が可能になるか?
- RQ2単一モダリティモデルと比較して、言語-細胞の共同事前学習が、細胞タイプアノテーションおよびバッチ統合タスクのパフォーマンスにどのように寄与するか?
- RQ3ラベル付きファインチューニングデータが存在しない状況でも、モデルが新しい細胞タイプや疾患にどの程度一般化できるか?
- RQ4オントロジーからの人間がキュレートした意味的知識(例:オントロジー)を事前学習プロセスに組み込むと、どのような影響を与えるか?
- RQ5クロスモダリティ対照目的を用いたマルチタスク学習が、細胞アイデンティティタスクの表現学習をどの程度向上させるか?
主な発見
- LangCellは、PBMC10K、PBMC3&68K、Zheng68K、macParland、Aizarani、Perirhinal Cortex、Tabula Sapiensを含む複数のベンチマークで、ゼロショット、フェイントショット、フルファインチューニング設定において、すべてで最先端の性能を達成した。
- これは、ゼロショットでの細胞タイプアノテーションが可能な最初の単一細胞PLMであり、ほとんどの場合でフェイントショットベースラインを上回った。
- Tabula Sapiensデータセットでは、マクロファージやB細胞を含む上位10個の細胞タイプにおいて、高いリCALLを達成し、細胞-テキスト検索で優れたパフォーマンスを示した。
- 特にラベル付きデータが少ない低データ環境において、既存のモデルを著しく上回った。
- アブレーションスタディの結果、4つの事前学習目的(MGM、C-C、C-T、CTM)すべてがパフォーマンス向上に寄与しており、特にC-TとCTMがモダリティ間整列に顕著に効果的であることが確認された。
- LangCellは、意味的知識統合によって強化された強力なトランスファーラーニング能力を示し、新しい細胞タイプや疾患に対しても堅牢な一般化性能を示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。