Skip to main content
QUICK REVIEW

[論文レビュー] The Gene Mover's Distance: Single-cell similarity via Optimal Transport

Riccardo Bellazzi, Andrea Codegoni|ArXiv.org|Feb 1, 2021
Single-cell and spatial transcriptomics参考文献 46被引用数 8
ひとこと要約

本稿では、最適輸送理論に基づく単細胞RNAシーケンシングデータのための新しい類似度メトリックであるGene Mover's Distance (GMD)を紹介する。遺伝子発現プロファイルを離散確率測度としてモデル化し、遺伝子埋め込み(gene2vec)またはピアソン相関を基底距離として用いることで、最適輸送計画を介して細胞類似度を計算する。この手法は分類性能において競争力があり、特にピアソンに基づくコストではユークリッド距離を上回り、クロス・インディビデュアル分類タスクにおいても頑健性を示す。

ABSTRACT

This paper introduces the Gene Mover's Distance, a measure of similarity between a pair of cells based on their gene expression profiles obtained via single-cell RNA sequencing. The underlying idea of the proposed distance is to interpret the gene expression array of a single cell as a discrete probability measure. The distance between two cells is hence computed by solving an Optimal Transport problem between the two corresponding discrete measures. In the Optimal Transport model, we use two types of cost function for measuring the distance between a pair of genes. The first cost function exploits a gene embedding, called gene2vec, which is used to map each gene to a high dimensional vector: the cost of moving a unit of mass of gene expression from a gene to another is set to the Euclidean distance between the corresponding embedded vectors. The second cost function is based on a Pearson distance among pairs of genes. In both cost functions, the more two genes are correlated, the lower is their distance. We exploit the Gene Mover's Distance to solve two classification problems: the classification of cells according to their condition and according to their type. To assess the impact of our new metric, we compare the performances of a $k$-Nearest Neighbor classifier using different distances. The computational results show that the Gene Mover's Distance is competitive with the state-of-the-art distances used in the literature.

研究の動機と目的

  • 高次元かつスパースなデータにおける単細胞遺伝子発現プロファイル間の類似度を測定する課題に対処すること。
  • 従来の距離尺度に代わる理論的裏付けのある輸送ベースのアプローチを導入することで、単細胞データ解析における分類精度を向上させること。
  • 生物学的に意味のあるコスト関数(gene2vec やピアソン相関)を用いた最適輸送が、ユークリッド距離などの標準的メトリックを上回るかどうかを評価すること。
  • 特定の遺伝子に利用可能な埋め込みが欠落している場合のGMD性能への影響を調査すること。

提案手法

  • 各単細胞遺伝子発現プロファイルを遺伝子上の離散確率測度としてモデル化する。
  • 2つの細胞間の類似度を、一方の測度を他方へ変換するコストを最小化する最適輸送問題として定式化する。
  • 2つの基底距離関数を定義する:(1) gene2vec埋め込み(200次元ベクトル)間のユークリッド距離、(2) 遺伝子対間のピアソン相関に基づく距離。
  • 効率的な計算のため、ネットワークシンプレックス法を用いて得られる線形計画問題を解く。
  • k-Nearest Neighbor (k-NN) 分類器内でGMDを適用し、細胞タイプおよび状態分類を実行する。
  • 繰り返しの訓練・テスト分割と統計的有意性検定(t検定)を用いて、GMDの性能をユークリッド距離およびピアソン相関と比較する。

実験結果

リサーチクエスチョン

  • RQ1gene2vec埋め込みを基底コストとして用いる最適輸送ベースの類似度が、標準的メトリックと比較して単細胞分類精度を向上させるか?
  • RQ2実際の単細胞データセットにおいて、ピアソン相関に基づく基底距離がgene2vecに基づくGMDを上回るか?
  • RQ3特定の遺伝子にgene2vec埋め込みが欠落している場合、GMDの性能および頑健性にどのような影響を与えるか?
  • RQ4k-NN分類において、GMDは従来の距離よりも統計的に有意性が高いか?

主な発見

  • ピアソン相関を基底距離として用いたGMDは、GSE67835脳細胞データセットにおけるインディビデュアル間分類で0.8以上の正解率を達成し、ユークリッド距離およびgene2vecベースのGMDを上回った。
  • gene2vecベースのGMDはピアソンベースのGMDよりもわずかに性能が低く、数千の遺伝子で埋め込みが欠落していることが原因で、その適用範囲が制限された可能性がある。
  • t検定の結果、gene2vecベースのGMDは全テストインスタンス(成人、胎児、統合)においてユークリッド距離よりも統計的に優れていた(p < 0.05)。
  • ピアソンベースのGMDと他の2つのメトリックとの間に統計的に有意な差は認められなかった(p > 0.05)、これにより一貫性と頑健性が示された。
  • 予測スコアの四分位範囲が小さく、繰り返し実験における安定性と低分散性を示した。
  • 結果から、現在の単細胞応用において、ピアソン相関に基づく基底距離はgene2vec埋め込みよりも信頼性が高く、完全性および生物学的妥当性に優れていると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。