Skip to main content
QUICK REVIEW

[論文レビュー] Uncertainty Quantification for Atlas-Level Cell Type Transfer

Jan Engelmann, Leon Hetzel|arXiv (Cornell University)|Nov 7, 2022
Single-cell and spatial transcriptomics被引用数 5
ひとこと要約

本論文は、単一細胞リファレンスアトラスにおける細胞タイプ転送の不確実性評価手法を導入し、DKL や MIMO などのモデルが WKNN などの従来のベースラインよりも、より良好にキャリブレーションされた、かつ頑健な不確実性推定を提供することを示している。これらのモデルは、分布外の細胞に対して高い予測不確実性を示すことで、未知の細胞タイプをより効果的に検出でき、新規細胞状態の同定に役立つインサイトを提供する。

ABSTRACT

Single-cell reference atlases are large-scale, cell-level maps that capture cellular heterogeneity within an organ using single cell genomics. Given their size and cellular diversity, these atlases serve as high-quality training data for the transfer of cell type labels to new datasets. Such label transfer, however, must be robust to domain shifts in gene expression due to measurement technique, lab specifics and more general batch effects. This requires methods that provide uncertainty estimates on the cell type predictions to ensure correct interpretation. Here, for the first time, we introduce uncertainty quantification methods for cell type classification on single-cell reference atlases. We benchmark four model classes and show that currently used models lack calibration, robustness, and actionable uncertainty scores. Furthermore, we demonstrate how models that quantify uncertainty are better suited to detect unseen cell types in the setting of atlas-level cell type transfer.

研究の動機と目的

  • 単一細胞リファレンスアトラスにおける細胞タイプ分類の信頼性の高い不確実性推定の欠如に対処すること。
  • 技術的および生物学的変動に起因するデータセットシフト下で、不確実性に配慮したモデルが、頑健性およびキャリブレーションの観点で向上するかどうかを評価すること。
  • 不確実性評価が、リファレンスアトラスに存在しない未知または分布外の細胞タイプの検出を可能にするかどうかを同定すること。
  • WKNN、RF、DKL、MIMO の4つのモデルクラスを、不確実性の質、キャリブレーション、OOD検出性能の観点からベンチマークすること。
  • 実世界の単一細胞ゲノム解析ワークフローにおける細胞タイプ転送の信頼性ある解釈を支援する、実用的な不確実性指標を提供すること。

提案手法

  • 重み付き KNN (WKNN)、ランダムフォレスト (RF)、ディープカーネル学習 (DKL)、マルチインプットマルチアウトプット (MIMO) クラスファイアーの4つのモデルクラスを評価した。
  • エントロピーおよび相互情報量を用いた予測不確実性、モデル不確実性、データ不確実性の分解を実施:$\mathbb{H}[y|\mathbf{x},\mathcal{D}] = \mathbb{I}[y,\boldsymbol{\omega}|\mathbf{x},\mathcal{D}] + \mathbb{E}_{p(\omega|\mathcal{D})}[\mathbb{H}[y|\mathbf{x},\boldsymbol{\omega}]]$。
  • OOD検出のための分布外(OOD)シナリオを再現するために、学習から3つの細胞タイプ(B細胞、マスト細胞、イオンオシット)を除外した。
  • OOD vs. in-distribution 分類の AUPR を用いて不確実性性能を定量評価し、予測不確実性およびモデル不確実性を別々に評価した。
  • 見られていたと見られなかった細胞タイプの不確実性密度間の差を、ワッサーシュタイン距離を用いて測定した。
  • 生物学的および技術的変動(遺伝子発現の変動)を含むドメインシフト下で、モデルのキャリブレーションおよび頑健性を評価した。

実験結果

リサーチクエスチョン

  • RQ1不確実性評価手法は、単一細胞リファレンスアトラスにおける細胞タイプ転送の信頼性および解釈可能性を向上させることができるか?
  • RQ2WKNN、RF、DKL、MIMO などの異なるモデルクラスは、データセットシフト下でのキャリブレーション、頑健性、不確実性の質においてどのように比較されるか?
  • RQ3不確実性推定は、学習用リファレンスアトラスに存在しない未知の細胞タイプを効果的に検出できるか?
  • RQ4予測不確実性、モデル不確実性、ソフトマックス信頼度のうち、どのタイプの不確実性が、最も実用的で信頼性の高い OOD 検出性能を示すか?
  • RQ5モデル不確実性とデータ不確実性を分離するモデルは、未知または希少な細胞状態の同定において、優れた性能を発揮するか?

主な発見

  • DKL および MIMO モデルは、予測不確実性を用いて B 細胞で 93±3%、マスト細胞で 95±1% の AUPR スコアを達成し、WKNN の 61±2% および 83±1% より顕著に優れていた。
  • MIMO 8 がモデル不確実性を用いて、B 細胞で 93±1%、イオンオシットで 82±6% の AUPR を達成し、WKNN の 51±1% および 12±1% よりも優れた OOD 検出能力を示した。
  • 予測不確実性を用いた場合、DKL は MIMO 8 よりも B 細胞およびイオンオシットで高い AUPR を示し、予測不確実性のキャリブレーションが優れているが、モデル不確実性性能は弱いことを示唆している。
  • MIMO 8 のモデル不確実性は、モデル不確実性とデータ不確実性の分離がより良好に実現されており、モデル不確実性を用いた OOD 検出性能の高さがその証左であった。
  • WKNN およびソフトマックス信頼度は、大多数の未知細胞タイプで 60% 未満の AUPR を示し、不確実性推定が不適切にキャリブレーションされていたため、新規細胞状態の検出における有用性が限定的であった。
  • 結果から、DKL や MIMO のような不確実性評価を内蔵したモデルは、未知の細胞タイプの同定およびアトラスレベルの細胞タイプ転送における実用的な信頼度推定に適していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。