[論文レビュー] Multimodal contrastive learning for spatial gene expression prediction using histology images
本稿では、空間的転写プロファイルを予測するためのマルチモーダル対照学習フレームワークmclSTExpを提案する。この手法は、TransformerとDenseNet-121エンコーダーを用い、H&E染色画像から空間的遺伝子発現を予測する。STスポットを「単語」として扱い、自己注意機構と対照学習を活用して空間的特徴と画像特徴を統合する。3つのデータセットで最先端の性能を達成し、前向きな手法より23.01–32.09%高いPCCを示した。また、がん特異的および免疫関連遺伝子の解釈可能性も可能である。
In recent years, the advent of spatial transcriptomics (ST) technology has unlocked unprecedented opportunities for delving into the complexities of gene expression patterns within intricate biological systems. Despite its transformative potential, the prohibitive cost of ST technology remains a significant barrier to its widespread adoption in large-scale studies. An alternative, more cost-effective strategy involves employing artificial intelligence to predict gene expression levels using readily accessible whole-slide images (WSIs) stained with Hematoxylin and Eosin (H\&E). However, existing methods have yet to fully capitalize on multimodal information provided by H&E images and ST data with spatial location. In this paper, we propose extbf{mclSTExp}, a multimodal contrastive learning with Transformer and Densenet-121 encoder for Spatial Transcriptomics Expression prediction. We conceptualize each spot as a "word", integrating its intrinsic features with spatial context through the self-attention mechanism of a Transformer encoder. This integration is further enriched by incorporating image features via contrastive learning, thereby enhancing the predictive capability of our model. Our extensive evaluation of extbf{mclSTExp} on two breast cancer datasets and a skin squamous cell carcinoma dataset demonstrates its superior performance in predicting spatial gene expression. Moreover, mclSTExp has shown promise in interpreting cancer-specific overexpressed genes, elucidating immune-related genes, and identifying specialized spatial domains annotated by pathologists. Our source code is available at https://github.com/shizhiceng/mclSTExp.
研究の動機と目的
- 空間的転写プロファイル(ST)の高コストを低減するため、容易に入手可能で低コストなH&E全スライド画像(WSI)から遺伝子発現を正確に予測すること。
- 従来の手法よりも効果的に、STデータ(空間的遺伝子発現)とH&E画像(組織像の形態)のマルチモーダル情報を統合すること。
- 自己注意と対照学習を用いてSTスポット間の空間的関係をモデル化することで、予測性能を向上させること。
- 特にがん特異的過剰発現遺伝子や免疫関連マーカーを含む生物学的に意味のある遺伝子の解釈を可能にすること。
- 予測された遺伝子発現パターンを用いて病理医がアノテートした空間的領域を同定すること。
提案手法
- 各STスポットを「単語」として扱い、自己位置埋め込みを学習可能なものとして持つTransformerエンコーダーを用いて、スポットの系列を「文」としてモデル化する。
- 各STスポットに対応するH&E WSIパッチから画像特徴を抽出するために、DenseNet-121バックボーンを用いる。
- 対照学習を適用し、画像特徴とSTスポット埋め込みを共通の潜在空間に一致させる。陽性ペア(一致する画像とスポット)の類似度を最大化し、陰性ペアの類似度を最小化する。
- Transformer内の自己注意により空間的文脈を統合し、各スポットが他のスポットに注目することで、長距離の空間的依存関係を捉える。
- クエリに対して類似度が最も高い上位k個の「単語」(スポット)を、画像表現とのコサイン類似度に基づいて重み付けして集約し、遺伝子発現を予測する。
- 遺伝子発現予測の対照損失と回帰損失を用いて、モデルをエンドツーエンドで訓練する。
実験結果
リサーチクエスチョン
- RQ1マルチモーダル対照学習フレームワークは、H&E画像特徴と空間的STスポットデータを効果的に統合し、遺伝子発現予測を向上させることができるか?
- RQ2自己注意を用いてSTスポットを系列内の「単語」として扱うことで、空間的文脈のモデリングと予測精度が向上するか?
- RQ3モデルはがん組織における生物学的に意味のある空間的領域や過剰発現遺伝子を同定できるか?
- RQ4BLEEP、HisToGene、STnetといった最先端手法と比較して、mclSTExpは複数のデータセットで予測性能に優れているか?
- RQ5mclSTExpは、予測データにおける遺伝子間共発現パターンと生物学的ヘテロジニアシティをどの程度保持しているか?
主な発見
- HER2+乳がんデータセットにおいて、mclSTExpは2番目に優れた手法(BLEEP)よりも23.01%高いPCC(ACG)を達成した。
- cSCC皮膚扁平上皮がんデータセットでは、BLEEPより32.09%高いPCC(ACG)を示した。
- Alex+10xデータセットでは、BLEEPより25.56%高いPCC(ACG)を達成し、多様な組織タイプにわたり一貫した優位性を示した。
- 3つのデータセット全体で、mclSTExpはすべてのベースライン手法よりもPCC(HEG)で27.82%~36.48%高い性能を示した。
- mclSTExpは、従来の手法では検出できなかった重要な免疫関連遺伝子であるHLA-BおよびHLA-DRAを正しく予測し、生物学的解釈可能性の高さを示した。
- 予測された遺伝子発現データの階層的クラスタリングにより、既知の生物学的共発現パターンが保持され、相関行列が実際のSTデータと密接に一致した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。