Skip to main content
QUICK REVIEW

[論文レビュー] Data Augmentation for Compositional Data: Advancing Predictive Models of the Microbiome

Elliott Gordon-Rodríguez, Thomas P. Quinn|arXiv (Cornell University)|May 20, 2022
Oral microbiology and periodontitis research被引用数 6
ひとこと要約

本稿では、マイクロバイオームの組成データなど、組成データ(CoDa)に特化した、Aitchison Mixup、構成的CutMix、およびランダム部分組成体といった新規なデータ拡張技術を導入する。単体のAitchison幾何学を活用し、教師ありおよび対照的学習パイプラインに統合することで、大腸がん、2型糖尿病、クローン病といった主要なマイクロバイオーム疾患予測タスクで最先端の性能を達成し、一部のモデルではAUCが20%以上向上した。

ABSTRACT

Data augmentation plays a key role in modern machine learning pipelines. While numerous augmentation strategies have been studied in the context of computer vision and natural language processing, less is known for other data modalities. Our work extends the success of data augmentation to compositional data, i.e., simplex-valued data, which is of particular interest in the context of the human microbiome. Drawing on key principles from compositional data analysis, such as the Aitchison geometry of the simplex and subcompositions, we define novel augmentation strategies for this data modality. Incorporating our data augmentations into standard supervised learning pipelines results in consistent performance gains across a wide range of standard benchmark datasets. In particular, we set a new state-of-the-art for key disease prediction tasks including colorectal cancer, type 2 diabetes, and Crohn's disease. In addition, our data augmentations enable us to define a novel contrastive learning model, which improves on previous representation learning approaches for microbiome compositional data. Our code is available at https://github.com/cunningham-lab/AugCoDa.

研究の動機と目的

  • 組成データ(CoDa)、特にマイクロバイオーム研究において有効なデータ拡張戦略の欠如に取り組む。
  • 相対的割合データの単体幾何学を尊重するデータ拡張技術を開発し、統計的・幾何学的妥当性を保証する。
  • 低サンプルサイズと高次元性が特徴のマイクロバイオームデータセットにおいて、教師ありおよび対照的学習モデルの性能を向上させる。
  • データ拡張を用いて、マイクロバイオーム関連疾患の予測モデリングにおいて新たな最先端性能を確立する。
  • 新規な対照的学習フレームワークを用いて、組成的拡張を活用し、マイクロバイオームデータのより良い表現学習を可能にする。

提案手法

  • Aitchison Mixupを提案。これは、Aitchison単体幾何学上で2つの組成データ点を線形補間するデータ拡張法であり、相対的割合を保持する。
  • Compositional CutMixを導入。これは、1つのデータ点の一部の特徴を別のデータ点の特徴に置き換え、組成的整合性を維持するためにAitchison幾何学を用いる。
  • Random Subcompositionsを開発。各データ点から特徴の部分集合(部分組成体)をランダムに選択し、拡張されたサンプルを生成する戦略であり、特徴部分集合の変動に対して耐性を高める。
  • これらの拡張法を標準的な教師あり学習パイプラインに統合し、ベンチマークデータセットにおける汎化性能と性能を向上させる。
  • 対照的学習にこれらの拡張法を適応する。同じサンプルの拡張ビューを正例ペアとして、異なるサンプル同士を負例ペアとして形成し、対照的損失を用いて不変表現を学習する。
  • 2,000エポックにわたり、エポックの早期停止を伴い、Adam最適化手法と標準的なハイパーパrameterを用い、複数のデータセットで線形評価とファインチューニングプロトコルによる評価を実施。

実験結果

リサーチクエスチョン

  • RQ1コンピュータビジョンや自然言語処理で用いられるデータ拡張技術が、マイクロバイオームの相対的割合のような組成データに効果的に適応可能か。
  • RQ2単体(Aitchison幾何学)の幾何構造をどのように活用し、CoDaのための意味的かつ妥当なデータ拡張を設計できるか。
  • RQ3これらの新規拡張法が、マイクロバイオーム疾患予測タスクにおける教師あり学習で一貫した性能向上をもたらすか。
  • RQ4これらの拡張法を用いて、効果的な対照的表現学習モデルをマイクロバイオームCoDa用に訓練可能か。
  • RQ5提案された拡張法は、低サンプルサイズ・高次元マイクロバイオームデータセットにおいて、汎化性能と耐性を向上させるか。

主な発見

  • 提案されたデータ拡張法(Aitchison Mixup、Compositional CutMix、Random Subcompositions)は、マイクロバイオーム学習リポジトリの12の標準的ベンチマークデータセットにおいて一貫して性能向上を達成した。
  • DeepCoDaは、提案された拡張法を用いることで、大腸がん分類で10%以上の絶対的AUC向上を達成し、2型糖尿病分類では20%以上を記録した。
  • Random Subcompositionsを用いた対照的学習フレームワークは、すべてのタスクにおいて線形評価およびファインチューニングプロトコルでDeepMicroおよびランダム初期化モデルを上回った。
  • 平均して、対照的モデルは線形評価で78%のAUC、ファインチューニングで77%のAUCを達成したのに対し、DeepMicroはそれぞれ75%および76%であった。
  • 大腸がん、2型糖尿病、クローン病といった主要な疾患予測タスクにおいて、統計的に有意な向上を示し、新たな最先端性能を確立した。
  • 結果は、データ拡張が、特にデータ不足が大きな課題となるマイクロバイオーム研究において、モデル性能を向上させる強力で低コストな手法であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。