Skip to main content
QUICK REVIEW

[論文レビュー] It's easy to fool yourself: Case studies on identifying bias and confounding in bio-medical datasets

Subhashini Venugopalan, Arunachalam Narayanaswamy|arXiv (Cornell University)|Dec 12, 2019
Machine Learning and Data Classification参考文献 12被引用数 6
ひとこと要約

本論文は、バイオメディカル画像におけるディープラーニングモデルが、実験的バッチ、画像の焦点度、細胞密度などの交絡変数から誤った信号を偶然に学習してしまうメカニズムを調査している。SMAおよびALSのデータセットを用いた事例研究を通じて、非教師ありクラスタリング、モデルの解釈可能性(GradCAM)、パフォーマンス分析を用いてバイアスを同定し、モデルが疾患関連の特徴を検出するのではなく、データ取得および処理における技術的アーティファクトを活用することで高い正確性を達成していることが明らかになった。

ABSTRACT

Confounding variables are a well known source of nuisance in biomedical studies. They present an even greater challenge when we combine them with black-box machine learning techniques that operate on raw data. This work presents two case studies. In one, we discovered biases arising from systematic errors in the data generation process. In the other, we found a spurious source of signal unrelated to the prediction task at hand. In both cases, our prediction models performed well but under careful examination hidden confounders and biases were revealed. These are cautionary tales on the limits of using machine learning techniques on raw data from scientific experiments.

研究の動機と目的

  • バイオメディカル画像データセットにおける交絡変数が、ディープラーニング応用における誤ったモデルパフォーマンスを引き起こすメカニズムを調査すること。
  • 高スループット顕微鏡画像データに生じる、実験設計、画像取得、処理パイプラインに起因する隠れたバイアスを同定すること。
  • 非教師あり埋め込みとモデル解釈技術が、細胞画像分類における誤った信号の検出に果たす役割を評価すること。
  • 高いモデル正確性が生物学的信号に基づくのではなく、焦点度の勾配やプレート位置といった体系的なアーティファクトによって達成され得ることを示すこと。
  • 機械学習を用いたバイオメディカル探索の文脈において、モデル行動とデータのルートコラムに対する厳密な吟味を提唱すること。

提案手法

  • ImageNetで事前学習されたInceptionV4を用いた非教師ありCNN埋め込みの可視化のため、t-SNEを適用し、実験的バッチやプレート位置によるクラスタリングを検出した。
  • 事前学習済みCNNを用いて、画像の焦点度を評価し、各サイト画像に対して0~1の順位付き確率スコアを割り当てた。
  • 手動で特徴量を設計したロジスティック回帰と、完全に教師ありのCNNを用いて分類のための教師ありモデルを訓練した。
  • GradCAMを用いてサリエンシーマップを生成し、CNN内の注目領域を可視化することで、モデルが生物学的に関連のある特徴よりもアーティファクトに起因する特徴に注目しているかどうかを特定した。
  • 5分割交差検証を実施し、各foldで1つのバッチを除外することで汎化性能を評価し、バッチ間でのデータ漏洩を検出する手段とした。
  • fold間でのパフォーマンス差を分析し、ラボ源やバッチ固有要因に依存しているかどうかを検証した。特にゼロショット一般化設定において注目した。

実験結果

リサーチクエスチョン

  • RQ1細胞画像解析におけるディープラーニングモデルは、生物学的に関連する疾患マーカーではなく、実験的バッチやプレート位置といった交絡変数をどれほど学習してしまうのか?
  • RQ2焦点度の勾配といった画像取得アーティファクトが、モデルのパフォーマンスと一般化性能にどのように影響を与えるのか?
  • RQ3CNN埋め込みの非教師ありクラスタリングは、ラベル分布からは見えない隠れたデータバイアスを明らかにできるか?
  • RQ4細胞密度や画像統計といった手動特徴量がモデルパフォーマンスをどれほど説明でき、交絡要因として機能するのか?
  • RQ5GradCAMのようなモデル解釈技術は、バイオメディカルデータにおけるディープラーニングモデルの予測信号の真の源をどのように暴露できるか?

主な発見

  • SMA Mainデータセットでは、12の交差検証foldすべてで高いROC AUCスコアを達成したが、唯一のランダムより悪い性能を示したfoldでは、健康および疾患由来の細胞線が同一ラボから供給されていたことが判明し、モデルがラボ固有要因に依存していることが示された。
  • CNN埋め込みの非教師ありt-SNEクラスタリングにより、SMAおよびALS両データセットで実験的バッチによる強いクラスタリングが確認され、バッチ効果が特徴空間を支配していることが明らかになった。
  • ALSデータセットでは、細胞密度のみを用いたモデルが完全に教師ありCNNと同等のROC AUCを達成しており、細胞密度が主要な交絡信号である可能性が示された。
  • 部分的依存プロットにより、細胞密度が主要な交絡要因であることが確認され、モデルの予測が1サイトあたりの細胞数に強く依存していることが示された。
  • GradCAMのサリエンシーマップでは、TDPwt線の分類時にモデルが空の領域に注目していることが判明し、細胞形態よりも空間的アーティファクトに注目していることが明らかになった。
  • zスタック共焦点画像法を用いることで、単一面の広視野画像法に比べて焦点度が著しく向上し、元のSMA Mainデータセットにおける主要な画像レベルバイアス要因が解消された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。