Skip to main content
QUICK REVIEW

[論文レビュー] Detect, Quantify, and Incorporate Dataset Bias: A Neuroimaging Analysis on 12,207 Individuals

Christian Wachinger, Benjamín Gutiérrez-Becker|arXiv (Cornell University)|Apr 28, 2018
Functional Brain Connectivity Studies参考文献 25被引用数 4
ひとこと要約

本研究では、15のデータセットにまたがる12,207例のT1強調MRIスキャンを分析することで、神経画像法におけるデータセットバイアスを検出し、定量的に評価し、活用する。本研究では、データセット適合性を測る2つの指標(バタチャリヤ距離と年齢予測誤差)を導入し、神経画像法の施設間の類似性を明らかにするt-SNE埋め込みを構築し、バイアスに配慮したトレーニングセット選択が、ランダムサンプリングに比べて自閉症予測の正確性を向上させることを示している。

ABSTRACT

Neuroimaging datasets keep growing in size to address increasingly complex medical questions. However, even the largest datasets today alone are too small for training complex models or for finding genome wide associations. A solution is to grow the sample size by merging data across several datasets. However, bias in datasets complicates this approach and includes additional sources of variation in the data instead. In this work, we combine 15 large neuroimaging datasets to study bias. First, we detect bias by demonstrating that scans can be correctly assigned to a dataset with 73.3% accuracy. Next, we introduce metrics to quantify the compatibility across datasets and to create embeddings of neuroimaging sites. Finally, we incorporate the presence of bias for the selection of a training set for predicting autism. For the quantification of the dataset bias, we introduce two metrics: the Bhattacharyya distance between datasets and the age prediction error. The presented embedding of neuroimaging sites provides an interesting new visualization about the similarity of different sites. This could be used to guide the merging of data sources, while limiting the introduction of unwanted variation. Finally, we demonstrate a clear performance increase when incorporating dataset bias for training set selection in autism prediction. Overall, we believe that the growing amount of neuroimaging data necessitates to incorporate data-driven methods for quantifying dataset bias in future analyses.

研究の動機と目的

  • 大規模神経画像法データセットにおけるデータセットバイアスを検出し、定量的に評価すること。これは、データ統合とモデルの一般化性を妨げる要因である。
  • 神経画像法データセットと画像収集施設間の適合性を測るデータ駆動型指標を開発すること。
  • 異なるデータセット間で類似性を可視化する施設レベルの埋め込みを構築すること。その結果、同じデータセット内にある施設よりも、異なるデータセットに属する施設同士の方が類似していることが明らかになった。
  • 臨床予測タスク(例:自閉症検出)において、トレーニングセット選択にデータセットバイアスを組み込むことで得られる実用的利点を示すこと。

提案手法

  • MRIスキャンの元データセットを分類器を用いて予測することで、データセットバイアスを検出。73.3%の正答率を達成。
  • 脳容積と皮質厚さの特徴分布間のバタチャリヤ距離を用いて、データセット適合性を定量的に評価。
  • 年齢予測誤差をデータセット適合性の代理指標として用い、モデルの一般化能力を評価。
  • 2点間の年齢予測誤差を用いて、t-SNEベースの神経画像法施設の埋め込みを構築し、異なるデータセット間での施設類似性を可視化。
  • 施設適合性指標を用いて、自閉症分類のための非一様なトレーニングセット選択を実施。適合性指標値が低い施設を優先。
  • 指標に基づく指数関数的重み付けを用い、トレーニングセット構成において類似した施設を優先する。

実験結果

リサーチクエスチョン

  • RQ1画像特徴に基づいて、神経画像法データセットを信頼性高く区別できるか。これは、データセットバイアスの存在を示唆する。
  • RQ2画像ベースおよび人口統計ベースの指標を用いて、データセット適合性を定量的に測定する方法は何か。
  • RQ3異なるデータセットに属する神経画像法施設は、画像的特徴においてどの程度類似しているのか。また、その類似性は意味的に明確に可視化できるか。
  • RQ4トレーニングセット選択にデータセットバイアスを組み込むことで、ランダムサンプリングに比べて自閉症予測の性能が向上するか。
  • RQ5バタチャリヤ距離と年齢予測誤差のどちらの指標が、バイアスに配慮したモデル学習においてより優れた性能を示すか。

主な発見

  • 分類器は、MRIスキャンをその元データセットに73.3%の正答率で割り当てることができ、顕著なデータセットバイアスの存在が確認された。
  • 年齢予測誤差指標が、自閉症予測のためのトレーニングセット選択をガイドするうえで、バタチャリヤ距離を上回る性能を示した。
  • t-SNE可視化により、神経画像法施設が4つの明確なクラスタに分類された。その結果、同じデータセット内にある施設よりも、異なるデータセットに属する施設同士の方が類似していることが明らかになった。
  • ABIDE、HCP、GSP、CORRの施設は若年層被験者を対象としているクラスタを形成した。一方、ADNIとAIBLの施設は高年齢層被験者を対象としているクラスタを形成した。
  • 年齢予測誤差指標に基づくトレーニングセット選択は、ランダムサンプリングやバタチャリヤ距離に基づく選択に比べ、自閉症分類の正確性が向上した。
  • 提案されたバイアスに配慮したトレーニング戦略は、モデル性能を向上させ、大規模神経画像法解析においてバイアスを定量的に評価し、組み込むことの有効性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。