Skip to main content
QUICK REVIEW

[論文レビュー] Inflation of test accuracy due to data leakage in deep learning-based classification of OCT images

Iulian Emil Tampu, Anders Eklund|arXiv (Cornell University)|Feb 21, 2022
Retinal Imaging and Analysis参考文献 42被引用数 66
ひとこと要約

本研究は、OCT画像分類における深層学習において、3Dボリュームまたは被験者レベルではなく2Dスライスレベルでデータを分割すると、顕著なデータ漏洩が生じ、テスト精度が最大30%上昇すること(MCCの上昇が0.07~0.43)を示している。著者らは、重複する訓練・テストセットを用いて学習したモデルが汎化性能を過大評価することを示し、OCTベースの深層学習研究における信頼できる評価を確保するため、ボリュームまたは被験者レベルでの分割が不可欠であることを強調している。

ABSTRACT

In the application of deep learning on optical coherence tomography (OCT) data, it is common to train classification networks using 2D images originating from volumetric data. Given the micrometer resolution of OCT systems, consecutive images are often very similar in both visible structures and noise. Thus, an inappropriate data split can result in overlap between the training and testing sets, with a large portion of the literature overlooking this aspect. In this study, the effect of improper dataset splitting on model evaluation is demonstrated for three classification tasks using three OCT open-access datasets extensively used, Kermany's and Srinivasan's ophthalmology datasets, and AIIMS breast tissue dataset. Results show that the classification performance is inflated by 0.07 up to 0.43 in terms of Matthews Correlation Coefficient (accuracy: 5% to 30%) for models tested on datasets with improper splitting, highlighting the considerable effect of dataset handling on model evaluation. This study intends to raise awareness on the importance of dataset splitting given the increased research interest in implementing deep learning on OCT data.

研究の動機と目的

  • 深層学習ベースのOCT画像分類におけるモデル評価に影響を及ぼす不適切なデータ分割戦略の影響を調査すること。
  • 文献で一般的に用いられる画像単位での分割が、連続する2D OCTスライス間に高い類似性を示すため、データ漏洩を引き起こすことを実証すること。
  • OCTデータセットにおける訓練・テストセットの重複が、テスト精度およびMCCに及ぼす上昇の程度を定量化すること。
  • OCT研究における偏りのないモデル評価を保証するため、ボリュームまたは被験者レベルでの分割を必須の基準とするべきであることを提唱すること。

提案手法

  • 画像単位およびボリューム/被験者単位の戦略を用いて、訓練およびテストセットを作成するためのカスタムデータ分割関数を実装した。
  • ReLUおよびマックスプーリングを伴う2層の畳み込み層を持つ浅い畳み込みニューラルネットワーク(LightOCTモデル)を用い、その後にソフトマックス出力を持つ全結合層を配置した。
  • 早期停止なしで、勾配降下法(モーメンタムm=0.9)、一定学習率(0.0001)、バッチサイズ64、250エポックで、モデルを再訓練から開始した。
  • 結果の信頼性を確保するため、10回繰り返しの5分割交差検証を実施した。
  • 各クラスについて、MCC(マチューズ相関係数)、正確度、適合率、再現率、F1スコア、AUCを評価指標として計算した。
  • バイアスの検出のため、10,000回のシミュレーションを実行したランダムラベル実験を実施:重複のない状態で構築した帰無分布と比較し、ランダムラベルで学習したモデルのMCCを一標本Wilcoxon検定を用いてp値を算出した。

実験結果

リサーチクエスチョン

  • RQ1画像単位でのデータ分割は、OCT画像分類のための深層学習モデルにおいて、テスト精度をどの程度上昇させるか?
  • RQ2訓練・テストセットの重複によるデータ漏洩は、OCTベースの分類タスクにおけるマチューズ相関係数(MCC)にどのような影響を及ぼすか?
  • RQ3適切なボリュームレベルの分割と比較して、重複するデータ分割を使用した場合の性能上昇の程度はどの程度か?
  • RQ4ランダムラベル実験は、モデル評価におけるデータ漏洩を検出可能か?このようなテストのp値は、重複の有無をどのように反映するか?

主な発見

  • 画像単位での分割によるデータ漏洩により、3つのOCTデータセット全体でテスト精度が5%~30%上昇し、MCCも0.07~0.43上昇した。
  • KermanyのOCT2017バージョン2データセットでは、92%のテスト画像が訓練セットにも存在する被験者IDを有しており、顕著な重複が確認された。
  • Kermanyのデータセットのoriginal_v3分割では被験者IDの重複がなかったが、original_v2分割では顕著な漏洩が確認され、過去の研究で性能が誇張された理由を説明できた。
  • ランダムラベル実験では、重複する分割で学習したモデルに対して統計的に有意なバイアス(p < 0.05)が検出され、データ漏洩の影響が確認された。
  • 本研究では、original_v2分割を用いたモデルが99.6%の正確度を報告したが、これはデータ漏洩のため過大評価されている可能性が高く、適切なボリューム単位の分割を用いることでより信頼できる推定が得られるだろう。
  • 著者らは、不適切な分割がモデルの汎化性能の評価を損なうと結論づけ、OCTの深層学習研究における信頼できる評価を確保するため、ボリュームまたは被験者レベルでの分割が不可欠であると結論づけた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。