Skip to main content
QUICK REVIEW

[論文レビュー] Highly Efficient Representation and Active Learning Framework for Imbalanced Data and its Application to COVID-19 X-Ray Classification

Heng Hao, Sima Didari|arXiv (Cornell University)|Feb 24, 2021
COVID-19 diagnosis using AI参考文献 41被引用数 4
ひとこと要約

本論文は、自己教師付き表現学習とガウス過程に基づくアクティブラーニングを組み合わせることで、不均衡な胸部X線画像の分類にデータおよびラベルの両面で効率的なフレームワークを提案する。教師なし特徴学習と不確実性を考慮した予測を活用することで、ラベル付きデータの約10%のみで最先端の性能を達成し、COVID-19 X線分類において従来モデルを4%上回る性能を発揮する。

ABSTRACT

We propose a highly data-efficient classification and active learning framework for classifying chest X-rays. It is based on (1) unsupervised representation learning of a Convolutional Neural Network and (2) the Gaussian Process method. The unsupervised representation learning employs self-supervision that does not require class labels, and the learned features are proven to achieve label-efficient classification. GP is a kernel-based Bayesian approach that also leads to data-efficient predictions with the added benefit of estimating each decision's uncertainty. Our novel framework combines these two elements in sequence to achieve highly data and label efficient classifications. Moreover, both elements are less sensitive to the prevalent and challenging class imbalance issue, thanks to the (1) feature learned without labels and (2) the Bayesian nature of GP. The GP-provided uncertainty estimates enable active learning by ranking samples based on the uncertainty and selectively labeling samples showing higher uncertainty. We apply this novel combination to the data-deficient and severely imbalanced case of COVID-19 chest X-ray classification. We demonstrate that only $\sim 10\%$ of the labeled data is needed to reach the accuracy from training all available labels. Its application to the COVID-19 data in a fully supervised classification scenario shows that our model, with a generic ResNet backbone, outperforms (COVID-19 case by 4\%) the state-of-the-art model with a highly tuned architecture. Our model architecture and proposed framework are general and straightforward to apply to a broader class of datasets, with expected success.

研究の動機と目的

  • COVID-19 X線分類におけるデータ不足と深刻なクラス不均衡の課題に対処すること。
  • 自己教師学習を活用することで、最小限のラベル付きデータで表現学習手法を開発すること。
  • ガウス過程による不確実性推定を統合し、情報量の多いサンプルを優先するアクティブラーニングを実現すること。
  • 大規模なラベル付きデータセットへの依存を減らしながら、高い分類精度を維持すること。
  • 他の不均衡な医療画像分類タスクに適用可能な汎用性の高いフレームワークを構築すること。

提案手法

  • クラスラベルを必要とせず、胸部X線画像に対して対照的プリトレーニングを用いた自己教師付き表現学習を実装する。
  • 事前学習済みのResNetバックボーンを用いて、ラベルなしでX線画像から深層特徴を抽出する。
  • ガウス過程分類器を適用し、不確実性推定を伴う予測を実行することで、不確実性に基づくアクティブラーニングを可能にする。
  • 未ラベルデータを不確実性の度合いに基づいて順位付けし、反復的なラベル付けプロセスにおいて最も不確実なサンプルを人間によるラベル付けに選択する。
  • 教師なし特徴抽出器とGP分類器を順次パイプラインとして組み合わせることで、データ効率を向上させる。
  • GPのベイジアン性とラベルに依存しない特徴学習を活用することで、クラス不均衡への感受性を低減する。

実験結果

リサーチクエスチョン

  • RQ1自己教師付き表現学習は、胸部X線画像分類においてラベル付きデータの必要性を顕著に低減できるか?
  • RQ2ガウス過程による不確実性推定は、不均衡データセットにおけるアクティブラーニングの性能をどのように向上させるか?
  • RQ3自己教師付き特徴を有する事前学習済みCNNは、限られたラベル付きデータで完全に教師ありモデルを上回れるか?
  • RQ4自己教師学習とGPベースのアクティブラーニングの組み合わせは、医療画像におけるクラス不均衡の影響を緩和できるか?
  • RQ5このフレームワークは、他のデータが不足し、クラスが不均衡な医療画像分類タスクにも一般化可能か?

主な発見

  • 提案されたフレームワークは、ラベル付きデータの約10%のみで、完全に教師あり学習と同等の性能を達成する。
  • 一般的なResNetバックボーンを用いた場合、COVID-19 X線分類タスクにおいて、最先端モデルを4%上回る性能を発揮する。
  • ラベルフリーな特徴学習とベイジアン不確実性推定のおかげで、クラス不均衡に対して高い耐性を示す。
  • GPの不確実性に基づくアクティブラーニングは、情報量の多いサンプルを効果的に優先し、ラベリング作業の負担を軽減する。
  • 限られたアノテーションでも高い精度を維持するため、データ効率性が顕著に高い。
  • このアプローチは一般化性に優れており、同様の課題を有する他の医療画像データセットへの適応が容易である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。