Skip to main content
QUICK REVIEW

[論文レビュー] Imbalance-Aware Self-Supervised Learning for 3D Radiomic Representations

Hongwei Li, Fei-Fei Xue|arXiv (Cornell University)|Mar 6, 2021
Radiomics and Machine Learning in Medical Imaging参考文献 24被引用数 4
ひとこと要約

本稿では、自己教師あり3次元シアン方式を用いて、ラベルの偏りを補正することで、医療画像解析のためのラジオミクス表現を向上させるフレームワークを提案する。データの不均衡を解消するための非教師あり再重み付けとバッチ構成のバランス化を組み合わせ、脳腫瘍分類および肺がんステージングにおいて、従来のラジオミクスおよび教師あり学習を上回る最先端の性能を達成した。特にラベルが限られる状況下でも顕著な優位性を示した。

ABSTRACT

Radiomic representations can quantify properties of regions of interest in medical image data. Classically, they account for pre-defined statistics of shape, texture, and other low-level image features. Alternatively, deep learning-based representations are derived from supervised learning but require expensive annotations from experts and often suffer from overfitting and data imbalance issues. In this work, we address the challenge of learning representations of 3D medical images for an effective quantification under data imbalance. We propose a \emph{self-supervised} representation learning framework to learn high-level features of 3D volumes as a complement to existing radiomics features. Specifically, we demonstrate how to learn image representations in a self-supervised fashion using a 3D Siamese network. More importantly, we deal with data imbalance by exploiting two unsupervised strategies: a) sample re-weighting, and b) balancing the composition of training batches. When combining our learned self-supervised feature with traditional radiomics, we show significant improvement in brain tumor classification and lung cancer staging tasks covering MRI and CT imaging modalities.

研究の動機と目的

  • 臨床データセットに広く見られるが、まだ十分に検討が進んでいない3次元医療画像の自己教師あり表現学習におけるデータ不均衡問題に対処すること。
  • アノテーションデータを必要とせずに高レベルで判別力のある特徴を学習できる、自己教師あり3次元シアンネットワークの開発。
  • 自己教師あり表現を従来のラジオミクスと統合し、神経画像診断および腫瘍学分野における下流タスクの性能向上を図ること。
  • 自己教師あり学習におけるクラス不均衡を軽減するための非教師あり戦略(サンプル再重み付けとバランスの取れたバッチ構成)の有効性を評価すること。
  • ラベルデータが限られる状況において、自己教師あり特徴が教師あり学習を上回るか、あるいは補完的役割を果たすかどうかを実証すること。

提案手法

  • 同一の3次元医療ボリュームの2つの拡張されたビューを比較することで、不変な表現を学習する、重みを共有する3次元シアンネットワークを採用。
  • 広範なデータ拡張を4つのカテゴリに分け実施:アフィン変換、外観強化、コントラスト変更、ノイズ注入。これにより陽性ペアを生成。
  • クラス頻度に基づいて損失重みを調整する非教師あり再重み付け戦略(RE)を導入。多数クラスへのバイアスを低減。
  • クラスタリングを用いたサンプリング戦略(SE)を採用。サンプルをクラスタにグループ化し、各クラスタからサンプリングすることで、バッチ内のクラス表現をバランス化。
  • SEモジュールではk-meansクラスタリングを用いて、等しいクラス分布を持つ新たなバッチを形成。これにより、学習の安定性と表現品質が向上。
  • 最終的なモデルでは、自己教師あり特徴と古典的ラジオミクスを、ラテンフェージュ戦略を用いて統合し、下流分類タスクに応用。

実験結果

リサーチクエスチョン

  • RQ1自己教師あり3次元表現学習は、不均衡な医療画像データセットにおけるラジオミクス特徴の質を向上させることができるか?
  • RQ2非教師あり再重み付けとバランスの取れたバッチサンプリングは、自己教師あり3次元医療画像学習におけるデータ不均衡をどのように緩和するか?
  • RQ3自己教師あり特徴と従来のラジオミクスを統合することで、データが限られる状況下で教師あり学習を上回る性能が得られるか?
  • RQ4本手法は、ルービックキューブなどのプロキシタスクベースの自己教師あり学習(例:ルービックキューブ)と比較して、判別力に優れているか?
  • RQ5SEモジュールにおける最適なクラスタ数(k)は何か?これは表現品質と一般化性能の両立を考慮した上で決定される。

主な発見

  • 従来のラジオミクスと自己教師あり3次元表現(3DSiam+SE)を組み合わせた手法は、全ラベル条件下で脳腫瘍分類において91.6%の感度と71.1%の特異度を達成。教師あり学習(88.8%/71.1%)を上回った。
  • 訓練ラベルを50%に制限した状況でも、ハイブリッド手法は84.8%の感度と76.3%の特異度を達成。同条件で教師あり学習(80.4%/56.6%)を上回った。
  • SEモジュールにより特徴の重複が低減され、共分散解析で低くなった相関係数が、よりコンパクトで判別力の高い表現であることを示した。
  • SEモジュールにおける最適なクラスタ数(k)は3と判明。k=5などの高い値では、サンプリングバイアスによりAUCが低下した。
  • 本手法は、脳腫瘍および肺がんの両タスクにおいて、プロキシタスクベースの自己教師あり学習(例:ルービックキューブ)を上回った。これは、直接的な自己教師あり表現学習が優れた判別力を有することを示している。
  • 肺がんステージングでは、全ラベル条件下で全体の正答率53.8%、マイナスクラス正答率37.5%を達成。教師あり学習(52.6%/37.5%)および従来のラジオミクス(49.0%/37.5%)を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。