Skip to main content
QUICK REVIEW

[論文レビュー] Selective Synthetic Augmentation with Quality Assurance

Yuan Xue, Jiarong Ye|arXiv (Cornell University)|Dec 9, 2019
AI in cancer detection参考文献 34被引用数 4
ひとこと要約

本稿では、分類タスクの訓練データに追加する前に、信頼性の高い条件付き生成対抗ネットワーク(cGAN)で生成された高品質な画像をフィルタリングする、選択的で合成増強するフレームワークを提案する。予測の不確実性を推定するためのモンテカルロドロップアウトと、実データの重心との特徴空間距離を組み合わせることで、高品質な合成サンプルのみを用いる。病理組織像分類、CIFAR10、SVHNの各データセットで、それぞれ6.8%、3.9%、1.6%の精度向上を達成した。

ABSTRACT

Supervised training of an automated medical image analysis system often requires a large amount of expert annotations that are hard to collect. Moreover, the proportions of data available across different classes may be highly imbalanced for rare diseases. To mitigate these issues, we investigate a novel data augmentation pipeline that selectively adds new synthetic images generated by conditional Adversarial Networks (cGANs), rather than extending directly the training set with synthetic images. The selection mechanisms that we introduce to the synthetic augmentation pipeline are motivated by the observation that, although cGAN-generated images can be visually appealing, they are not guaranteed to contain essential features for classification performance improvement. By selecting synthetic images based on the confidence of their assigned labels and their feature similarity to real labeled images, our framework provides quality assurance to synthetic augmentation by ensuring that adding the selected synthetic images to the training set will improve performance. We evaluate our model on a medical histopathology dataset, and two natural image classification benchmarks, CIFAR10 and SVHN. Results on these datasets show significant and consistent improvements in classification performance (with 6.8%, 3.9%, 1.6% higher accuracy, respectively) by leveraging cGAN generated images with selective augmentation.

研究の動機と目的

  • 限られた、かつ不均衡な医療画像データセットにおいて、モデルの耐性を高めるために高品質な合成データを必要とする課題に対処すること。
  • 視覚的にリアルなが、低品質な合成画像を訓練データに無差別に追加することで性能が低下するリスクを回避すること。
  • 信頼性の高い、代表的な合成サンプルのみを含む品質保証付きの合成増強パイプラインを開発すること。
  • 本手法の有効性と汎用性が、医療画像および自然画像分類タスクの両方で確認されること。

提案手法

  • 高精細な合成病理組織パッチを生成するための条件付き生成対抗ネットワーク(cGAN)を訓練し、滑らかにしたFrechet Inception Distance(FID)スコアに基づいてモデル選択を行う。
  • 事前学習済みのResNet34にモンテカルロドロップアウトを適用し、実際の訓練データから特徴空間におけるクラス固有の重心を抽出する。
  • 複数回の順伝播(モンテカルロサンプリング)による予測エントロピーを用いて、合成画像をフィルタリングし、エントロピーが低い(ラベルの信頼性が高い)もののみを保持する。
  • 実データのクラス重心からのL2距離に基づき、特徴空間上で真のクラス分布に最も近い画像をさらにフィルタリングして保持する。
  • 最終的な合成サンプルの選択は、増強比 $ r $ に基づいて決定され、訓練データの制御された、品質中心の拡張が可能になる。
  • 本フレームワークは、子宮頸部病理組織データセットおよび標準ベンチマーク(CIFAR10、SVHN)で評価され、公平な比較のためのバックボーン分類器としてResNet34が使用された。

実験結果

リサーチクエスチョン

  • RQ1cGANで生成された画像を用いた選択的合成増強は、小規模で不均衡な医療画像データセットにおける分類性能を向上させることができるか?
  • RQ2実データの重心との特徴類似度とラベルの信頼性に基づいて合成画像をフィルタリングすることで、単純な増強に比べてモデルの一般化性能が向上するか?
  • RQ3従来のデータ増強法や非選択的合成増強法と比較して、本手法は精度と耐性の面で優れているか?
  • RQ4ノイズや誤った情報を含むサンプルを導入せずに、性能向上を最大化する最適な増強比 $ r $ は何か?
  • RQ5本手法の選択的増強パイプラインは、医療画像から自然画像に至る多様な画像ドメインに一般化可能か?

主な発見

  • 子宮頸部病理組織データセットでは、本手法によりベースラインモデルに比べて6.8%の絶対的な精度向上が達成された。
  • 訓練データの10%しか使用しないCIFAR10では、本手法によりベースラインに比べて3.9ポイントの精度向上が見られた。
  • SVHNでは、非選択的GAN増強に比べて1.6%の精度向上を示し、全データセットで一貫した向上効果を確認した。
  • 非選択的GAN増強で訓練されたモデルは、ベースラインよりも性能が悪化しており、合成データを無差別に使用すると性能が低下する可能性があることを裏付けた。
  • アブレーションスタディの結果、増強比 $ r $ を0.5を超えて増加させると性能が低下することが判明し、選択的フィルタリングの重要性が強調された。
  • 不確実性推定にモンテカルロドロップアウトを、分布整合性のための特徴空間距離を用いることで、合成データ統合における品質保証が極めて重要であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。