[論文レビュー] ACPL: Anti-curriculum Pseudo-labelling for Semi-supervised Medical Image Classification
ACPLは、クラス不均衡を軽減するため、ラベルなしサンプルのクロスディストリビューション情報量に基づいて、有益な未ラベルサンプルを選択する半教師あり学習手法を提案する。また、情報量に基づく混合によるアンサンブルモデルとKNN予測を用いて、偽ラベルの正確性を向上させる。確認バイアスとトレーニングの不均衡を解消することで、クラスごとのしきい値を必要とせず、マルチラベル(Chest X-ray14)およびマルチクラス(ISIC2018)ベンチマークで最先端の性能を達成する。
Effective semi-supervised learning (SSL) in medical image analysis (MIA) must address two challenges: 1) work effectively on both multi-class (e.g., lesion classification) and multi-label (e.g., multiple-disease diagnosis) problems, and 2) handle imbalanced learning (because of the high variance in disease prevalence). One strategy to explore in SSL MIA is based on the pseudo labelling strategy, but it has a few shortcomings. Pseudo-labelling has in general lower accuracy than consistency learning, it is not specifically designed for both multi-class and multi-label problems, and it can be challenged by imbalanced learning. In this paper, unlike traditional methods that select confident pseudo label by threshold, we propose a new SSL algorithm, called anti-curriculum pseudo-labelling (ACPL), which introduces novel techniques to select informative unlabelled samples, improving training balance and allowing the model to work for both multi-label and multi-class problems, and to estimate pseudo labels by an accurate ensemble of classifiers (improving pseudo label accuracy). We run extensive experiments to evaluate ACPL on two public medical image classification benchmarks: Chest X-Ray14 for thorax disease multi-label classification and ISIC2018 for skin lesion multi-class classification. Our method outperforms previous SOTA SSL methods on both datasets
研究の動機と目的
- 半教師あり医療画像分類におけるクラス不均衡の課題、特に希少疾患クラスに対して対処する。
- 固定の信頼度しきい値に依存する伝統的な偽ラベル付けの限界、例えば確認バイアスを克服する。
- マルチクラスおよびマルチラベル医療画像問題の両方に対して、効果的な半教師あり学習を可能にする。
- サンプルの情報量を重み付け基準として用いることで、深層モデルの予測とKNN分類の組み合わせによる偽ラベルの正確性を向上させる。
- ラベルあり分布から遠く離れた未ラベルサンプルを選択することで、安定的かつバランスの取れたトレーニングプロセスを実現し、マイノリティクラスの学習を促進する。
提案手法
- ラベルありアンカーセットから遠く離れた未ラベルサンプルを特定するためのクロスディストリビューション・サンプル情報量測定を導入し、マイノリティクラスに属する可能性の高いサンプルを優先的に選択する。
- アンカーセットの密度に基づく重みを用いて、モデル予測とKNN予測を組み合わせる情報量に基づく混合(informative mixup)という、偽ラベル付け機構を提案し、ラベルの正確性を向上させ、確認バイアスを低減する。
- 最も情報量の高い偽ラベル付きサンプルのみを用いてアンカーセットを更新する、アンカーセットの洗練戦略を設計し、トレーニングの各エポックでKNN分類器の信頼性を向上させる。
- 高い情報量を持つ偽ラベル付きサンプルを統合することで進化する動的アンカーセットを用い、その後続のKNN予測の安定性と正確性を向上させる。
- 容易で多数派クラスのサンプルを選択を避けるため、分布的に離れた情報量の高い未ラベルサンプルに焦点を当てたカリキュラム風の学習戦略を適用する。
- サンプル情報量に従って誘導されるKNN分類器を実装し、特に複雑なクラス相関を示すマルチラベル設定において、頑健な偽ラベルを提供する。

実験結果
リサーチクエスチョン
- RQ1ラベルありデータからの分布的距離に基づいて未ラベルサンプルを選択することで、不均衡な医療画像分類におけるモデルの一般化性能が向上するか?
- RQ2情報量重み付きの混合を用いてモデル予測とKNN分類を組み合わせることで、偽ラベルの正確性とモデルの頑健性にどのような影響を与えるか?
- RQ3提案手法が半教師あり医療画像学習における確認バイアスをどの程度軽減できるか?
- RQ4問題固有のしきい値チューニングを必要とせず、マルチクラスおよびマルチラベル医療画像ベンチマークの両方で一般化可能か?
- RQ5アンカーセットの洗練機構は、KNNベースの偽ラベル付けコンponentの安定性と性能を向上させるか?
主な発見
- マルチラベルのChest X-ray14データセットにおいて、2%のラベル付きデータでのみテストAUCが74.44に達し、以前のSOTA手法を上回る。
- マルチクラスのISIC2018ベンチマークにおいても、ACPLは最先端の性能を達成し、異なる問題タイプにおける有効性を示している。
- 情報量に基づく混合戦略により、モデル単体、KNN単体、およびランダムなα混合のベースライン手法と比較して、偽ラベルの正確性が最低1.5%向上した。
- 情報量に基づくサンプル選択により、マイノリティクラスとマジョリティクラスの代表の差が縮小され、マイノリティクラスのサンプルの割合が5–10%からほぼ30%に上昇した。
- アンカーセットの洗練機構により、異なるKNN近傍数に対する性能が安定化し、AUCのばらつきが2%から1%に減少した。
- アブレーションスタディにより、情報量の高いサンプル選択と情報量に基づく混合機構の両方が、性能向上に不可欠であることが確認され、それぞれが最終的な正確性に顕著な寄与を示した。
![(b) Imbalanced distribution on multi-label Chest X-ray14 [ 39 ] (left) and multi-class ISIC2018 [ 36 ] (right)](https://ar5iv.labs.arxiv.org/html/2111.12918/assets/latex/page1distribution.png)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。