[論文レビュー] Variability Matters : Evaluating inter-rater variability in histopathology for robust cell detection
本稿では、120名のボード資格を持つ病理学者の間の適合性を、アンカーパathologistを用いて測定・低減する手法を提案する。小さな、低ばらつきのデータセットで学習したモデルが、大きな、高ばらつきのデータセットで学習したモデルを上回ることを示しており、細胞検出のディーブラーニングにおいて、アノテーションの質が量を上回ることを証明している。
Large annotated datasets have been a key component in the success of deep learning. However, annotating medical images is challenging as it requires expertise and a large budget. In particular, annotating different types of cells in histopathology suffer from high inter- and intra-rater variability due to the ambiguity of the task. Under this setting, the relation between annotators' variability and model performance has received little attention. We present a large-scale study on the variability of cell annotations among 120 board-certified pathologists and how it affects the performance of a deep learning model. We propose a method to measure such variability, and by excluding those annotators with low variability, we verify the trade-off between the amount of data and its quality. We found that naively increasing the data size at the expense of inter-rater variability does not necessarily lead to better-performing models in cell detection. Instead, decreasing the inter-rater variability with the expense of decreasing dataset size increased the model performance. Furthermore, models trained from data annotated with lower inter-labeler variability outperform those from higher inter-labeler variability. These findings suggest that the evaluation of the annotators may help tackle the fundamental budget issues in the histopathology domain
研究の動機と目的
- ヒストパスロジー細胞検出におけるディーブラーニングモデルのパフォーマンスに及ぼす評価者間ばらつきの影響を調査すること。
- 基準(アンカー)病理学者に対するアノテーターの適合性を測定・定量化するスケーラブルな手法を開発すること。
- 選択的データキュレーションによる評価者間ばらつきの低減が、モデルの汎化性能およびパフォーマンスを向上させることを評価すること。
- 高品質で小さなデータセットが、大規模でノイズの多いデータセットを上回ることを証明する根拠を提供すること。
- データ量ではなく専門家の一貫性を優先することで、病理学的アノテーションにおける予算配分をより効率的に行う支援をすること。
提案手法
- アンカードアノテーションプロトコル:1名のエキスパート(アンカー)が、12,326枚のウェルスライド画像(WSIs)から抽出された29,387個のパッチを制御セットとしてラベル付けした。
- 120名の病理学者全員がテスト画像および制御画像をアノテートし、制御画像は適合性スコアの算出に使用された。
- 各アノテーターのアンカーへの適合性を測定するため、修正F1スコア(mF1)が用いられ、評価者間ばらつきが定量化された。
- アノテーターは適合性スコア順にランク付けされ、データは百分位数(例:p0–25、p75–100)に分割され、ばらつきレベルごとのモデルパフォーマンスを比較した。
- 適合性百分位数ごとにグループ化されたデータサブセットを用いてディーブラーニングモデルを学習させ、標準指標を用いてパフォーマンスを評価し、統計的有意性の検定を行った。
- 異なる評価者間ばらつきを示すデータサブセット間でのモデルパフォーマンスの差を検証するために、統計的比較(t検定、α=0.05)が用いられた。
実験結果
リサーチクエスチョン
- RQ1ヒストパスロジー細胞アノテーションにおける評価者間ばらつきは、ディーブラーニングモデルのパフォーマンスに顕著に影響を及ぼすか?
- RQ2基準(アンカー)病理学者を用いて、アノテーターの適合性を客観的に測定・順位付けできるか?
- RQ3モデルパフォーマンスの観点から、データセットのサイズとアノテーション品質の間にトレードオフがあるか?
- RQ4小さな、適合性の高いデータセットが、大きな、ばらつきの高いデータセットを上回る性能を示せるか?
- RQ5高ばらつきのアノテーターを除外することで、モデルの汎化性能および効率性はどの程度向上するか?
主な発見
- 120名の病理学者の平均適合性スコアは0.70、標準偏差は0.08であり、顕著な評価者間ばらつきが確認された。
- 平均CohenのKappaスコアはκ = 0.43であり、アノテーター間で中程度の一致を示しており、範囲は-0.01から0.87であった。
- 適合性が最も低いアノテーター(p75–100)のデータで学習したモデルが、適合性が最も高いアノテーター(p0–25)のデータで学習したモデルを上回り、統計的に有意なp値0.00614を示した。
- データ量の50%未満でも、低ばらつきアノテーション(p50–100)で学習したモデルは、全データセットで学習したモデルを上回り、p値0.00054を示した。
- 上位75%のデータ(p25–100)で学習したモデルは、全データセットで学習したモデルを有意に上回り(p値 = 0.01778)、ばらつきが低いデータ量の削減が、より良いパフォーマンスをもたらすことを示した。
- 本研究は、モデルパフォーマンスに影響を与えることなく、高適合性アノテーターのみを選別することで、アノテーション時間の50%削減(2298時間から1176時間)が可能である可能性を示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。