Skip to main content
QUICK REVIEW

[論文レビュー] Variability Matters : Evaluating inter-rater variability in histopathology for robust cell detection

Cholmin Kang, Chunggi Lee|arXiv (Cornell University)|Oct 11, 2022
AI in cancer detection被引用数 4
ひとこと要約

本稿では、120名のボード資格を持つ病理学者の間の適合性を、アンカーパathologistを用いて測定・低減する手法を提案する。小さな、低ばらつきのデータセットで学習したモデルが、大きな、高ばらつきのデータセットで学習したモデルを上回ることを示しており、細胞検出のディーブラーニングにおいて、アノテーションの質が量を上回ることを証明している。

ABSTRACT

Large annotated datasets have been a key component in the success of deep learning. However, annotating medical images is challenging as it requires expertise and a large budget. In particular, annotating different types of cells in histopathology suffer from high inter- and intra-rater variability due to the ambiguity of the task. Under this setting, the relation between annotators' variability and model performance has received little attention. We present a large-scale study on the variability of cell annotations among 120 board-certified pathologists and how it affects the performance of a deep learning model. We propose a method to measure such variability, and by excluding those annotators with low variability, we verify the trade-off between the amount of data and its quality. We found that naively increasing the data size at the expense of inter-rater variability does not necessarily lead to better-performing models in cell detection. Instead, decreasing the inter-rater variability with the expense of decreasing dataset size increased the model performance. Furthermore, models trained from data annotated with lower inter-labeler variability outperform those from higher inter-labeler variability. These findings suggest that the evaluation of the annotators may help tackle the fundamental budget issues in the histopathology domain

研究の動機と目的

  • ヒストパスロジー細胞検出におけるディーブラーニングモデルのパフォーマンスに及ぼす評価者間ばらつきの影響を調査すること。
  • 基準(アンカー)病理学者に対するアノテーターの適合性を測定・定量化するスケーラブルな手法を開発すること。
  • 選択的データキュレーションによる評価者間ばらつきの低減が、モデルの汎化性能およびパフォーマンスを向上させることを評価すること。
  • 高品質で小さなデータセットが、大規模でノイズの多いデータセットを上回ることを証明する根拠を提供すること。
  • データ量ではなく専門家の一貫性を優先することで、病理学的アノテーションにおける予算配分をより効率的に行う支援をすること。

提案手法

  • アンカードアノテーションプロトコル:1名のエキスパート(アンカー)が、12,326枚のウェルスライド画像(WSIs)から抽出された29,387個のパッチを制御セットとしてラベル付けした。
  • 120名の病理学者全員がテスト画像および制御画像をアノテートし、制御画像は適合性スコアの算出に使用された。
  • 各アノテーターのアンカーへの適合性を測定するため、修正F1スコア(mF1)が用いられ、評価者間ばらつきが定量化された。
  • アノテーターは適合性スコア順にランク付けされ、データは百分位数(例:p0–25、p75–100)に分割され、ばらつきレベルごとのモデルパフォーマンスを比較した。
  • 適合性百分位数ごとにグループ化されたデータサブセットを用いてディーブラーニングモデルを学習させ、標準指標を用いてパフォーマンスを評価し、統計的有意性の検定を行った。
  • 異なる評価者間ばらつきを示すデータサブセット間でのモデルパフォーマンスの差を検証するために、統計的比較(t検定、α=0.05)が用いられた。

実験結果

リサーチクエスチョン

  • RQ1ヒストパスロジー細胞アノテーションにおける評価者間ばらつきは、ディーブラーニングモデルのパフォーマンスに顕著に影響を及ぼすか?
  • RQ2基準(アンカー)病理学者を用いて、アノテーターの適合性を客観的に測定・順位付けできるか?
  • RQ3モデルパフォーマンスの観点から、データセットのサイズとアノテーション品質の間にトレードオフがあるか?
  • RQ4小さな、適合性の高いデータセットが、大きな、ばらつきの高いデータセットを上回る性能を示せるか?
  • RQ5高ばらつきのアノテーターを除外することで、モデルの汎化性能および効率性はどの程度向上するか?

主な発見

  • 120名の病理学者の平均適合性スコアは0.70、標準偏差は0.08であり、顕著な評価者間ばらつきが確認された。
  • 平均CohenのKappaスコアはκ = 0.43であり、アノテーター間で中程度の一致を示しており、範囲は-0.01から0.87であった。
  • 適合性が最も低いアノテーター(p75–100)のデータで学習したモデルが、適合性が最も高いアノテーター(p0–25)のデータで学習したモデルを上回り、統計的に有意なp値0.00614を示した。
  • データ量の50%未満でも、低ばらつきアノテーション(p50–100)で学習したモデルは、全データセットで学習したモデルを上回り、p値0.00054を示した。
  • 上位75%のデータ(p25–100)で学習したモデルは、全データセットで学習したモデルを有意に上回り(p値 = 0.01778)、ばらつきが低いデータ量の削減が、より良いパフォーマンスをもたらすことを示した。
  • 本研究は、モデルパフォーマンスに影響を与えることなく、高適合性アノテーターのみを選別することで、アノテーション時間の50%削減(2298時間から1176時間)が可能である可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。