Skip to main content
QUICK REVIEW

[論文レビュー] Handling Inter-Annotator Agreement for Automated Skin Lesion Segmentation

Vinícius Ribeiro, Sandra Avila|arXiv (Cornell University)|Jun 6, 2019
Cutaneous Melanoma Detection and Management参考文献 25被引用数 17
ひとこと要約

本論文は、ISICアーカイブを用いて皮膚レセントのセグメンテーションにおけるアノテーター間整合性を調査し、凸包やモルフォロジカル操作などの単純な画像処理の条件付け手法を提案する。これらの手法により、アノテーションの整合性が著しく向上し、境界の歪みを引き起こさずに、特にCohenのKappaの中央値が0.7185から0.7552に上昇することを示している。これは、堅牢なセグメンテーションモデルの学習と評価に実用的な解決策を提供する。

ABSTRACT

In this work, we explore the issue of the inter-annotator agreement for training and evaluating automated segmentation of skin lesions. We explore what different degrees of agreement represent, and how they affect different use cases for segmentation. We also evaluate how conditioning the ground truths using different (but very simple) algorithms may help to enhance agreement and may be appropriate for some use cases. The segmentation of skin lesions is a cornerstone task for automated skin lesion analysis, useful both as an end-result to locate/detect the lesions and as an ancillary task for lesion classification. Lesion segmentation, however, is a very challenging task, due not only to the challenge of image segmentation itself but also to the difficulty in obtaining properly annotated data. Detecting accurately the borders of lesions is challenging even for trained humans, since, for many lesions, those borders are fuzzy and ill-defined. Using lesions and annotations from the ISIC Archive, we estimate inter-annotator agreement for skin-lesion segmentation and propose several simple procedures that may help to improve inter-annotator agreement if used to condition the ground truths.

研究の動機と目的

  • 皮膚レセントセグメンテーションにおけるアノテーター間整合性を分析すること。これは医療画像セグメンテーション分野で重要な課題だが、まだ十分に検討されていない。
  • 異なる水準の整合性が、自動皮膚レセント分析におけるモデル学習と評価に与える影響を評価すること。
  • 境界の歪みを引き起こさずに整合性を向上させる単純な条件付け手法を提案・検証すること。
  • 条件付けされたアノテーションが、セグメンテーションモデルのロバスト性と公平性の評価を向上させることを評価すること。
  • 最近のコンペティションで上位の成績を収めたモデルが、追加のアノテーションデータを避ける理由を調査すること。アノテーションの不一致がその要因である可能性を検討する。

提案手法

  • 本研究では、ISICアーカイブを用い、1枚の画像に対して複数のヒトアノテーションマスクが提供されている。これにより、CohenのKappaとDiceスコアを用いてアノテーター間整合性を推定する。
  • バウンディングボックス、凸包、モルフォロジカルクロージング、モルフォロジカルオープニングといった単純な画像処理操作を、元のアノテーションを変更するための条件付け手法として適用する。
  • 各条件付け手法をすべてのアノテーションに適用し、再びアノテーター間整合性を評価することで、改善の有無を検証する。
  • 整合性の分布の差を検証するために、統計的仮説検定(コルモゴロフ=スミルノフ検定)を用いる。
  • 一般化可能性を評価するため、2017年および2018年のコンペティションで使用されたISICアーカイブのサブセットを対象とする。
  • 元のアノテーションと条件付け済みアノテーションの整合性スコアの分布を、バイオリンプロットと密度推定を用いて可視化する。

実験結果

リサーチクエスチョン

  • RQ1皮膚レセントセグメンテーションデータセット、特にISICアーカイブにおいて、アノテーター間整合性はどのように変動するか?
  • RQ2異なる水準のアノテーター間整合性は、臨床的および機械学習用途において何を意味するのか?
  • RQ3単純な画像処理の条件付け手法は、境界の歪みを引き起こさずにアノテーター間整合性を向上させることができるか?
  • RQ4どの条件付け手法が最も高い整合性の向上をもたらし、これは異なるレセントタイプや画像サブセットによってどのように変化するか?
  • RQ5最近のコンペティションで上位の成績を収めたモデルが、追加のアノテーションデータを避けるのはなぜか?アノテーションの不一致がその要因である可能性は何か?

主な発見

  • ISICアーカイブ全体におけるアノテーター間整合性の中央値(CohenのKappa)は0.7185であり、ISICチャレンジ2018サブセットでは0.7552に上昇する。
  • モルフォロジカル操作および凸包による条件付けは、整合性の向上に顕著な効果を示し、バウンディングボックス対凸包の比較においてp値が0.002未満である。
  • バウンディングボックスによる条件付けは、他の手法と比較して整合性を悪化させた。これは、強い単純化が必ずしも有益ではないことを示唆している。
  • コルモゴロフ=スミルノフ検定により、元の分布とすべての条件付け済み分布の間で等価性が棄却された(p < 10^-20)。これにより、整合性分布に統計的に有意なシフトが生じたことが示された。
  • 条件付け後でも、低整合性のアノテーションの裾野が顕著に残っており、強い不一致は依然として解消されていない。
  • 結果から、条件付けがノイズ除去操作として機能し、重要なレセント特徴を保持しながらアノテーター固有のノイズを低減することで、モデルのロバスト性と評価の公平性が向上することが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。