Skip to main content
QUICK REVIEW

[論文レビュー] Are we using appropriate segmentation metrics? Identifying correlates of human expert perception for CNN training beyond rolling the DICE coefficient

Florian Kofler, Ivan Ezhov|arXiv (Cornell University)|Mar 10, 2021
Radiomics and Machine Learning in Medical Imaging被引用数 16
ひとこと要約

本研究では、医療画像分野における標準的なセグメンテーション指標(例:Dice係数)の使用を疑問視し、人間の専門家がCNNによって生成されたセグメンテーションを人間が作成した基準ラベルよりも一貫して高く評価することを示している。著者らは、専門家の認識により適切に一致するように設計された複合損失関数を構築するための新しい統計的フレームワークを提案している。これにより、現在の指標が臨床的意義や専門家の判断とあまり相関しないことが明らかになり、特に膠腫の強化腫瘍や灰色 matter といった重要な構造に対して顕著であることが判明した。

ABSTRACT

Metrics optimized in complex machine learning tasks are often selected in an ad-hoc manner. It is unknown how they align with human expert perception. We explore the correlations between established quantitative segmentation quality metrics and qualitative evaluations by professionally trained human raters. Therefore, we conduct psychophysical experiments for two complex biomedical semantic segmentation problems. We discover that current standard metrics and loss functions correlate only moderately with the segmentation quality assessment of experts. Importantly, this effect is particularly pronounced for clinically relevant structures, such as the enhancing tumor compartment of glioma in brain magnetic resonance and grey matter in ultrasound imaging. It is often unclear how to optimize abstract metrics, such as human expert perception, in convolutional neural network (CNN) training. To cope with this challenge, we propose a novel strategy employing techniques of classical statistics to create complementary compound loss functions to better approximate human expert perception. Across all rating experiments, human experts consistently scored computer-generated segmentations better than the human-curated reference labels. Our results, therefore, strongly question many current practices in medical image segmentation and provide meaningful cues for future research.

研究の動機と目的

  • 医療画像分野におけるセグメンテーション指標と人間の専門家の認識との相関関係を調査すること。
  • 標準的な指標(例:Dice係数)が、特に膠腫の強化腫瘍や灰色 matter といった重要な構造に対して、臨床的意義のあるセグメンテーション品質を適切に反映できない理由を特定すること。
  • CNNの学習中に人間の専門家の認識に近づけるように設計された複合損失関数を生成するための新しい統計的フレームワークを開発すること。
  • 人間が作成した基準ラベルが、セグメンテーションベンチマークにおいて信頼できる真のラベルであるという仮定に疑問を呈すること。
  • 現在の評価手法が、専門家の判断と整合性が取れていないため、誤解を招く可能性があるという実証的証拠を提供すること。

提案手法

  • 神経線維腫瘍の脳MRI画像と超音波画像における灰色 matter の2つの複雑なバイオメディカルセグメンテーションタスクにおいて、プロフェッショナルな放射線科医を対象に心理物理学実験を実施し、CNN生成セグメンテーションと人間が作成したラベルの両方の品質を評価した。
  • 専門家評価者から、解剖学的正確性、輪郭の精密さ、臨床的意義を焦点にしたセグメンテーション品質に関する定性的な評価を収集した。
  • 古典的統計的手法を用いて、形状、空間的要因、強度に基づく特徴を統合し、専門家の認識を複合指標としてモデル化し、新たな損失関数を構築した。
  • 専門家の評価から得られた複数のセグメンテーション品質の相関要因(例:表面距離、体積被り重なり、形状類似度)を回帰ベースの重み付けにより組み合わせ、新規の複合損失関数を定式化した。
  • 得られた損失関数を用いてCNNを学習させ、標準的な指標と専門家の順位付けに基づいて性能を評価した。
  • 専門家の評価を用いて、単一のCNNとアンサンブルモデルの性能を、人間が作成した基準ラベルと比較して相対的な品質を評価した。

実験結果

リサーチクエスチョン

  • RQ1標準的なセグメンテーション指標(例:Dice係数)は、医療画像分野における人間の専門家のセグメンテーション品質認識とどの程度相関しているか?
  • RQ2現在の評価指標は、特に膠腫の強化腫瘍や超音波画像における灰色 matter のような重要な構造に対して、どの程度臨床的意義を適切に反映していないか?
  • RQ3専門家の評価から得た複合損失関数は、CNN学習中に標準的な指標よりも人間の認識に適切に近づけるか?
  • RQ4なぜ人間の専門家が一貫してAI生成セグメンテーションを人間が作成した基準ラベルよりも高く評価するのか?
  • RQ5基準ラベルと専門家の認識との乖離は、どの程度系統的またはランダムなアノテーション誤差に起因しているか?

主な発見

  • 人間の専門家は、すべての実験において、単一モデルの予測でさえも、CNNによって生成されたセグメンテーションを人間が作成した基準ラベルよりも一貫して高く評価した。
  • Dice係数は、特に膠腫の強化腫瘍や超音波画像における灰色 matter といった臨床的に重要な構造に対して、専門家の認識と僅かな相関しか示さなかった。
  • 通常は真のラベルとみなされている基準ラベルは、AI生成セグメンテーションよりも品質が低いと評価されたため、信頼できるベンチマークとはなり得ない可能性がある。
  • 専門家の評価の統計的モデリングから得られた本研究が提案する複合損失関数は、標準的な指標よりも専門家の認識に優れた適合性を示した。
  • 人間とAIのセグメンテーションの乖離は、軸断層像(axial views)において最小であったため、専門家によるアノテーションで使用される標準的な視点が、人間のパフォーマンスにバイアスをもたらしている可能性がある。
  • 人間のラベルにおけるランダムおよび系統的なアノテーション誤差が、標準指標と専門家の認識との間の相関が低い原因となっており、CNNがランダム誤差を平均化する可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。