Skip to main content
QUICK REVIEW

[論文レビュー] Learning from Multiple Datasets with Heterogeneous and Partial Labels for Universal Lesion Detection in CT

Ke Yan, Jinzheng Cai|arXiv (Cornell University)|Sep 5, 2020
Radiomics and Machine Learning in Medical Imaging参考文献 67被引用数 9
ひとこと要約

本稿では、異種で部分的にラベル付けされたCTデータセットを統合し、ユニバーサルな病変検出を実現するマルチタスク学習フレームワークであるLesion ENSemble (LENS) を提案する。複数のデータセット固有の検出器からの提案を統合し、臨床的先行知識とクロスデータセット間の知識移譲を用いて欠落しているアノテーションを抽出することで、DeepLesion において最先端手法比で平均感度が49%向上した。

ABSTRACT

Large-scale datasets with high-quality labels are desired for training accurate deep learning models. However, due to the annotation cost, datasets in medical imaging are often either partially-labeled or small. For example, DeepLesion is such a large-scale CT image dataset with lesions of various types, but it also has many unlabeled lesions (missing annotations). When training a lesion detector on a partially-labeled dataset, the missing annotations will generate incorrect negative signals and degrade the performance. Besides DeepLesion, there are several small single-type datasets, such as LUNA for lung nodules and LiTS for liver tumors. These datasets have heterogeneous label scopes, i.e., different lesion types are labeled in different datasets with other types ignored. In this work, we aim to develop a universal lesion detection algorithm to detect a variety of lesions. The problem of heterogeneous and partial labels is tackled. First, we build a simple yet effective lesion detection framework named Lesion ENSemble (LENS). LENS can efficiently learn from multiple heterogeneous lesion datasets in a multi-task fashion and leverage their synergy by proposal fusion. Next, we propose strategies to mine missing annotations from partially-labeled datasets by exploiting clinical prior knowledge and cross-dataset knowledge transfer. Finally, we train our framework on four public lesion datasets and evaluate it on 800 manually-labeled sub-volumes in DeepLesion. Our method brings a relative improvement of 49% compared to the current state-of-the-art approach in the metric of average sensitivity. We have publicly released our manual 3D annotations of DeepLesion in https://github.com/viggin/DeepLesion_manual_test_set.

研究の動機と目的

  • 複数の医療画像データセットから、異種で部分的なラベルが付与されたデータを用いてユニバーサルな病変検出器を学習する課題に対処すること。
  • ラベルの範囲やアノテーション品質が異なる多様なデータセット間の相乗効果を活用することで、病変検出性能を向上させること。
  • 放射線科医のワークフローを模倣し、CTスキャンにおけるさまざまな臓器にまたがる多様な病変タイプを検出できる手法を開発すること。
  • DeepLesion のような大規模データセットにおける欠落アノテーションによって引き起こされる性能低下を軽減すること。

提案手法

  • LENSは、複数のデータセット固有の病変検出器間で特徴を共有するとともに、各エキスパートからの領域提案を統合することで検出感度を向上させるマルチタスク学習フレームワークを採用する。
  • 異なるデータセットエキスパートからの検出結果を統合する提案統合戦略を用いて、病変タイプ全体の再現率を向上させる。
  • 部分的にラベル付けされたデータセットにおける欠落アノテーションは、病変のサイズ、位置、解剖学的妥当性といった臨床的先行知識を用いてマイニングする。
  • 良好にアノテートされたデータセット(例:LUNA, LiTS)から、ラベルが不足しているデータセット(例:DeepLesion)へと検出知識を移譲するクロスデータセット間の知識移譲を適用する。
  • 個々のエキスパートからの誤検出を低減するための偽陽性削減分類器を用いて、精度を向上させる。
  • 本フレームワークは4つの公開データセット(DeepLesion, LUNA, LiTS, その他のデータセット)を用いて学習され、DeepLesionの手動でキュレートされたテストセット(800個のサブボリューム)で評価された。

実験結果

リサーチクエスチョン

  • RQ1ラベルの範囲やアノテーションの完全性が異なる異種の病変データセットから、統一された深層学習フレームワークが効果的に学習できるか。
  • RQ2手動での再アノテーションを伴わずに、部分的にラベル付けされたデータセットにおける欠落アノテーションを効果的に回復できるか。
  • RQ3複数データセットの共同学習が、ラベルが豊富なタイプと不足しているタイプの両方の病変検出性能を向上させられるか。
  • RQ4複数のデータセット固有エキスパート間での提案統合が、ユニバーサルな病変検出における感度をどの程度向上させるか。
  • RQ5臨床的先行知識とクロスデータセット間の知識移譲が、データが乏しい状況下でも検出性能を向上させられるか。

主な発見

  • LENSは、DeepLesion テストセットにおいて、最先端手法比で平均感度が49%向上し、顕著な性能向上を示した。
  • 複数のデータセットを共同で学習させることで、すべての単一タイプのデータセットにおいて一貫した検出性能の向上が得られ、特に訓練データが限られた状況で顕著であった。
  • LUNAベンチマークにおいて、公式評価指標下で平均感度が0.898に達し、アンサンブルや特別な後処理を用いない状態で62チーム中6位を達成した。
  • 複数のデータセットエキスパートを提案統合することで、単一エキスパートモデルが見逃すような希少または微細な病変の再現率が顕著に向上した。
  • 臨床的先行知識とクロスデータセット間の知識移譲の統合により、欠落ラベルの効果的なマイニングが可能になり、部分ラベル付けの悪影響が軽減された。
  • 本フレームワークは、データセット間の分布シフトに対しても頑健であり、多様な病変タイプや解剖学的部位にわたる一般化性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。