Skip to main content
QUICK REVIEW

[論文レビュー] MDNet: A Semantically and Visually Interpretable Medical Image Diagnosis Network

Zizhao Zhang, Yuanpu Xie|arXiv (Cornell University)|Jul 8, 2017
AI in cancer detection被引用数 62
ひとこと要約

MDNetは、医用画像を読み取り診断レポートを生成し、症状説明によって画像を検索し、解釈可能な診断のための注意力を可視化する統一型マルチモーダルネットワークを構築します。これは、多スケール特徴のための ensemble-connection ResNet と、attention-enhanced LSTM を補助的な attention sharpening module を備えて進化させます。

ABSTRACT

The inability to interpret the model prediction in semantically and visually meaningful ways is a well-known shortcoming of most existing computer-aided diagnosis methods. In this paper, we propose MDNet to establish a direct multimodal mapping between medical images and diagnostic reports that can read images, generate diagnostic reports, retrieve images by symptom descriptions, and visualize attention, to provide justifications of the network diagnosis process. MDNet includes an image model and a language model. The image model is proposed to enhance multi-scale feature ensembles and utilization efficiency. The language model, integrated with our improved attention mechanism, aims to read and explore discriminative image feature descriptions from reports to learn a direct mapping from sentence words to image pixels. The overall network is trained end-to-end by using our developed optimization strategy. Based on a pathology bladder cancer images and its diagnostic reports (BCIDR) dataset, we conduct sufficient experiments to demonstrate that MDNet outperforms comparative baselines. The proposed image model obtains state-of-the-art performance on two CIFAR datasets as well.

研究の動機と目的

  • 画像特徴と診断レポートを整合させて interpretable な医療画像診断を促進する。
  • 画像を読み取り、レポートを生成し、症状説明によって画像を検索し、注意を可視化できる統一モデルを開発する。
  • 新規の ensemble-connection ベースのネットワークを通じて多スケールの画像表現を強化する。
  • レポートの語彙から画像ピクセルへの意味的対応を学習し、予測の正当性を提供する。
  • 補助監督を用いて画像モデルと言語モデルをエンドツーエンドで共同最適化し、注意を改善する。

提案手法

  • EcNetを導入して ensemble-connection による多スケール特徴の統合と特徴利用を改善する。
  • soft attention を用いた LSTM ベースの言語モデルを採用して、文章の語を画像領域に対応づける。
  • auxiliary attention sharpening (AAS) モジュールを組み込み、より鋭くクラス特異的な attention マップを生成する。
  • 診断結論予測とレポート生成の両方を最適化する共同訓練目的を使用し、二つのタスクの勾配をブレンドするバックプロパゲーション方式を採用する。
  • 言語モデルへのガイダンスのための K タスク特有の入力を作成するため、サンプルを複製する訓練スキームを実装する。
  • 統一された目的の下で画像モデル、言語モデル、AAS のエンドツーエンド最適化を提供する。

実験結果

リサーチクエスチョン

  • RQ1統合されたマルチモーダルネットワークは、 semantically および visually interpretable な説明を提供しつつ、医用画像から診断レポートを生成できるか。
  • RQ2提案する MDNet は BCIDR データセットにおける泌尿器がんの画像診断と画像と言語タスクでベースラインを上回るか。
  • RQ3ensemble-connection ベースのネットワークは医用画像タスクにおける多スケール特徴利用を改善するか。
  • RQ4注意の鋭化は臨床解釈における注意マップの局在化と有用性を向上させるか。

主な発見

  • MDNet は BCIDR において、ベースラインと比較して診断結論の正確さとレポート生成の指標が優れている。
  • MDNet の文を案内する注意マップは、医学的に有用な尿路上皮領域に焦点を合わせ、解釈性を向上させる。
  • モデルの DCA(diagnostic conclusion accuracy)スコアはベースラインを上回り、フォールド間で安定した性能を示す。
  • EcNet における Ensemble-connection は画像表現の効率を向上させ、CIFAR-10 および CIFAR-100 で競合または最先端の結果を、いくつかのベースラインよりも少ないパラメータで達成する。
  • 効果的な勾配フローを伴う共同最適化(画像モデルと言語モデルの勾配のバランス)が、マルチモーダルマッピングの質を高め、小規模な医療データセットでの過剰適合を減少させる。
  • MDNet は症状ベースの画像検索における文から画像へのマッピング精度が高く、Cr@k 指標でベースラインを上回る。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。