Skip to main content
QUICK REVIEW

[論文レビュー] MR to X-Ray Projection Image Synthesis

Bernhard Stimpel, Christopher Syben|arXiv (Cornell University)|Oct 20, 2017
Advanced Image Processing Techniques参考文献 13被引用数 5
ひとこと要約

本稿では、3つの生成器アーキテクチャ(U-Net、ResNet、カスケードリファインメントネットワーク)と2つの損失関数(ℓ₁および知覚的損失)を用いて、MRプロジェクション画像からX線プロジェクション画像を合成する深層学習ベースの手法を提案する。知覚的損失はℓ₁損失よりも高周波数の詳細をよりよく保持しており、カスケードリファインメントネットワークと組み合わせた場合、定量的・定性的に最も優れた結果を達成した。これにより、高解像度の Fluoroscopic 画像の強化およびマルチモodal融合が可能になった。

ABSTRACT

Hybrid imaging promises large potential in medical imaging applications. To fully utilize the possibilities of corresponding information from different modalities, the information must be transferable between the domains. In radiation therapy planning, existing methods make use of reconstructed 3D magnetic resonance imaging data to synthesize corresponding X-ray attenuation maps. In contrast, for fluoroscopic procedures only line integral data, i.e., 2D projection images, are present. The question arises which approaches could potentially be used for this MR to X-ray projection image-to-image translation. We examine three network architectures and two loss-functions regarding their suitability as generator networks for this task. All generators proved to yield suitable results for this task. A cascaded refinement network paired with a perceptual-loss function achieved the best qualitative results in our evaluation. The perceptual-loss showed to be able to preserve most of the high-frequency details in the projection images and, thus, is recommended for the underlying task and similar problems.

研究の動機と目的

  • Fluoroscopic 介入的手術における使用を目的として、MRプロジェクション画像からX線プロジェクション画像へのクロスモodal画像変換を可能にすること。
  • MRプロジェクションからX線プロジェクションを合成する際の、さまざまな深層学習生成器アーキテクチャおよび損失関数の適切さを評価すること。
  • 伝統的なℓ₁損失と比較して、知覚的損失が医療画像間変換において微細な解剖学的詳細をよりよく保持できるかどうかを特定すること。
  • 低線量 Fluoroscopy におけるノイズ除去やスーパーレゾリューションなどの後続応用に、合成されたX線プロジェクションが利用可能かどうかを評価すること。

提案手法

  • U-Net、ResNet、およびカスケードリファインメントネットワーク(CRN)の3つの生成器ネットワークを、入力としてのMRプロジェクション画像を対応するX線プロジェクション画像にマッピングするように訓練した。
  • モデルは、同じ解剖的視点および患者姿勢におけるペアドMRおよびX線プロジェクションデータを用いて訓練された。
  • 2つの損失関数を評価した:ピクセル単位の再構成を目的としたℓ₁損失と、事前学習済みVGGネットワークの特徴マップに基づく知覚的損失。
  • U-NetおよびResNetでは、ダウンサンプリングおよびアップサンプリング中に空間情報を保持するためにスキップ接続が使用された。
  • CRNは、敵対的訓練を回避するフィードフォワードアーキテクチャを採用し、安定した推論を実現した。
  • 評価には、平均二乗誤差(MSE)、ピークサイナリオ比(PSNR)、構造的類似性(SSIM)、およびℓ₁誤差という標準指標が用いられた。

実験結果

リサーチクエスチョン

  • RQ1 深層ニューラルネットワークは、 Fluoroscopic 環境下で、MRプロジェクション画像からX線プロジェクション画像を効果的に合成できるか?
  • RQ2 U-Net、ResNet、CRN の異なる生成器アーキテクチャは、MRからX線プロジェクションへの変換において、性能に差があるか?
  • RQ3 知覚的損失は、このタスクにおいてℓ₁損失と比較して、高周波数の解剖学的詳細をよりよく保持するか?
  • RQ4 合成されたX線プロジェクションは、低線量 Fluoroscopy におけるノイズ除去やスーパーレゾリューションなどの後続応用を支援できるか?

主な発見

  • 知覚的損失は、頭蓋部周辺の細かい線などの高周波数の詳細を、ℓ₁損失よりも顕著に良好に保持していた。ℓ₁損失はこのような特徴をぼやけさせた。
  • カスケードリファインメントネットワーク(CRN)に知覚的損失を組み合わせた場合、MSEが0.013にまで低下し、この指標においてℓ₁損失を上回った。
  • ResNetにℓ₁損失を適用した場合、ピクセル単位の誤差が最小(0.058の偏差、2.4%)かつPSNRが最高であったが、知覚的損失と比較して画像がぼやけていた。
  • 知覚的損失は、ピクセル単位の誤差を最適化していないにもかかわらず、CRNにおいてすべての誤差指標で競争的または優れた結果を示した。これは、構造的忠実性の維持に有効であることを示している。
  • U-NetおよびResNetはℓ₁損失で良好な性能を示したが、知覚的損失を用いた場合、CRNがそれらを上回った。これは、損失関数の選択が極めて重要であることを示している。
  • 結果から、知覚的損失は空間分解能が求められる Fluoroscopic 応用において特に効果的であることが示された。画像のシャープネスと詳細の保持が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。