Skip to main content
QUICK REVIEW

[論文レビュー] Eformer: Edge Enhancement based Transformer for Medical Image Denoising

Achleshwar Luthra, Harsh Sulakhe|arXiv (Cornell University)|Sep 16, 2021
Image and Signal Denoising Methods参考文献 23被引用数 11
ひとこと要約

Eformerは、非オverlappingウィンドウ自己注意を用いたU-Netに類似したエンコーダデコーダフレームワーク内に学習可能なソーベル=フェルドマンエッジ強調モジュールを統合した、医療画像ノイズ除去のための新しいトランスフォーマー基盤アーキテクチャを提案する。低線量CTのAAPM-Mayo Clinic低線量CTデータセットにおいて、残差学習を用いて43.487 PSNR、0.0067 RMSE、0.9861 SSIMの最先端性能を達成した。

ABSTRACT

In this work, we present Eformer - Edge enhancement based transformer, a novel architecture that builds an encoder-decoder network using transformer blocks for medical image denoising. Non-overlapping window-based self-attention is used in the transformer block that reduces computational requirements. This work further incorporates learnable Sobel-Feldman operators to enhance edges in the image and propose an effective way to concatenate them in the intermediate layers of our architecture. The experimental analysis is conducted by comparing deterministic learning and residual learning for the task of medical image denoising. To defend the effectiveness of our approach, our model is evaluated on the AAPM-Mayo Clinic Low-Dose CT Grand Challenge Dataset and achieves state-of-the-art performance, $i.e.$, 43.487 PSNR, 0.0067 RMSE, and 0.9861 SSIM. We believe that our work will encourage more research in transformer-based architectures for medical image denoising using residual learning.

研究の動機と目的

  • 低線量CTスキャンにおけるノイズ劣化の課題に取り組みながら、重要な解剖学的エッジや構造を保持すること。
  • 視覚トランスフォーマーが、これまでの応用が限られていた医療画像ノイズ除去分野における有効性を検証すること。
  • トランスフォーマー・アーキテクチャに学習可能なエッジ強調モジュールを統合することで、ノイズ除去性能を向上させること。
  • 残差学習と直接回帰の比較を行い、医療画像ノイズ除去の文脈における再構成品質への影響を評価すること。
  • マルチスケールの知覚損失を組み合わせたハイブリッドトランスフォーマー-CNNアーキテクチャを用いて、低線量CTノイズ除去の新しい最先端ベンチマークを確立すること。

提案手法

  • Eformerは、非オーバーラップウィンドウに基づく自己注意を用いるLeWinトランスフォーマーブロックで構築された、U-Netスタイルのエンコーダデコーダアーキテクチャを採用しており、計算コストを低減する。
  • エッジ強調は、入力画像に適用される学習可能なソーベル=フェルドマンフィルタによって実現され、エンコーダおよびデコーダパスの両方の段階で中間特徴量に連結される。
  • 再構成画像の構造的およびピxlsレベルの忠実度を保つために、マルチスケールの知覚損失と平均二乗誤差(MSE)損失の組み合わせが用いられる。
  • エンコーダとデコーダの段階の間にはスキップ接続が用いられ、同じエッジ強調特徴マップ $ S(I) $ がすべての層で共有され、エッジの一貫性が維持される。
  • 最終出力は、最終特徴マップを1チャネルのノイズ除去画像に変換する学習可能な畳み込み投影層によって生成される。
  • ネットワークはハイブリッド損失関数で訓練される:$ L_{final} = \lambda_{mse}L_{mse} + \lambda_{msp}L_{msp} $、ここで $ L_{msp} $ は事前学習されたバックボーンから抽出されたマルチスケールの知覚損失である。

実験結果

リサーチクエスチョン

  • RQ1エッジ強調を組み込んだトランスフォーマー基盤アーキテクチャは、従来のCNNベースのモデルと比較して、低線量CT画像のノイズ除去性能を向上させることができるか?
  • RQ2トランスフォーマー基盤フレームワークを用いた医療画像ノイズ除去タスクにおいて、残差学習は直接回帰を上回る性能を示すか?
  • RQ3トランスフォーマーのエンコーダデコーダに学習可能なソーベルフィルタを統合することで、微細なディテールおよびエッジの保持にどの程度効果的か?
  • RQ4マルチスケールの知覚損失は、再構成された低線量CTスキャンにおける構造的類似性および視覚的品質をどの程度向上させるか?
  • RQ5トランスフォーマーにおける非オーバーラップウィンドウ自己注意機構は、過度な計算コストを伴わず、医療画像ノイズ除去で高い効率性と性能を達成できるか?

主な発見

  • Eformerは残差学習を用いて、AAPM-Mayo Clinic低線量CTグランドチャレンジデータセットで43.487 PSNR、0.0067 RMSE、0.9861 SSIMを達成し、すべての先行最先端手法を上回った。
  • Eformerの残差学習バージョンは、決定論的(直接回帰)バージョン(42.2371 PSNR、0.0077 RMSEを達成)と比較して、PSNRおよびRMSEが顕著に向上した。
  • 学習可能なソーベル=フェルドマンフィルタの統合により、エッジの保持が向上し、再構成画像の構造的類似性および知覚的品質が向上した。
  • MSE損失と組み合わせたマルチスケールの知覚損失の使用により、構造的忠実度が向上し、高いSSIM値と視覚的にシャープな画像が得られた。
  • 非オーバーラップウィンドウ自己注意機構は、計算複雑性を効果的に低減しつつ、競争力ある性能を維持でき、臨床応用に適したモデルとなった。
  • Eformerは、トランスフォーマーが医療画像ノイズ除去に効果的に適応可能であることを示し、新たなベンチマークを確立するとともに、今後の研究を促進した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。