Skip to main content
QUICK REVIEW

[論文レビュー] A residual dense vision transformer for medical image super-resolution with segmentation-based perceptual loss fine-tuning

Jin Zhu, Guang Yang|arXiv (Cornell University)|Feb 22, 2023
Advanced Image Processing Techniques被引用数 7
ひとこと要約

本稿では、リーマン密度接続と局所的特徴統合を統合することで特徴学習を向上させる、医療画像超解像のための残差密度ビジョントランスフォーマー(RDST)を提案する。再構成忠実度と下流タスク性能を向上させるために、事前学習済みのセグメンテーションモデルを活用するセグメンテーションベースの知覚損失を導入し、SwinIRと比較して38%少ないパラメータで最先端のPSNR向上を達成した。

ABSTRACT

Super-resolution plays an essential role in medical imaging because it provides an alternative way to achieve high spatial resolutions and image quality with no extra acquisition costs. In the past few decades, the rapid development of deep neural networks has promoted super-resolution performance with novel network architectures, loss functions and evaluation metrics. Specifically, vision transformers dominate a broad range of computer vision tasks, but challenges still exist when applying them to low-level medical image processing tasks. This paper proposes an efficient vision transformer with residual dense connections and local feature fusion to achieve efficient single-image super-resolution (SISR) of medical modalities. Moreover, we implement a general-purpose perceptual loss with manual control for image quality improvements of desired aspects by incorporating prior knowledge of medical image segmentation. Compared with state-of-the-art methods on four public medical image datasets, the proposed method achieves the best PSNR scores of 6 modalities among seven modalities. It leads to an average improvement of $+0.09$ dB PSNR with only 38\% parameters of SwinIR. On the other hand, the segmentation-based perceptual loss increases $+0.14$ dB PSNR on average for SOTA methods, including CNNs and vision transformers. Additionally, we conduct comprehensive ablation studies to discuss potential factors for the superior performance of vision transformers over CNNs and the impacts of network and loss function components. The code will be released on GitHub with the paper published.

研究の動機と目的

  • ビジョントランスフォーマーを低レベルの医療画像超解像に適用する課題に対処し、自然画像タスクと比較して性能が劣る現状を改善すること。
  • 畳み込みニューラルネットワーク(CNN)由来のメカニズム—リーマン学習、密度接続、局所的特徴統合—をビジョントランスフォーマーのアーキテクチャに統合することで、医療画像における超解像品質を向上させること。
  • 事前学習済みの医療画像セグメンテーションモデルからの事前知識を損失関数に組み込むことで、知覚的品質と下流のセグメンテーション性能を向上させること。
  • 複数の医療画像モodalitiesにわたる単一画像超解像において、モデルの複雑さを低減しつつ最先端の性能を達成すること。

提案手法

  • リーマン学習と密度特徴接続、局所的特徴統合を組み合わせた、ビジョントランスフォーマーの特徴伝搬と表現を向上させる残差密度ビジョントランスフォーマー(RDST)を提案する。
  • パラメータを削減(SwinIRの38%)しながらも、競争力のある性能を維持する、効率的な変種RDST-Eを設計する。
  • 事前学習済みのU-Netからの特徴を用いて超解像をガイドする、セグメンテーションベースの知覚損失($\mathcal{L}_{E(1)}$)を導入し、再構成忠実度と下流のセグメンテーション精度の両方を向上させる。
  • 医療画像データセット(OASIS, ACDC, COVID)ごとに事前学習済みのセグメンテーションモデルを活用し、セグメンテーションベースの知覚損失を用いて超解像モデルを微調整する。
  • L1損失とセグメンテーションベースの知覚損失の組み合わせでモデルを訓練し、各構成要素の寄与度を検証するアブレーションスタディを実施する。
  • トランスファー学習を用いて、セグメンテーションベースの知覚損失が異なる医療画像ドメインにわたって一般化する能力を評価する。

実験結果

リサーチクエスチョン

  • RQ1リーマン密度接続と局所的特徴統合は、医療画像超解像におけるビジョントランスフォーマーの性能を向上させるか?
  • RQ2事前学習済みモデルから導出されたセグメンテーションベースの知覚損失を組み込むことで、超解像における画像忠実度と下流のセグメンテーション性能が向上するか?
  • RQ3SwinIRなどの最先端手法と比較して、提案されたRDSTモデルは複数の医療画像モダリティにおいて性能と効率性の両面で優れているか?
  • RQ4個々の構成要素(例:リーマン接続、局所的特徴統合、セグメンテーションベースの損失)が全体の性能向上に果たす寄与度は何か?

主な発見

  • 提案されたRDSTモデルは、7種類の医療画像モダリティにおいて、SOTA手法と比較して平均で+0.09 dBのPSNR向上を達成し、SwinIRの38%のパラメータで実現した。
  • セグメンテーションベースの知覚損失($\mathcal{L}_{E(1)}$)は、CNNおよびビジョントランスフォーマーを含むSOTA手法において、平均で+0.14 dBのPSNR向上をもたらした。
  • RDST-Eバージョンは、SwinIRの20%のパラメータで、SOTA手法と比較して平均で+0.06 dBのPSNR向上を達成した。
  • セグメンテーションベースの知覚損失は、下流のセグメンテーションタスクにおいて、Dice係数を平均で0.0023向上させ、機械の知覚能力の向上を示した。
  • アブレーションスタディの結果、リーマン密度接続と局所的特徴統合が、特に医療画像の微細構造を保存する点で性能向上に顕著な寄与をしていることが確認された。
  • トランスファー学習の実験から、セグメンテーションベースの知覚損失は、OASIS, ACDC, COVIDなどの異なる医療画像データセットにわたって良好に一般化し、一貫した性能向上を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。