Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Image Super-Resolution with Feature Interaction Weighted Hybrid Network

Wenjie Li, Juncheng Li|arXiv (Cornell University)|Dec 29, 2022
Advanced Image Processing Techniques被引用数 5
ひとこと要約

本稿では、特徴量相互作用機構を備えた新規なワイドリーマンドリスティレーションインタラクションブロック(WDIB)を介してCNNとTransformer部品を統合することで、軽量で効率的な画像超解像ネットワークである特徴量相互作用重み付きハイブリッドネットワーク(FIWHN)を提案する。ワイド畳み込みおよび同一リーマンド重み付けユニット、自己キャリブレーション融合、特徴量シャッフル重み付きグループを採用することで、中間特徴量の損失を低減し、FLOPsとパラメータ数を削減しながら、DIV2KやRealSRを含むベンチマークで最先端の性能を達成する。

ABSTRACT

Lightweight image super-resolution aims to reconstruct high-resolution images from low-resolution images using low computational costs. However, existing methods result in the loss of middle-layer features due to activation functions. To minimize the impact of intermediate feature loss on reconstruction quality, we propose a Feature Interaction Weighted Hybrid Network (FIWHN), which comprises a series of Wide-residual Distillation Interaction Block (WDIB) as the backbone. Every third WDIB forms a Feature Shuffle Weighted Group (FSWG) by applying mutual information shuffle and fusion. Moreover, to mitigate the negative effects of intermediate feature loss, we introduce Wide Residual Weighting units within WDIB. These units effectively fuse features of varying levels of detail through a Wide-residual Distillation Connection (WRDC) and a Self-Calibrating Fusion (SCF). To compensate for global feature deficiencies, we incorporate a Transformer and explore a novel architecture to combine CNN and Transformer. We show that our FIWHN achieves a favorable balance between performance and efficiency through extensive experiments on low-level and high-level tasks. Codes will be available at \url{https://github.com/IVIPLab/FIWHN}.

研究の動機と目的

  • 既存の深層学習ベースの単一画像超解像(SISR)手法における高い計算コストと中間特徴量損失を解決すること。
  • 深層リーマンドネットワークにおけるReLU活性化による特徴量損失を低減しつつ、モデル効率を維持すること。
  • ハイブリッドCNN-Transformerアーキテクチャを用いて、マルチスケールおよびグローバル特徴量を統合することで、特徴量表現を向上させること。
  • モデルサイズとFLOPsを最小限に抑えることで、リソース制約のあるデバイスへの効果的な展開を可能にすること。
  • 向上した画像再構成により、セマンティックセグメンテーションや顔認識などの下流ビジョンタスクを改善すること。

提案手法

  • 格子構造のワイドリーマンドブロックとアテンションベースのスイープ接続を組み合わせた、コアとなる構築ユニットとしてのワイドリーマンドディスティレーションインタラクションブロック(WDIB)を提案。
  • 活性化の前段階で中間特徴量を保存・補完するためのワイド畳み込みリーマンド重み付け(WCRW)およびワイド同一リーマンド重み付け(WIRW)ユニットを導入。
  • スプリット特徴量ディスティレーションとジャンプ接続を備えたワイドリーマンドディスティレーション接続(WRDC)フレームワークを採用し、特徴量統合と一般化性能を向上。
  • 動的重み付けと異なる精錬度の特徴量を統合するための自己キャリブレーション統合(SCF)ユニットを設計。
  • 各3番目のWDIBを対象に特徴量を混合・再重み付けすることで、特徴量のグループレベルでの相互作用を強化する、特徴量シャッフル重み付きグループ(FSWG)を構築。
  • CNNバックボーンに軽量なTransformerモジュールを統合し、長距離依存関係を捉え、局所的なCNN表現を補完。

実験結果

リサーチクエスチョン

  • RQ1ハイブリッドCNN-Transformerアーキテクチャは、計算コストを低減しつつ、優れたSISR性能を達成できるか?
  • RQ2深層リーマンドネットワークにおいて、ReLU活性化による中間特徴量損失をどのように軽減できるか?
  • RQ3異なる表現レベル間での特徴量相互作用とクロス統合は、再構成品質とモデル一般化性能を向上させられるか?
  • RQ4提案アーキテクチャは、実世界およびベンチマークデータセットにおいて、既存の軽量SISRモデルをどの程度上回るか?
  • RQ5FIWHNによる向上した画像再構成は、セマンティックセグメンテーションや顔認識などの下流ビジョンタスクを改善できるか?

主な発見

  • RealSRデータセットにおいて×2スケールでPSNR 33.96 dB、SSIM 0.927を達成し、2番目に優れた手法ESRTを×3スケールで0.19 dB上回る。
  • DIV2Kデータセットでは×4スケールでPSNR 34.01 dB、SSIM 0.937を達成し、最先端の性能を示した。
  • EDSRと比較してFLOPsを30%、パラメータ数を25%削減し、1台のNVIDIA RTX 2080Ti GPUでの学習が可能となった(他のモデルは2台必要)。
  • 視覚的比較では、FIWHNはFDIWNやバイキュービックと比較して、より繊細なテクスチャとシャープなエッジを回復しており、アーチファクトが少なく、HRの真値に近い。
  • CamVidにおけるセマンティックセグメンテーションタスクでは、FIWHNで再構成された画像から得られるセグメンテーション結果が真値に近く、特に電柱のような微細構造について顕著に改善された。
  • 顔超解像および実世界超解像ベンチマークでも優れた性能を発揮し、多様な画像分布にわたるロバストネスと一般化性能を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。