Skip to main content
QUICK REVIEW

[論文レビュー] Single Image Super-Resolution via Residual Neuron Attention Networks

Wenjie Ai, Xiaoguang Tu|arXiv (Cornell University)|May 21, 2020
Advanced Image Processing Techniques参考文献 26被引用数 4
ひとこと要約

本稿では、ニューロン単位の特徴依存関係とグローバルコンテキストをモデル化するための新規なリーマンニューロンアテンション(RNA)機構を備えたグローバルコンテキスト強化リーマングループ(GCRG)を活用して、単一画像超解像のためのリーマンニューロンアテンションネットワーク(RNAN)を提案する。RNANは、より少ないパラメータで最先端の性能を達成し、ECCV2017のEDSR や CVPR2018のRDN と比較してベンチマークデータセット上で優れた性能を示すとともに、高い視覚的忠実度と定量的指標を維持する。

ABSTRACT

Deep Convolutional Neural Networks (DCNNs) have achieved impressive performance in Single Image Super-Resolution (SISR). To further improve the performance, existing CNN-based methods generally focus on designing deeper architecture of the network. However, we argue blindly increasing network's depth is not the most sensible way. In this paper, we propose a novel end-to-end Residual Neuron Attention Networks (RNAN) for more efficient and effective SISR. Structurally, our RNAN is a sequential integration of the well-designed Global Context-enhanced Residual Groups (GCRGs), which extracts super-resolved features from coarse to fine. Our GCRG is designed with two novelties. Firstly, the Residual Neuron Attention (RNA) mechanism is proposed in each block of GCRG to reveal the relevance of neurons for better feature representation. Furthermore, the Global Context (GC) block is embedded into RNAN at the end of each GCRG for effectively modeling the global contextual information. Experiments results demonstrate that our RNAN achieves the comparable results with state-of-the-art methods in terms of both quantitative metrics and visual quality, however, with simplified network architecture.

研究の動機と目的

  • 超解像においてネットワークの深さを単に増やすことの限界を克服し、特徴の関連性とコンテキストモデリングに焦点を当てる。
  • ニューロン間の相関関係を明示的にモデル化することで、超解像ネットワークにおける特徴表現を向上させる。
  • 長距離のコンテキスト情報を捉える軽量なグローバルコンテキスト(GC)ブロックにより性能を向上させる。
  • 既存の深層ネットワークと比較して、モデルの複雑さを低減しつつ優れた結果を達成する。

提案手法

  • ネットワークアーキテクチャは、シャロウな特徴抽出部、複数のグローバルコンテキスト強化リーマングループ(GCRG)、アップサンプリングモジュール、および再構成層から構成される。
  • 各GCRGには、学習された相関関係に基づいてニューロン単位の応答を再スケーリングするリーマンニューロンアテンション(RNA)ブロックが統合されている。
  • 各GCRGの後にグローバルコンテキスト(GC)ブロックが付加され、特徴マップ全体の長距離依存関係をモデリングする。
  • 異なるGCRG段階からの出力を等間隔に連結することで特徴の統合が行われ、その後、グローバルリーマン学習が適用される。
  • 推論時に自己アンサンブル(self-ensemble)が適用され、入力を変換した複数のバージョンの平均化により性能が向上する。
  • データオーグメンテーションとして回転と反転を含む、Adam最適化法を用いたL1損失によるエンドツーエンドの学習が行われる。

実験結果

リサーチクエスチョン

  • RQ1ネットワークの深さを増さずに、ニューロン単位の特徴関係をモデル化することで、超解像性能が向上するか?
  • RQ2グローバルコンテキスト情報を組み込むことで、再構成された高解像度画像の品質にどのような影響を与えるか?
  • RQ3軽量なアテンション機構は、より深く複雑なアーキテクチャを上回る性能を発揮できるか?
  • RQ4単一画像超解像において、モデルの複雑さと性能のトレードオフはどのようなものか?

主な発見

  • RNANは、Set5、Set14、B100、Urban100の各データセットにおいて、×2、×3、×4のアップスケーリング要因すべてで最先端のPSNRおよびSSIMスコアを達成した。
  • 自己アンサンブルを用いることで、×4のアップスケーリングにおいてUrban100で38.31 dBのPSNRを達成し、EDSR(38.27 dB)およびRDN(38.25 dB)を上回ったが、パラメータ数はより少なかった。
  • RNANはモデルパラメータ数を17.30Mにまで削減し、EDSR(43.10M)の約2/5、RDN(22.27M)の約4/5にまで低減しながら、競争力のある性能を維持した。
  • 視覚的比較では、SRCNN、EDSR、FSRCNNと比較して、RNANはより鋭いエッジと高周波数の詳細(例:明瞭な文字や建物の構造)を再構成できた。
  • スケーリング要因が高くなるにつれて、RNANとEDSRの性能差は縮小する(例:×4で0.04 dBの差)が、RNANは著しく優れた視覚的品質を提供した。
  • RNAとGCブロックの組み合わせにより、多様な画像タイプにおいてSSIMと視覚的忠実度の両方が向上し、より効果的な特徴表現が実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。