Skip to main content
QUICK REVIEW

[論文レビュー] Implicit Transformer Network for Screen Content Image Continuous Super-Resolution

Jingyu Yang, Sheng Shen|arXiv (Cornell University)|Dec 12, 2021
Advanced Image Processing Techniques参考文献 25被引用数 32
ひとこと要約

ITSRN(暗黙的トランスフォーマーベースの連続スケール超解像法)を提案し、画面コンテンツ画像の連続スケール超解像を可能にする。従来の連続・離散SR法を特にシャープで高対比のコンテンツで上回る。

ABSTRACT

Nowadays, there is an explosive growth of screen contents due to the wide application of screen sharing, remote cooperation, and online education. To match the limited terminal bandwidth, high-resolution (HR) screen contents may be downsampled and compressed. At the receiver side, the super-resolution (SR) of low-resolution (LR) screen content images (SCIs) is highly demanded by the HR display or by the users to zoom in for detail observation. However, image SR methods mostly designed for natural images do not generalize well for SCIs due to the very different image characteristics as well as the requirement of SCI browsing at arbitrary scales. To this end, we propose a novel Implicit Transformer Super-Resolution Network (ITSRN) for SCISR. For high-quality continuous SR at arbitrary ratios, pixel values at query coordinates are inferred from image features at key coordinates by the proposed implicit transformer and an implicit position encoding scheme is proposed to aggregate similar neighboring pixel values to the query one. We construct benchmark SCI1K and SCI1K-compression datasets with LR and HR SCI pairs. Extensive experiments show that the proposed ITSRN significantly outperforms several competitive continuous and discrete SR methods for both compressed and uncompressed SCIs.

研究の動機と目的

  • テキストとグラフィックスが支配的な画面コンテンツに対して、任意の拡大率を扱える高品質なSCI SRを動機づける。
  • 鋭いエッジと高コントラストによる自然画像SR手法のSCIへの一般化不足に対処する。
  • ピクセル値だけでなく座標を活用して高忠実度のSCI結果を生成する連続スケールSRフレームワークを開発する。
  • 異なる劣化条件下でSCI SR手法を評価するためのSCI1KおよびSCI1K-compressionベンチマークを作成する。

提案手法

  • 画素値生成のために、HR空間のクエリ座標をLR空間のキー座標と特徴に写像する暗黙的トランスフォーマーを導入する。
  • 座標差分とスケールトークンの非線形写像を介して変換重みを予測し、座標から値への学習を可能にする。
  • 近傍の類似画素値を集約して予測を洗練させるため、暗黙的位置エンコーディングを用いてモデルを拡張する。
  • 特徴抽出にはCNNバックボーン(RDNベース)を用い、特徴展開で受容野を拡大し、MLPで変換重みを計算する。
  • 学習を安定化させ、連続的な倍率を可能にするため座標を[-1,1]レンジに正規化する。
  • 粗いSR出力を洗練させるため、MLPで学習される局所的な3x3近傍エンコーディング(暗黙的位置エンコーディング)を取り入れる。)

実験結果

リサーチクエスチョン

  • RQ1座標上で動作する暗黙的トランスフォーマーは、画面コンテンツ画像において既存の連続SR法(LIIF, MetaSR)を上回ることができるか?
  • RQ2暗黙的位置エンコーディングの導入は、任意のスケールでSCI SRのエッジ保存とエッジ鮮明さを改善しますか?
  • RQ3スケールトークンとIPEが、訓練内外の倍率因子で性能にどのように影響しますか?
  • RQ4圧縮済みおよび未圧縮のSCIデータに対する暗黙的位置エンコーディングで、学習可能な近傍ウェイティングと固定ウェイティングを使用した場合の影響は何ですか?

主な発見

  • ITSRNは、SCI1KおよびSCI1K-compressionで複数のスケールにわたり、連続SRメソッド(MetaSR、LIIF)および離散SRベースライン(RDN、RCAN)を一貫して上回る。
  • アブレーション実験により、スケールトークンと暗黙的位置エンコーディングが顕著な向上をもたらす(x4で約0.39 dB PSNR、訓練外のスケールで約0.06 dB)。
  • 暗黙的位置エンコーディングの学習可能なウェイトは、固定距離よりも優れ、特にJPEG圧縮入力で顕著に優れる。
  • 広範なスケールでの学習は、より大きな倍率(x6–x10)での性能を向上させる。
  • 細い文字のエッジ再現性を改善し、特に高倍率時に競合法と比較してエッジ再構成が優れている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。