Skip to main content
QUICK REVIEW

[論文レビュー] Perceptual Image Quality Assessment with Transformers

Manri Cheon, Sungjun Yoon|arXiv (Cornell University)|Apr 30, 2021
Image and Video Quality Assessment参考文献 56被引用数 5
ひとこと要約

本論文では、CNNバックボーンを用いて参照画像と歪曲画像から抽出された知覚特徴を比較することで、フルレファレンスの知覚的画像品質評価を実行するトランスフォーマー・エンコーダ・デコーダアーキテクチャを採用した画像品質トランスフォーマー(IQT)を提案する。モデルは最先端の性能を達成し、NTIRE 2021 知覚的 IQA チャレンジで1位となり、メインスコア1.5885(PLCC: 0.7896、SRCC: 0.7990)を記録した。

ABSTRACT

In this paper, we propose an image quality transformer (IQT) that successfully applies a transformer architecture to a perceptual full-reference image quality assessment (IQA) task. Perceptual representation becomes more important in image quality assessment. In this context, we extract the perceptual feature representations from each of input images using a convolutional neural network (CNN) backbone. The extracted feature maps are fed into the transformer encoder and decoder in order to compare a reference and distorted images. Following an approach of the transformer-based vision models, we use extra learnable quality embedding and position embedding. The output of the transformer is passed to a prediction head in order to predict a final quality score. The experimental results show that our proposed model has an outstanding performance for the standard IQA datasets. For a large-scale IQA dataset containing output images of generative model, our model also shows the promising results. The proposed IQT was ranked first among 13 participants in the NTIRE 2021 perceptual image quality assessment challenge. Our work will be an opportunity to further expand the approach for the perceptual IQA task.

研究の動機と目的

  • 現代のGANベースの修復アルゴリズムによって歪曲された画像についても、人間の知覚的品質を正確に予測できる深層学習ベースのフルレファレンス画像品質評価手法を開発すること。
  • 自然言語処理やビジョンタスクで成功を収めたトランスフォーマー・アーキテクチャが、知覚的画像品質評価に効果的に応用可能かどうかを調査すること。
  • PSNR や SSIM といった従来の目的的指標が、現実的なアーティファクトを伴う画像の知覚的品質を捉えられていないことへの改善を図ること。
  • ピクセルレベルの差異と特徴レベルの差異表現のどちらが品質予測において優れているかを評価すること。
  • 生成モデルに起因する多様な歪曲タイプにわたり、強固で汎用性の高い性能を発揮すること。

提案手法

  • 参照画像および歪曲画像から、CNNバックボーン(例:ResNet)が深層知覚特徴マップを抽出する。
  • 抽出された特徴マップは一次元化され、学習可能な品質埋め込みと位置埋め込みを追加したトランスフォーマー・エンコーダ・デコーダアーキテクチャによって処理される。
  • モデルは、特徴空間における画像パッチ間の長距離依存関係をモデル化するために、マルチヘッド自己注意機構を用いる。
  • 学習可能な品質埋め込みが特徴トークンに連結され、トランスフォーマーが品質スコアを予測するのを支援する。
  • 空間情報を保持するために、位置埋め込みが追加される。
  • トランスフォーマー・デコーダからの最終出力を予測ヘッドに通して、最終的な画像品質スコア(例:MOS)を回帰する。

実験結果

リサーチクエスチョン

  • RQ1トランスフォーマー基盤のアーキテクチャは、参照画像と歪曲画像の間の知覚的品質差を効果的にモデル化できるか?
  • RQ2CNNバックボーンから抽出した知覚特徴を用いることで、ピクセルレベルの処理に比べて品質評価性能が向上するか?
  • RQ3トランスフォーマー・フレームワークにおいて、学習可能な品質埋め込みと位置埋め込みの使用が品質スコア予測に有益であるか?
  • RQ4GANベースの画像修復モデルが生成するアーティファクトを伴うデータセットにおいて、本モデルは従来の指標よりも優れた性能を示すか?
  • RQ5本モデルは多様な歪曲タイプに一般化できるか、それともPIPALのような特定のデータセットに過学習しやすいか?

主な発見

  • IQTモデルは、NTIRE 2021 知覚的 IQA チャレンジで13名の参加者の中で最高のメインスコア1.5885を記録し、1位となった。
  • PIPALバリデーションセットでは、IQT-CバージョンがPLCC 0.7896、SRCC 0.7990を達成し、人間の評価スコアと強い相関を示した。
  • 標準的なIQAデータセット(LIVE、CSIQ、TID2013)においても、既存手法を上回った。LIVEではSRCC/KRCCが0.970/0.845、CSIQでは0.947/0.805を記録した。
  • 知覚的特徴空間における差異表現を用いることで、ピクセルレベルの差異を用いる場合よりも優れた性能が得られ、高レベルの意味的特徴の重要性を確認した。
  • PIPALデータセットで学習したIQT-Cモデルは、自身のテストセットでは優れた性能を示したが、標準的なデータセットでは一般化性能が低下しており、過学習のリスクを示唆した。
  • GANによって生成された歪曲を含む大規模データセットにおいて、本モデルは優れたロバスト性と一般化性能を示し、現代の画像修復評価に適していることを強調した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。