[論文レビュー] Multi-Scale Features and Parallel Transformers Based Image Quality Assessment
本稿では、マルチスケール畳み込み特徴量と並列トランスフォーマーを統合することで、知覚的品質予測を向上させる、新しいフルレファレンス画像品質評価モデルMSFPTを提案する。マルチスケール入力とトランスフォーマーに基づくアーキテクチャを活用することで、ベンチマークデータセット上で最先端の性能を達成し、DISTS や LPIPS といった既存モデルを上回る性能を示した。特に、NTIRE 2022 チャレンジにおいて、SRCC で最大 0.068 の向上を達成した。
With the increase in multimedia content, the type of distortions associated with multimedia is also increasing. This problem of image quality assessment is expanded well in the PIPAL dataset, which is still an open problem to solve for researchers. Although, recently proposed transformers networks have already been used in the literature for image quality assessment. At the same time, we notice that multi-scale feature extraction has proven to be a promising approach for image quality assessment. However, the way transformer networks are used for image quality assessment until now lacks these properties of multi-scale feature extraction. We utilized this fact in our approach and proposed a new architecture by integrating these two promising quality assessment techniques of images. Our experimentation on various datasets, including the PIPAL dataset, demonstrates that the proposed integration technique outperforms existing algorithms. The source code of the proposed algorithm is available online: https://github.com/KomalPal9610/IQA
研究の動機と目的
- マルチメディア分野における画像歪みの複雑化に対応するため、ノーレファレンスおよびフルレファレンス画像品質評価の向上を図ること。
- 画像品質評価におけるマルチスケール特徴抽出とトランスフォーマーに基づくモデリングのギャップを埋めること。
- 人間の知覚に近い品質予測を実現する、堅牢でエンドツーエンドのディーブラーニングフレームワークの構築。
- PIPAL や NTIRE 2022 を含む多様な IQA ベンチマークで、既存の最先端手法を上回る性能を発揮すること。
- 並列トランスフォーマーとマルチスケール入力の組み合わせが、知覚的品質推定に与える有効性を検証すること。
提案手法
- 本手法は、入力画像を 1x、2x、3x、0.5x 解像度の4つの異なるスケールで処理することで、マルチスケール特徴抽出を実現する。
- マルチスケール特徴は CNN バックボーンを用いて抽出され、その後、クロススケール特徴統合とアテンションベースの表現学習を目的とした、並列トランスフォーマーのエンコーダ・デコーダアーキテクチャに供給される。
- 長距離依存性をモデル化するため、学習済みの位置埋め込みを用いたマルチヘッド自己注意機構を採用する。
- 複数スケールからのピクセル単位の品質スコアの重み付き平均を用いて、最終的な画像品質予測を生成する。
- バッチサイズ 16 で、Adam 最適化法、重み減衰、コサインスケジューリングを用いた L1 損失関数でネットワークを訓練する。
- 一般化性能の向上を目的として、トレーニング中にランダムクロップ、反転、回転などのデータオーグメンテーション技術を適用する。
実験結果
リサーチクエスチョン
- RQ1マルチスケール特徴量と並列トランスフォーマーの統合は、フルレファレンス画像品質評価の性能向上に寄与するか?
- RQ2提案された MSFPT モデルは、多様なデータセット上で、最先端のディーブラーニングベースの IQA 手法と比較してどのように性能を発揮するか?
- RQ3マルチスケール入力と並列アテンション機構の貢献は、モデルのロバスト性と精度にどのように影響するか?
- RQ4複数スケールにわたる共通のトランスフォーマーアーキテクチャの使用は、特徴学習と一般化性能の向上に寄与するか?
- RQ5非ディープラーニングおよび浅い学習ベースの IQA 評価指標と比較して、本モデルの性能はいかがであるか?
主な発見
- NTIRE 2022 フルレファレンスチャレンジの検証セットにおいて、MSFPT はメインスコア 1.598、SRCC 0.81、PLCC 0.788 を達成し、すべてのベースラインモデルを上回った。
- NTIRE 2022 のテストセットでは、MSFPT はメインスコア 1.45、SRCC 0.738、PLCC 0.713 を達成し、DISTS(1.342、0.655、0.687)および LPIPS-VGG(1.228、0.595、0.633)を上回った。
- KADID-10k データセットでは、VSI よりも PLCC で 0.01、SRCC で 0.004、KRCC で 0.009 の向上を示し、人間の評価との相関が優れていることを裏付けた。
- TID2013 では、既存のディープラーニングモデルと比較して、SRCC で 0.021、KRCC で 0.034 の向上を達成し、多様な歪みに対して優れた性能を示した。
- LIVE データセットでは、IQT 手法を SRCC で 0.07、KRCC で 0.029 上回り、フルレファレンス設定下での有効性を確認した。
- アブレーションスタディの結果、『Attention is All You Need』の標準的なトランスフォーマー構造を採用した場合、BERT ベースの変種よりも優れた性能を発揮することが確認され、IQA に適したアーキテクチャ選定の妥当性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。