[論文レビュー] You Only Train Once: A Unified Framework for Both Full-Reference and No-Reference Image Quality Assessment
本稿では、1つのアーキテクチャを用いて、フルレファレンス(FR)およびノーレファレンス(NR)の両方の画像品質評価を統合的に行うUNIQAという包括的なディーブラーニングフレームワークを提案する。階層的自己自己注意機構とクロススケールクロス注意モジュールを活用し、マルチレベル特徴量における歪みおよび意味的影響をモデル化することで、FRおよびNRベンチマークの両方で最先端の性能を達成し、タスク間で一貫性のある性能を発揮する。これにより、別々のモデルを用意する必要がなくなる。
Although recent efforts in image quality assessment (IQA) have achieved promising performance, there still exists a considerable gap compared to the human visual system (HVS). One significant disparity lies in humans' seamless transition between full reference (FR) and no reference (NR) tasks, whereas existing models are constrained to either FR or NR tasks. This disparity implies the necessity of designing two distinct systems, thereby greatly diminishing the model's versatility. Therefore, our focus lies in unifying FR and NR IQA under a single framework. Specifically, we first employ an encoder to extract multi-level features from input images. Then a Hierarchical Attention (HA) module is proposed as a universal adapter for both FR and NR inputs to model the spatial distortion at each encoder stage. Furthermore, considering that different distortions contaminate encoder stages and damage image semantic meaning differently, a Semantic Distortion Aware (SDA) module is proposed to examine feature correlations between shallow and deep layers of the encoder. By adopting HA and SDA, the proposed network can effectively perform both FR and NR IQA. When our proposed model is independently trained on NR or FR IQA tasks, it outperforms existing models and achieves state-of-the-art performance. Moreover, when trained jointly on NR and FR IQA tasks, it further enhances the performance of NR IQA while achieving on-par performance in the state-of-the-art FR IQA. You only train once to perform both IQA tasks. Code will be released at: https://github.com/BarCodeReader/YOTO.
研究の動機と目的
- 別々に訓練されたFRおよびNR IQAモデルの性能の不一致と応用範囲の制限を解消すること。
- FRおよびNR IQAを1つのアーキテクチャに統合し、パラメータと学習を共有することで、モデルの保守およびデプロイの複雑さを低減すること。
- 入力タイプ(レファレンス有無)に応じて適応する注意メカニズムを用いて、空間的歪みおよび歪みの意味的影響を同時にモデル化すること。
- エンコーダーステージ間のクロススケール相関を捉えることで、多様な歪みタイプに対して一般化性とロバスト性を向上させること。
- 特にリアルタイムまたはデータ制限のある環境において、FRおよびNR評価モード間を切り替えても一貫性のある性能を発揮できること。
提案手法
- 共通のエンコーダー(ResNet50 または Swin Transformer)が、入力画像からマルチレベル特徴量を抽出し、FRおよびNRタスクのバックボーンとして機能する。
- 階層的自己注意(HSA)モジュールは入力タイプに応じて動的に適応する:NRでは歪み特徴量のみの自己注意、FRでは歪み特徴量と完全な特徴量のクロス注意を実行する。
- HSAはエンコーダーステージごとに注意行列を空間的ブロックに分割することで、局所化精度と収束性を向上させる。
- クロススケールクロス注意(CSCA)モジュールは、浅いエンコーダーステージと深いエンコーダーステージの特徴量間でクロス注意を計算し、歪みが意味的意味に与える影響をスケール間でモデル化する。
- 品質スコア回帰のための1つの共有ヘッドを採用することで、FRおよびNRデータの両方でエンドツーエンド学習が可能になる。
- 合成データ(TID2013, KADID-10K など)および実際のデータ(LIVE, PIPAL, TID2013)を用いて学習することで、ロバスト性を確保する。

実験結果
リサーチクエスチョン
- RQ11つのディーブラーニングモデルが、FRおよびNR画像品質評価の両方で最先端の性能を達成できるか?
- RQ2統合アーキテクチャは、異なる入力タイプに対応して、空間的歪みおよび意味的影響を効果的にモデル化できるか?
- RQ3共有アーキテクチャは、FRおよびNR評価モード間を切り替えても性能の不一致を低減できるか?
- RQ4クロススケール注意は、エンコーダーステージ間で意味的レベルの歪み影響を検出するのに有効か?
- RQ5実世界の忤用において、タスク特化モデルに比べて本フレームワークはより効率的かつ一貫性があるか?
主な発見
- UNIQAは、4つの合成歪みデータセット(TID2013, KADID-10K, PaQ-2D, LPIPS)および3つの実際の歪みデータセット(LIVE, PIPAL, TID2013)で最先端の性能を達成し、専用のFRおよびNR手法を上回った。
- TID2013(FR)ではピアソン相関係数(PLCC)が0.958、PIPAL(NR)では0.932を記録し、優れた一般化性能を示した。
- UNIQAはFRおよびNRスコアリングの間に著しく高い一貫性を示し、タスク間でのPLCC差がわずか0.015にとどまり、従来のモデルと比べて大きな乖離を示さなかった。
- アブレーションスタディにより、HSAおよびCSCAモジュールが両方とも不可欠であることが確認された。両者のいずれかを除去すると、主要ベンチマークでPLCCが0.05以上低下した。
- 本モデルは実世界の歪みに対しても良好な一般化性能を示し、実際のLIVEデータセットではPLCCが0.921、PIPALでは0.918を達成し、既存のSOTA手法を上回った。
- UNIQAは、ノイズ、ぼかし、圧縮など多様な歪みタイプに対して一貫した性能を維持しており、効果的な意味的影響検出を示す一貫性のある注目マップを示した。
![Figure 3: Performance comparison against other FR and NR IQA models on LIVE [ 43 ] dataset. Our method achieves state-of-the-art performance on both FR and NR IQA benchmarks using the same network architecture.](https://ar5iv.labs.arxiv.org/html/2310.09560/assets/images/performance_live.png)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。