[論文レビュー] PSCR: Patches Sampling-based Contrastive Regression for AIGC Image Quality Assessment
本稿では、AIGC画像品質評価のためのパッチサンプリングに基づく対照的回帰フレームワークPSCRを提案する。この手法は、クエリ画像と例示画像間の相対的スコア回帰を通じて、幾何的歪みを回避する重複パッチサンプリングを用いることで、判別性の高い表現空間を学習し、性能を向上させる。3つの主要なAIGCIQAベンチマークで最先端の結果を達成し、SRCCで最大+0.016、PLCCで最大+0.012の向上を達成した。
In recent years, Artificial Intelligence Generated Content (AIGC) has gained widespread attention beyond the computer science community. Due to various issues arising from continuous creation of AI-generated images (AIGI), AIGC image quality assessment (AIGCIQA), which aims to evaluate the quality of AIGIs from human perception perspectives, has emerged as a novel topic in the field of computer vision. However, most existing AIGCIQA methods directly regress predicted scores from a single generated image, overlooking the inherent differences among AIGIs and scores. Additionally, operations like resizing and cropping may cause global geometric distortions and information loss, thus limiting the performance of models. To address these issues, we propose a patches sampling-based contrastive regression (PSCR) framework. We suggest introducing a contrastive regression framework to leverage differences among various generated images for learning a better representation space. In this space, differences and score rankings among images can be measured by their relative scores. By selecting exemplar AIGIs as references, we also overcome the limitations of previous models that could not utilize reference images on the no-reference image databases. To avoid geometric distortions and information loss in image inputs, we further propose a patches sampling strategy. To demonstrate the effectiveness of our proposed PSCR framework, we conduct extensive experiments on three mainstream AIGCIQA databases including AGIQA-1K, AGIQA-3K and AIGCIQA2023. The results show significant improvements in model performance with the introduction of our proposed PSCR framework. Code will be available at \url{https://github.com/jiquan123/PSCR}.
研究の動機と目的
- 単一の画像から直接スコアを回帰する既存のAIGCIQA手法が、画像間の差異を活用しないという制限を解消すること。
- リサイズやクロッピングなどの画像前処理が引き起こす幾何的歪みと情報損失が性能を低下させることを克服すること。
- ノンレファレンスAIGCIQAモデルが例示リファレンス画像を活用してスコア回帰を向上させることを可能にし、従来手法の主な制限を克服すること。
- AIGI間の相対的品質順位をモデル化することで、表現学習を強化する、頑健で汎用性の高いフレームワークを開発すること。
- スライディングウィンドウに基づく重複パッチサンプリング戦略を導入し、AIGI入力における情報損失と構造的破壊を最小限に抑えること。
提案手法
- クエリAIGIとランダムに選択された複数の例示AIGI間の相対的スコアを回帰する対照的回帰フレームワークを提案し、順位認識の監視によりより良い表現学習を実現する。
- 元解像度のAIGIに対してスライディングウィンドウを適用し、重複する非重複パッチを抽出するパッチサンプリング戦略を導入し、グローバル構造を保持するとともに情報損失を最小限に抑える。
- VGG、ResNet、InceptionV4などの深層ニューラルネットワークバックボーンを用いてサンプル化されたパッチからの特徴を抽出し、グローバルプーリングと回帰ヘッドによるスコア予測を実行する。
- 類似した相対的スコアを持つ画像の表現を近づけ、異なるスコアを持つ画像の表現を広く分離するように、対照的損失を用いてモデルを訓練する。
- 既存のIQアーキテクチャにPSCRフレームワークをプラグインモジュールとして統合し、異なるバックボーンやデータセットへの容易な適応を可能にする。
- データオーグメンテーションおよび正規化技術を適用し、多様なAIGI分布にわたる訓練の安定性と一般化性能を向上させる。
実験結果
リサーチクエスチョン
- RQ1相対的品質差をモデル化する対照的回帰フレームワークは、AIGCIQA性能の向上に寄与するか?
- RQ2スライディングウィンドウによる重複パッチサンプリングは、標準的なクロッピングやリサイズと比較して、幾何的歪みと情報損失を軽減するか?
- RQ3例示ベースのリファレンス画像は、単一画像回帰を上回るノンレファレンスAIGCIQA性能を実現できるか?
- RQ4PSCRフレームワークは、SRCCおよびPLCCの観点から、複数のAIGCIQAベンチマークで最先端手法と比較してどのように差をつけるか?
- RQ5パッチサンプリング戦略のハイパーパrameter(例:ストライド、パッチサイズ)は、モデルの性能と効率にどのような影響を及えるか?
主な発見
- PSCRフレームワークは、InceptionV4をバックボーンとして用いることで、AGIQA-1K、AGIQA-3K、AIGCIQA2023で最先端性能を達成し、SRCCが0.8498、PLCCが0.9059を記録した。
- InceptionV4を用いたPSCRバージョンは、ベースラインモデルと比較してSRCCが+0.016、PLCCが+0.0058向上させ、顕著な性能向上を示した。
- アブレーションスタディの結果、パッチサンプリング(PS)および対照的回帰(CR)の両成分が、独立してかつ相乗的に性能向上に寄与していることが確認された。
- 3つのデータセットすべてにおいて、VGG16、VGG19、ResNet18、ResNet50、InceptionV4のすべてのベースラインモデルを上回る性能を発揮し、特にAIGCIQA2023で最大の向上が観察された。
- リファレンス画像としての例示AIGIの使用により、特に低品質または著しく歪んだ画像領域において、より頑健で汎用性の高い表現を学習できるようになった。
- スライディングウィンドウによるパッチサンプリング戦略は、情報損失を低減し、AIGI品質評価に不可欠なローカルテクスチャーやアーティファクトを保持した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。