Skip to main content
QUICK REVIEW

[論文レビュー] A Perceptual Quality Assessment Exploration for AIGC Images

Zicheng Zhang, Chunyi Li|arXiv (Cornell University)|Mar 22, 2023
Image and Video Quality Assessment被引用数 4
ひとこと要約

本稿では、diffusionモデルから生成された1,080枚の画像を含む、AI生成画像(AGI)のための最初の知覚的品質評価データベースAGIQA-1Kを紹介する。技術的問題、AIアーティファクト、不自然さ、不一致、芸術的美しさの5つの側面に注目した品質評価フレームワークを構築し、既存のIQAモデルをベンチマーク化することで、特徴的なアーティファクトと分布シフトのため、それらの性能が限定的であることが明らかになった。

ABSTRACT

\underline{AI} \underline{G}enerated \underline{C}ontent ( extbf{AIGC}) has gained widespread attention with the increasing efficiency of deep learning in content creation. AIGC, created with the assistance of artificial intelligence technology, includes various forms of content, among which the AI-generated images (AGIs) have brought significant impact to society and have been applied to various fields such as entertainment, education, social media, etc. However, due to hardware limitations and technical proficiency, the quality of AIGC images (AGIs) varies, necessitating refinement and filtering before practical use. Consequently, there is an urgent need for developing objective models to assess the quality of AGIs. Unfortunately, no research has been carried out to investigate the perceptual quality assessment for AGIs specifically. Therefore, in this paper, we first discuss the major evaluation aspects such as technical issues, AI artifacts, unnaturalness, discrepancy, and aesthetics for AGI quality assessment. Then we present the first perceptual AGI quality assessment database, AGIQA-1K, which consists of 1,080 AGIs generated from diffusion models. A well-organized subjective experiment is followed to collect the quality labels of the AGIs. Finally, we conduct a benchmark experiment to evaluate the performance of current image quality assessment (IQA) models.

研究の動機と目的

  • AI生成画像(AGI)に特有の主観的品質要因である技術的問題、AIアーティファクト、不自然さ、不一致、芸術的美しさを特定・形式化すること。
  • stable-diffusion-v2およびstable-inpainting-v1のdiffusionモデルから生成された1,080枚のAGIを含む、最初の知覚的AGI品質評価データベースAGIQA-1Kを構築すること。
  • 定義された評価次元に沿って、人間によるアノテーション付き品質ラベルを収集するための制御された、体系的な主観的実験を実施すること。
  • 既存の画像品質評価(IQA)モデルのAGIにおける性能をベンチマーク化し、AGI固有の品質評価に適しているかどうかを評価すること。
  • 現在のIQAモデルがAGIに適用された際の限界を明らかにし、AGI固有の品質評価手法の必要性を強調すること。

提案手法

  • 著者らは、視覚的検査と専門家分析に基づき、AGIのための5つの主要な主観的品質次元(技術的問題、AIアーティファクト、不自然さ、不一致、芸術的美しさ)を定義する。
  • 多様なテキストプロンプト(主な物体、副次的物体、場所、スタイル、属性)を用いて、2つの潜在的テキストから画像へのdiffusionモデル(stable-diffusion-v2およびstable-inpainting-v1)を用いて1,080枚のAGIを生成する。
  • 標準化された品質スケールを用いて、人間被験者が5つの品質次元ごとに各AGIを評価する、制御されたラボベースの主観的実験を実施する。
  • AGIQA-1Kデータベースは、1,080枚のAGIと対応する主観的品質ラベルを含み、生成モデルおよび画像スタイル(アニメ対レリスティック)に基づいてサブセットに分割される。
  • 15の最先端IQAモデル(手作業特徴抽出、手作業特徴抽出+SVR、深層学習ベースのアプローチを含む)を、SRCC、PLCC、RMSEの標準指標を用いてAGIQA-1K上で評価する。
  • 統計的分析とアブレーションスタディを実施し、全データベース、モデル固有のサブセット、画像スタイルのカテゴリごとにモデルの性能を比較する。
Fig. 1 : Illustration of the generation process of AGIs and NSIs, where NSIs are captured from the natural scenes and AGIs are directly generated from AI models.
Fig. 1 : Illustration of the generation process of AGIs and NSIs, where NSIs are captured from the natural scenes and AGIs are directly generated from AI models.

実験結果

リサーチクエスチョン

  • RQ1AI生成画像(AGI)と自然シーン画像(NSI)を区別する主な知覚的品質要因は何か?
  • RQ2NSIとAGIの間で、品質関連属性(例:ぼやけ具合、色、空間情報)の分布はどのように異なるか?
  • RQ3既存のIQAモデルはAGIにどの程度一般化可能か?AGI固有の歪みに対する性能の限界は何か?
  • RQ4diffusionモデルの選択(例:stable-diffusion-v2対stable-inpainting-v1)は、品質分布およびIQAモデルの性能にどのように影響するか?
  • RQ5画像スタイル(例:アニメ対レリスティック)は、IQAモデルのAGIにおける性能に顕著な影響を及えるか?

主な発見

  • 手作業特徴抽出ベースのIQAモデルはAGIQA-1Kにおいて著しく低い性能を示し、SRCC値が0.05未満にとどまる。これは、特徴量がAGIの品質表現に不適切であることを示している。
  • 深層学習ベースのIQAモデルはより高い性能を示し、ResNet50が全データベースで最高のSRCC 0.6365を達成したが、依然として満足できる性能には至っていない。
  • すべてのIQAモデルがstable-diffusion-v2サブセットで顕著な性能低下を示し、SRCCが0.6365から0.4777に低下した。これは、より高い画像の多様性と複雑さに起因すると考えられる。
  • アニメスタイルおよびレリスティックスタイルのサブセットにおける性能は類似しており、MGQAなどの深層学習モデルがそれぞれSRCC 0.6876および0.6613を達成した。これは、スタイルがモデル性能に大きな影響を及えないことを示している。
  • AGIにおける品質属性の分布はNSIとは顕著に異なり、AGIではぼやけ具合が高く、予期しないアーティファクトが多く、不自然さが強いことが、正規化確率分布から明らかになった。
  • ベンチマークの結果から、現在のIQAモデルはAGI固有の歪みに適応されていないことが判明し、客観的AGI品質評価における重要なギャップが浮き彫りになった。
Fig. 2 : Sample images from the AGIQA-1k database, where the first to sixth rows show AGIs with ( bird, cat, batman, kid, man, woman ) as the main objects respectively.
Fig. 2 : Sample images from the AGIQA-1k database, where the first to sixth rows show AGIs with ( bird, cat, batman, kid, man, woman ) as the main objects respectively.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。