Skip to main content
QUICK REVIEW

[論文レビュー] PKU-I2IQA: An Image-to-Image Quality Assessment Database for AI Generated Images

Jiquan Yuan, Xinyan Cao|arXiv (Cornell University)|Nov 27, 2023
Image and Video Quality Assessment被引用数 5
ひとこと要約

本論文は、MidjourneyおよびStable Diffusion V1.5を用いて200の画像プロンプトから生成された1,600枚のAI生成画像を含む、人間の知覚に基づく画像対画像AIGC画像品質評価(AIGCIQA)データベースであるPKU-I2IQAを紹介する。2つのベンチマークモデル—NR-AIGCIQAとFR-AIGCIQA—を提案し、FR-AIGCIQAがNR-AIGCIQAを上回ることを示した。特にResNet18は全体として最高のパフォーマンスを示し、SRCC: 0.7241、PLCC: 0.7565を達成した。

ABSTRACT

As image generation technology advances, AI-based image generation has been applied in various fields and Artificial Intelligence Generated Content (AIGC) has garnered widespread attention. However, the development of AI-based image generative models also brings new problems and challenges. A significant challenge is that AI-generated images (AIGI) may exhibit unique distortions compared to natural images, and not all generated images meet the requirements of the real world. Therefore, it is of great significance to evaluate AIGIs more comprehensively. Although previous work has established several human perception-based AIGC image quality assessment (AIGCIQA) databases for text-generated images, the AI image generation technology includes scenarios like text-to-image and image-to-image, and assessing only the images generated by text-to-image models is insufficient. To address this issue, we establish a human perception-based image-to-image AIGCIQA database, named PKU-I2IQA. We conduct a well-organized subjective experiment to collect quality labels for AIGIs and then conduct a comprehensive analysis of the PKU-I2IQA database. Furthermore, we have proposed two benchmark models: NR-AIGCIQA based on the no-reference image quality assessment method and FR-AIGCIQA based on the full-reference image quality assessment method. Finally, leveraging this database, we conduct benchmark experiments and compare the performance of the proposed benchmark models. The PKU-I2IQA database and benchmarks will be released to facilitate future research on \url{https://github.com/jiquan123/I2IQA}.

研究の動機と目的

  • 画像対画像生成において急速に普及しているが、人間の知覚に基づく包括的なAIGCIQAデータベースが不足している問題に対処すること。
  • プロンプト画像を参照として用いることで、人間の知覚スコアのバイアスを低減するバランスの取れた信頼性の高い主観的評価フレームワークを確立すること。
  • 画像対画像生成画像におけるノーレンシス(NR)およびフルレファレンス(FR)AIGCIQAモデルの評価のためのベンチマークを提供すること。
  • GitHubを通じてPKU-I2IQAデータベースとベンチマークモデルを公開することで、今後のAI生成画像品質に関する研究を促進すること。

提案手法

  • 著者らは200のImageNetカテゴリを選定し、Pixabayから高解像度の画像を収集して画像対画像生成のためのプロンプトとした。
  • 最先端の2つのモデル—MidjourneyとStable Diffusion V1.5—を用い、1プロンプトあたり4つの異なる画像を生成し、合計1,600枚のAIGI(AI生成画像)を生成した。
  • 人間の知覚に基づく品質スコアを各生成画像について収集するため、体系的かつ明確な主観実験を実施した。
  • 2つのベンチマークモデルを提案した:NR-AIGCIQA(ノーレンシス)とFR-AIGCIQA(フルレファレンス)。両モデルとも、ResNet18、ResNet50、VGG19、InceptionV4といった事前学習済みCNNバックボーンに基づいている。
  • 予測スコアと人間がアノテートした品質スコアとの相関を測るため、SRCCおよびPLCC指標を用いてモデルのパフォーマンスを評価した。
  • 異なるモデルの出力で訓練し、別のモデルの出力でテストすることで、クロスモデル一般化能力を評価した。その結果、一般化能力は限定的であることが判明した。

実験結果

リサーチクエスチョン

  • RQ1ノーレンシス(NR)とフルレファレンス(FR)AIGCIQAモデルは、画像対画像生成画像においてどのように性能を比較できるか?
  • RQ2どの深層畳み込みニューラルネットワーク(DNN)アーキテクチャが、画像対画像AIGI品質の人の知覚を最もよく予測できるか?
  • RQ3AIGCIQAモデルは、異なる画像対画像生成モデル間でどの程度一般化できるか?
  • RQ4主観的評価においてプロンプト画像を参照として用いることで、人間の知覚スコアのバイアスを低減できるか?
  • RQ5画像対画像AIGIにおいて、テキスト対画像AIGIとは異なる主要な品質劣化パターンは何か?

主な発見

  • FR-AIGCIQAベンチマークモデルはNR-AIGCIQAを上回り、特にResNet18ベースのFR-AIGCIQAが最高のパフォーマンスを示した(SRCC: 0.7241、PLCC: 0.7565)。
  • バックボーンネットワークの中で、ResNet18がPKU-I2IQAデータベース全体で最も優れたパフォーマンスを発揮し、特に照応性と最終スコア指標で顕著な優位性を示した。
  • InceptionV4は「真正性」指標で最高のパフォーマンスを示し(SRCC: 0.7298、PLCC: 0.7529)、一方ResNet50は最高の最終スコア(SRCC: 0.7359、PLCC: 0.7606)を記録した。
  • 提案されたベンチマークモデルは、異なるAIGIモデル間で評価された際、一般化能力に制限があることが判明した。これは、今後のAIGCIQAモデルにおいてドメイン一般化の向上が求められることを示唆している。
  • PKU-I2IQAデータベースは、構造的不整合、テクスチャの不規則性、AIアーティファクトといった多様な画像対画像生成アーティファクトを的確に捉えており、実世界のAIGC評価における妥当性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。