Skip to main content
QUICK REVIEW

[논문 리뷰] PKU-I2IQA: An Image-to-Image Quality Assessment Database for AI Generated Images

Jiquan Yuan, Xinyan Cao|arXiv (Cornell University)|2023. 11. 27.
Image and Video Quality Assessment인용 수 5
한 줄 요약

이 논문은 Midjourney와 Stable Diffusion V1.5를 사용하여 200개의 이미지 프롬프트에서 생성한 총 1,600개의 AI 생성 이미지를 포함한, 인간의 시각 인지 기반 이미지 간 AIGC 이미지 품질 평가(AIGCIQA) 데이터베이스인 PKU-I2IQA를 소개한다. 이는 첫 번째로 인간의 시각 인지 기반 AIGCIQA 데이터베이스이다. 두 가지 벤치마크 모델인 NR-AIGCIQA와 FR-AIGCIQA를 제안하였으며, FR-AIGCIQA가 NR-AIGCIQA를 능가함을 보였고, ResNet18 기반 모델이 가장 뛰어난 성능을 보였다 (SRCC: 0.7241, PLCC: 0.7565).

ABSTRACT

As image generation technology advances, AI-based image generation has been applied in various fields and Artificial Intelligence Generated Content (AIGC) has garnered widespread attention. However, the development of AI-based image generative models also brings new problems and challenges. A significant challenge is that AI-generated images (AIGI) may exhibit unique distortions compared to natural images, and not all generated images meet the requirements of the real world. Therefore, it is of great significance to evaluate AIGIs more comprehensively. Although previous work has established several human perception-based AIGC image quality assessment (AIGCIQA) databases for text-generated images, the AI image generation technology includes scenarios like text-to-image and image-to-image, and assessing only the images generated by text-to-image models is insufficient. To address this issue, we establish a human perception-based image-to-image AIGCIQA database, named PKU-I2IQA. We conduct a well-organized subjective experiment to collect quality labels for AIGIs and then conduct a comprehensive analysis of the PKU-I2IQA database. Furthermore, we have proposed two benchmark models: NR-AIGCIQA based on the no-reference image quality assessment method and FR-AIGCIQA based on the full-reference image quality assessment method. Finally, leveraging this database, we conduct benchmark experiments and compare the performance of the proposed benchmark models. The PKU-I2IQA database and benchmarks will be released to facilitate future research on \url{https://github.com/jiquan123/I2IQA}.

연구 동기 및 목표

  • 이미지 간 생성에서 점점 더 흔해지는 AI 콘텐츠 생성 분야에서 종합적이고 인간의 시각 인지 기반 AIGCIQA 데이터베이스의 부족을 해결하기 위해.
  • 프롬프트 이미지를 기준으로 삼아 인간의 시각 인지 점수에 대한 편향을 줄이기 위해 균형 잡히고 신뢰할 수 있는 주관적 평가 프레임워크를 구축하기 위해.
  • 이미지 간 생성된 이미지에 대해 비참조(NR) 및 전체 기준(FR) AIGCIQA 모델을 평가하기 위한 벤치마크를 제공하기 위해.
  • 미래의 AI 생성 이미지 품질 연구를 가능하게 하기 위해 GitHub를 통해 PKU-I2IQA 데이터베이스와 벤치마크 모델을 공개하기 위해.

제안 방법

  • 저자들은 ImageNet의 200개 카테고리 선택하고, Pixabay에서 고해상도 이미지를 수집하여 이미지 간 생성을 위한 프롬프트로 사용하였다.
  • 최신 기술인 Midjourney와 Stable Diffusion V1.5를 사용하여 프롬프트당 4개의 서로 다른 이미지를 생성하여 총 1,600개의 AIGI 이미지를 확보하였다.
  • 각 생성된 이미지에 대한 인간의 시각 인지 기반 품질 점수를 수집하기 위해 체계적인 주관적 실험을 실시하였다.
  • 두 가지 벤치마크 모델을 제안하였다: NR-AIGCIQA(비참조)와 FR-AIGCIQA(전체 기준), 모두 ResNet18, ResNet50, VGG19, InceptionV4 등의 사전 학습된 CNN 기반 모델을 기반으로 하였다.
  • 예측된 점수와 인간이 기록한 점수 간 상관관계를 측정하기 위해 SRCC 및 PLCC 지표를 사용하여 모델 성능을 평가하였다.
  • 다른 모델의 출력에서 학습하고 다른 모델의 출력에서 테스트하는 방식으로 모델 간 일반화 능력을 평가하였으며, 제한된 일반화 능력이 드러났다.

실험 결과

연구 질문

  • RQ1비참조(NR) 대비 전체 기준(FR) AIGCIQA 모델이 이미지 간 생성된 이미지에서 성능적으로 어떻게 비교되는가?
  • RQ2어느 깊이 신경망 아키텍처가 이미지 간 AIGI 품질에 대한 인간의 시각 인지 예측에 가장 잘 수행되는가?
  • RQ3AIGCIQA 모델이 서로 다른 이미지 간 생성 모델 간에 얼마나 일반화되는가?
  • RQ4주관적 평가에서 프롬프트 이미지를 기준으로 사용할 경우 인간의 시각 인지 점수에 대한 편향을 줄일 수 있는가?
  • RQ5이미지 간 AIGI에서 발생하는 주요 품질 저하 패턴은 텍스트 간 AIGI와 어떻게 다를까?

주요 결과

  • FR-AIGCIQA 벤치마크 모델이 NR-AIGCIQA 모델를 능가하였으며, ResNet18 기반 FR-AIGCIQA 모델이 가장 높은 SRCC(0.7241)와 PLCC(0.7565)를 기록하였다.
  • 백본 네트워크 중에서 ResNet18이 PKU-I2IQA 데이터베이스에서 가장 뛰어난 종합 성능을 보였으며, 특히 대응성 및 최종 점수 지표에서 뛰어난 성능을 보였다.
  • InceptionV4는 진정성 지표에서 가장 뛰어난 성능을 보였으며(SRCC: 0.7298, PLCC: 0.7529), ResNet50는 최고의 최종 점수(SRCC: 0.7359, PLCC: 0.7606)를 기록하였다.
  • 제안된 벤치마크 모델는 서로 다른 AIGI 모델 간 평가 시 일반화 능력이 제한되어 있음을 확인하였으며, 향후 AIGCIQA 모델의 도메인 일반화 향상 필요성을 시사하였다.
  • PKU-I2IQA 데이터베이스는 구조적 일관성 결여, 질감 이상, AI 아티팩트 등 다양한 이미지 간 생성 아티팩트를 성공적으로 캡처하여 실제 AIGC 평가에 적합함을 검증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.