Skip to main content
QUICK REVIEW

[논문 리뷰] A Perceptual Quality Assessment Exploration for AIGC Images

Zicheng Zhang, Chunyi Li|arXiv (Cornell University)|2023. 03. 22.
Image and Video Quality Assessment인용 수 4
한 줄 요약

이 논문은 확산 모델에서 유래한 1,080幅의 이미지를 포함하는, 인공지능 생성 이미지(AGIs)를 위한 첫 번째 인지적 품질 평가 데이터베이스인 AGIQA-1K를 소개한다. 기술적 문제, AI 아티팩트, 비자연스러움, 이질성, 미학을 중심으로 한 품질 평가 프레임워크를 수립하고, 기존의 IQA 모델을 벤치마킹하여 AGIs에서 고유한 아티팩트와 분포 이탈로 인해 성능이 제한됨을 드러낸다.

ABSTRACT

\underline{AI} \underline{G}enerated \underline{C}ontent ( extbf{AIGC}) has gained widespread attention with the increasing efficiency of deep learning in content creation. AIGC, created with the assistance of artificial intelligence technology, includes various forms of content, among which the AI-generated images (AGIs) have brought significant impact to society and have been applied to various fields such as entertainment, education, social media, etc. However, due to hardware limitations and technical proficiency, the quality of AIGC images (AGIs) varies, necessitating refinement and filtering before practical use. Consequently, there is an urgent need for developing objective models to assess the quality of AGIs. Unfortunately, no research has been carried out to investigate the perceptual quality assessment for AGIs specifically. Therefore, in this paper, we first discuss the major evaluation aspects such as technical issues, AI artifacts, unnaturalness, discrepancy, and aesthetics for AGI quality assessment. Then we present the first perceptual AGI quality assessment database, AGIQA-1K, which consists of 1,080 AGIs generated from diffusion models. A well-organized subjective experiment is followed to collect the quality labels of the AGIs. Finally, we conduct a benchmark experiment to evaluate the performance of current image quality assessment (IQA) models.

연구 동기 및 목표

  • 인공지능 생성 이미지(AGIs)에 고유한 주요 인지적 품질 요소인 기술적 문제, AI 아티팩트, 비자연스러움, 이질성, 그리고 미학을 식별하고 체계화한다.
  • 스테이블 디퓨전-바이오 및 스테이블 인paint링-바이오 확산 모델에서 생성한 1,080장의 AGIs를 포함하는, 첫 번째 인지적 AGI 품질 평가 데이터베이스인 AGIQA-1K를 구축한다.
  • 정의된 평가 차원을 기반으로 인간이 라벨링한 품질 평가를 수집하기 위해 통제된, 체계적인 주관적 실험을 수행한다.
  • 기존의 이미지 품질 평가(IQA) 모델의 성능을 AGIs에서 평가하고, AGI 전용 품질 평가에 적합한지 평가한다.
  • 기존의 IQA 모델이 AGIs에 적용되었을 때의 한계를 드러내고, AGI 전용 품질 평가 방법의 필요성을 강조한다.

제안 방법

  • 저자들은 시각적 점검과 전문가 분석을 바탕으로 AGIs에 대한 다섯 가지 핵심 인지적 품질 차원을 정의한다: 기술적 문제, AI 아티팩트, 비자연스러움, 이질성, 그리고 미학.
  • 주요 객체, 보조 객체, 장소, 스타일, 특성 등을 포함하는 다양한 텍스트 프롬프트를 사용하여 두 가지 잠재 텍스트-이미지 확산 모델인 스테이블 디퓨전-바이오 및 스테이블 인패이팅-바이오를 활용해 1,080장의 AGIs를 생성한다.
  • 통제된 실내 실험 환경에서 인간 참가자가 표준화된 품질 척도를 사용해 각 AGI의 다섯 가지 품질 차원을 평가한다.
  • AGIQA-1K 데이터베이스는 1,080장의 AGIs와 해당 주관적 품질 레이블을 포함하며, 생성 모델 및 이미지 스타일(애니메이션 대비 사실적인 스타일) 기반으로 데이터를 서브셋으로 분할한다.
  • 표준 평가 지표인 SRCC, PLCC, RMSE를 사용하여 15종의 최신 IQA 모델(수작업 기반, 수작업 기반+SVR, 딥 러닝 기반)의 성능을 AGIQA-1K에서 평가한다.
  • 통계 분석 및 아블레이션 연구를 수행하여 전체 데이터베이스, 모델별 서브셋, 이미지 스타일 카테고리 간의 모델 성능을 비교한다.
Fig. 1 : Illustration of the generation process of AGIs and NSIs, where NSIs are captured from the natural scenes and AGIs are directly generated from AI models.
Fig. 1 : Illustration of the generation process of AGIs and NSIs, where NSIs are captured from the natural scenes and AGIs are directly generated from AI models.

실험 결과

연구 질문

  • RQ1AI 생성 이미지(AGIs)를 자연 풍경 이미지(NSIs)와 구별하는 데 주로 작용하는 주요 인지적 품질 요소는 무엇인가?
  • RQ2NSIs와 AGIs 간의 품질 관련 속성(예: 흐림, 색상, 공간 정보)의 분포는 어떻게 다를까?
  • RQ3기존의 IQA 모델들이 AGIs로 일반화되는 정도는 어느 정도이며, AGI 전용 왜곡에서의 성능 한계는 무엇인가?
  • RQ4확산 모델의 선택(예: 스테이블 디퓨전-바이오 대비 스테이블 인패이팅-바이오)이 품질 분포와 IQA 모델 성능에 어떤 영향을 미치는가?
  • RQ5이미지 스타일(예: 애니메이션 대비 사실적인 스타일)이 IQA 모델의 AGIs에 대한 성능에 유의미하게 영향을 미치는가?

주요 결과

  • 수작업 기반 IQA 모델은 AGIQA-1K에서 빈약한 성능을 보이며, SRCC 값이 0.05 이하에 머물러 있어, 이러한 특징들이 AGI 품질 표현에 부적합함을 시사한다.
  • 딥 러닝 기반 IQA 모델은 더 높은 성능을 기록하며, ResNet50는 전체 데이터베이스에서 최고의 SRCC 0.6365를 기록했지만, 여전히 만족스러운 성능에 못 미친다.
  • 모든 IQA 모델이 스테이블 디퓨전-바이오 서브셋에서 심각한 성능 저하를 보이며, SRCC가 0.6365에서 0.4777로 하락했다. 이는 더 높은 이미지 다양성과 복잡성으로 인한 것으로 보인다.
  • 애니메이션 스타일 및 사실적인 스타일 서브셋에서의 성능은 유사하며, MGQA와 같은 딥 러닝 모델은 각각 SRCC 0.6876과 0.6613을 기록하여 스타일이 모델 성능에 미치는 영향이 제한적임을 시사한다.
  • AGIs의 품질 속성 분포는 NSIs와 상당히 다름을 보이며, AGIs는 더 높은 흐림, 더 많은 예상치 못한 아티팩트, 더 큰 비자연스러움을 나타내며, 정규화된 확률 분포도 이를 뒷받침한다.
  • 벤치마크 결과에 따르면 현재의 IQA 모델들은 AGI 전용 왜곡에 잘 적응되어 있지 않으며, 객관적 AGI 품질 평가 분야에 중요한 격차가 있음을 드러낸다.
Fig. 2 : Sample images from the AGIQA-1k database, where the first to sixth rows show AGIs with ( bird, cat, batman, kid, man, woman ) as the main objects respectively.
Fig. 2 : Sample images from the AGIQA-1k database, where the first to sixth rows show AGIs with ( bird, cat, batman, kid, man, woman ) as the main objects respectively.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.