Skip to main content
QUICK REVIEW

[논문 리뷰] Theme Aware Aesthetic Distribution Prediction with Full Resolution Photos.

Gengyun Jia, Peipei Li|arXiv (Cornell University)|2019. 08. 04.
Visual Attention and Saliency Detection참고 문헌 29인용 수 5
한 줄 요약

이 논문은 이미지 패딩과 ROI 풀링을 조합하여 해상도 손실 없이 전체 해상도 이미지 특징을 유지하는 주제 인식 미적 분포 예측 방법을 제안한다. 이는 크기 조정 시 발생하는 왜곡을 방지한다. 또한 주제 기준 편향을 해결하기 위해 주제 인식 모델링을 통합하여, 고해상도 입력에서 최신 기술 성능을 달성하면서도 전반적인 구조나 미적 충실도를 훼손하지 않는다.

ABSTRACT

Aesthetic quality assessment (AQA) of photos is a challenging task due to the subjective and diverse factors in human assessment process. Nowadays, it is common to tackle AQA with deep neural networks (DNNs) for their superior performance on modeling such complex relations. However, traditional DNNs require fix-sized inputs, and resizing various inputs to a uniform size may significantly change their aesthetic features. Such transformations lead to the mismatches between photos and their aesthetic evaluations. Existing methods usually adopt two solutions for it. Some methods directly crop fix-sized patches from the inputs. The others alternately capture the aesthetic features from pre-defined multi-size inputs by inserting adaptive pooling or removing fully connected layers. However, the former destroys the global structures and layout information, which are crucial in most situations. The latter has to resize images into several pre-defined sizes, which is not enough to reflect the diversity of image sizes, and the aesthetic features are still destroyed. To address this issue, we propose a simple and effective method that can handle the arbitrary sizes of batch inputs to achieve AQA on the full resolution images by combining image padding with ROI (region of interest) pooling. Padding keeps inputs of the same size, while ROI pooling cuts off the forward propagation of features on padding regions, thus eliminates the side effects of padding. Besides, we observe that the same image may receive different scores under different themes, which we call the theme criterion bias. However, previous works only focus on the aesthetic features of the images and ignore the criterion bias brought by their themes. In this paper, we introduce the theme information and propose a theme aware model. Extensive experiments prove the effectiveness of the proposed method over the state-of-the-arts.

연구 동기 및 목표

  • 딥 뉴럴 네트워크의 고정 크기 입력 요구 사항으로 인해 크기 조정 과정에서 이미지 특징이 왜곡되는 문제를 해결한다.
  • 자르기나 다중 해상도 크기 조정을 피하여 전체 이미지의 구조와 레이아웃을 유지함으로써 추론 중에 전체 해상도 입력을 유지한다.
  • 동일한 이미지가 다른 주제에서 다른 미적 점수를 받는 주제 기준 편향을 주제 인식 표현을 통합함으로써 명시적으로 모델링한다.
  • 특정 입력 크기를 요구하지 않으면서도 특징 무결성이나 모델 성능을 희생시키지 않는 통합된 방법을 개발한다.
  • 전체 해상도 처리와 주제 인식 학습을 조합하여 최신 기술 수준의 미적 분포 예측을 달성한다.

제안 방법

  • 입력의 원래 해상도를 유지하기 위해 이미지 패딩을 사용하여 크기 조정으로 인한 정보 손실을 방지한다.
  • 패딩된 영역에서의 특징 전파를 선택적으로 무시하기 위해 ROI 풀링을 적용하여 관련 없는 특징이 최종 예측에 영향을 주지 않도록 한다.
  • 주제 인식 표현을 추출하기 위해 주제 인코더를 통합하여 모델이 주제적 맥락에 따라 미적 판단을 적응적으로 조정할 수 있도록 한다.
  • 게이트드 퓨전 메커니즘을 통해 주제 인식 특징과 전체 해상도 이미지 특징을 조합하여 맥락 인식 기반의 미적 점수 분포를 생성한다.
  • 미적 품질 예측과 주제 인식 일致성 양측을 최적화하는 다중 태스크 손실을 사용해 모델을 엔드 투 엔드로 훈련한다.
  • 이미지의 공간적 구조와 일치하는 학습 가능한 패딩 전략을 사용하여 특징 추출 과정에서 간섭을 최소화한다.

실험 결과

연구 질문

  • RQ1딥 러닝 모델은 크기 조정이나 자르기 없이 전체 해상도 이미지에서 효과적으로 미적 품질 평가를 수행할 수 있는가?
  • RQ2주제 기준 편향은 미적 판단에 어떤 영향을 미치며, 이를 명시적으로 모델링하면 정확도 향상에 기여할 수 있는가?
  • RQ3패딩과 ROI 풀링을 통해 전체 이미지의 구조를 유지함으로써 기존의 크기 조정 방법에 비해 미적 분포 예측 성능이 얼마나 향상되는가?
  • RQ4주제 인식 아키텍처는 주제적 맥락을 忽시하는 기존 AQA 모델보다 우월한 성능을 보일 수 있는가?
  • RQ5전체 해상도 처리와 주제 모델링의 조합이 다양한 이미지 데이터셋에서 일관된 성능 향상을 이끌어낼 수 있는가?

주요 결과

  • 제안된 방법은 크기 조정 없이 전체 해상도 입력을 활용함으로써 미적 분포 예측 벤치마크에서 최신 기술 성능을 달성한다.
  • ROI 풀링은 패딩 영역에서 유발되는 노이즈와 관련 없는 특징을 효과적으로 억제하여 특징 품질과 모델의 강건성을 향상시킨다.
  • 주제 인식 모델링 통합으로 주제 기준 편향의 영향을 줄여 더 일관되고 맥락에 부합하는 미적 점수를 도출한다.
  • 모델은 정확한 미적 평가에 필수적인 전체 이미지의 구조와 레이아웃 정보를 유지한다.
  • 실험 결과, 고정 크기 입력에 의존하거나 주제 특화 평가 편향을 忽시하는 기존 방법들에 비해 뚜렷한 성능 향상을 보였다.
  • 다양한 이미지 크기와 주제에 걸쳐 잘 일반화되어 실제 환경에서의 확장성과 강건성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.