Skip to main content
QUICK REVIEW

[논문 리뷰] An End-to-End Neural Network for Image Cropping by Learning Composition from Aesthetic Photos

Peng Lu, Hao Zhang|arXiv (Cornell University)|2019. 07. 02.
Visual Attention and Saliency Detection인용 수 12
한 줄 요약

이 논문은 명시적 객체와 고미학적 영역 간의 공간적 관계를 학습하여 최적의 자르기 영역을 직접 예측하는 엔드 투 엔드 딥 러닝 프레임워크를 제안한다. U-Net 기반의 시각적 강조도 탐지기, 앵커 영역 생성 레이어, 경량 회귀 네트워크를 사용하여 정확도(이격도수와 BDE로 측정)와 효율성(50 fps) 모두에서 최신 기술 수준의 성능을 달성하며, 반복적인 후보 평가 과정을 제거한다.

ABSTRACT

As one of the fundamental techniques for image editing, image cropping discards unrelevant contents and remains the pleasing portions of the image to enhance the overall composition and achieve better visual/aesthetic perception. In this paper, we primarily focus on improving the accuracy of automatic image cropping, and on further exploring its potential in public datasets with high efficiency. From this respect, we propose a deep learning based framework to learn the objects composition from photos with high aesthetic qualities, where an anchor region is detected through a convolutional neural network (CNN) with the Gaussian kernel to maintain the interested objects' integrity. This initial detected anchor area is then fed into a light weighted regression network to obtain the final cropping result. Unlike the conventional methods that multiple candidates are proposed and evaluated iteratively, only a single anchor region is produced in our model, which is mapped to the final output directly. Thus, low computational resources are required for the proposed approach. The experimental results on the public datasets show that both cropping accuracy and efficiency achieve the state-ofthe-art performances.

연구 동기 및 목표

  • 반복적인 후보 영역 생성 없이 직접 고미학적 자르기 영역을 예측할 수 있는 엔드 투 엔드 신경망을 개발하는 것.
  • 시각적 강조도 객체와 높은 미학적 품질을 가진 영역 간의 관계를 모델링하여 자르기 정확도를 향상시키는 것.
  • 포괄적인 스캔이나 다수의 후보 평가를 피하여 계산 효율성을 향상시키는 것.
  • 확률적 프레임워크를 통해 딥 페처가 이미지 구성과 미학에 어떻게 기여하는지의 해석 가능성을 탐색하는 것.
  • 소비자 기기에서의 구현에 적합한 실시간 성능을 달성하는 것.

제안 방법

  • 이미지 내 주요 객체를 강조하는 데 목적이 있는 U-형 컨볼루션 신경망(U-Net)을 사용하여 시각적 강조도 맵을 생성한다.
  • 시각적 강조도 맵을 정밀하게 다듬기 위해 소프트 이진화 레이어를 적용하여 강조도 객체와 배경을 분리한다.
  • 객체의 무결성을 유지하고 단일 초기 앵커 영역을 정의하기 위해 가우시안 유사 커널을 사용하는 앵커 영역 생성 레이어를 도입한다.
  • 앵커 영역에서 특징을 추출하기 위해 영역 관심(ROI) 풀링 레이어를 활용한다.
  • 앵커 영역 특징에서 직접적으로 최종 자르기 직사각형을 예측하기 위해 경량 회귀 네트워크를 사용한다.
  • 지역화 정확도와 미학적 품질을 동시에 최적화하기 위해 확률적 프레임워크를 사용하여 전체 파이프라인을 엔드 투 엔드로 훈련한다.

실험 결과

연구 질문

  • RQ1시각적 강조도에서 자르기 영역으로의 단일 직접적 회귀 경로가 이미지 자르기에서 다단계 후보 생성 및 평가 방식을 능가할 수 있는가?
  • RQ2딥 신경망이 시각적 강조도 객체와 높은 미학적 구성 간의 암묵적 관계를 얼마나 잘 학습할 수 있는가?
  • RQ3반복적인 후보 평가 과정을 제거함으로써 계산 효율성이 얼마나 향상되며, 정확도 손실 없이 가능한가?
  • RQ4가우시안 커널을 사용하는 제안된 앵커 영역 생성 레이어가 객체의 무결성을 어떻게 유지하고 국소화 정확도를 향상시키는가?
  • RQ5다양한 데이터셋에 대해 일반화가 가능할까? 동시에 목적적 지표와 주관적 사용자 선호도 모두에서 높은 성능를 유지하는가?

주요 결과

  • 제안된 방법은 공개 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, FLMS 데이터셋에서 평균 IoU는 0.78, BDE는 0.81을 기록하였다.
  • 시스템은 평균 50 프레임 매초의 속도로 이미지를 처리하여 실시간 응용에 적합하다.
  • 기존의 브루트 포스 검색을 통해 후보 영역를 찾는 기준선 방법 [7]보다 다섯 배 빠르다.
  • 주관적 사용자 연구에서 제안된 방법은 2000표 중 792표를 확보하여 AIC, A2-RL, VEN을 모두 앞선 가장 미학적으로 매력적인 자르기 결과로 평가받았다.
  • 실패 사례는 주로 시각적 강조도가 희박한 이미지(예: FLMS) 또는 지도 데이터와 완전히 일치하지 않는 다수의 시각적 강조도 객체를 포함한 이미지(예: FCD)에서 발생하며, 이는 시각적 강조도 탐지 및 애너테이션 일치도의 한계를 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.