Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Detect Multiple Photographic Defects

Ning Yu, Xiaohui Shen|arXiv (Cornell University)|2016. 12. 06.
Visual Attention and Saliency Detection인용 수 3
한 줄 요약

이 논문은 자연 이미지에서 일곱 가지 일반적인 사진 결함—예를 들어 과도한 노출, 노이즈, 블러, 구성 문제 등—을 동시에 감지하고 심각도를 순위 매기는 데 사용하는 다중 컬럼 딥 컨volution 신경망(CNN)을 활용한 다중 작업 학습 프레임워크를 소개한다. 12,853장의 이미지로 구성된 대규모 인간 레이블링 데이터셋을 기반으로 훈련된 모델은 이전의 저수준 통계 기반 방법보다 인간 평가와 더 일관되며, 심지어 평균 인간 사용자보다도 결함 심각도 예측에서 뛰어난 성능을 보였다.

ABSTRACT

In this paper, we introduce the problem of simultaneously detecting multiple photographic defects. We aim at detecting the existence, severity, and potential locations of common photographic defects related to color, noise, blur and composition. The automatic detection of such defects could be used to provide users with suggestions for how to improve photos without the need to laboriously try various correction methods. Defect detection could also help users select photos of higher quality while filtering out those with severe defects in photo curation and summarization. To investigate this problem, we collected a large-scale dataset of user annotations on seven common photographic defects, which allows us to evaluate algorithms by measuring their consistency with human judgments. Our new dataset enables us to formulate the problem as a multi-task learning problem and train a multi-column deep convolutional neural network (CNN) to simultaneously predict the severity of all the defects. Unlike some existing single-defect estimation methods that rely on low-level statistics and may fail in many cases on natural photographs, our model is able to understand image contents and quality at a higher level. As a result, in our experiments, we show that our model has predictions with much higher consistency with human judgments than low-level methods as well as several baseline CNN models. Our model also performs better than an average human from our user study.

연구 동기 및 목표

  • 자연 이미지에서 여러 사진 결함을 동시에 감지할 수 있는 방법의 부족을 해결하기 위해.
  • 일곱 가지 일반적인 결함에 대해 심각도 점수를 부여한 대규모 인간 레이블링 데이터셋 12,853장의 수집을 위해.
  • 단일 결함 방법보다 정확도를 향상시키기 위해 병렬로 여러 종류의 결함을 예측할 수 있는 딥 러닝 모델 개발을 위해.
  • 결함 심각도와 위치를 예측하여 자동 사진 보정, 정렬, 품질 필터링 등의 애플리케이션을 가능하게 하기 위해.
  • 실제 인간 평가 기반의 딥 러닝 모델이 전통적인 통계 기반 방법과 기본 베이스라인 CNN보다 우수한 성능을 보임을 입증하기 위해.

제안 방법

  • 저자들은 일곱 가지 사진 결함—나쁜 노출, 나쁜 화이트 밸런스, 과도/부족 포화도, 노이즈, 안개, 원치 않는 블러, 나쁜 구성—에 대해 인간 레이블링을 통해 심각도 점수를 부여한 자연 이미지 12,853장의 데이터셋을 수집했다.
  • 문제를 다중 작업 학습 문제로 재정의하여, 전체 이미지 특징과 국소 이미지 패치를 모두 처리하는 다중 컬럼 CNN을 훈련시켰다.
  • 네트워크 아키텍처는 고수준의 콘텐츠 이해와 저수준의 통계적 특징을 균형 있게 유지하기 위해 전체 이미지 입력과 국소 패치 입력을 조합한다.
  • 모델은 각 결함에 대해 연속적인 심각도 점수를 예측하도록 훈련되었으며, 인간 레이블링과의 일관성을 최적화한 손실 함수를 사용했다.
  • 지역화를 위해 네트워크는 업샘플링을 통해 공간적으로 변화하는 결함 히트맵을 생성할 수 있도록 완전 컨volution 신경망(FCN)으로 변환되었다.
  • 모델 평가에는 인간 평가와의 일관성을 측정하기 위한 켄달의 순위 상관계수(ρ)를 사용하였으며, 실제 데이터와 합성 데이터에서 기준 방법과의 비교를 수행했다.
Figure 1: An illustration of detecting multiple photographic defects. For each defect (from left to right: bad exposure , bad white balance , over/under saturation , noise , haze , undesired blur , bad composition ), we report the relative ranking of a severity score in percentage, compared to all t
Figure 1: An illustration of detecting multiple photographic defects. For each defect (from left to right: bad exposure , bad white balance , over/under saturation , noise , haze , undesired blur , bad composition ), we report the relative ranking of a severity score in percentage, compared to all t

실험 결과

연구 질문

  • RQ1인간 레이블링 데이터 기반의 딥 러닝 모델은 저수준 통계 기반 방법보다 여러 사진 결함 감지에서 인간 평가와 더 높은 일관성을 달성할 수 있는가?
  • RQ2전체 이미지 및 국소 이미지 특징을 모두 활용하는 다중 컬럼 CNN은 단일 결함 추정 기반 모델보다 다중 결함 감지에서 더 우수한 성능을 보일 수 있는가?
  • RQ3제안된 모델은 합성 결함으로 일반화 가능한가? 실제 데이터와 합성 데이터 간 성능 비교는 어떻게 되는가?
  • RQ4모델의 성능은 평균 인간 사용자보다 결함 심각도 예측에서 뛰어나게 되는가?
  • RQ5모델은 공간적으로 인지 가능한 결함 지apap을 생성하여 결함이 있는 이미지 영역을 정확히 특정할 수 있는가?

주요 결과

  • 제안된 다중 컬럼 CNN 모델은 일곱 가지 결함에 대해 인간 평가와의 평균 켄달 순위 상관계수(ρ)가 0.956을 기록하여, 저수준 통계 기반 방법과 기본 베이스라인 CNN보다 유의미하게 뛰어난 성능을 보였다.
  • 네 명의 다른 레이블러의 기준값과의 순위 일관성 측정 결과, 모델은 평균 인간 사용자보다 결함 심각도 예측에서 뛰어난 성능을 보였다.
  • 합성 데이터에서는 다섯 가지 결함 유형에 대해 평균 ρ가 0.9568을 기록하여, 전반적인 결함에 대한 강력한 일반화 능력과 내구성을 입증했다.
  • 이전 방법이 실패한 과제들, 예를 들어 운동 블러와 얕은 초점 깊이를 구분하는 데서도 모델은 뛰어난 성능을 보였다.
  • 완전 컨볼루션 변환을 통해 공간적으로 변화하는 결함 지역화가 가능해졌으며, 과도하게 노출된 그림자나 흐릿한 얼굴과 같은 높은 결함 심각도 영역을 강조하는 히트맵을 생성했다.
  • 12,853장의 인간 레이블링이 된 이미지로 구성된 데이터셋은 향후 다중 결함 감지 및 이미지 품질 평가 연구를 지원하기 위해 공개되었다.
Figure 3: The histogram of the ground-truth severity scores for the bad exposure defect, shown with a coarse bin size (left) and with a fine bin size (right). Each bin in the left figure corresponds to a peak in the right figure. The hiogram has 11 peaks due to the discrete levels used in user annot
Figure 3: The histogram of the ground-truth severity scores for the bad exposure defect, shown with a coarse bin size (left) and with a fine bin size (right). Each bin in the left figure corresponds to a peak in the right figure. The hiogram has 11 peaks due to the discrete levels used in user annot

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.