Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Koalarization: Image Colorization using CNNs and Inception-ResNet-v2

Federico Baldassarre, Diego González Morín|arXiv (Cornell University)|2017. 12. 09.
Generative Adversarial Networks and Image Synthesis참고 문헌 20인용 수 84
한 줄 요약

CNN 기반 색상화 모델은 Scratch에서 학습된 인코더와 Inception-ResNet-v2의 고수준 특징을 결합하여 엔드투엔드 완전 컨볼루션 프레임워크에서 회색조 이미지를 색상화하고 사용자 연구를 통해 공개 수용성을 평가합니다.

ABSTRACT

We review some of the most recent approaches to colorize gray-scale images using deep learning methods. Inspired by these, we propose a model which combines a deep Convolutional Neural Network trained from scratch with high-level features extracted from the Inception-ResNet-v2 pre-trained model. Thanks to its fully convolutional architecture, our encoder-decoder model can process images of any size and aspect ratio. Other than presenting the training results, we assess the "public acceptance" of the generated images by means of a user study. Finally, we present a carousel of applications on different types of images, such as historical photographs.

연구 동기 및 목표

  • 자동 이미지 색상화를 위한 엔드-투-엔드 딥러닝 접근 방식 탐구.
  • 사전 학습된 Inception-ResNet-v2로부터의 고수준 의미 특징을 색상 추정에 활용.
  • 다양한 크기와 종횡비를 처리하는 완전 컨볼루션 인코더-디코더 아키텍처를 개발.
  • 사람 사용자 연구를 통해 생성 색상의 가능성을 평가.
  • 역사적 사진 및 기타 이미지 유형에 대한 응용 사례를 보여줌.

제안 방법

  • L*a*b* 색공간(CIE L*a*b* space)을 사용하고 input 이미지에서 명도(L*)를 기준으로 a* 및 b* 채널을 예측.
  • 299x299의 스택된 명도 이미지를 입력시 pre-trained Inception-ResNet-v2로부터 중/상위 레벨 특징 임베딩을 추출.
  • 임베딩을 공간 위치에 걸쳐 복제하는 융합 계층을 통해 인셉션 임베딩과 인코더 특징을 융합.
  • 8개의 3x3 컨브 레이어로 인코더를 학습시켜 512-채널의 H/8 x W/8 피처 맵을 생성.
  • 업샘플링과 컨볼루션으로 2채널 a*b* 맵을 출력하고 L*와 결합하여 색상 이미지를 형성.
  • Adam 옵티마이저를 사용하여 예측된 및 그라운드-truth a*b* 구성 요소 간의 평균 제곱 오차를 최적화.

실험 결과

연구 질문

  • RQ1사전 학습 네트워크의 고수준 특징으로 guided될 때 CNN 기반 인코더-디코더 색상화 모델이 실제 사진처럼 보이는 색상 이미지를 생성할 수 있는가?
  • RQ2Inception-ResNet-v2 임베딩을 통합하는 것이 순수하게 학습된 인코더보다 색상화 성능을 향상시키는가?
  • RQ3제안된 아키텍처가 서로 다른 크기와 종횡비의 이미지에서 어떻게 동작하는가?
  • RQ4인간 평가자가 측정한 색상화 이미지의 인지적 현실감은 어느 정도인가?
  • RQ5모델이 역사 사진에 색상을 부여할 수 있는가, 그리고 한계는 무엇인가?

주요 결과

  • 일부 이미지는 해상도에 가까운 색상화를 생성할 수 있으며, 구름, 바다, 숲과 같은 고수준 특징이 인식될 때 특히 그렇다.
  • 일부 결과는 특정 영역에서 색 포화가 제한되고 보수적이며 회색빛 색조를 보인다.
  • 사용자 연구에서 공개 수용성은 관찰자를 속일 정도의 비율이 무시하지 못할 정도로 나타나 선택된 이미지에 대해 신뢰할 만한 색상화를 시사한다.
  • 다른 방법과의 비교에서 제안된 접근이 일부 경우에서 우수하고 다른 경우에는 콘텐츠에 따라 미흡한 경우가 있음.
  • 완전 컨볼루션 설계로 인해 다양한 크기의 이미지 처리 가능하며, 학습에 작은 ImageNet 서브셋을 사용했다.
  • 역사 사진은 색을 입힐 수 있으며 ground truth가 없는 주관적 평가를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.