Skip to main content
QUICK REVIEW

[논문 리뷰] Coloring with Words: Guiding Image Colorization Through Text-based Palette Generation

Hyojin Bahng, Seungjoo Yoo|arXiv (Cornell University)|2018. 04. 11.
Generative Adversarial Networks and Image Synthesis인용 수 4
한 줄 요약

이 논문은 풍부한 텍스트 입력(예: 어휘나 문장)으로부터 다수의 다양하고 의미적으로 일치하는 색상 팔레트를 생성하고, 이를 바탕으로 고품질의 이미지 색상화를 유도하는 조건부 GAN 프레임워크인 Text2Colors를 제안한다. 인간 선호도 연구에서 모델는 지표 팔레트를 능가하며, 사용자의 56.2%가 실제 팔레트보다 생성된 팔레트를 선호함으로써 의미적 일치성과 다중모odal 색상 생성 능력이 효과적임을 입증한다.

ABSTRACT

This paper proposes a novel approach to generate multiple color palettes that reflect the semantics of input text and then colorize a given grayscale image according to the generated color palette. In contrast to existing approaches, our model can understand rich text, whether it is a single word, a phrase, or a sentence, and generate multiple possible palettes from it. For this task, we introduce our manually curated dataset called Palette-and-Text (PAT). Our proposed model called Text2Colors consists of two conditional generative adversarial networks: the text-to-palette generation networks and the palette-based colorization networks. The former captures the semantics of the text input and produce relevant color palettes. The latter colorizes a grayscale image using the generated color palette. Our evaluation results show that people preferred our generated palettes over ground truth palettes and that our model can effectively reflect the given palette when colorizing an image.

연구 동기 및 목표

  • 풍부한 텍스트 입력(예: 어휘나 문장)으로부터 단일 단어나 고정된 데이터셋에 국한되지 않는 다수의 의미적으로 관련된 색상 팔레트를 생성할 수 있도록 하는 것.
  • 한 번의 텍스트 입력으로부터 다양한 팔레트를 생성하여 색상 인식의 다중모달성을 반영함으로써, 인간이 의미 개념을 어떻게 다양하게 인식하는지 반영하는 것.
  • 텍스트에서 팔레트 생성과 팔레트 기반 이미지 색상화를 통합한 통합 프레임워크를 개발하여, 팔레트에서 이미지로의 색상 전이가 충실하게 유지되도록 하는 것.
  • 학습 및 평가를 지원하기 위해 인간이 수작업으로 구성한 10,183개의 텍스트-팔레트 쌍을 포함한 새로운 벤치마크 데이터셋인 Palette-and-Text (PAT)을 구축하는 것.

제안 방법

  • 모델는 두 개의 조건부 GAN을 사용한다: 텍스트 임베딩을 다수의 다양한 색상 팔레트로 매핑하는 텍스트-팔레트 생성기(TPN)와 생성된 팔레트를 사용해 회색조 이미지를 색상화하는 팔레트 기반 색상화 네트워크(PCN).
  • TPN은 동일한 텍스트 입력에서 다양한 팔레트를 생성하기 위해 조건부 증강(conditioning augmentation)을 적용하여 색상 의미의 다중모달성을 반영한다.
  • PCN은 U-Net 아키텍처의 스킵 커넥션 레이어에 생성된 팔레트를 통합하여 색상 전파의 정밀성과 색상화 과정에서의 의미 일致성을 보장한다.
  • 두 네트워크에 조건부 적대적 손실(conditional adversarial loss)을 적용하여 생성된 팔레트와 색상화된 이미지가 입력 텍스트와 일치하고 시각적 품질을 유지하도록 보장한다.
  • 모델는 수작업으로 구성된 인간 커리티드 데이터셋인 수동으로 구성된 Palette-and-Text (PAT) 데이터셋을 기반으로 엔드 투 엔드로 훈련되며, 이는 다단어 텍스트와 다색 팔레트의 10,183개의 쌍을 포함한다.
  • 사용자 평가를 통해 팔레트 품질과 색상화 성능을 검증하였으며, 사용자들은 생성된 출력을 지표 및 기준 모델과 비교하였다.

실험 결과

연구 질문

  • RQ1딥 러닝 생성 모델이 어휘나 문장과 같은 풍부한 텍스트 입력으로부터 단일 단어가 아닌, 다수의 다양하고 의미적으로 관련된 색상 팔레트를 생성할 수 있는가?
  • RQ2생성된 색상 팔레트가 입력 텍스트의 의미적 의미와 얼마나 잘 일치하는가? 특히 인간이 수작업으로 구성한 지표 팔레트와 비교하여.
  • RQ3팔레트 기반 색상화 네트워크가 최종 이미지 출력에서 생성된 팔레트의 색상과 의미를 얼마나 충실하게 반영할 수 있는가?
  • RQ4모델가 사진과 무늬 등 다양한 이미지 유형에 대해 일반화할 수 있는가? 이때 색상화 과정에서 의미 일치성이 유지되는가?
  • RQ5다섯 가지 색상 팔레트 색상만을 사용할 경우, 제안된 모델의 성능이 최신 기술 기준 색상화 모델과 비교해 어떻게 되는가?

주요 결과

  • 텍스트-팔레트 생성기(TPN)는 사용자 선호도 연구에서 56.2%의 오염률(fooling rate)을 기록하여, 참가자들이 실제 팔레트보다 생성된 팔레트를 더 선호하는 경우가 절반 이상임을 나타낸다.
  • 팔레트 기반 색상화 네트워크(PCN)는 313개의 ab 감도 영역 대비 다섯 색상만을 사용할 때에도 최신 기술 기준 모델보다 더 높은 품질의 색상화 결과를 도출하였다.
  • 사용자 평가에서 PCN은 팔레트의 다양한 색상을 이미지에 효과적으로 적용하였으며, 팔레트 활용도 및 시각적 품질에 대한 5점 리커트 척도 질문 전반에서 높은 점수를 기록하였다.
  • 모델는 강력한 다중모달 생성 능력을 보였으며, 동일한 텍스트 입력에서 다수의 타당한 팔레트를 생성하여 인간의 색상 인식에서 내재된 모호성을 반영하였다.
  • 10,183개의 수작업으로 구성된 텍스트-팔레트 쌍을 포함한 제안된 Palette-and-Text (PAT) 데이터셋은 텍스트 기반 색상 생성의 학습 및 평가를 가능하게 하여 향후 의미 기반 색상 추천 분야의 연구를 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.