Skip to main content
QUICK REVIEW

[논문 리뷰] Colorization Transformer

M. P. Pavan Kumar, Dirk Weissenborn|arXiv (Cornell University)|2021. 02. 08.
Generative Adversarial Networks and Image Synthesis참고 문헌 33인용 수 5
한 줄 요약

컬러라이제이션 트랜스포머(ColTran)는 조건부 트랜스포머 레이어와 3단계 프로세스를 사용하여 고해상도, 다양한 이미지 컬러라이제이션을 위한 새로운 완전히 자기주의적 어텐션 기반 아키텍처를 도입한다: 저해상도에서의 코arse 순차적 컬러라이제이션, 그 다음에 공간적 및 색상 슈퍼리졸루션을 병렬로 수행한다. 이는 Mechanical Turk 평가에서 FID 19.37을 기록하며 최신 기준 성능을 달성했고, 실제 이미지보다 인간 선호도에서 62%의 경우에서 승리한다.

ABSTRACT

We present the Colorization Transformer, a novel approach for diverse high fidelity image colorization based on self-attention. Given a grayscale image, the colorization proceeds in three steps. We first use a conditional autoregressive transformer to produce a low resolution coarse coloring of the grayscale image. Our architecture adopts conditional transformer layers to effectively condition grayscale input. Two subsequent fully parallel networks upsample the coarse colored low resolution image into a finely colored high resolution image. Sampling from the Colorization Transformer produces diverse colorings whose fidelity outperforms the previous state-of-the-art on colorising ImageNet based on FID results and based on a human evaluation in a Mechanical Turk test. Remarkably, in more than 60% of cases human evaluators prefer the highest rated among three generated colorings over the ground truth. The code and pre-trained checkpoints for Colorization Transformer are publicly available at https://github.com/google-research/google-research/tree/master/coltran

연구 동기 및 목표

  • 딥 러닝을 사용하여 회색조 이미지에 대해 다양하고 고해상도의 컬러라이제이션을 생성하는 도전 과제를 해결한다.
  • 이전의 순차적 및 CNN 기반 모델이 전반적인 맥락을 포착하고 시각적으로 현실적인 출력을 생성하는 데에 한계를 가진 점을 극복한다.
  • 조건부 어텐션 메커니즘을 통해 효율적이고 고해상도의 컬러라이제이션을 가능하게 하는 트랜스포머 기반 아키텍처를 개발한다.
  • 순차적 모델링과 병렬 슈퍼리졸루션을 조합하여 더 빠르고 고성능의 추론을 가능하게 함으로써 기존 방법을 향상시킨다.
  • 모델이 생성한 컬러라이제이션 이미지가 인간 평가에서 실제 이미지보다 선호될 수 있음을 입증함으로써, 시각적 현실감을 보여준다.

제안 방법

  • 조건부 축 방향 트랜스포머를 사용하여 저해상도(64×64)에서 순차적 컬러라이제이션을 수행하며, 조건부 적용은 자기주의 어텐션 레이어 내의 학습 가능한 픽셀별 및 채널별 구성요소를 통해 이루어진다.
  • 학습 가능한 구성요소를 통해 그레이스케일 입력을 명시적으로 통합하는 조건부 트랜스포머 레이어를 도입하여, 단순한 입력 덧셈보다 더 높은 조건부 정밀도를 확보한다.
  • 고해상도(256×256) 컬러라이제이션을 세 단계로 분해한다: 코어스 순차적 컬러라이제이션, 그 다음에 공간적 및 색상 슈퍼리졸루션을 위한 두 개의 병렬 완전 연결 네트워크.
  • 축 방향 트랜스포머에서 반복적 샘플링을 부분적으로 병렬화하여 추론 속도를 향상시키면서도 고품질 순차적 생성을 유지한다.
  • 코어스 컬러라이제이션 모델과 함께 공동으로 훈련되는 보조 병렬 예측 모델을 사용하여, 향상된 특징 학습을 통해 FID 점수를 향상시킨다.
  • 최종 고해상도 출력을 위한 빠르고 결정론적인 업샘플링을 적용하여 256×256 해상도에서 효율적인 생성을 가능하게 한다.

실험 결과

연구 질문

  • RQ1자기주의 어텐션 기반 모델이 다양성과 고해상도를 유지하면서도 이미지 컬러라이제이션에서 최신 기준 성능을 달성할 수 있는가?
  • RQ2트랜스포머 레이어 내의 학습 가능한 구성요소를 통한 명시적 조건부 적용은 순차적 컬러라이제이션에서 입력 편향 또는 덧셈 조건부 적용보다 어떻게 비교되는가?
  • RQ3보조 슈퍼리졸루션 모델과 함께 공동 훈련하는 것이 컬러라이제이션 품질과 FID 점수에 어느 정도 기여하는가?
  • RQ4축 어텐션을 사용하는 순차적 트랜스포머가 커널 또는 복잡한 어텐션 메커니즘 없이도 고해상도 컬러라이제이션을 효율적으로 생성할 수 있는가?
  • RQ5사람들이 생성된 컬러라이제이션 이미지와 실제 이미지 간의 현실감과 시각적 품질에서 어떤 선호도를 보이는가?

주요 결과

  • ColTran은 ImageNet 256×256 그레이스케일 이미지에서 기존 최고 성능(FID 19.37)을 달성하여, 이전 방법들인 PixColor(24.32)와 cINN(25.13)을 크게 앞서간다.
  • Mechanical Turk 2AFC 테스트에서 모델의 최상의 3개 컬러라이제이션은 실제 이미지보다 62.0%의 경우에서 선호되며, 이는 더 뛰어난 시각적 현실감을 의미한다.
  • ColTran-B(입력 덧셈을 사용한 기본 축 트랜스포머)는 FID 19.98을 기록했고, 28×28에서 훈련된 ColTran-S는 FID 22.06을 기록하여, 더 높은 해상도의 순차적 모델링이 유의미한 이점을 제공함을 보여준다.
  • 로그-가능도와 FID 사이에 중간 정도의 양의 상관관계(0.57)가 존재하며, 이는 개선된 가능도 모델링이 더 나은 시각적 품질로 이어짐을 시사한다.
  • 시각화 결과는 물체 경계와 복잡한 무늬에서 높은 불확실성을 보이며, 이는 모델이 모호한 색상 전이에 대해 추론하는 것을 학습했음을 확인한다.
  • 보조 병렬 예측 모델은 FID 향상에 기여하여, 훈련 중 특징 표현과 색상 정확도 향상에 기여함을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.