Skip to main content
QUICK REVIEW

[논문 리뷰] ITTR: Unpaired Image-to-Image Translation with Transformers

Wanfeng Zheng, Qiang Li|arXiv (Cornell University)|2022. 03. 30.
Multimodal Machine Learning Applications인용 수 12
한 줄 요약

이 논문은 비쌍화 이미지 간 번역을 위한 비전 트랜스포머 기반 아키텍처인 ITTR을 제안한다. 이는 국소적이고 전역적인 맥락을 포착하기 위해 하이브리드 인지 블록(HPB)을 결합하고, 계산 비용을 줄이기 위해 이중 정렬된 자기주의(DPSA)를 사용한다. ITTR는 여섯 가지 벤치마크에서 최신 기술 성능(SOTA)을 달성하며, FID와 DRN-Score 모두에서 이전 방법을 능가하면서도 효율성을 유지한다.

ABSTRACT

Unpaired image-to-image translation is to translate an image from a source domain to a target domain without paired training data. By utilizing CNN in extracting local semantics, various techniques have been developed to improve the translation performance. However, CNN-based generators lack the ability to capture long-range dependency to well exploit global semantics. Recently, Vision Transformers have been widely investigated for recognition tasks. Though appealing, it is inappropriate to simply transfer a recognition-based vision transformer to image-to-image translation due to the generation difficulty and the computation limitation. In this paper, we propose an effective and efficient architecture for unpaired Image-to-Image Translation with Transformers (ITTR). It has two main designs: 1) hybrid perception block (HPB) for token mixing from different receptive fields to utilize global semantics; 2) dual pruned self-attention (DPSA) to sharply reduce the computational complexity. Our ITTR outperforms the state-of-the-arts for unpaired image-to-image translation on six benchmark datasets.

연구 동기 및 목표

  • 비쌍화 이미지 간 번역 작업에서 CNN 기반 생성기의 장거리 의존성 포착 능력에 한계가 있음을 해결하기 위해.
  • 이미지 번역 작업에서 인식 기반 비전 트랜스포머의 높은 계산 비용과 생성 불안정성을 극복하기 위해.
  • 전역 맥락 모델링과 계산 효율성의 균형을 잡은 효율적이고 효과적인 트랜스포머 기반 생성기를 설계하기 위해.
  • 강력한 정량적 및 정성적 결과를 바탕으로 다양한 비쌍화 이미지 번역 벤치마크에서 제안된 아키텍처를 검증하기 위해.

제안 방법

  • 하이브리드 인지 블록(HPB)은 국소적 특징 추출을 위한 딥워이즈 컨볼루션 브랜치와 전역 맥락 모델링을 위한 자기주의 브랜치를 통합하여, 다중 수용 영역 특징 융합을 가능하게 한다.
  • 이중 정렬된 자기주의(DPSA)는 주의 맵을 계산하기 전에 행 및 열 방향으로 기여도가 낮은 토큰을 평가하고 제거하여 자기주의 복잡도를 감소시킨다.
  • DPSA에서 쿼리 및 키 행렬에 토큰 단위 L2 정규화를 적용하여 학습 안정성을 향상시키고 붕괴를 방지함으로써 신뢰할 수 있는 주의 학습을 보장한다.
  • 생성기 아키텍처는 원본 도메인과 타겟 도메인의 비쌍화 데이터를 활용하여 사이클 일致성과 아이덴티티 손실을 기반으로 엔드 투 엔드로 훈련된다.
  • DPSA는 학습 가능한 기여도 점수를 활용해 희소한 토큰 선택을 통해 FLOPs를 감소시키면서도 성능을 유지한다.
  • 모델은 표준 GAN 목표 함수를 사용하여 최적화되며, 여섯 가지 표준 비쌍화 번역 벤치마크에서 평가된다.

실험 결과

연구 질문

  • RQ1비전 트랜스포머 기반 생성기가 장거리 의존성을 포착함으로써 CNN 기반 생성기보다 비쌍화 이미지 간 번역에서 우월한 성능을 낼 수 있는가?
  • RQ2비전 트랜스포머의 자기주의에서 계산 비용을 줄이되 번역 품질을 손상시키지 않으려면 어떻게 해야 하는가?
  • RQ3한 개의 블록에 국소 인지(CNN)와 전역 주의(트랜스포머)를 융합할 경우 이미지 번역에 어떤 영향을 미치는가?
  • RQ4자기주의에서 토큰 정렬이 번역 작업에서 의미 일致성과 이미지 품질을 유지하거나 향상시키는가?
  • RQ5FID, DRN-Score 및 추론 효율성 측면에서 제안된 아키텍처는 최신 기술 방법과 비교해 어떻게 성능을 낼 수 있는가?

주요 결과

  • ITTR는 여섯 가지 비쌍화 이미지 간 번역 벤치마크에서 최신 기술 성능을 달성하며, FID와 DRN-Score 모두에서 이전 방법을 능가한다.
  • Horse→Zebra 및 Cityscapes 데이터셋에서 ITTR는 각각 FID 점수 45.1과 33.6을 기록하여 CUT와 LSeSim을 초월한다.
  • 절단 실험을 통해 HPB의 국소 인지 브랜치를 제거할 경우 성능 저하가 발생함(45.7 → 48.6)을 확인하여, 도메인 간 격차 감소에 있어 그 중요성을 입증한다.
  • DPSA는 계산 복잡도를 크게 감소시켰다: ITTR 생성기는 단지 45.8 G MACs를 사용하며, CUT 및 LSeSim보다 낮은 계산량이지만 더 낮은 FID를 달성한다.
  • 쿼리(Q)와 키(K)에 토큰 단위 L2 정규화를 적용하지 않을 경우 모델이 붕괴되며, 이는 학습 안정성에 있어 그 핵심적인 역할을 함을 시사한다.
  • DPSA에서 8×8 희소 토큰이 최적의 성능을 낸다; 더 큰 토큰 수(예: 16×16)는 정렬 효과 감소와 소프트맥스 스무딩으로 인해 성능 저하를 초래한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.