[논문 리뷰] InstaFormer: Instance-Aware Image-to-Image Translation with Transformer
InstaFormer는 자기주의 어텐션을 사용하여 전역적이고 개체 수준의 특징을 동시에 모델링하는 트랜스포머 기반 아키텍처를 제안하며, 개체 수준 번역 정밀도를 향상시킨다. 개체 수준의 콘텐츠 대비 손실과 적응형 개체 정규화(AdaIN)를 통합함으로써 콘텐츠가 풍부한 시나리오 번역과 도메인 적응형 객체 검출에서 최신 기술 수준의 성능을 달성한다.
We present a novel Transformer-based network architecture for instance-aware image-to-image translation, dubbed InstaFormer, to effectively integrate global- and instance-level information. By considering extracted content features from an image as tokens, our networks discover global consensus of content features by considering context information through a self-attention module in Transformers. By augmenting such tokens with an instance-level feature extracted from the content feature with respect to bounding box information, our framework is capable of learning an interaction between object instances and the global image, thus boosting the instance-awareness. We replace layer normalization (LayerNorm) in standard Transformers with adaptive instance normalization (AdaIN) to enable a multi-modal translation with style codes. In addition, to improve the instance-awareness and translation quality at object regions, we present an instance-level content contrastive loss defined between input and translated image. We conduct experiments to demonstrate the effectiveness of our InstaFormer over the latest methods and provide extensive ablation studies.
연구 동기 및 목표
- 다수의 개체 인스턴스를 포함한 콘텐츠가 풍부한 시나리오를 다루는 데에 있어 기존 이미지 간 번역 방법의 한계를 해결한다.
- 개체 인스턴스 간 상호작용과 전역 이미지 컨텍스트를 모델링하여 번역에서의 개체 인식 능력을 향상시킨다.
- 새로운 개체 수준의 콘텐츠 대비 손실을 통해 개체 영역의 번역 품질을 향상시킨다.
- 스타일 코드를 사용하여 다중 모달 번역을 가능하게 하기 위해 트랜스포머 인코더에서 LayerNorm을 AdaIN으로 대체한다.
- 도메인 적응형 객체 검출과 같은 후행 작업에서 뛰어난 성능을 입증한다.
제안 방법
- 이미지에서 추출한 콘텐츠 특징을 트랜스포머 인코더의 토큰으로 간주하여 자기주의 어텐션을 통해 전역적 컨텍스트를 모델링한다.
- 바운딩 박스 정보를 활용해 콘텐츠 특징에서 유도된 개체 수준의 특징을 전역 토큰에 통합하여 개체 인식 표현을 향상시킨다.
- 위치 임베딩을 통합하여 전역 및 개체 수준의 패치를 함께 모델링하여 공간 인식 능력을 향상시킨다.
- 다중 모달 번역을 지원하기 위해 표준 LayerNorm을 적응형 개체 정규화(AdaIN)로 대체한다.
- 계산 비용을 줄이기 위해 트랜스포머의 입력과 출력에 컨볼루션 패치 임베딩 및 디컨볼루션 모듈을 적용한다.
- 입력 이미지와 번역된 이미지 간에 개체 수준의 콘텐츠 대비 손실을 도입하여 개체 영역에서의 특징 정렬을 향상시킨다.

실험 결과
연구 질문
- RQ1트랜스포머 기반 아키텍처가 개체 인식 이미지 간 번역에 있어 전역적 특징과 개체 수준 특징을 효과적으로 통합할 수 있는가?
- RQ2제안된 개체 수준의 대비 손실이 표준 대비 손실 대비 개체 수준의 번역 정밀도를 얼마나 향상시키는가?
- RQ3사이클 일관성이 없을 경우 LayerNorm을 AdaIN으로 대체하는 것이 다중 모달 번역 능력을 얼마나 향상시키는가?
- RQ4InstaFormer은 기존 최신 기술 수준의 방법들과 비교해 도메인 적응형 객체 검출과 같은 후행 작업에서 어떻게 성능을 발휘하는가?
- RQ5각 구성 요소(예: 트랜스포머 인코더, 대비 손실, AdaIN)가 전체 번역 품질과 개체 인식 능력에 기여하는 정도는 어떠한가?
주요 결과
- InstaFormer는 개체 인식 이미지 간 번역 벤치마크에서 CUT, DUNIT, MGUIT를 모두 능가하는 최신 기술 수준의 성능을 달성한다.
- 제거 실험 결과, 개체 수준의 대비 손실이 복잡한 시나리오에서 특히 두드러지게 개체 수준의 선명도를 향상시키고 흐림을 감소시킴을 확인한다.
- 트랜스포머 인코더를 MLP-Mixer로 대체해도 유사한 성능을 기록함으로써 프레임워크가 백본 선택에 대해 강건함을 입증한다.
- KITTI→Cityscapes 도메인 적응 검출 벤치마크에서 mAP 55.5를 기록하여 DUNIT(54.1)과 MGUIT(54.6)를 모두 초월한다.
- 인간 평가 결과, InstaFormer가 전반적인 이미지 품질, 의미 일관성, 스타일 일관성에서 베이스라인들을 능가함을 확인한다.
- AdaIN 제거 시 단일 모달 출력과 스타일 보존 능력 저하가 발생함을 확인하여 다중 모달 번역에서 AdaIN의 중요성을 입증한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.