[논문 리뷰] Diverse Image Inpainting with Bidirectional and Autoregressive Transformers
이 논문은 장거리 의존성과 이중 방향적 맥락을 모델링하기 위해 이중 방향 자동회귀 트랜스포머(BAT)를 사용하는 새로운 이미지 복원 프레임워크인 BAT-Fill을 제안한다. 순열된 시퀀스에서 자동회귀 모델링과 마스크된 언어 모델링(MLM)을 결합함으로써, 다양한 고해상도 이미지 생성이 가능해지며, CelebA-HQ, Places2 및 Paris StreetView 데이터셋에서 품질과 다양성 측면에서 최신 기술(SOTA)을 초월한다.
Image inpainting is an underdetermined inverse problem, which naturally allows diverse contents to fill up the missing or corrupted regions realistically. Prevalent approaches using convolutional neural networks (CNNs) can synthesize visually pleasant contents, but CNNs suffer from limited perception fields for capturing global features. With image-level attention, transformers enable to model long-range dependencies and generate diverse contents with autoregressive modeling of pixel-sequence distributions. However, the unidirectional attention in autoregressive transformers is suboptimal as corrupted image regions may have arbitrary shapes with contexts from any direction. We propose BAT-Fill, an innovative image inpainting framework that introduces a novel bidirectional autoregressive transformer (BAT) for image inpainting. BAT utilizes the transformers to learn autoregressive distributions, which naturally allows the diverse generation of missing contents. In addition, it incorporates the masked language model like BERT, which enables bidirectionally modeling of contextual information of missing regions for better image completion. Extensive experiments over multiple datasets show that BAT-Fill achieves superior diversity and fidelity in image inpainting qualitatively and quantitatively.
연구 동기 및 목표
- 크고 비정형적인 손실 영역이 존재하는 상황에서 다양한 동시에 현실적인 이미지 복원을 생성하는 데 도전한다.
- 자동회귀 트랜스포머의 단방향 어텐션과 MLM 기반 모델의 독립적 예측 방식의 한계를 극복한다.
- 출력 의존성과 이중 방향 맥락 통합을 통해 이미지 복원의 글로벌 맥락 모델링과 구조적 일관성을 향상시킨다.
- BAT를 통해 일관된 구조를 먼저 생성하고, 이후 CNN 기반 생성기로 질감을 정밀하게 보정하는 이중 단계 프레임워크를 개발한다.
제안 방법
- 손실된 픽셀에 대해 과거와 미래 맥락을 모두 모델링할 수 있도록 입력 시퀀스를 순열하는 이중 방향 자동회귀 트랜스포머(BAT)를 제안한다.
- 이중 단계 학습 절차를 적용한다: 첫 번째 단계에서 BAT는 자동회귀 모델링을 통해 다양한 일관성 있는 이미지 구조를 생성하고, 두 번째 단계에서 CNN 기반 질감 생성기가 고주파 세부 정보로 결과를 정밀하게 보정한다.
- BERT와 유사한 마스크된 언어 모델링(MLM)을 적용하여 이중 방향 맥락을 활용해 손실된 토큰을 재구성함으로써 맥락 인식 능력을 향상시킨다.
- 유효한 픽셀과 손실된 픽셀을 정렬하는 시퀀스 순열 전략을 도입하여, 자동회귀 생성이 첫 번째 손실 토큰에서 시작되면서도 모든 가용 맥락에 조건을 부여할 수 있도록 한다.
- 출력 의존성을 강제하는 자동회귀 모델링을 통합하여 예측 토큰 간의 일관성을 확보한다.
- 재구성 손실과 적대적 손실을 함께 학습하여 현실감과 구조적 정확도를 향상시킨다.
실험 결과
연구 질문
- RQ1이중 방향 맥락 모델링과 자동회귀 생성을 통합한 트랜스포머 기반 아키텍처가 단방향 자동회귀 모델보다 더 다양한 일관성 있는 이미지 복원 결과를 도출할 수 있는가?
- RQ2자동회귀 모델링과 마스크된 언어 모델링(MLM)의 통합이 이미지 복원의 품질과 다양성에 어떻게 기여하는가?
- RQ3제안된 BAT-Fill 프레임워크가 이미지 품질과 구조적 다양성 측면에서 기존 최신 기술(SOTA) 방법을 얼마나 뛰어나게 성능을 내는가?
- RQ4이중 단계 설계—즉, 구조 생성 후 질감 보정—이 종단 간 접근 방식에 비해 전체 이미지 복원 품질을 향상시키는가?
주요 결과
- BAT-Fill은 CelebA-HQ, Places2 및 Paris StreetView에서 최신 기술(SOTA) 성능을 달성하였으며, Paris StreetView에서 20-40% 마스크 시 FID 점수 36.19, 40-60% 마스크 시 64.20, 랜덤 마스크 시 48.19를 기록하여 확률적 및 다각적 방법을 모두 압도한다.
- 제거 실험 결과, BAT는 재구성 품질을 크게 향상시켜 FID: 40.91을 달성하였고, 높은 다양성(LPIPS: 0.0301)을 유지하였으며, 이중 방향 맥락(모델 없이 FID: 59.60)이나 자동회귀 모델링(모델 없이 FID: 49.62)을 제거한 경우보다 우수한 성능을 보였다.
- 20-40% 마스크 조건에서 Paris StreetView에서 PSNR 26.52, SSIM 0.864를 기록하여 강력한 품질 유지와 함께 높은 다양성을 동시에 확보하였다.
- LPIPS 점수 0.076(20-40%), 0.147(40-60%), 0.106(랜덤)는 BAT-Fill이 강력한 다각적 복원 기준인 PIC보다 더 시각적으로 다양한 결과를 생성함을 시사한다.
- 이중 단계 설계 덕분에 더 나은 질감 합성이 가능했으며, PIC 대비 더 낮은 ℓ₁ 손실(2.70%)과 높은 PSNR(26.52)를 기록하였다. 반면 PIC는 ℓ₁: 3.43%, PSNR: 24.80을 기록하였다.
- 제거 실험 결과, 자동회귀 모델링을 제거하면 FID는 49.62로 낮아지지만 다양성(LPIPS: 0.0304)도 감소하였고, 이중 방향 맥락을 제거하면 FID가 급격히 59.60으로 증가하여 두 구성 요소의 중요성을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.