[논문 리뷰] Reduce Information Loss in Transformers for Pluralistic Image Inpainting
이 논문은 입력의 다운샘플링과 양자화를 피함으로써 정보 손실을 최소화하는 새로운 트랜스포머 기반 프레임워크 PUT을 제안한다. 비중첩적인 특징 인코딩을 위해 패치 기반 VQ-VAE(P-VQVAE)를 사용하고, 양자화되지 않은 특징을 처리하지만 양자화 토큰을 예측하는 비양자화 트랜스포머(UQ-Transformer)를 적용하여, 특히 큰 크기와 복잡한 마스킹 영역에서 최고 수준의 정밀도를 달성한다.
Transformers have achieved great success in pluralistic image inpainting recently. However, we find existing transformer based solutions regard each pixel as a token, thus suffer from information loss issue from two aspects: 1) They downsample the input image into much lower resolutions for efficiency consideration, incurring information loss and extra misalignment for the boundaries of masked regions. 2) They quantize $256^3$ RGB pixels to a small number (such as 512) of quantized pixels. The indices of quantized pixels are used as tokens for the inputs and prediction targets of transformer. Although an extra CNN network is used to upsample and refine the low-resolution results, it is difficult to retrieve the lost information back.To keep input information as much as possible, we propose a new transformer based framework "PUT". Specifically, to avoid input downsampling while maintaining the computation efficiency, we design a patch-based auto-encoder P-VQVAE, where the encoder converts the masked image into non-overlapped patch tokens and the decoder recovers the masked regions from inpainted tokens while keeping the unmasked regions unchanged. To eliminate the information loss caused by quantization, an Un-Quantized Transformer (UQ-Transformer) is applied, which directly takes the features from P-VQVAE encoder as input without quantization and regards the quantized tokens only as prediction targets. Extensive experiments show that PUT greatly outperforms state-of-the-art methods on image fidelity, especially for large masked regions and complex large-scale datasets. Code is available at https://github.com/liuqk3/PUT
연구 동기 및 목표
- 입력의 다운샘플링과 픽셀 양자화로 인한 트랜스포머 기반 복수 이미지 보정에서의 정보 손실 문제를 해결하기 위해.
- 특히 마스킹 영역 경계에서 고해상도 이미지 세부 정보와 공간 정렬을 유지하기 위해.
- 특히 ImageNet과 같은 대규모 데이터셋에서 큰 복잡한 영역에서의 보정 정밀도와 다양성을 향상시키기 위해.
- 비양자화된 트랜스포머를 위한 학습 전략을 설계하여, 학습 중 무작위 양자화를 통해 이산 토큰 예측이 가능하도록 하기 위해.
- 기존 방법에서 흔히 발생하는 고해상도 및 저해상도 표현 간의 정렬 오류를 제거하기 위해.
제안 방법
- 입력을 다운샘플링하지 않고도 패치 기반의 비중첩 자동에코더인 P-VQVAE를 도입하여 이미지 패치를 잠재 특징으로 인코딩한다.
- 마스킹된 영역과 마스킹되지 않은 영역을 별도로 표현하기 위해 P-VQVAE에 이중 코드북을 도입하여 특징의 분리도 향상시킨다.
- P-VQVAE의 디코더를 사용해 마스킹된 영역를 재구성하면서도 마스킹되지 않은 영역는 그대로 유지한다.
- 비양자화된 특징 벡터를 입력으로 받지만 예측은 양자화된 토큰을 대상으로 하는 UQ-Transformer를 제안하여, 양자화로 인한 정보 손실을 방지한다.
- 학습 중에 입력 특징을 무작위로 양자화하여 추론 조건을 시뮬레이션함으로써, 추론 시 전체적으로 양자화하지 않아도 정확한 생성이 가능하도록 한다.
- 네트워크 전반에 걸쳐 고해상도 입력을 유지하여 입력과 예측 간의 해상도 정렬 오류를 제거한다.
실험 결과
연구 질문
- RQ1트랜스포머 기반 모델에서 입력의 다운샘플링과 양자화를 피하면 이미지 보정 정밀도가 향상되는가?
- RQ2트랜스포머에서 비양자화된 특징을 처리하면 생성된 이미지 영역의 품질과 다양성에 어떤 영향을 미치는가?
- RQ3자동에코더에서 비중첩 패치 설계를 사용할 경우 마스킹된 영역와 마스킹되지 않은 영역 간 간섭을 어느 정도 줄일 수 있는가?
- RQ4UQ-Transformer의 학습 중 무작위 양자화가 이산 토큰 예측을 가능하게 하면서도 특징의 정밀도를 유지하는 데 효과적인가?
- RQ5PUT은 비정규적 형태이거나 큰 마스킹 영역을 처리할 때 기존 방법과 비교해 어떻게 성능을 냈는가?
주요 결과
- FFHQ, Places2, ImageNet 데이터셋에서 FID, LPIPS, FVD 지표 전반에서 SOTA 성능을 달성하였으며, 특히 큰 마스킹 영역에서 기존 방법을 압도적으로 뛰어넘었다.
- 절단 실험 결과, 이중 코드북을 사용한 PUT(비교: PUT)는 단일 코드북(비교: PUT one)과 비양자화 추론(비교: PUT no_ref)보다 우수한 성능을 보여, 체계적인 코드북 설계의 유용성을 확인했다.
- 슬라이딩 윈도우 처리 방식을 사용하는 CNN 기반 인코더를 사용한 PUT conv보다 PUT이 뛰어난 성능을 보여, 겹치지 않는 패치 인코딩이 마스킹된 영역와 마스킹되지 않은 영역 간 간섭을 효과적으로 방지함을 입증했다.
- 학습 중 무작위 양자화를 적용한 모델(비교: PUT)은 이를 적용하지 않은 버전(비교: PUT qua0)보다 유의미하게 뛰어난 성능을 보여, UQ-Transformer의 학습 전략이 효과적임을 입증했다.
- PUT는 ICT의 결과에서 관찰되는 마스킹 영역 경계의 정렬 오류를 제거하여, 비정규적 마스크 조건에서도 매끄럽고 자연스러운 출력을 생성한다.
- ImageNet과 같은 복잡한 데이터셋에서 PUT은 기존 트랜스포머 기반 방법보다 이미지 정밀도에서 뚜렷한 향상을 보이며, 시나리오의 복잡성에 대한 강건성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.