[논문 리뷰] Bridging Global Context Interactions for High-Fidelity Image Completion
이 논문은 TFill을 제안하며, 이는 전이기반 이미지 보완 방법으로, 이미지 보완을 순서 없는 시퀀스-투-시퀀스 예측 문제로 간주하여 국소적 편향 없이 장거리 전역적 맥락을 명시적으로 모델링한다. 비정상적인 컨볼루션 네트워크를 사용해 겹치지 않는 작은 수신장 영역을 가진 토큰 표현을 생성함으로써, 먼 거리의 가시 영역에 대해서도 동일한 주의를 보장하며, 주의 인식 레이어(AAL)를 통해 외관 일관성을 향상시켜 다양한 벤치마크에서 최고 성능을 기록하며 FID 및 LPIPS 점수를 낮춘다.
Bridging global context interactions correctly is important for high-fidelity image completion with large masks. Previous methods attempting this via deep or large receptive field (RF) convolutions cannot escape from the dominance of nearby interactions, which may be inferior. In this paper, we propose to treat image completion as a directionless sequence-to-sequence prediction task, and deploy a transformer to directly capture long-range dependence in the encoder. Crucially, we employ a restrictive CNN with small and non-overlapping RF for weighted token representation, which allows the transformer to explicitly model the long-range visible context relations with equal importance in all layers, without implicitly confounding neighboring tokens when larger RFs are used. To improve appearance consistency between visible and generated regions, a novel attention-aware layer (AAL) is introduced to better exploit distantly related high-frequency features. Overall, extensive experiments demonstrate superior performance compared to state-of-the-art methods on several datasets.
연구 동기 및 목표
- 큰 불규칙한 마스크를 가진 고해상도 이미지 보완에서 장거리 맥락 모델링의 과제를 해결하기 위해.
- 깊은 컨볼루션 네트워크에서 가까운 영역보다 먼 영역을 우선시하는 국소적 편향을 극복하기 위해.
- 트랜스포머 인코더 내 모든 가시 토큰 간 전역적 의존성을 명시적이고 동일한 가중치로 모델링할 수 있도록 하기 위해.
- 가시 영역과 생성된 영역에서 특징을 적응적으로 선택함으로써 생성 영역과 가시 영역 간의 외관 일관성을 향상시키기 위해.
- 임의의 이미지 해상도에 대응할 수 있는 유연하고 완전히 컨볼루션 기반의 프레임워크를 설계하기 위해.
제안 방법
- 트랜스포머 인코더를 사용해 이미지 보완을 방향성 없는 시퀀스-투-시퀀스 예측 문제로 간주한다.
- 작은 겹치지 않는 수신장 영역을 가진 제한적인 컨볼루션 네트워크를 활용해 토큰 표현을 생성함으로써, 국소적 상관관계에서 가시 맥락을 분리한다.
- 트랜스포머의 자기주의 주의를 통해 모든 가시 토큰 간 장거리 의존성을 동일하게 모델링하여 거리에 따른 우세함을 방지한다.
- 주의 점수에 기반해 고주파 특징을 동적으로 선택하는 주의 인식 레이어(AAL)를 도입하여 외관 일관성을 향상시킨다.
- 두 단계의 정밀화 프레임워크를 채택한다: TFill-Coarse를 통한 거친 콘텐츠 생성 후 AAL을 사용한 외관 정밀화.
- 완전히 컨볼루션 기반의 설계를 통해 표준 위치 임베딩의 고정된 시퀀스 길이 제한을 극복하고 임의의 이미지 크기에서 추론이 가능하도록 한다.
실험 결과
연구 질문
- RQ1트랜스포머 기반 아키텍처는 국소적 특징에 치우치지 않고 이미지 보완에서 장거리 전역적 맥락을 효과적으로 모델링할 수 있는가?
- RQ2토큰 인코더의 수신장이 제한될 경우 이미지 보완에서 전역적 의존성 모델링에 어떤 영향을 미치는가?
- RQ3주의 인식 레이어는 가시 영역과 생성 영역에서 특징를 적응적으로 선택함으로써 외관 일관성을 향상시킬 수 있는가?
- RQ4기존의 두 단계 기반 접근법과 비교해 본다면, 제안된 방법은 다양한 마스크 유형에 걸쳐 정밀도와 일반화 능력 측면에서 어떻게 성능을 내는가?
- RQ5큰 수신장에서도 성능과 효율성을 유지하면서 고해상도 이미지에 대응할 수 있는가?
주요 결과
- TFill은 다양한 데이터셋에서 최신 기술 성능을 달성하여 이전 방법 대비 평균 FID를 2.8% 감소시키고 LPIPS를 6.0% 감소시켰다.
- 제한적인 CNN 토큰화는 16×16 수신장일 경우 FID를 3.63, LPIPS를 0.057로 낮춰 더 큰 수신장보다 뛰어난 성능을 보였다.
- AAL 모듈은 다음으로 좋은 베이스라인 대비 FID를 0.11 감소시키고 LPIPS를 0.004 감소시켜 외관 일관성 향상을 입증했다.
- FFHQ 데이터셋에서 TFill-AAL은 무작위 마스크에서 LPIPS 0.0412, FID 2.57을 기록하여 SA, CA, SLTA를 모두 능가했다.
- 큰 수신장에서도 메모리 소비(1.15 GB)와 추론 시간(0.180 s)이 낮아 효율성을 유지했다.
- 정성적 결과에서는 CA 및 PIC와 같이 색상 일관성이 떨어지는 출력을 생성하는 것과 달리, 생성된 영역에 잡음이나 이상이 없었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.