[논문 리뷰] ASSET: Autoregressive Semantic Scene Editing with Transformers at High Resolutions
ASSET는 조잡한-세밀한 주의 메커니즘을 통해 장거리 상관관계를 효율적으로 포착함으로써, 1024×1024 해상도의 의미적 이미지 편집을 가능하게 하는 트랜스포머 기반 아키텍처를 도입한다. 스파arsed 가이드드 어텐션(SGA)을 사용하여 전체 자기주의(self-attention)의 일부에 불과한 계산 비용으로도 현실적이고 다양한 편집을 달성하며, 기존의 CNN 및 트랜스포머 방법보다 품질과 효율성 면에서 뛰어나다.
We present ASSET, a neural architecture for automatically modifying an input high-resolution image according to a user's edits on its semantic segmentation map. Our architecture is based on a transformer with a novel attention mechanism. Our key idea is to sparsify the transformer's attention matrix at high resolutions, guided by dense attention extracted at lower image resolutions. While previous attention mechanisms are computationally too expensive for handling high-resolution images or are overly constrained within specific image regions hampering long-range interactions, our novel attention mechanism is both computationally efficient and effective. Our sparsified attention mechanism is able to capture long-range interactions and context, leading to synthesizing interesting phenomena in scenes, such as reflections of landscapes onto water or flora consistent with the rest of the landscape, that were not possible to generate reliably with previous convnets and transformer approaches. We present qualitative and quantitative results, along with user studies, demonstrating the effectiveness of our method.
연구 동기 및 목표
- 고해상도 이미지 편집에서 장거리 상관관계를 모델링하면서도 계산 가능성을 유지하는 데 도전한다.
- 근처 영역에 국한되는 지역적 주의 메커니즘의 한계를 극복하여 일관성 없는 편집을 방지한다.
- 자기회귀적 트랜스포머 기반 프레임워크를 사용하여 1024×1024 해상도에서 다양한, 현실적이며 일관된 이미지 편집을 가능하게 한다.
- 저해상도 자기주의 맵을 활용해 주의를 희소화함으로써 고해상도 이미지에 대한 트랜스포머의 계산 비용을 감소시킨다.
- VQGAN 기반 이미지 인코더에서 마스킹된 영역에서의 특징 유출을 방지한다.
제안 방법
- 모델은 양자화된 이미지 및 세그멘테이션 표현을 확보하기 위해 수정된 VQGAN 인코더를 사용하며, 마스킹된 영역은 [MASK] 토큰으로 대체된다.
- 고해상도 트랜스포머는 마스킹된 이미지와 편집된 세그멘테이션 맵에 조건부로 이미지 토큰을 자동회귀적으로 생성한다.
- 스파arsed 가이드드 어텐션(SGA)은 256×256 해상도에서 작동하는 가이드 트랜스포머를 사용해 각 고해상도 토큰에 대해 관련 있는 이미지 영역을 순위 매김함으로써 희소 주의 행렬을 계산한다.
- 가이드 트랜스포머는 저해상도에서 전체 자기주의를 계산하며, 그 주의 맵을 사용해 고해상도 주의에 대해 가장 관련성이 높은 상위-K 위치를 선택함으로써 효율적인 장거리 모델링을 가능하게 한다.
- 최종적으로 생성된 토큰을 VQGAN 디코더를 사용해 복원함으로써 고해상도 출력을 유지한다.
- 부분적 컨볼루션과 영역 정규화를 인코더에 적용하여 마스킹된 영역에서의 정보 유출을 방지한다.
실험 결과
연구 질문
- RQ1전체 자기주의의 계산 비용이 과도하게 높지 않도록 하면서도, 트랜스포머 기반 아키텍처가 고해상도 의미적 이미지 편집에서 장거리 상관관계를 효과적으로 모델링할 수 있는가?
- RQ2저해상도 자기주의를 가이드로 사용하는 희소 주의 메커니즘이 지역적 또는 밀도 높은 주의보다 고해상도 편집에서 더 나은 일관성과 현실감을 달성할 수 있는가?
- RQ31024×1024 해상도에서 제안된 스파arsed 가이드드 어텐션(SGA) 메커니즘이 전체 자기주의 및 기타 희소 주의 변종과 비교해 품질과 효율성 면에서 어떻게 성과를 내는가?
- RQ4멀리 떨어진 이미지 영역 간에 반사나 일관된 식생과 같은 전반적인 시나리오 일관성을 얼마나 잘 유지하는가?
- RQ5고해상도에서 계산 가능성을 유지하면서도 다양한 고품질 편집을 생성할 수 있는가?
주요 결과
- ASSET는 1024×1024 해상도에서 고품질, 다양한, 일관된 편집을 달성하여 물 반사나 일관된 풍경 요소와 같은 현실적인 현상을 가능하게 한다.
- 계산 비용을 크게 감소시켰다: SGA를 사용한 훈련은 A100에서 37GB VRAM만을 요구하며, 전체 주의를 사용할 경우 40GB를 초과한다.
- 1024×1024 해상도에서 SGA를 사용한 추론은 전체 주의 대비 약 20배 빠르며, 높은 출력 품질을 유지한다.
- 256×256 해상도에서 작동하는 가이드 트랜스포머는 총 추론 시간의 3.4%에 불과하여 고해상도 SGA 메커니즘이 주요 성능 가속기임을 입증한다.
- ASSET는 이전 방법인 TT와 유사한 추론 속도를 보이지만, 사용자 연구와 정량적 지표를 통해 훨씬 높은 품질의 결과를 도출한다.
- 수정된 VQGAN 인코더는 마스킹된 영역에서의 특징 유출을 성공적으로 방지했으며, 잠재 특징 차이의 시각화를 통해 이를 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.