[논문 리뷰] Bipartite Graph Reasoning GANs for Person Image Generation
BiGraphGAN은 Bipartite Graph Reasoning (BGR)과 Interaction-and-Aggregation (IA) 블록을 도입하여 교차하는 장거리 포즈 관계를 모델링하고 포즈 가이드 사람 이미지 생성에서 외관과 형태를 함께 향상시키며, Market-1501과 DeepFashion에서 강력한 정량적 및 시각적 결과를 달성합니다.
We present a novel Bipartite Graph Reasoning GAN (BiGraphGAN) for the challenging person image generation task. The proposed graph generator mainly consists of two novel blocks that aim to model the pose-to-pose and pose-to-image relations, respectively. Specifically, the proposed Bipartite Graph Reasoning (BGR) block aims to reason the crossing long-range relations between the source pose and the target pose in a bipartite graph, which mitigates some challenges caused by pose deformation. Moreover, we propose a new Interaction-and-Aggregation (IA) block to effectively update and enhance the feature representation capability of both person's shape and appearance in an interactive way. Experiments on two challenging and public datasets, i.e., Market-1501 and DeepFashion, show the effectiveness of the proposed BiGraphGAN in terms of objective quantitative scores and subjective visual realness. The source code and trained models are available at https://github.com/Ha0Tang/BiGraphGAN.
연구 동기 및 목표
- 사람 이미지 생성에서 포즈 변형 모델링의 개선 동기 부여.
- 소스 포즈와 대상 포즈 간의 교차 장거리 관계를 포착하기 위한 그래프 기반 모듈 제안.
- 모듈 간 인터랙티브 블록으로 모양(shape)과 외관(appearance) 표현을 공동으로 강화.
- 최종 고품질 이미지를 생성하기 위한 주의(attention) 기반 융합 메커니즘 도입.
- 종합적인 정량적 및 정성적 평가를 통해 두 공용 데이터셋에서의 효과성 입증
제안 방법
- 그래프 컨볼루션 네트워크(GCNs)를 통해 소스 포즈와 대상 포즈 간의 교차하는 장거리 관계를 모델링하기 위해 Bipartite Graph Reasoning (BGR) 블록 도입.
- 포즈 피처를 이분 그래프 공간으로 투영하고, 교차 관계 추론을 수행한 뒤 잔여 연결(residual connections)으로 좌표 공간에 매핑.
- Appearance와 Shape 피처를 인터랙티브하게 강화하고 업데이트를 동기화하기 위해 Interaction-and-Aggregation (IA) 블록 도입.
- 입력 및 중간 결과를 선택적으로 융합하여 최종 이미지를 생성하는 Attention-based Image Fusion (AIF) 모듈 사용.
- 적대적 손실(adversarial), L1, 인지적(perceptual) 손실을 사용하여 이중 판별기(appearance 및 shape)로 학습.
- 포즈를 18-channel 히트맵으로 표현하고 소스 포즈와 대상 포즈의 shape 인코더를 공유합니다.
실험 결과
연구 질문
- RQ1교차하는 장거리 포즈 관계를 이분 그래프 추론으로 효과적으로 모델링하여 포즈-투-포즈 및 포즈-투-이미지 변환 성능을 개선할 수 있는가?
- RQ2전용 IA 모듈이 생성 중 모양 및 외관 표현의 공동 형성에 효과가 있는가?
- RQ3주의 기반 융합이 입력과 중간 결과를 선택적으로 결합하여 더 현실적인 최종 이미지를 생성하는 데 도움이 되는가?
- RQ4BiGraphGAN이 Market-1501과 DeepFashion에서 표준 지표 및 인간 판단 측면에서 최첨단 방법과 비교하여 어떤 성능을 보이는가?
주요 결과
- BiGraphGAN은 Market-1501에서 여러 최첨단 방법과 비교하여 더 나은 SSIM, Mask-SSIM 및 PCKh를 달성합니다.
- BiGraphGAN은 DeepFashion에서 여러 최첨단 방법과 비교하여 더 나은 SSIM 및 PCKh를 달성합니다.
- 본 방법은 두 데이터셋에서 가장 관련 있는 모델 PATN보다 더 높은 Inception Score(IS)를 달성합니다.
- ablations 연구는 BGR 가지(B2A 및 A2B)와 비공유(non-sharing) 구성이 베이스라인보다 성능을 개선하며, AIF가 추가 이득에 기여함을 보여줍니다.
- 사용자 연구는 BiGraphGAN이 경쟁 방법보다 사진처럼 더 사실적인 이미지를 생성한다는 것을 나타냅니다.
- 정성적 결과는 여러 베이스라인 및 SOTA PATN보다 더 선명하고 더 타당한 사람 이미지를 보여줍니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.