[논문 리뷰] Progressive Pose Attention Transfer for Person Image Generation
진보적인 Pose-Attentional Transfer Network(PATN)과 계단식 PATB를 이용한 포즈 전송으로 외관/형상 일관성을 향상시키고 재ID를 위한 데이터 증강을 가능하게 한다.
This paper proposes a new generative adversarial network for pose transfer, i.e., transferring the pose of a given person to a target pose. The generator of the network comprises a sequence of Pose-Attentional Transfer Blocks that each transfers certain regions it attends to, generating the person image progressively. Compared with those in previous works, our generated person images possess better appearance consistency and shape consistency with the input images, thus significantly more realistic-looking. The efficacy and efficiency of the proposed network are validated both qualitatively and quantitatively on Market-1501 and DeepFashion. Furthermore, the proposed architecture can generate training images for person re-identification, alleviating data insufficiency. Codes and models are available at: https://github.com/tengteng95/Pose-Transfer.git.
연구 동기 및 목표
- 다양한 포즈와 시점을 가진 비강체 인간 이미지에서 강건한 포즈 전송을 모티브로 삼는다.
- 외모를 보존하면서 포즈를 점진적으로 전송하는 계단식 주의 기반 제너레이터를 개발한다.
- 이전 포즈 전송 방법들에 비해 형상 및 외관 일관성을 향상시킨다.
- Market-1501과 DeepFashion 데이터셋에서 품질과 효율성을 입증한다.
- 생성된 이미지가 사람 재식별(re-ID) 데이터셋을 증강하는 데 가능성을 보여준다.
제안 방법
- 인코더가 조건 이미지와 축적된 조건/대상 포즈 맵을 잠재 코드로 변환한다.
- 포즈 주의 전송 블록(PATB)의 계단식 구성이 이미지 코드와 포즈 코드를 포즈-주의 마스크로 점진적으로 업데이트한다.
- 포즈 주의 마스크 M_t는 조건에서 샘플링할 위치와 대상 포즈의 패치를 배치하는 방법을 안내한다(M_t = sigmoid(conv_S(F_{t-1}^S))).
- 이미지 코드 업데이트: F_t^P = M_t ⊙ conv_P(F_{t-1}^P) + F_{t-1}^P(잔차).
- 포즈 코드 업데이트: F_t^S = conv_S(F_{t-1}^S) | F_t^P(연결).
- 디코더는 최종 이미지 코드 F_T^P로부터 최종 이미지를 생성하며 포즈 코드 F_T^S는 폐기된다.
- 두 개의 판별기(외관 D_A 및 형상 D_S)가 외관 일관성과 포즈 정렬을 판단하며 최종 점수 R = R^A R^S를 얻는다.
실험 결과
연구 질문
- RQ1포즈-주의 블록을 통한 점진적 포즈 전송이 단일 단계 방법보다 더 현실적이고 기하학적으로 일관된 사람 이미지를 생성할 수 있는가?
- RQ2PATN이 외관 및 형상 일관성을 개선하면서도 계산 효율성을 유지하는가?
- RQ3생성된 이미지가 사람 재식별(re-ID) 태스크를 위한 데이터셋을 의미 있게 증강할 수 있는가?
- RQ4제안된 방법은 Market-1501, DeepFashion에서 다중 지표에 대해 기존 포즈 전송 방법과 어떻게 비교되는가?
주요 결과
- 우리의 방법은 Market-1501과 DeepFashion 모두에서 형상 일관성(구체적으로 PCKh)에서 최고 또는 경쟁 수준을 달성하며 강력한 외관 지표를 보인다.
- Market-1501에서 우리의 방법은 SSIM 0.311, IS 3.323, DS 0.74, PCKh 0.94; DeepFashion에서 SSIM 0.976, IS 0.96, DS 0.96, PCKh 0.96(테이블 텍스트로부터의 근사치)로 기록된다.
- 우리의 방법은 여러 선행 연구보다 마스크-SSIM 및 마스크-IS가 더 우수하여 구조적 및 질감의 충실도가 향상되었음을 보여준다.
- 모델 크기와 속도 측면에서 우수하다: 41.36M 파라미터와 DeepFashion에서 60.61 fps로, 효율성 및 품질에서 여러 베이스라인을 능가한다.
- 사용자 연구에서 우리의 방법이 더 높은 사실감(제작물이 실제로 간주될 확률, G2R)이 나타났으며 Market-1501에서 63.47%, DeepFashion에서 31.78%의 비율을 보고한다.
- 가설 검증 연구에서 PATB 구성 요소 또는 판별기 강화 기능을 제거하면 성능이 저하되어 디자인 선택의 타당성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.