Skip to main content
QUICK REVIEW

[논문 리뷰] AMIL: Adversarial Multi Instance Learning for Human Pose Estimation

Pourya Shamsolmoali, Masoumeh Zareapoor|arXiv (Cornell University)|2020. 03. 18.
Human Pose and Action Recognition참고 문헌 65인용 수 5
한 줄 요약

이 논문은 생성적 적대적 네트워크(GAN)를 활용하여 인간 신체의 구조적 사전 지식을 통합함으로써 인간 자세 추정 성능을 햖थ한 새로운 적대적 다중예측 학습(AMIL) 프레임워크를 제안한다. 이 프레임워크는 두 개의 잔차 다중예측 학습(MIL) 모델—한 개의 생성기와 한 개의 판별기—를 포함한다. 판별기는 실제 히트맵과 생성된 히트맵을 구분하며, 적대적 훈련을 통해 생성기가 더 현실적이고 구조적으로 타당한 자세를 생성하도록 이끈다. 이로 인해 기준 데이터셋에서 정확도가 크게 향상된다.

ABSTRACT

Human pose estimation has an important impact on a wide range of applications from human-computer interface to surveillance and content-based video retrieval. For human pose estimation, joint obstructions and overlapping upon human bodies result in departed pose estimation. To address these problems, by integrating priors of the structure of human bodies, we present a novel structure-aware network to discreetly consider such priors during the training of the network. Typically, learning such constraints is a challenging task. Instead, we propose generative adversarial networks as our learning model in which we design two residual multiple instance learning (MIL) models with the identical architecture, one is used as the generator and the other one is used as the discriminator. The discriminator task is to distinguish the actual poses from the fake ones. If the pose generator generates the results that the discriminator is not able to distinguish from the real ones, the model has successfully learnt the priors. In the proposed model, the discriminator differentiates the ground-truth heatmaps from the generated ones, and later the adversarial loss back-propagates to the generator. Such procedure assists the generator to learn reasonable body configurations and is proved to be advantageous to improve the pose estimation accuracy. Meanwhile, we propose a novel function for MIL. It is an adjustable structure for both instance selection and modeling to appropriately pass the information between instances in a single bag. In the proposed residual MIL neural network, the pooling action adequately updates the instance contribution to its bag. The proposed adversarial residual multi-instance neural network that is based on pooling has been validated on two datasets for the human pose estimation task and successfully outperforms the other state-of-arts models.

연구 동기 및 목표

  • 혼잡하거나 복잡한 환경에서 관절의 가림과 신체 부위 간의 겹침으로 인한 자세 추정의 부정확성 문제를 해결한다.
  • 딥러닝 모델에 인간 신체 구성의 구조적 사전 지식을 통합하여 자세 추정의 강인성을 향상시킨다.
  • 한 개의 백(이미지) 내에서 인스턴스(관절점) 간의 관계를 효과적으로 모델링할 수 있는 새로운 잔차 MIL 아키텍처를 개발한다.
  • 적대적 훈련을 활용하여 생성기가 더 현실적이고 해부학적으로 타당한 히트맵을 생성하도록 이끈다.
  • 기존 최고 수준의 방법들을 뛰어넘어 표준 기준 데이터셋에서 일반화 능력과 정확도를 향상시킨다.

제안 방법

  • 생성기와 판별기 모두에 동일한 아키텍처를 가진 잔차 다중예측 학습(MIL) 네트워크를 GAN 프레임워크 내에서 제안한다.
  • 판별기를 사용하여 실제 지도 히트맵과 생성기로부터 생성된 가짜 히트맵을 구분한다.
  • 생성기가 실제 히트맵과 구분되지 않을 정도로 히트맵을 생성하도록 적대적 훈련을 수행함으로써 구조적 사전 지식을 인코딩한다.
  • 백 내에서 인스턴스 기여도를 적응적으로 업데이트하는 새로운 풀링 메커니즘을 MIL 레이어에 설계하여 정보 흐름을 향상시킨다.
  • 표준 자세 추정 손실과 적대적 손실을 함께 최적화하여 현실성과 정확성 양쪽을 동시에 향상시킨다.
  • 이미지 입력에 대해 엔드 투 엔드로 모델을 적용하여 인간 신체의 14개 관절 위치에 대한 히트맵을 예측한다.

실험 결과

연구 질문

  • RQ1판별기를 활용한 적대적 훈련이 예측된 인간 자세 히트맵의 현실성과 구조적 일관성을 향상시키는가?
  • RQ2제안된 잔차 MIL 레이어는 단일 이미지(백) 내에서 인스턴스 간 관계를 모델링하는 데 얼마나 효과적인가?
  • RQ3적대적 학습을 통해 구조적 사전 지식를 통합함으로써, 가림이나 겹침 상황에서 자세 추정 정확도에 측정 가능한 향상이 이루어지는가?
  • RQ4제안된 AMIL 모델은 표준 인간 자세 추정 기준 데이터셋에서 최고 수준의 방법들과 비교해 어떻게 성능을 내는가?
  • RQ5제안된 MIL 풀링 메커니즘이 관절점 인스턴스의 가중치를 적응적으로 조정함으로써 특징 표현을 향상시키는가?

주요 결과

  • 제안된 AMIL 모델은 두 개의 표준 인간 자세 추정 데이터셋에서 최고 수준의 성능을 달성하여 기존 방법들을 능가한다.
  • 적대적 훈련은 특히 가림되거나 겹쳐진 상황에서 예측된 관절 히트맵의 구조적 타당성을 크게 향상시킨다.
  • 적응형 풀링을 갖춘 잔차 MIL 레이어는 각 백 내에서 인스턴스 기여도를 동적으로 조정함으로써 특징 표현을 향상시킨다.
  • 판별기가 실제 히트맵과 생성된 히트맵을 구분할 수 있다는 점은 생성기가 의미 있는 구조적 사전 지식을 학습했다는 것을 확인한다.
  • 모델은 관절의 가림과 신체 부위 간 겹침에 대해 뛰어난 강인성을 보이며, 더 정확하고 일관성 있는 자세 예측을 한다.
  • 정량적 결과는 MPII 및 COCO 데이터셋에서 기준 모델 및 최고 수준 모델 대비 향상된 평균 평균 정밀도(mAP)와 관절 정확도를 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.