Skip to main content
QUICK REVIEW

[논문 리뷰] Dynamic Kernel Distillation for Efficient Pose Estimation in Videos

Xuecheng Nie, Yuncheng Li|arXiv (Cornell University)|2019. 08. 24.
Human Pose and Action Recognition참고 문헌 31인용 수 10
한 줄 요약

이 논문은 동적 커널 디스틸레이션(Dynamic Kernel Distillation, DKD)을 제안하며, 이는 이전 프레임들로부터 실시간으로 자세 지식을 소형 네트워크로 디스틸레이션함으로써 효율적인 영상 기반 인간 자세 추정을 가능하게 한다. 학습된 자세 커널과 현재 특징 간의 컨볼루션 매칭 절차로 관절 위치 추정을 단순화함으로써, DKD는 기존 최고 성능 모델 대비 10× FLOPs 감소와 2× 속도 향상을 달성하면서도 Penn Action 및 Sub-JHMDB 벤치마크에서 정확도를 유지하거나 향상시킨다.

ABSTRACT

Existing video-based human pose estimation methods extensively apply large networks onto every frame in the video to localize body joints, which suffer high computational cost and hardly meet the low-latency requirement in realistic applications. To address this issue, we propose a novel Dynamic Kernel Distillation (DKD) model to facilitate small networks for estimating human poses in videos, thus significantly lifting the efficiency. In particular, DKD introduces a light-weight distillator to online distill pose kernels via leveraging temporal cues from the previous frame in a one-shot feed-forward manner. Then, DKD simplifies body joint localization into a matching procedure between the pose kernels and the current frame, which can be efficiently computed via simple convolution. In this way, DKD fast transfers pose knowledge from one frame to provide compact guidance for body joint localization in the following frame, which enables utilization of small networks in video-based pose estimation. To facilitate the training process, DKD exploits a temporally adversarial training strategy that introduces a temporal discriminator to help generate temporally coherent pose kernels and pose estimation results within a long range. Experiments on Penn Action and Sub-JHMDB benchmarks demonstrate outperforming efficiency of DKD, specifically, 10x flops reduction and 2x speedup over previous best model, and its state-of-the-art accuracy.

연구 동기 및 목표

  • 영상 기반 인간 자세 추정에서 대규모 네트워크의 높은 계산 비용 문제를 해결하기 위해, 특히 저지연 조건 하에서의 성능을 향상시키기 위해.
  • 영상 프레임 간 시간적 일관성을 활용하여 소형 네트워크가 높은 정확도의 자세 추정을 달성하도록 유도하기 위해.
  • 시간 모델링을 위해 3D 컨볼루션, 광학 흐름 또는 RNN과 같은 고비용 구성 요소에 대한 의존도를 줄이기 위해.
  • 프레임 간 자세 지식을 효율적으로 전달하는 일회성, 피드포워드 디스틸레이션 메커니즘을 개발하기 위해.
  • 추론 시 추가 비용 없이도 시간적 일관성을 확보하기 위해 시간적 적으로 대비하는 훈련 전략을 도입하기 위해.

제안 방법

  • 경량 CNN 기반 디스틸레이터가 이전 프레임의 특징과 자세 예측값에서 일회성, 피드포워드 방식으로 자세 커널을 추론한다.
  • 자세 커널은 신체 관절 구성 패턴을 압축하여 저장하며, 이후 프레임의 추정에 사용 가능한 컴act한 가이드라인 역할을 한다.
  • 신체 관절 위치 추정이 소형 네트워크의 특징맵과 자세 커널 간의 2D 컨볼루션을 통한 공간 매칭 절차로 재정의된다.
  • 훈련 중 연속된 프레임 간에 자연스럽고 일관된 자세 변화를 유도하기 위해 시간적 적으로 대비하는 디스크림리네이터를 도입한다.
  • 대비 훈련은 신뢰도 맵의 시간적 변동성을 제약함으로써 추론 시 추가 계산 없이도 일관성을 향상시킨다.
  • 전체 프레임워크는 엔드 투 엔드로 훈련 가능하며, 추론 시 디스크림리네이터를 제거함으로써 최소한의 추론 비용으로 배포가 가능하다.

실험 결과

연구 질문

  • RQ1소형 디스틸레이션 메커니즘이 영상 기반 자세 추정에서 한 프레임에서 다음 프레임로 자세 지식을 전달할 수 있는가?
  • RQ2자세 커널과 특징 간의 컨볼루션 매칭 연산으로 관절 위치 추정을 단순화할 경우, 계산 비용을 줄이면서도 높은 정확도를 유지할 수 있는가?
  • RQ3시간적 대비 훈련 전략이 프레임 간 자연스러운 자세 변화를 유도하는 데 얼마나 효과적인가?
  • RQ4동적으로 디스틸레이션된 자세 커널에 의해 안내될 때, 소형 네트워크가 얼마나 높은 정확도를 달성할 수 있는가?
  • RQ5제안된 방법이 제한된 학습 데이터를 가진 소규모 데이터셋에 잘 일반화되는가?

주요 결과

  • DKD는 정규화된 인치당 신장 기준으로 Sub-JHMDB에서 94.0% PCK를 기록하여 이전 SOTA 모델보다 3.8%p 높은 성능을 달성했다.
  • ResNet50를 백본으로 사용할 경우, DKD는 기존 최고 성능 모델 대비 FLOPs를 10× 감소시키고 추론 속도를 2× 향상시켰다.
  • DKD(ResNet18)는 이전 SOTA 모델과 유사한 정확도를 달성했지만, 4× 더 빠른 속도로 실행되어 뛰어난 효율성 향상을 보였다.
  • Penn Action 데이터셋에서 DKD는 단지 9.96G FLOPs로 92.4% PCK를 유지했으며, 이는 이전 SOTA 모델의 70.98G FLOPs 대비 크게 감소한 것이다.
  • 정성적 결과에서 모델은 운동 흐림, 가림, 시점 변화, 척도 변화 등에 대해 강건함을 보였다.
  • 시간적 대비 훈련은 추론 비용을 추가하지 않으면서도 프레임 간 자세 일관성을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.