Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Real-Time Action Recognition on Mobile Devices Using Deep Models

Chen-Lin Zhang, Xinxin Liu|arXiv (Cornell University)|2019. 06. 17.
Human Pose and Action Recognition참고 문헌 34인용 수 8
한 줄 요약

이 논문은 효율적인 딥러닝 모델을 활용하여 모바일 기기에서 실시간 동작 인식 프레임워크를 제안한다. 시간 이동 모듈(TSM)과 압축-흥장 모듈(SE)을 활용하여 기존 최고 성능 기록보다 6배 적은 FLOPs와 추론 시간으로 상태 최고 수준의 정확도를 달성한다. 이는 딥러닝 기반 동작 인식 모델을 모바일 폰에 성공적으로 구현한 최초의 사례로, 화웨이 메이트 10에서 수기 인식에 대해 약 10 FPS 성능을 달성한다.

ABSTRACT

Action recognition is a vital task in computer vision, and many methods are developed to push it to the limit. However, current action recognition models have huge computational costs, which cannot be deployed to real-world tasks on mobile devices. In this paper, we first illustrate the setting of real-time action recognition, which is different from current action recognition inference settings. Under the new inference setting, we investigate state-of-the-art action recognition models on the Kinetics dataset empirically. Our results show that designing efficient real-time action recognition models is different from designing efficient ImageNet models, especially in weight initialization. We show that pre-trained weights on ImageNet improve the accuracy under the real-time action recognition setting. Finally, we use the hand gesture recognition task as a case study to evaluate our compact real-time action recognition models in real-world applications on mobile phones. Results show that our action recognition models, being 6x faster and with similar accuracy as state-of-the-art, can roughly meet the real-time requirements on mobile devices. To our best knowledge, this is the first paper that deploys current deep learning action recognition models on mobile devices.

연구 동기 및 목표

  • 중요한 데이터 증강 기법을 사용하지 않는 실시간 모바일 추론 설정을 재정의하여 기존 서버 기반 설정과 차별화한다.
  • 실시간 제약 조건 하에서 모바일 하드웨어에서 최신 동작 인식 모델의 실험적 평가를 수행한다.
  • 기기 내 배포를 위해 FLOPs와 지연 시간을 극도로 줄이고도 높은 정확도를 유지하는 컴act하고 효율적인 모델을 설계한다.
  • 특히 수기 인식과 같은 실세계 모바일 애플리케이션에서 접근 방식의 유효성을 검증한다.
  • 이미지넷 모델 최적화 원칙과는 다름을 고려한 효율적인 실시간 동작 인식 모델 설계 통찰을 제공한다.

제안 방법

  • 효율성과 모바일 적합성으로 인해 MnasNet을 기본 아키텍처로 채택하였다.
  • 시간 이동 모듈(TSM)을 통합하여 FLOP 비용 없이 프레임 간 특징 교환을 가능하게 하여 시간적 모델링을 향상시켰다.
  • 채널 별 특징 반응을 재조정하기 위해 압축-흥장(SE) 모듈을 추가하여 표현 능력을 향상시켰다.
  • 일반화 및 실시간 제약 조건 하에서의 정확도 향상을 위해 ImageNet과 Kinetics에서 공동 미사전학습을 수행하였다.
  • 25 에포크 동안 학습률 감소를 활용하여 Jester 데이터셋에서 수기 인식을 위한 미세조정을 수행하였다.
  • 두 가지 입력 모드에서 모델 평가를 수행하였다: 8프레임 클립의 배치 처리 방식과 실시간 추론을 시뮬레이션하기 위한 순차적 프레임 입력 방식.

실험 결과

연구 질문

  • RQ1중요한 데이터 증강 없이 실시간 모바일 추론 설정에서 최신 동작 인식 모델의 성능는 어떻게 변화하는가?
  • RQ2사전 학습된 ImageNet 가중치는 실시간 동작 인식에서 정확도 향상에 어떤 역할을 하는가?
  • RQ3TSM 및 SE와 같은 추가 모듈은 컴act 모델에서 정확도, FLOPs, 추론 지연 시간에 어떤 영향을 미치는가?
  • RQ4이미지 분류를 위한 효율적인 모델은 실시간 비디오 동작 인식에 대해 모바일 플랫폼에서 효과적으로 적응 가능한가?
  • RQ5효율적인 이미지넷 모델과 효율적인 실시간 동작 인식 모델 간의 모델 설계 원칙의 핵심 차이는 무엇인가?

주요 결과

  • TSM 및 SE 모듈을 통합한 MnasNet은 Kinetics 검증 세트에서 66.5%의 상위-1 정확도를 달성하여 기준 MnasNet(60.7%) 대비 5.8% 향상되었고, FLOPs와 추론 시간은 각각 6배 감소하였다.
  • ImageNet과 Kinetics에서 모두 사전 학습한 모델가 Kinetics에서만 학습한 모델보다 성능이 뛰어났으며, 실시간 설정 하에서 Kinetics 정확도는 ImageNet 정확도와 강한 상관관계를 보였다.
  • 컴 pact 모델에서 과적합 문제가 심각한 문제로 나타났으며, 이미지넷 설정에서는 과적합이 덜 두드러지는 것으로 나타난 것과는 정반대였다.
  • Inception과 같은 브랜치 아키텍처는 효과적이었지만, 유사한 FLOP 수준에서도 모바일 기기에서 높은 CPU 지연 시간을 유발하였다.
  • HUAWEI Mate 10에서 순차적 추론을 통해 약 10 FPS(프레임당 90.24ms 지연) 성능을 달성하여 수기 인식에 대한 실시간 요구 조건을 충족시켰다.
  • 제안된 모델은 ResNet-50 대비 20%의 지연 시간과 10%의 FLOPs로 Jester 데이터셋에서 93.7%의 정확도를 달성하여 뛰어난 효율-정확도 트레이드오프를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.