Skip to main content
QUICK REVIEW

[논문 리뷰] EgoDistill: Egocentric Head Motion Distillation for Efficient Video Understanding

Shuhan Tan, Tushar Nagarajan|arXiv (Cornell University)|2023. 01. 05.
Human Pose and Action Recognition인용 수 6
한 줄 요약

EgoDistill는 고비용의 이고세트릭 비디오 클립 특징을 단일 RGB 프레임과 경량 IMU 헤드 동작 데이터만을 사용하여 재구성하는 지식 정련 프레임워크를 제안한다. 이는 기준 모델 대비 200배 적은 GFLOPs를 기록하면서도 Ego4D와 EPIC-Kitchens에서 최신 효율적인 비디오 이해 방법을 능가한다.

ABSTRACT

Recent advances in egocentric video understanding models are promising, but their heavy computational expense is a barrier for many real-world applications. To address this challenge, we propose EgoDistill, a distillation-based approach that learns to reconstruct heavy egocentric video clip features by combining the semantics from a sparse set of video frames with the head motion from lightweight IMU readings. We further devise a novel self-supervised training strategy for IMU feature learning. Our method leads to significant improvements in efficiency, requiring 200x fewer GFLOPs than equivalent video models. We demonstrate its effectiveness on the Ego4D and EPICKitchens datasets, where our method outperforms state-of-the-art efficient video understanding methods.

연구 동기 및 목표

  • 최신 기술 수준의 이고세트릭 비디오 이해 모델이 가지는 높은 계산 비용을 해결하여 자원 제약이 있는 AR/VR 장치에의 구현 가능성을 높이기.
  • IMU에서 얻은 헤드 동작 신호가 밀도 높은 비디오 프레임의 동적 특성을 대체할 수 있는지 탐색하기.
  • IMU와 희소 시각적 프레임을 활용하여 무거운 비디오 모델의 전체 클립 특징을 재구성하는 정련 기반 방법 개발하기.
  • 새로운 자기지도 학습 전훈 전략을 통해 IMU 특징 학습을 향상시켜 최종 비디오 이해 성능을 향상시키기.
  • 기존의 적응형 비디오 프레임 샘플링 방법보다 더 나은 정확도-효율성 트레이드오프를 달성하기.

제안 방법

  • 강력한 교사 비디오 모델로부터 지식 정련을 통해 단일 RGB 프레임과 시간적으로 희소한 IMU 읽기 데이터로부터 고밀도 비디오 클립 특징을 재구성하는 경량 학생 모델을 훈련한다.
  • 정련 이전에 IMU 특징의 표현 품질을 향상시키기 위해 새로운 자기지도 학습 전훈 단계를 도입한다.
  • 비디오 의미 정보를 희소 프레임에서, 운동 동역학 정보를 IMU에서 조건화하여 외관과 운동 정보를 모두 유지한다.
  • 학생의 출력 특징을 교사의 고밀도 클립 수준 표현과 일치시키기 위해 대비 손실을 사용한 지식 정련을 적용한다.
  • 종단 간 훈련이 가능하고 효율적인 학생 모델을 설계하여 자원이 제한된 장치에서 실시간 추론을 가능하게 한다.
  • IMU 데이터를 융합 모odal로 사용하는 것이 아니라, 최소한의 시각 입력으로부터 운동 인식 특징을 재구성할 수 있도록 동적 신호로 활용한다.
Figure 1 : Illustration of EgoDistill. Given a single video frame and camera motion from IMU, EgoDistill learns to reconstruct the more expensive dense video clip feature. With its lightweight input, EgoDistill significantly improves efficiency.
Figure 1 : Illustration of EgoDistill. Given a single video frame and camera motion from IMU, EgoDistill learns to reconstruct the more expensive dense video clip feature. With its lightweight input, EgoDistill significantly improves efficiency.

실험 결과

연구 질문

  • RQ1IMU 데이터가 복잡한 이고세트릭 비디오 특징 재구성에 있어 밀도 높은 비디오 프레임을 효과적으로 대체할 수 있는가?
  • RQ2희소 시각 프레임과 IMU 신호를 조합하면 단일 시각 프레임만을 사용할 때보다 더 나은 비디오 특징 재구성 성능을 달성할 수 있는가?
  • RQ3IMU에 대한 자기지도 학습 전훈 전략이 정련 기반 비디오 이해 모델의 성능 향상에 기여하는가?
  • RQ4EgoDistill은 최신 기술 수준의 효율적 비디오 모델 대비 계산 비용을 얼마나 줄이며, 정확도를 유지하거나 향상시키는가?
  • RQ5어떤 종류의 이고세트릭 동작에서 IMU 기반 정련이 가장 큰 성능 향상을 제공하는가?

주요 결과

  • EgoDistill은 원본 MotionFormer 모델 대비 추론 GFLOPs를 200배 감소시켜 200배 높은 효율성을 확보했다.
  • 50분 분량의 이고세트릭 비디오에 대해 EgoDistill은 추론 시간을 25분에서 36초로 단축시켜 실시간 실행 가능성을 입증했다.
  • EPIC-Kitchens에서 EgoDistill은 STTS보다 4.4% 높은 정확도를 기록했으며, 6.5배 더 빠르게 작동하여 최신 기술 수준의 적응형 샘플링 방법을 능가했다.
  • EgoDistill은 '닫기' 동작에서 20.3% 높은 정확도를 달성했고, '놓기' 동작에서는 10.4% 향상시켜 IMU를 활용해 장면의 운동을 명확히 구분함으로써 성능 향상을 이뤘다.
  • 예측 가능한 헤드 동작이 수반되는 동작(예: '자르기', '닫기')에서 가장 우수한 성능를 보였고, 헤드 동작이 최소이거나 상관성이 없는 동작(예: '누르기', '채우기')에서는 성능이 떨어졌다.
  • 정성적 결과 분석에서 EgoDistill은 IMU에 조건화된 고유하고 운동 인식 특징을 생성하여, 단지 시각적 프레임만을 사용하는 모델들과 달리 일관된 카메라 운동을 가진 클립을 효과적으로 검색할 수 있음을 보였다.
Figure 2 : EgoDistill architecture. Left: Self-supervised IMU feature learning. Given start and end frames of a clip, we train the IMU encoder to anticipate visual changes. Right: Video feature distillation with IMU. Given image frame(s) and IMU, along with our pre-trained IMU encoder, our method tr
Figure 2 : EgoDistill architecture. Left: Self-supervised IMU feature learning. Given start and end frames of a clip, we train the IMU encoder to anticipate visual changes. Right: Video feature distillation with IMU. Given image frame(s) and IMU, along with our pre-trained IMU encoder, our method tr

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.