Skip to main content
QUICK REVIEW

[논문 리뷰] Listen to Look: Action Recognition by Previewing Audio

Ruohan Gao, Tae-Hyun Oh|arXiv (Cornell University)|2019. 12. 10.
Human Pose and Action Recognition참고 문헌 88인용 수 10
한 줄 요약

이 논문은 긴 트림되지 않은 영상에서 효율적인 행동 인식을 가능하게 하기 위해 청각을 경량 프리뷰로 사용하는 새로운 프레임워크인 Listen to Look을 제안한다. 이미지-청각 쌍에서 클립 수준의 특징을 희석하고, 주의 기반 LSTM을 사용한 영상 스캐닝을 통해, 성능을 훼손하지 않으면서도 단기 및 장기적 시간적 중복을 줄인다. 이로 인해 최신 기술 수준의 정확도와 속도를 달성한다.

ABSTRACT

In the face of the video data deluge, today's expensive clip-level classifiers are increasingly impractical. We propose a framework for efficient action recognition in untrimmed video that uses audio as a preview mechanism to eliminate both short-term and long-term visual redundancies. First, we devise an ImgAud2Vid framework that hallucinates clip-level features by distilling from lighter modalities---a single frame and its accompanying audio---reducing short-term temporal redundancy for efficient clip-level recognition. Second, building on ImgAud2Vid, we further propose ImgAud-Skimming, an attention-based long short-term memory network that iteratively selects useful moments in untrimmed videos, reducing long-term temporal redundancy for efficient video-level recognition. Extensive experiments on four action recognition datasets demonstrate that our method achieves the state-of-the-art in terms of both recognition accuracy and speed.

연구 동기 및 목표

  • 긴 트림되지 않은 영상에서 밀도 높은 클립 수준 행동 인식의 계산 비효율성을 해결하기 위해.
  • 클립 수준 처리를 경량 이미지-청각 특징 희석으로 대체하여 단기적 중복을 줄이기 위해.
  • 청각을 가이드로 삼아 트림되지 않은 영상에서 핵심 순간을 선택하는 방식으로 장기적 중복을 줄이기 위해.
  • 영상 행동 인식에서 최신 기술 수준의 정확도-속도 트레이드오프를 달성하기 위해.
  • 청각이 행동 인식에서 시각 콘텐츠의 효과적이고 효율적인 프리뷰로 기능할 수 있음을 보여주기 위해.

제안 방법

  • ImgAud2Vid 프레임워크는 단일 이미지와 해당 청각에서 3D CNN에 비해 비용이 많이 드는 클립 수준 특징을 생성하기 위해 지식 희석을 사용한다.
  • 이 방법은 전체 클립에서 강력한 교사 네트워크의 예측을 모방하기 위해 이미지-청각 쌍에서 경량 학생 네트워크를 훈련시킨다.
  • ImgAud-Skimming 네트워크는 주의 기반 LSTM을 사용하여 트림되지 않은 영상에서 가장 정보가 많은 이미지-청각 쌍을 반복적으로 선택한다.
  • 스캐닝 모듈은 이미지-청각 쌍에서 파생된 색인 특징을 기반으로 작동하여, 정보가 적은 세그먼트를 건너뛰면서 효율적인 영상 수준 인식을 가능하게 한다.
  • 청각은 시간적 동역학과 맥락적 단서의 대체 자료로 사용되어, 행동이 시작되거나 끝나는 순간을 감지할 수 있도록 한다.
  • 프레임워크는 미분 가능한 주의를 통해 엔드 투 엔드로 훈련되어 특징 추출과 순간 선택의 공동 최적화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1청각을 사용하여 영상 행동 인식에서 중복 처리를 줄이기 위한 효율적인 프리뷰로 활용할 수 있는가?
  • RQ2희석된 이미지-청각 특징이 훨씬 더 효율적이면서도 전체 클립 수준 특징과 비교해 유사한 성능을 달성할 수 있는가?
  • RQ3청각과 이미지 특징으로 유도된 주의 기반 영상 스캐닝 메커니즘이 균일 샘플링이나 밀도 높은 추론보다 우수한 성능을 낼 수 있는가?
  • RQ4클립 수준 및 영상 수준 처리에서 모두 청각을 활용하면 정확도-속도 트레이드오프가 향상되는가?
  • RQ5제안된 방법이 다양한 길이의 영상과 행동 밀도가 다른 다양한 행동 인식 데이터셋에 일반화 가능한가?

주요 결과

  • ResNet-152 특징을 사용할 때 제안된 방법은 ActivityNet에서 84.2의 mAP를 달성하여 이전 방법보다 0.4个百分点 높은 최신 기술 수준의 성능을 보였다.
  • R(2+1)D-152 특징을 사용할 경우, 밀도 높은 추론 대비 10배 빠르고 균일 샘플링 대비 20배 빠른 89.9% mAP를 기록했다.
  • ActivityNet에서 밀도 높은 추론 대비 계산 비용을 1.31 TFLOPs로 줄였으며, 높은 정확도를 유지했다 (밀도 높은 추론: 25.9 TFLOPs).
  • 정성적 결과는 ImgAud-Skimming이 균일하게 샘플링한 프레임보다 행동을 훨씬 더 잘 나타내는 프레임을 선택하는 것으로 나타났다.
  • 짧고 드문드문 발생하는 행동인 사격, 트리플점프, 비어포롱과 같은 희귀 행동에서 가장 높은 정확도 향상을 달성했다.
  • 제거 분석 결과, 경량 인식 특징을 사용할 때조차도 ImgAud2Vid 희석 단계가 정확도에 크게 기여하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.