Skip to main content
QUICK REVIEW

[논문 리뷰] Intra- and Inter-Action Understanding via Temporal Action Parsing

Dian Shao, Yue Zhao|arXiv (Cornell University)|2020. 05. 20.
Human Pose and Action Recognition참고 문헌 67인용 수 8
한 줄 요약

이 논문은 올림픽 경기 영상에서 하위 동작의 세밀한 시간 정보를 갖춘 새로운 데이터셋인 TAPOS를 소개하고, 시간적 행동 해석을 위한 자기지도 학습 기반의 트랜스포머 기반 프레임워크인 TransParser를 제안한다. 이 방법은 하위 동작 레이블이 없이도 행동 내부의 구조(하위 동작 조합)와 행동 간 관계(동일한 하위 동작 공유)를 밝혀내며, 최적의 프레임 샘플링을 통해 행동 인식 성능을 1% 향상시킨다.

ABSTRACT

Current methods for action recognition primarily rely on deep convolutional networks to derive feature embeddings of visual and motion features. While these methods have demonstrated remarkable performance on standard benchmarks, we are still in need of a better understanding as to how the videos, in particular their internal structures, relate to high-level semantics, which may lead to benefits in multiple aspects, e.g. interpretable predictions and even new methods that can take the recognition performances to a next level. Towards this goal, we construct TAPOS, a new dataset developed on sport videos with manual annotations of sub-actions, and conduct a study on temporal action parsing on top. Our study shows that a sport activity usually consists of multiple sub-actions and that the awareness of such temporal structures is beneficial to action recognition. We also investigate a number of temporal parsing methods, and thereon devise an improved method that is capable of mining sub-actions from training data without knowing the labels of them. On the constructed TAPOS, the proposed method is shown to reveal intra-action information, i.e. how action instances are made of sub-actions, and inter-action information, i.e. one specific sub-action may commonly appear in various actions.

연구 동기 및 목표

  • 기존 데이터셋에서 하위 동작에 대한 세밀한 행동 구조 레이블이 부족한 문제를 해결하기 위해.
  • 사전 정의된 하위 동작 카테고리 없이도 비지도 학습을 통해 시간적 하위 동작 경계와 의미적 패턴을 탐지할 수 있도록 하기 위해.
  • 내부 행동 구조(intra-action)와 다양한 행동 간 공통 하위 동작(inter-action)이 행동 인식 성능 향상에 어떻게 기여할 수 있는지 탐구하기 위해.
  • 시각적 및 운동적 특징만을 사용하여 행동 인스턴스를 의미적으로 일관된 하위 동작으로 분해할 수 있는 방법을 개발하기 위해.
  • 시간적 해석이 더 나은 프레임 샘플링을 통해 최종 행동 인식 성능 향상에 어떻게 기여하는지 입증하기 위해.

제안 방법

  • 하위 동작 카테고리 레이블이 필요 없이 16,000개의 올림픽 스포츠 인스턴스와 고품질의 시간적 세그먼트를 갖춘 TAPOS 데이터셋을 구축한다.
  • 프레임을 쿼리로 사용하고, 학습 가능한 메모리 백엔드가 키와 밸류를 제공하는 두 스택의 트랜스포머 아키텍처인 TransParser를 제안한다.
  • 자기지도 학습 기반의 대비 학습을 통해 다양한 행동 인스턴스 간에 분별성 있는 하위 동작 패턴을 식별할 수 있는 패턴 마이너 모듈을 도입한다.
  • 하위 동작 세그먼트 내부의 일관성을 강화하고 세그먼트 간 유사도를 억제하기 위해 국소적 의미 손실을 사용하여 경계 정확도를 향상시킨다.
  • 분석 결과를 바탕으로 하위 동작 간의 분별성 차이를 증폭시키기 위해 SPS (Segment Pattern Selection) 유닛을 도입하였으며, 2–3개의 유닛에서 최적 성능를 기록한다.
  • 해당 분석 결과를 활용해 TSN의 프레임 샘플링 전략을 개선함으로써 행동 인식 정확도를 향상시킨다.

실험 결과

연구 질문

  • RQ1카테고리 레이블 없이도 비지도 학습을 통해 개별 행동 내에서 의미 있는 하위 동작 구조를 탐지할 수 있는가?
  • RQ2다른 행동 클래스 간에 공통되는 하위 동작(상호작용 관계)은 어떻게 자기지도 학습 과정에서 도출되는가?
  • RQ3시간적 해석은 얼마나 하위 행동 인식 성능 향상에 기여하는가?
  • RQ4국소적 손실 및 SPS 유닛과 같은 아키텍처 구성 요소가 해석 정확도에 어떤 영향을 미치는가?
  • RQ5모델은 인간이 운동 역학을 인식하는 방식과 일치하는 의미적으로 일관된 하위 동작 패턴을 탐지할 수 있는가?

주요 결과

  • TransParser는 TAPOS 데이터셋에서 최신 기술 수준의 성능을 달성하며, 기준 방법들보다 시간적 행동 해석에서 뚜렷한 승리를 거두었다.
  • 모델은 '접근 달리기'와 '낙상'과 같은 하위 동작이 '멀리뛰기'와 '점프'와 같은 다양한 동작에서 일관되게 식별된다는 것을 발견했다.
  • '던지기'와 같은 하위 동작은 디스크스로와 저격병 던지기 등 서로 다른 동작 간에 공통적으로 나타나며, 이는 상호작용 관계를 보여준다.
  • TransParser 기반 샘플링을 사용함으로써 TSN의 행동 인식 정확도가 균일 샘플링 대비 약 1% 향상되었으며, RGB 기반으로는 Top-1 정확도가 84.80%에 도달했고, RGB+Flow 조합에서는 91.62%에 이르렀다.
  • 절단 분석 결과, 국소적 의미 손실이 재현율과 정밀도의 균형을 이루는 데 핵심적인 역할을 하며, SPS 유닛 수를 2개 초과로 늘여도 추가로 성능 향상이 없다는 점이 확인되었다.
  • 정성적 결과에서는 TransParser가 인간 레이블링된 하위 동작과 다를 수 있는 경우에도 운동 기반 패턴을 정확히 식별함을 보여주었으며, 예를 들어 '후추를 넣는다'와 '기름을 넣는다'는 서로 다른 레이블을 가졌지만 유사한 운동 패턴을 공유하고 있음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.