Skip to main content
QUICK REVIEW

[논문 리뷰] Temporal Graph Modeling for Skeleton-based Action Recognition

Jianan Li, Xuemei Xie|arXiv (Cornell University)|2020. 12. 16.
Human Pose and Action Recognition참고 문헌 34인용 수 15
한 줄 요약

이 논문은 시간적 관계 그래프를 구성하여 인접한 시간 간격뿐만 아니라 비인접 시간 간격의 의존성을 학습 가능한 엣지 연결을 통해 명시적으로 포착함으로써 스켈레톤 기반 동작 인식을 모델링하는 시간 강화 그래프 컨볼루션 네트워크(TE-GCN)를 제안한다. 다중 헤드 메커니즘은 다양한 시간적 관계를 모델링함으로써 NTU-60 및 NTU-120 RGB+D 데이터셋에서 각각 CS 및 C-setup 프로토콜 하에 90.8% 및 85.9%의 정확도로 최신 기준 성능을 달성한다.

ABSTRACT

Graph Convolutional Networks (GCNs), which model skeleton data as graphs, have obtained remarkable performance for skeleton-based action recognition. Particularly, the temporal dynamic of skeleton sequence conveys significant information in the recognition task. For temporal dynamic modeling, GCN-based methods only stack multi-layer 1D local convolutions to extract temporal relations between adjacent time steps. With the repeat of a lot of local convolutions, the key temporal information with non-adjacent temporal distance may be ignored due to the information dilution. Therefore, these methods still remain unclear how to fully explore temporal dynamic of skeleton sequence. In this paper, we propose a Temporal Enhanced Graph Convolutional Network (TE-GCN) to tackle this limitation. The proposed TE-GCN constructs temporal relation graph to capture complex temporal dynamic. Specifically, the constructed temporal relation graph explicitly builds connections between semantically related temporal features to model temporal relations between both adjacent and non-adjacent time steps. Meanwhile, to further explore the sufficient temporal dynamic, multi-head mechanism is designed to investigate multi-kinds of temporal relations. Extensive experiments are performed on two widely used large-scale datasets, NTU-60 RGB+D and NTU-120 RGB+D. And experimental results show that the proposed model achieves the state-of-the-art performance by making contribution to temporal modeling for action recognition.

연구 동기 및 목표

  • 기존 GCN 기반 방법이 1D 국소 컨볼루션을 반복적으로 사용함에 따라 장거리 시간 의존성을 모델링하는 데 한계가 있음을 해결하기 위해.
  • 의미적으로 관련된 비인접 시간 단계를 연결하는 시간 관계 그래프를 구성하여 스켈레톤 시퀀스의 복잡한 시간 역학을 명시적으로 모델링하기 위해.
  • 다양한 종류의 고차원 시간 관계를 포착하기 위해 다중 헤드 어텐션을 통합함으로써 동작 인식 성능을 향상시키기 위해.
  • 향상된 특징 학습을 위해 다중 스트림 TE-GCN 프레임워크 내에서 다중 모odal 표현(관절, 뼈, 운동)을 탐색하기 위해.

제안 방법

  • 노드가 시간 특징을 나타내고, 엣지가 서로 다른 시간 단계에서의 특징 간 학습 가능한 상관관계를 나타내는 시간 관계 그래프를 구축하기 위해.
  • 특징 유사도 또는 학습 가능한 파라미터에 기반해 시간 관계를 계산하는 두 가지 엣지 구축 함수—특징 계산 및 특징 학습—을 설계하기 위해.
  • 다양한 종류의 시간 의존성을 비인접 단계 간에 포착하는 각기 다른 유형의 시간 의존성을 학습할 수 있는 다중 어텐션 헤드를 학습하기 위해.
  • 다양한 시간 관계를 집계하고 특징 표현을 풍부하게 하기 위해 다중 헤드 시간 강화 그래프 컨볼루션을 적용하기 위해.
  • 관절, 뼈, 운동 모달리티를 별도로 처리한 후 그 표현을 융합하여 성능을 향상시키기 위해 다중 스트림 TE-GCN을 통합하기 위해.
  • 공간 모델링을 위해 표준 GCN 레이어를 사용하고, 제안된 시간 그래프 컨볼루션과 조합하여 엔드 투 엔드 동작 인식을 구현하기 위해.

실험 결과

연구 질문

  • RQ1학습 가능한 시간 관계 그래프가 인접 단계 컨볼루션을 초월하여 스켈레톤 시퀀스의 비인접 시간 의존성을 효과적으로 모델링할 수 있는가?
  • RQ2다중 헤드 어텐션은 동작 인식에서 다양한 시간 관계를 모델링하는 데 어떻게 향상되는가?
  • RQ3다중 스트림 TE-GCN 프레임워크 내에서 관절, 뼈, 운동 모달리티를 통합할 경우 인식 성능 향상 정도는 어느 정도인가?
  • RQ4제안된 시간 그래프 구축 방식이 대규모 데이터셋의 다양한 평가 프로토콜에서 일관된 성능 향상을 이끌어내는가?

주요 결과

  • 제안된 TE-GCN는 CS 프로토콜 하에서 NTU-60 RGB+D 데이터셋에서 90.8%의 인식 정확도를 달성하여 이전 최신 기준 방법보다 0.8个百分点 높게 기록하였다.
  • NTU-120 RGB+D 데이터셋에서 C-setup 프로토콜 하에선 85.9%의 정확도를 기록하여 강력한 일반화 능력과 기존 GCN 기반 접근법에 비해 뛰어난 성능을 입증하였다.
  • CS 프로토콜에서 관절과 뼈 모달리티를 융합하면 성능이 87.4%에서 88.9%로 향상되었으며, 공간 및 운동 표현을 포함한 네 가지 모달리티를 모두 융합할 경우 CS 및 CV 프로토콜에서 각각 90.84% 및 96.2%의 정확도를 기록하였다.
  • 다중 헤드 메커니즘이 복잡한 시간 역학을 더 잘 모델링할 수 있도록 해주었으며, 이는 두 데이터셋과 평가 프로토콜 전반에서 일관된 성능 향상을 통해 입증되었다.
  • 제거 실험 결과 시간 관계 그래프와 다중 헤드 어텐션은 핵심 구성 요소임을 확인하였으며, 이를 제거할 경우 성능이 크게 떨어졌다.
  • 모달리티 간 일반화 능력이 뛰어나며, 다중 스트림 TE-GCN는 관절, 뼈, 운동 표현을 융합함으로써 상호 보완적인 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.