Skip to main content
QUICK REVIEW

[논문 리뷰] Video Is Graph: Structured Graph Module for Video Action Recognition

Rong-Chang Li, Xiao‐Jun Wu|arXiv (Cornell University)|2021. 10. 12.
Human Pose and Action Recognition참고 문헌 46인용 수 7
한 줄 요약

이 논문은 구조적 그래프 모듈(SGM)을 제안하며, 비디오 프레임을 그래프로 재구성하여 장거리 시간적 의존성을 포착하면서도 순차적 정보를 유지한다. 이전의 구조적 정보를 기반으로 인접 프레임을 시간 영역으로 그룹화함으로써 SGM은 전역적 구조적 특징과 국소적 순차적 특징을 동시에 추출할 수 있으며, 최소한의 계산 부담으로 다양한 동작 인식 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

In the field of action recognition, video clips are always treated as ordered frames for subsequent processing. To achieve spatio-temporal perception, existing approaches propose to embed adjacent temporal interaction in the convolutional layer. The global semantic information can therefore be obtained by stacking multiple local layers hierarchically. However, such global temporal accumulation can only reflect the high-level semantics in deep layers, neglecting the potential low-level holistic clues in shallow layers. In this paper, we first propose to transform a video sequence into a graph to obtain direct long-term dependencies among temporal frames. To preserve sequential information during transformation, we devise a structured graph module (SGM), achieving fine-grained temporal interactions throughout the entire network. In particular, SGM divides the neighbors of each node into several temporal regions so as to extract global structural information with diverse sequential flows. Extensive experiments are performed on standard benchmark datasets, i.e., Something-Something V1 & V2, Diving48, Kinetics-400, UCF101, and HMDB51. The reported performance and analysis demonstrate that SGM can achieve outstanding precision with less computational complexity.

연구 동기 및 목표

  • 비디오 동작 인식에서 순차적 모델링의 한계를 해결하기 위해, 국소적이고 쌓인 시간 연산에 의존함으로써 장거리 의존성을 포착하기 어려운 문제를 해결한다.
  • 비디오 프레임을 완전한 그래프 표현으로 변환할 때 발생하는 순차적 정보 손실 문제를 해결한다.
  • 비디오 클립에서 전역적 구조 패턴과 국소적 시간적 순서를 동시에 포착할 수 있는 메커니즘을 개발한다.
  • 계산 비용을 최소한으로 증가시키면서도 표준 동작 인식 데이터셋에서 경쟁력 있거나 최신 기술 수준의 성능을 달성한다.

제안 방법

  • 모든 프레임이 학습 가능한 간선으로 연결된 프레임 그래프로 비디오 클립을 변환하여 장거리 정보 흐름을 가능하게 한다.
  • 시간 거리와 방향을 기반으로 인접 노드를 별도의 시간 영역으로 분할하는 구조적 그래프 모듈(SGM)을 제안한다.
  • 지역, 전역, 향후, 과거 등의 하위그래프로 이웃을 그룹화하여 그래프 변환 중 순차 인식 표현을 유지한다.
  • 각 하위그래프에서 별도의 압축 기반 메시지 전파를 사용하여 중복을 줄이고 특징 집중도를 향상시킨다.
  • 스파atiotemporal 특징 학습이 가능한 엔드 투 엔드 훈련을 가능하게 하기 위해 SGM을 InceptionV3 블록에 통합하여 SGN 네트워크를 구성한다.
  • 시간 순서를 유지하면서도 모든 프레임 간 특징 전파가 가능한 그래프 컨볼루션 네트워크(GCNs)를 구조적 그래프에 적용한다.

실험 결과

연구 질문

  • RQ1완전한 그래프 표현으로 변환된 비디오 프레임의 그래프 기반 표현이 순차적 구조를 손실시키지 않고 장거리 시간적 의존성을 효과적으로 포착할 수 있는가?
  • RQ2시간 전후 정보를 어떻게 활용하여 그래프를 구조화함으로써 전역 패턴과 국소적 순차적 특징을 모두 유지할 수 있는가?
  • RQ3다중 헤드 어텐션 기반 메커니즘에 비해 비어 있는 다중 헤드 어텐션 기반 그래프 모듈이 동작 인식에서 효율성과 성능 면에서 뛰어나지 않는가?
  • RQ4구조적 그래프 모듈이 계산 비용을 거의 증가시키지 않으면서도 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • SGM는 Kinetics-400에서 86.9%의 top-1 정확도를 기록하여 TimeSformer-L(81.0%)과 GSM(80.7%)을 능가했으며, InceptionV3의 1.08배의 계산량으로만 수행되었다.
  • Something-Something V2에서 SGN은 84.7%의 top-1 정확도를 기록하여 TimeSformer-L을 초월하고 새로운 SOTA 기록을 수립했다.
  • Diving48에서 SGN은 MMVRAC 경쟁에서 앙상블 모델을 사용해 45.4%의 top-1 정확도를 기록하며 1위를 차지했다.
  • HMDB51에서 SGN은 2D 백본에 시간 모듈을 적용한 방법들 중에서 가장 뛰어난 성능을 보였으며, 강력한 시간 모델링 능력을 입증했다.
  • 시각화 결과 SGM은 关건 프레임에 주목하는 반면, 완전한 그래프는 이를 忽略하는 것으로 확인되어 특징 국소화가 향상됨을 확인했다.
  • 학습된 인접 행렬은 깊이가 깊어질수록 전역 패턴을 우선시하는 경향을 보였으며, 단기 동작(예: Something-Something)과 장기 동작(예: Kinetics-400) 간에 명확한 차이가 관찰되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.