Skip to main content
QUICK REVIEW

[논문 리뷰] Cooperative Cross-Stream Network for Discriminative Action Representation

Jingran Zhang, Fumin Shen|arXiv (Cornell University)|2019. 08. 27.
Human Pose and Action Recognition참고 문헌 47인용 수 4
한 줄 요약

이 논문은 시공간적(색상RGB) 및 시간적(광학 흐름) 스트림 특징을 모odal 보완성 블록과 교차 엔트로피 및 모달리티 랭킹 제약 조건을 조합한 공동 손실 함수를 통해 공동 최적화하는 협업 크로스스트림(CC) 네트워크를 제안한다. 이 방법은 분류 기반 특징 학습을 향상시키고 모달리티 간 격차를 줄이며, HMDB-51, UCF-101 및 Kinetics-S something 데이터셋에서 최신 기준 성능을 달성한다.

ABSTRACT

Spatial and temporal stream model has gained great success in video action recognition. Most existing works pay more attention to designing effective features fusion methods, which train the two-stream model in a separate way. However, it's hard to ensure discriminability and explore complementary information between different streams in existing works. In this work, we propose a novel cooperative cross-stream network that investigates the conjoint information in multiple different modalities. The jointly spatial and temporal stream networks feature extraction is accomplished by an end-to-end learning manner. It extracts this complementary information of different modality from a connection block, which aims at exploring correlations of different stream features. Furthermore, different from the conventional ConvNet that learns the deep separable features with only one cross-entropy loss, our proposed model enhances the discriminative power of the deeply learned features and reduces the undesired modality discrepancy by jointly optimizing a modality ranking constraint and a cross-entropy loss for both homogeneous and heterogeneous modalities. The modality ranking constraint constitutes intra-modality discriminative embedding and inter-modality triplet constraint, and it reduces both the intra-modality and cross-modality feature variations. Experiments on three benchmark datasets demonstrate that by cooperating appearance and motion feature extraction, our method can achieve state-of-the-art or competitive performance compared with existing results.

연구 동기 및 목표

  • 두 스트림 네트워크의 별도 학습 방식의 한계를 해결하기 위해, 상호 보완적인 시공간 정보를 활용하지 못하고 모달리티 간 격차 문제를 겪는 것을 방지한다.
  • 모달리티 전용 및 교차 모달리티 제약 조건을 공동 최적화하여 깊이 신경망 특징의 분류 능력을 향상시킨다.
  • 새로운 랭킹 손실을 통해 내부 및 외부 모달리티 특징 변동을 줄이며, 트리플릿 및 임bedding 제약 조건을 강제로 적용한다.
  • 공간적 및 시간적 스트림 간 상호 강화를 통해 끝내는 엔드 투 엔드 학습을 가능하게 하여 '마시다'와 '먹다'와 같은 모호한 행동의 분류 성능을 향상시킨다.

제안 방법

  • RGB 및 광학 흐름 특징 간의 교차 모달리티 상관관계를 명시적으로 모델링하기 위해 연결 블록을 도입한다.
  • 동일한 모달리티 및 이질적 모달리티 학습을 위한 표준 교차 엔트로피 손실과 모달리티 랭킹 제약 조건을 조합한 공동 손실 함수를 사용한다.
  • 모달리티 랭킹 제약 조건은 내부 모달리티 분류 기반 임베딩과 외부 모달리티 트리플릿 손실을 포함하여, 각 모달리티 내외의 특징 변동을 최소화한다.
  • 클립 수준 점수의 후기 융합을 위해 요소별 평균을 사용하며, 이는 HMDB-51에서 연결 및 기타 융합 전략보다 뛰어난 성능을 보였다.
  • 특징 추출을 위해 ImageNet에서 사전 학습된 BN-Inception, ResNet, VGG 등의 백본 네트워크를 활용한다.
  • 주의 영역을 시각화하기 위해 클래스 활성화 맵(CAM)을 적용하였으며, 모델이 손, 눈과 같은 행동 관련 부위에 집중하고 있음을 확인하였다.

실험 결과

연구 질문

  • RQ1RGB 및 광학 흐름 스트림의 공동 엔드 투 엔드 학습이 별도 학습 대비 행동 인식 정확도 향상에 기여하는가?
  • RQ2외관 및 운동 특징 간의 모달리티 격차를 어떻게 줄여 분류 능력을 향상시킬 수 있는가?
  • RQ3교차 엔트로피와 모달리티 랭킹을 조합한 공동 손실이 '마시다' 및 '먹다'와 같은 모호한 행동 클래스에서 성능 향상에 기여하는가?
  • RQ4정확도 및 내구성 측면에서 이중 스트림 네트워크의 클립 수준 점수 융합 전략 중 최적의 방법은 무엇인가?

주요 결과

  • 제안된 CCS 네트워크는 HMDB-51, UCF-101 및 Kinetics-S something 데이터셋에서 최신 기준 또는 경쟁력 있는 성능을 달성하였다.
  • 클립 점수의 요소별 평균 융합 전략이 연결 및 기타 후기 융합 방법보다 뛰어나며, HMDB-51에서 가장 높은 정확도를 기록하였다.
  • α₁=0.3, α₂=0.3, α₃=0.8로 설정한 하이퍼파rameter 조합이 UCF-101에서 97.4%의 최고 정확도를 달성하여 수렴성과 성능 간 최적의 균형을 확보하였다.
  • UCF-101에서 VGG, ResNet 및 BN-Inception 중 BN-Inception 백본이 가장 뛰어난 성능을 보였으며, 제안된 프레임워크에 적합함을 입증하였다.
  • CAM 시각화 결과 모델이 손, 눈과 같은 분류 기반 신체 부위에 집중하고 있음을 확인하였으며, 인간의 행동 관련 영역 인식과 일치하였다.
  • 모달리티 랭킹 제약 조건은 내부 및 외부 모달리티 특징 변동을 효과적으로 줄여 일반화 능력과 내구성을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.