Skip to main content
QUICK REVIEW

[논문 리뷰] Deep manifold-to-manifold transforming network for action recognition

Tong Zhang, Wenming Zheng|arXiv (Cornell University)|2017. 05. 30.
Human Pose and Action Recognition참고 문헌 2인용 수 3
한 줄 요약

이 논문은 행동 인식을 위한 대칭 양의 정부호(SPD) 행렬을 한 리만 다양체에서 더 분류 능력이 뛰어난 다양체로 매핑하는 엔드 투 엔드 딥 러닝 프레임워크인 딥 매니폴드 투 매니폴드 트랜스포밍 네트워크(DMT-Net)를 제안한다. SVD를 사용하지 않고도 SPD 구조를 유지하면서, 새로운 레이어—국소 SPD 컨볼루션, 비선형 SPD 활성화, 리만 유지형 순환—를 도입하여 행동 인식 벤치마크에서 최고 성능을 달성한다.

ABSTRACT

Symmetric positive definite (SPD) matrices (e.g., covariances, graph Laplacians, etc.) are widely used to model the relationship of spatial or temporal domain. Nevertheless, SPD matrices are theoretically embedded on Riemannian manifolds. In this paper, we propose an end-to-end deep manifold-to-manifold transforming network (DMT-Net) which can make SPD matrices flow from one Riemannian manifold to another more discriminative one. To learn discriminative SPD features characterizing both spatial and temporal dependencies, we specifically develop three novel layers on manifolds: (i) the local SPD convolutional layer, (ii) the non-linear SPD activation layer, and (iii) the Riemannian-preserved recursive layer. The SPD property is preserved through all layers without any requirement of singular value decomposition (SVD), which is often used in the existing methods with expensive computation cost. Furthermore, a diagonalizing SPD layer is designed to efficiently calculate the final metric for the classification task. To evaluate our proposed method, we conduct extensive experiments on the task of action recognition, where input signals are popularly modeled as SPD matrices. The experimental results demonstrate that our DMT-Net is much more competitive over state-of-the-art.

연구 동기 및 목표

  • 행동 인식을 위한 리만 다양체에 임bed된 SPD 행렬로부터 분류 능력 있는 특징을 학습하는 데 도전한다.
  • 기존의 SPD 딥 러닝 방법에서 SVD 기반 연산의 높은 계산 비용을 해결한다.
  • 리만 다양체 상에서 순환 레이어를 사용하여 행동 시퀀스의 시간 동적 특성을 효과적으로 모델링한다.
  • 비용이 많이 드는 행렬 로그 또는 SVD에 의존하지 않고도 효율적인 거리 측정을 위한 분류 방법을 설계한다.
  • 모든 레이어에서 SPD 구조를 유지하는 통합형 엔드 투 엔드 학습 가능한 네트워크를 개발하여 표현 학습 성능을 향상시킨다.

제안 방법

  • 필터를 SPD 행렬로 제약하는 국소 SPD 컨볼루션 레이어를 제안하며, 이론적 증명을 통해 다양체 유지 보장을 보장한다.
  • 요소별 연산(예: exp, sinh, cosh)을 사용하는 비선형 SPD 활성화 레이어를 도입하여 SVD를 피하고 슈르 곱의 정리에 의해 SPD 구조를 유지한다.
  • GRU에 영감을 얻은 리만 유지형 순환 레이어를 설계하였으며, 모든 연산(이차형 사영, 활성화, 하다르드 곱)이 SPD 성질을 유지하는 것으로 증명되었다.
  • SPD 행렬을 대각형으로 변환하여 SVD 없이도 효율적인 로그-유클리드 거리 측정을 가능하게 하는 대각화 SPD 레이어를 통합한다.
  • 매니폴드 간 전환 전략을 적용하여 SPD 특징가 여러 리만 다양체를 거쳐 다각도로 분류 능력을 향상시킨다.
  • 모든 구성 요소를 통합하여 행동 인식을 위한 공동 최적화가 가능한 엔드 투 엔드 딥 네트워크를 구성하였으며, 각 단계에서 SPD 유지 보장에 대한 이론적 보장을 확보하였다.

실험 결과

연구 질문

  • RQ1SPD 행렬에 대해 국소 컨볼루션 필터링을 수행하면서도 리만 다양체 구조를 유지할 수 있는 방법은 무엇인가?
  • RQ2SVD나 행렬 로그를 요구하지 않고도 SPD 행렬에 대한 비선형 활성화 함수를 설계할 수 있는가?
  • RQ3시간적 의존성을 모델링하기 위해 순환 학습을 리만 다양체로 일반화할 수 있는가?
  • RQ4계산 비용이 많이 드는 SVD나 행렬 로그 연산에 의존하지 않고도 SPD 행렬에 대한 효율적인 거리 측정을 달성할 수 있는가?
  • RQ5기존의 최고 성능 방법에 비해 매니폴드 투 매니폴드 딥 네트워크가 행동 인식 성능에 얼마나 기여하는가?

주요 결과

  • DMT-Net은 다양한 행동 인식 벤치마크에서 최고 성능을 기록하며 기존 최고 성능 방법을 능가한다.
  • 제안된 국소 SPD 컨볼루션 레이어는 리만 다양체 구조를 유지하면서 SVD 없이도 효과적인 局부 특징 학습을 가능하게 한다.
  • 비선형 SPD 활성화 레이어는 요소별 연산을 사용하여 SVD를 피하고 슈르 곱의 정리에 의해 SPD 성질을 유지한다.
  • 리만 유지형 순환 레이어는 시간 단계 간 SPD 구조를 유지하면서도 장거리 시간적 의존성을 효과적으로 모델링한다.
  • 대각화 SPD 레이어는 SVD 없이도 효율적인 로그-유클리드 거리 측정을 가능하게 하여 계산 비용을 감소시키면서도 분류 정확도를 유지한다.
  • 광범위한 실험을 통해 DMT-Net이 다양한 데이터셋에서 기존 방법을 일관되게 능가함을 확인하였으며, 이는 강건성과 일반화 능력을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.