Skip to main content
QUICK REVIEW

[논문 리뷰] Temporal Interlacing Network

Hao Shao, Shengju Qian|arXiv (Cornell University)|2020. 01. 17.
Human Pose and Action Recognition참고 문헌 29인용 수 11
한 줄 요약

이 논문은 시간적 및 공간적 특징을 학습을 통해 시간에 따라 표현을 교차시키는 방식으로 공간적 및 시간적 특징을 융합하는 경량이며 미분 가능한 모듈인 Time Interlacing Network(TIN)을 제안한다. 이는 복잡한 시간 모델을 대체한다. TIN은 여섯 개의 벤치마크에서 기존 최고 성능 기준으로 4% 높은 정확도를 달성하면서도 기존 최고 성능 기준으로 6배 빠른 저지연을 보이며 영상 이해 분야에서 새로운 SOTA 성능을 수립하였다. 이는 ICCV19 Multi Moments in Time 챌린지에서 1위를 차지한 바 있다.

ABSTRACT

For a long time, the vision community tries to learn the spatio-temporal representation by combining convolutional neural network together with various temporal models, such as the families of Markov chain, optical flow, RNN and temporal convolution. However, these pipelines consume enormous computing resources due to the alternately learning process for spatial and temporal information. One natural question is whether we can embed the temporal information into the spatial one so the information in the two domains can be jointly learned once-only. In this work, we answer this question by presenting a simple yet powerful operator -- temporal interlacing network (TIN). Instead of learning the temporal features, TIN fuses the two kinds of information by interlacing spatial representations from the past to the future, and vice versa. A differentiable interlacing target can be learned to control the interlacing process. In this way, a heavy temporal model is replaced by a simple interlacing operator. We theoretically prove that with a learnable interlacing target, TIN performs equivalently to the regularized temporal convolution network (r-TCN), but gains 4% more accuracy with 6x less latency on 6 challenging benchmarks. These results push the state-of-the-art performances of video understanding by a considerable margin. Not surprising, the ensemble model of the proposed TIN won the $1^{st}$ place in the ICCV19 - Multi Moments in Time challenge. Code is made available to facilitate further research at https://github.com/deepcs233/TIN

연구 동기 및 목표

  • 공간적 및 시간적 특징 학습을 번갈아가며 수행하는 기존의 스펙트로-시간 영상 인식 모델의 높은 계산 비용 문제를 해결하기 위해.
  • 시간적 및 공간적 정보가 통합된 단일의 경량 연산자를 통해 함께 학습할 수 있는지 탐색하기 위해.
  • RNN이나 3D 컨볼루션과 같은 복잡한 시간 모델링 구성 요소를 대체할 수 있는 단순하면서도 효과적인 모듈을 설계하기 위해.
  • 최소한의 FLOPs와 파라미터로 영상 분류 분야에서 최고의 성능을 달성하기 위해.

제안 방법

  • TIN은 입력 특징 맵을 그룹으로 나누고, 다양한 시간 프레임 간의 특징을 교차시키기 위한 공간적 오프셋을 학습한다.
  • 특징 공간 내에서 직접적으로 시간적 표현을 융합하기 위해 미분 가능한 이동 및 보간을 적용한다.
  • 그룹별로 학습 가능한 가중치를 사용하여 교차된 특징을 집계함으로써 적응형 시간 모델링을 가능하게 한다.
  • 교차 과정은 미분 가능하며, 종료에서 종료까지 최적화가 가능하여 공간적 및 시간적 표현의 공동 학습을 가능하게 한다.
  • 이론적으로 TIN은 정규화된 시간 컨볼루션 네트워크(r-TCN)와 동치임을 증명하여 그 표현력의 타당성을 입증한다.
  • 모듈은 플러그 앤 플레이 방식으로 구현되어 입력의 공간 차원을 유지하며 최소한의 계산 오버헤드를 유발한다.

실험 결과

연구 질문

  • RQ1단일의 통합 연산자로 시간적 및 공간적 특징을 함께 학습함으로써 계산 비용을 줄일 수 있는가?
  • RQ2학습 가능한 교차 메커니즘은 RNN이나 3D 컨볼루션과 같은 무거운 시간 모델링 구성 요소를 대체할 수 있는가?
  • RQ3제안된 TIN 모듈은 기존의 최고 성능 기준 방법과 비교해 비슷하거나 더 뛰어난 영상 인식 성능을 달성하는가?
  • RQ4그룹 수와 역방향 오프셋의 사용이 장거리 시간적 의존성을 포착하는 데 모델의 능력에 어떤 영향을 미치는가?

주요 결과

  • TIN은 여섯 개의 과도한 영상 이해 벤치마크에서 이전의 최고 성능 기준 방법보다 4% 높은 정확도를 달성하였다.
  • TIN은 이전 SOTA와 비교해 추론 지연을 6배 줄였으며, 정확도는 유지하거나 향상시켰다.
  • 8-프레임 및 16-프레임 입력을 사용한 TIN 앙상블은 ICCV19 Multi Moments in Time 챌린지에서 1위를 차지하였다.
  • Something-Something v2 데이터셋에서 TIN은 60.1%의 상위-1 정확도를 기록하여 TSM을 능가했으며, SOTA 성능에 가까이 접근하였다.
  • 절단 분석 결과, 2개의 그룹과 역방향 오프셋 조합이 가장 우수한 성능를 보였으며, 표현 능력과 학습 안정성 사이의 최적 균형을 이룬다.
  • 시각화 결과, 깊은 층일수록 더 큰 시간적 오프셋을 학습하고 있음을 확인하여 고수준 특징이 시간적 교차에 더 큰 이점을 얻음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.