Skip to main content
QUICK REVIEW

[논문 리뷰] TFCNet: Temporal Fully Connected Networks for Static Unbiased Temporal Reasoning

Shiwen Zhang|arXiv (Cornell University)|2022. 03. 11.
Human Pose and Action Recognition인용 수 4
한 줄 요약

TFCNet는 3D 컨볼루션 네트워크에서 시간적 차원을 따라 완전 연결층을 근사하는 Temporal Fully Connected Blocks(TFC 블록)을 도입하여 전역적인 시간적 수용 영역을 향상시켜 정적 편향이 없는 시간적 추론 벤치마크에서 성능을 크게 향상시킨다. 이 방법은 CATER(98.4% top-1 정확도)와 Diving48(88.3% top-1 정확도)에서 SOTA 성능을 달성하며, RNN, 비전 트랜스포머, 이전의 CNN보다 큰 격차로 앞서나간다.

ABSTRACT

Temporal Reasoning is one important functionality for vision intelligence. In computer vision research community, temporal reasoning is usually studied in the form of video classification, for which many state-of-the-art Neural Network structures and dataset benchmarks are proposed in recent years, especially 3D CNNs and Kinetics. However, some recent works found that current video classification benchmarks contain strong biases towards static features, thus cannot accurately reflect the temporal modeling ability. New video classification benchmarks aiming to eliminate static biases are proposed, with experiments on these new benchmarks showing that the current clip-based 3D CNNs are outperformed by RNN structures and recent video transformers. In this paper, we find that 3D CNNs and their efficient depthwise variants, when video-level sampling strategy is used, are actually able to beat RNNs and recent vision transformers by significant margins on static-unbiased temporal reasoning benchmarks. Further, we propose Temporal Fully Connected Block (TFC Block), an efficient and effective component, which approximates fully connected layers along temporal dimension to obtain video-level receptive field, enhancing the spatiotemporal reasoning ability. With TFC blocks inserted into Video-level 3D CNNs (V3D), our proposed TFCNets establish new state-of-the-art results on synthetic temporal reasoning benchmark, CATER, and real world static-unbiased dataset, Diving48, surpassing all previous methods.

연구 동기 및 목표

  • 클립 기반 3D CNN이 정적 편향이 없는 시간적 추론 벤치마크에서 전역적인 시간 모델링이 부족해 실패하는 데 기인한 한계를 해결하기 위해.
  • 비디오 수준의 샘플링 전략이 RNN과 비전 트랜스포머에 비해 편향 없는 벤치마크에서 3D CNN의 경쟁력을 복원할 수 있는지 조사하기 위해.
  • 3D CNN에 전역적인 시간 모델링을 가능하게 하되, 과도한 파라미터나 FLOP 증가 없이도 효율적인 새로운 구성요소—TFC 블록—을 설계하기 위해.
  • 외부 데이터나 애너테이션에 의존하지 않고도 경량의 종단 간 학습 가능한 아키텍처를 통해 CATER와 Diving48에서 새로운 SOTA를 확립하기 위해.

제안 방법

  • 시간 차원을 따라 완전 연결 연산을 적용하여 영상 특징 내 장거리 의존성을 모델링하는 Temporal Fully Connected Blocks(TFC 블록)을 제안한다.
  • TFC 블록을 비디오 수준 3D CNN(V3D) 및 그 딥와이즈 변형에 통합하여 TFCNets를 구성함으로써 중간 레이어에서 전역적인 시간적 맥락 학습이 가능하도록 한다.
  • 학습 및 추론 시 클립 기반 샘플링과는 달리, 전체 영상 맥락을 사용하는 비디오 수준 샘플링 전략을 적용한다.
  • 시간 길이에 따라 제곱형으로 파라미터가 증가하지만 FLOP 오버헤드는 최소화하여 계산적으로 효율적인 TFC 블록을 설계한다.
  • 공간 컨볼루션 이후 TFC 블록을 삽입함으로써 공간적 및 시간적 특징 해상도를 유지하는 잔차 박스형 아키텍처를 사용한다.
  • Ablation 연구에서 TFC 블록을 SE 및 Nonlocal 블록과 비교하여, 더 낮은 파라미터 및 FLOP 비용으로도 뛰어난 정확도를 확보함을 입증한다.

실험 결과

연구 질문

  • RQ1비디오 수준 샘플링을 사용하는 3D CNN이 정적 편향이 없는 시간적 추론 벤치마크에서 RNN과 비전 트랜스포머를 능가할 수 있는가?
  • RQ2TFC 블록과 같은 전역적인 시간 모델링 메커니즘을 도입함으로써 CATER 및 Diving48와 같은 벤치마크에서 3D CNN의 성능이 크게 향상되는가?
  • RQ3SE 및 Nonlocal 블록과 같은 기존의 전역 수용 영역 메커니즘과 비교했을 때 TFC 블록은 정확도, 파라미터 수, FLOPs 측면에서 어떻게 성능을 내는가?
  • RQ4TFC 블록의 효과성은 입력 시퀀스 길이에 따라 달라지며, 어떤 조건에서 성능 향상이 가장 두드러지는가?
  • RQ5TFCNets는 외부 데이터나 애너테이션에 의존하지 않고도 SOTA 성능을 달성할 수 있는가?

주요 결과

  • TFCNets는 CATER 벤치마크에서 98.4%의 top-1 정확도를 달성하여, 비전 트랜스포머 및 외부 애너테이션을 사용하는 모델을 포함한 모든 이전 방법을 앞서나간다.
  • Diving48 V2에서 TFCNets는 88.3%의 top-1 정확도를 기록했으며, 최고의 보고된 비전 트랜스포머보다 7.3% 높고, Diving48 V1의 이전 SOTA보다 11.6% 높다.
  • 비디오 수준 샘플링 전략은 클립 수준 및 하이브리드 V4D 샘플링보다 30% 이상의 절대 정확도 향상을 보이며, 전역 추론에서의 우수성을 확인한다.
  • Nonlocal 블록 대비 27 GFLOP 감소를 기록하면서도 더 높은 정확도를 달성하여, TFC 블록의 뛰어난 효율성과 효과성을 입증한다.
  • SE 블록은 V3D에서 성능을 저하시키며, 전역 평균 풀링이 세밀한 시공간적 구조를 손상시키기 때문인 것으로 나타나, TFC 블록은 이러한 구조를 유지함을 시사한다.
  • TFCNets의 성능 향상은 파라미터 수 증가 때문이 아니라, 기준 V3D 대비 뿐만 아니라 0.3 GFLOPs만 더 소비하면서도 뚜렷한 정확도 향상을 이룬다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.