Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring Optical-Flow-Guided Motion and Detection-Based Appearance for Temporal Sentence Grounding

Daizong Liu, Xiang Fang|arXiv (Cornell University)|2022. 03. 06.
Human Pose and Action Recognition인용 수 4
한 줄 요약

이 논문은 시간 문장 지목 작업을 위한 새로운 3D 세분적 추론 네트워크인 MA3SRN을 제안한다. 이 네트워크는 운동 인식 모듈을 통해 운동 인식 특징, 탐지 기반 외관 인식 특징, 3D 인식 특징을 융합한다. 모델은 ActivityNet Caption, Charades-STA, TACoS에서 최신 기준 성능을 달성하였으며, Charades-STA에서 최대 45.63% (R@1, IoU=0.7) 및 73.86% (R@5, IoU=0.7)의 성능 향상을 기록하였다.

ABSTRACT

Temporal sentence grounding aims to localize a target segment in an untrimmed video semantically according to a given sentence query. Most previous works focus on learning frame-level features of each whole frame in the entire video, and directly match them with the textual information. Such frame-level feature extraction leads to the obstacles of these methods in distinguishing ambiguous video frames with complicated contents and subtle appearance differences, thus limiting their performance. In order to differentiate fine-grained appearance similarities among consecutive frames, some state-of-the-art methods additionally employ a detection model like Faster R-CNN to obtain detailed object-level features in each frame for filtering out the redundant background contents. However, these methods suffer from missing motion analysis since the object detection module in Faster R-CNN lacks temporal modeling. To alleviate the above limitations, in this paper, we propose a novel Motion- and Appearance-guided 3D Semantic Reasoning Network (MA3SRN), which incorporates optical-flow-guided motion-aware, detection-based appearance-aware, and 3D-aware object-level features to better reason the spatial-temporal object relations for accurately modelling the activity among consecutive frames. Specifically, we first develop three individual branches for motion, appearance, and 3D encoding separately to learn fine-grained motion-guided, appearance-guided, and 3D-aware object features, respectively. Then, both motion and appearance information from corresponding branches are associated to enhance the 3D-aware features for the final precise grounding. Extensive experiments on three challenging datasets (ActivityNet Caption, Charades-STA and TACoS) demonstrate that the proposed MA3SRN model achieves a new state-of-the-art.

연구 동기 및 목표

  • 시간적으로 인접한 영상 프레임 간의 미세한 시각적 차이와 배경-전경 콘텐츠를 구분하는 데 어려움을 겪는 프레임 수준의 특징 추출 기법의 한계를 해결한다.
  • Faster R-CNN에 의존하는 탐지 기반 방법에서 시간적 모델링의 부족으로 인해 개체 수준에서 운동 맥락을 포착하지 못하는 문제를 해결한다.
  • 운동, 외관, 3D 인식 특징을 동시에 모델링하여 더 정확한 활동 지역화를 위한 시간 문장 지목 성능을 향상시킨다.
  • 운동 및 외관 신호를 3D 인식 특징과 효과적으로 융합하는 통합 프레임워크를 개발하여 지목 정밀도를 향상시킨다.

제안 방법

  • 광학 흐름 기반 운동 인식 특징, 탐지 기반 외관 인식 특징(Faster R-CNN 사용), 3D 합성곱 신경망을 통한 3D 인식 특징 학습을 위한 세 가지 전용 브랜치를 설계한다.
  • 운동 및 외관 정보를 3D 인식 특징에 융합하기 위해 새로운 운동-외관 연관 모듈을 도입하여 특징 표현을 향상시킨다.
  • 연속 프레임 간의 미세한 운동 역학을 포착하기 위해 광학 흐름을 활용하여 유사한 동작(예: '열기'와 '닫기') 간의 구분을 향상시킨다.
  • 비최대 억제와 신뢰도 임계값을 적용하여 프레임당 탐지된 객체 수(K=20)를 제어함으로써 중복을 줄이고 핵심 인스턴스를 유지한다.
  • 대조 손실과 경계 인식 회귀 헤드를 사용하여 시작 및 종료 타임스탬프를 예측하는 방식으로 엔드 투 엔드로 모델을 훈련시킨다.
  • 정밀도와 계산 비용의 균형을 맞추기 위해 하이퍼파라미터, 특히 양성 임계값 λ(최적값 0.55)과 객체 수 K를 최적화한다.

실험 결과

연구 질문

  • RQ1광학 흐름 기반 운동 특징을 융합함으로써 '열기'와 '닫기'와 같이 의미적으로 유사한 동작를 더 잘 구분할 수 있는가?
  • RQ2모호한 전경-배경 콘텐츠를 포함한 복잡한 장면에서 탐지 기반 외관 특징을 통합함으로써 지목 정확도는 어느 정도 향상되는가?
  • RQ3운동 및 외관 정보를 3D 인식 특징과 융합하는 것이 시간-공간적 개체 관계를 모델링하는 데 얼마나 효과적인가?
  • RQ4양성 임계값 λ 및 프레임당 탐지 객체 수 K와 같은 하이퍼파라미터의 최적 설정은 무엇인가?
  • RQ5제안된 운동-외관 연관 모듈은 특징을 직접 연결하는 것보다 지목 성능에서 뚜렷한 우월성을 보이는가?

주요 결과

  • 제안된 MA3SRN은 Charades-STA에서 최신 기준 성능을 달성하였으며, R@1, IoU=0.7일 때 45.63%, R@5, IoU=0.7일 때 73.86%의 성능을 기록하였다.
  • 제거 분석 결과, 3D 인식 특징에 운동 및 외관 정보를 추가한 경우 기준 모델 대비 R@1에서 1.79%, R@5에서 1.81% 향상되었다.
  • 운동-외관 연관 모듈은 직접 연결 대비 R@1에서 1.79%, R@5에서 1.81% 향상되어 그 효과를 입증하였다.
  • 최적의 양성 임계값 λ는 0.55이며, 이 이상일 경우 과도하게 엄격한 후보 필터링으로 인해 성능이 저하된다.
  • 프레임당 탐지 객체 수 K=20이 성능과 GPU 메모리 비용 간의 최적 균형을 이룬다. K=30은 높은 비용에 비해 유의미한 성능 향상이 없었다.
  • 정성적 결과 분석에서 MA3SRN은 '문'과 '옷장'과 같은 미세한 객체 차이와 '열기'와 '들기'와 같은 복잡한 동작을 더 잘 포착하여, DRN 및 CBLN과 같은 프레임 수준 기반 기준 모델을 능가하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.