Skip to main content
QUICK REVIEW

[논문 리뷰] AEI: Actors-Environment Interaction with Adaptive Attention for Temporal Action Proposals Generation

Viet-Khoa Vo-Ho, Hyekang Joo|arXiv (Cornell University)|2021. 10. 21.
Human Pose and Action Recognition참고 문헌 41인용 수 12
한 줄 요약

이 논문은 시간적 행동 제안 생성을 향상시키기 위해 적응형 어텐션을 사용하여 액터-환경 상호작용을 모델링하는 새로운 비디오 표현 네트워크인 AEI를 제안한다. 환경, 액터, 상호작용 감시자들을 적응형 어텐션 기반으로 통합함으로써 AEI는 ActivityNet-1.3과 THUMOS-14에서 최신 기술 수준(SOTA) 성능을 달성하여 제안 생성 및 탐지 작업 모두에서 이전 방법들보다 뚜렷한 성능 향상을 보였다.

ABSTRACT

Humans typically perceive the establishment of an action in a video through the interaction between an actor and the surrounding environment. An action only starts when the main actor in the video begins to interact with the environment, while it ends when the main actor stops the interaction. Despite the great progress in temporal action proposal generation, most existing works ignore the aforementioned fact and leave their model learning to propose actions as a black-box. In this paper, we make an attempt to simulate that ability of a human by proposing Actor Environment Interaction (AEI) network to improve the video representation for temporal action proposals generation. AEI contains two modules, i.e., perception-based visual representation (PVR) and boundary-matching module (BMM). PVR represents each video snippet by taking human-human relations and humans-environment relations into consideration using the proposed adaptive attention mechanism. Then, the video representation is taken by BMM to generate action proposals. AEI is comprehensively evaluated in ActivityNet-1.3 and THUMOS-14 datasets, on temporal action proposal and detection tasks, with two boundary-matching architectures (i.e., CNN-based and GCN-based) and two classifiers (i.e., Unet and P-GCN). Our AEI robustly outperforms the state-of-the-art methods with remarkable performance and generalization for both temporal action proposal generation and temporal action detection.

연구 동기 및 목표

  • 기존 시간적 행동 제안 생성(TAPG) 방법들이 비디오 표현을 흑상자처럼 취급하여 액터-환경 상호작용을 통한 행동 시작 및 종료에 대한 인간의 인지 방식을 忽略한다는 한계를 해결하기 위해.
  • 비디오 스니펫에서 액터와 환경 간의 상호작용을 명시적으로 모델링하여 인간의 인지 방식을 시뮬레이션함으로써 행동 국소화 정확도를 향상시키기 위해.
  • 새로운 적응형 어텐션 기반 메커니즘을 사용해 전역 환경적 맥락, 국소 액터 특징, 그리고 그들의 동적 상호작용을 통합함으로써 비디오 표현을 향상시키기 위해.
  • 비디오 이해에서 인간 유사 인지 방식을 모델링함으로써 다양한 데이터셋과 백본 아키텍처에서 강력하고 일반화 가능한 성능 향상을 이끌어내는 것이 가능함을 입증하기 위해.

제안 방법

  • 환경 감시자(전역 맥락), 액터 감시자(국소 액터 특징), 상호작용 감시자(액터-환경 관계 모델링)를 전용으로 갖춘 인지 기반 시각적 표현(PVR) 모듈을 도입한다.
  • 액터 감시자에서 주요 액터를 그 행동에 대한 관련성에 따라 동적으로 식별하고 집중하기 위해 적응형 어텐션 기반 메커니즘(AAM)을 적용한다.
  • 환경 감시자와 액터 감시자로부터의 특징을 상호작용 감시자를 통해 어텐션 기반 가중치를 사용해 융합하여 주목할 만한 상호작용을 강조한다.
  • 향상된 비디오 표현에서 행동 제안을 생성하기 위해 CNN 기반 또는 GCN 기반 아키텍처를 사용하는 경계 매칭 모듈(BMM)을 활용한다.
  • 신뢰도 점수와 IoU 임계값을 기반으로 중복된 제안을 제거하기 위해 비최대 억제(NMS)를 적용한다.
  • 제안 분류를 위한 교차 엔트로피 손실과 경계 정밀화를 위한 회귀 손실을 사용해 엔드 투 엔드로 훈련한다.

실험 결과

연구 질문

  • RQ1비디오 스니펫에서 액터-환경 상호작용을 모델링하는 것이 표준 비디오 표현 학습을 넘어서 시간적 행동 제안 생성을 향상시킬 수 있는가?
  • RQ2주요 액터 선택을 위한 적응형 어텐션의 포함 여부가 행동 제안 네트워크 성능에 어떤 영향을 미치는가?
  • RQ3제안된 AEI 프레임워크가 다양한 백본 아키텍처(CNN 대비 GCN)와 데이터셋(ActivityNet-1.3, THUMOS-14) 간에 얼마나 일반화되는가?
  • RQ4환경적 상호작용을 통해 행동 시작 및 종료에 대한 인간의 인지 방식을 명시적으로 모델링하면 탐지 및 제안 품질이 향상되는가?
  • RQ5PVR 모듈의 각 구성 요소(환경, 액터, 상호작용 감시자)가 전체 성능에 기여하는 비율은 어느 정도인가?

주요 결과

  • AEI-B(CNN 기반 BMM)는 THUMOS-14에서 600개의 제안에서 평균 재현율 58.7%를 달성하여 이전의 SOTA인 GTAD*보다 0.9% 높고, BSN*보다는 5.9% 높았다.
  • AEI-G(GCN 기반 BMM)는 THUMOS-14에서 600개의 제안에서 평균 재현율 57.4%를 달성하여 GTAD*보다 0.8% 높고, BSN*보다는 5.8% 높았다.
  • ActivityNet-1.3에서 AEI-B는 AR@100에서 23.4%, AR@200에서 35.9%, AR@300에서 44.7%, AR@500에서 52.7%, AR@1000에서 58.7%를 기록했으며, 이는 이전의 SOTA인 GTAD*보다 AR@1000에서 1.3% 높았다.
  • 절단 실험 결과 상호작용 감시자와 적응형 어텐션 기반 메커니즘이 핵심임을 확인했다. 이들을 제거하면 성능이 뚜렷이 저하되었으며, '상호작용 감시자 제외' 조건은 '환경만' 조건보다도 성능이 열 劣했다.
  • 주요 액터 선택 구성 요소가 특징 융합보다 더 큰 기여를 하며, 성능 향상에 있어 핵심 액터 식별의 정확성이 융합 전략보다 더 중요하다는 것을 시사한다.
  • AEI는 CNN 및 GCN 기반의 BMM 아키텍처와 UNet 및 P-GCN 기반의 분류기 모두에서 강력한 일반화 성능을 보여, 그 견고성과 설계의 효과성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.