[논문 리뷰] Learning Sparse 2D Temporal Adjacent Networks for Temporal Action Localization
이 논문은 제안된 2차원 시간적 인접 네트워크(S-2D-TAN)를 통해 제안된 방법의 길이에 따라 다를 수 있는 장기적 시간적 의존성을 구조적이고 희박한 샘플링 전략을 통해 균형 잡힌 맥락 인식을 가능하게 함으로써 시간적 액션 로컬라이제이션을 향상시키는 것을 제안한다. 이 방법은 HACS 테스트 세트에서 23.49 mAP를 기록하여, 2D-TAN의 불균형한 맥락 문제를 효과적으로 완화하고 압축된 계층적 특징 맵 처리 및 별도의 액션 분류기와의 점수 융합을 통해 2019년 경연에서 우승을 차지했다.
In this report, we introduce the Winner method for HACS Temporal Action Localization Challenge 2019. Temporal action localization is challenging since a target proposal may be related to several other candidate proposals in an untrimmed video. Existing methods cannot tackle this challenge well since temporal proposals are considered individually and their temporal dependencies are neglected. To address this issue, we propose sparse 2D temporal adjacent networks to model the temporal relationship between candidate proposals. This method is built upon the recent proposed 2D-TAN approach. The sampling strategy in 2D-TAN introduces the unbalanced context problem, where short proposals can perceive more context than long proposals. Therefore, we further propose a Sparse 2D Temporal Adjacent Network (S-2D-TAN). It is capable of involving more context information for long proposals and further learning discriminative features from them. By combining our S-2D-TAN with a simple action classifier, our method achieves a mAP of 23.49 on the test set, which win the first place in the HACS challenge.
연구 동기 및 목표
- 2D-TAN에서 짧은 제안은 특징 추출 중 더 많은 맥락에 접근하는 반면 긴 제안은 그렇지 못함에 따라 발생하는 불균형한 맥락 인식 문제를 해결하기 위함.
- 희박하고 계층적인 샘플링 전략을 통해 후보 제안 간 시간적 관계를 명시적으로 모델링함으로써 시간적 액션 로컬라이제이션을 향상시키기 위함.
- 제안 길이 기반으로 특징 맵을 재구성함으로써 긴 제안의 특징 학습을 향상시키기 위함.
- 겹치는 점수 예측과 액션 분류의 융합을 통해 HACS 데이터셋에서 최신 기술 성능을 달성하기 위함.
제안 방법
- 후보 제안의 시작 및 종료 시간을 각각 행과 열로 하는 2차원 시간 맵을 구성하며, 이는 SlowFast 기반 백본에서 유도된 특징 맵을 사용한다.
- 제안 길이에 따라 희박하게 샘플링한다: 짧은 제안(≤N/4)은 조밀하게, 중간 길이(N/4 < l ≤ N/2)는 간격 2로, 긴 제안(N/2 < l ≤ N)은 간격 4로 샘플링하여 세 개의 압축된 부분 맵을 형성한다.
- 각 부분 맵은 커널 크기 9와 0 패딩을 사용하는 공유된 4층 컨볼루션 네트워크를 거치며, 공간 차원을 유지한 후 원래 맵 레이아웃으로 특징 복구를 수행한다.
- 겹치는 점수는 완전 연결 층과 시그모이드 활성화 함수를 통해 예측되며, IoU 임계치 t_min=0.5와 t_max=1.0를 사용한 소프트 이진 교차 엔트로피 손실을 적용한다.
- IoU > 0.5인 제안을 정답에 기반으로 별도의 액션 분류기를 훈련시키며, 완전 연결 층과 소프트맥스를 사용해 클래스 점수를 예측한다.
- 최종 검출 점수는 겹치는 점수와 분류 점수의 원소별 곱셈으로 계산되며, 추론을 위해 NMS가 적용된다.
실험 결과
연구 질문
- RQ1시간적 액션 로컬라이제이션에서 제안 간 시간적 의존성을 효과적으로 모델링하여 특징 학습을 향상시킬 수 있는가?
- RQ2짧은 제안과 긴 제안 간 맥락 인식의 불균형이 2D-TAN의 성능에 얼마나 큰 영향을 미치며, 이를 어떻게 수정할 수 있는가?
- RQ3계층적이고 길이 인지 가능한 샘플링 전략이 제안 지속 시간에 걸쳐 특징 표현과 모델 일반화 능력을 향상시킬 수 있는가?
- RQ4겹치는 점수 예측과 별도의 액션 분류의 융합이 트림되지 않은 영상 데이터셋에서 로컬라이제이션 정확도를 향상시키는가?
주요 결과
- 제안된 S-2D-TAN은 HACS 테스트 세트에서 23.49 mAP를 기록하여 2019년 시간적 액션 로컬라이제이션 챌린지에서 1등을 차지했다.
- 절단 실험 결과에서 수신장(1에서 9층으로 증가)을 증가시키면 AR@100이 49.85%에서 63.25%로, AUC가 42.32%에서 58.11%로 향상되었다.
- 수신장은 그대로 유지하면서 후보 제안 수를 늘리면 성능이 55.24% AR@100(행 3)에서 63.25% (행 2)로 향상되었다.
- 길이 기반 부분 맵 처리를 통한 제안된 희박한 컨볼루션 전략은 AR@100을 67.25%로, AUC를 62.40%로 향상시켜 표준 2D-TAN을 능가했다(행 1).
- 최종적으로 S-2D-TAN과 별도의 액션 분류기의 융합은 HACS 테스트 세트에서 가장 높은 mAP 23.49를 기록했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.