Skip to main content
QUICK REVIEW

[논문 리뷰] Progressive Localization Networks for Language-based Moment Localization

Qi Zheng, Jianfeng Dong|arXiv (Cornell University)|2021. 02. 02.
Human Pose and Action Recognition참고 문헌 52인용 수 12
한 줄 요약

이 논문은 언어 기반 모멘트 로컬라이제이션을 위한 다단계적, 굵부터 섬세한 방식의 프로그레시브 로컬라이제이션 네트워크(PLN)를 제안한다. PLN은 각 단계에서 다양한 시간 해상도를 가진 영상 클립을 활용하여 점진적으로 로컬라이제이션을 정밀화한다. 조건부 특징 조작 모듈과 업샘플링 연결을 통합함으로써, 특히 짧은 모멘트에 대해 정확도를 향상시키며, 세 가지 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

This paper targets the task of language-based video moment localization. The language-based setting of this task allows for an open set of target activities, resulting in a large variation of the temporal lengths of video moments. Most existing methods prefer to first sample sufficient candidate moments with various temporal lengths, and then match them with the given query to determine the target moment. However, candidate moments generated with a fixed temporal granularity may be suboptimal to handle the large variation in moment lengths. To this end, we propose a novel multi-stage Progressive Localization Network (PLN) which progressively localizes the target moment in a coarse-to-fine manner. Specifically, each stage of PLN has a localization branch, and focuses on candidate moments that are generated with a specific temporal granularity. The temporal granularities of candidate moments are different across the stages. Moreover, we devise a conditional feature manipulation module and an upsampling connection to bridge the multiple localization branches. In this fashion, the later stages are able to absorb the previously learned information, thus facilitating the more fine-grained localization. Extensive experiments on three public datasets demonstrate the effectiveness of our proposed PLN for language-based moment localization, especially for localizing short moments in long videos.

연구 동기 및 목표

  • 언어 기반 모멘트 로컬라이제이션에서 매우 다양한 시간 길이를 가진 모멘트를 로컬라이제이션하는 과제를 해결한다.
  • 고정된 시간 해상도를 가진 후보 샘플링 방식의 한계를 극복하여, 짧거나 긴 모멘트에서의 성능 저하 문제를 해결한다.
  • 점진적으로 굵부터 섬세한 해상도로 로컬라이제이션을 정밀화하는 다단계 아키텍처를 개발한다.
  • 기존의 단일 단계 모델이 간과하는 경향이 있는 장시간 영상에서 짧은 모멘트의 성능 향상을 도모한다.
  • 다단계 로컬라이제이션에서 계층적 특징 학습과 단계 간 정보 흐름의 효과를 입증한다.

제안 방법

  • 각 단계에서 점점 더 세밀한 시간 해상도를 가진 영상 클립을 처리하는 다단계 프로그레시브 로컬라이제이션 네트워크(PLN)를 제안한다.
  • PLN의 각 단계는 고유한 시간 해상도에 맞는 후보 모멘트를 생성하고 매칭하는 로컬라이제이션 브랜치를 포함한다.
  • 이전 단계의 특징을 이후 단계에 입력하기 전에 적응적으로 개선하기 위해 조건부 특징 조작(CFM) 모듈을 도입한다.
  • 고수준 특징을 이전(粗) 단계에서 이후(細) 단계로 전달하기 위해 업샘플링 연결을 구현함으로써 점진적인 정밀화를 가능하게 한다.
  • 각 단계에서 언어 쿼리와 후보 모멘트 간의 다중 모odal 유사도 매칭을 통해 로컬라이제이션을 유도한다.
  • 각 해상도 수준에서 정확한 로컬라이제이션을 장려하기 위해 다단계 손실을 사용하여 전체 네트워크를 엔드 투 엔드로 훈련한다.

실험 결과

연구 질문

  • RQ1단일 단계 모델 대비 다양한 모멘트 길이에서 굵부터 섬세한 다단계 접근 방식이 로컬라이제이션 성능을 향상시키는가?
  • RQ2다양한 시간 해상도를 가진 점진적 정밀화가 짧고 긴 영상 모멘트의 로컬라이제이션에 어떤 영향을 미치는가?
  • RQ3조건부 특징 조작(CFM)과 업샘플링 연결의 기여도는 단계 간 특징 전달 향상에 어떤가?
  • RQ4제안된 PLN 아키텍처는 특히 장시간 영상에서 짧은 모멘트에 대해 기존 최신 기술 수준의 모델을 초월하는가?
  • RQ5고정된 해상도 샘플링 대비 굵부터 섬세한 설계가 재현성 감소와 최적화 향상에 얼마나 기여하는가?

주요 결과

  • PLN은 세 가지 공개 벤치마크인 Charades-STA, TACoS, ActivityNet Captions에서 최신 기술 수준의 성능을 달성했으며, 각각 Rank@1, IoU=0.5 점수는 45.43%, 31.12%, 45.66%를 기록했다.
  • TACoS에서 PLN는 가장 짧은 모멘트 그룹에 대해 2D-TAN 대비 상대적 성능 향상을 48.5% 기록하여 짧은 지속 시간의 모멘트 처리 능력이 뛰어나다는 것을 입증했다.
  • 제거 실험 결과 CFM 또는 업샘플링 연결(UC)을 제거할 경우 성능 저하가 발생함으로써, 두 요소의 효과성이 입증되었다.
  • 모든 단계에서 동일한 해상도를 사용하는 모델 대비 다양한 해상도를 가진 굵부터 섬세한 전략이 성능이 뛰어나, 설계 선택의 타당성을 입증했다.
  • TACoS에서 IoU=0.3일 때 PLN은 mIoU 29.70%를 기록하여 기준 모델 대비 뚜렷한 성능 향상을 보였으며, 특히 낮은 IoU 영역에서 두각을 나타냈다.
  • 모든 모멘트 길이 그룹에서 일관된 성능 향상을 보였으며, TACoS에서 가장 짧은 모멘트 그룹에서 상대적 향상이 가장 크게 나타났다(48.5%).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.