Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning for Weakly Supervised Temporal Grounding of Natural Language in Untrimmed Videos

Jie Wu, Guanbin Li|arXiv (Cornell University)|2020. 09. 18.
Multimodal Machine Learning Applications참고 문헌 41인용 수 10
한 줄 요약

이 논문은 영상 수준의 캡션만 제공되는 비정형 영상에서 약한 지도 학습 기반의 시간적 지정을 위한 강화학습 기반 프레임워크인 경계 적응형 정밀화(Boundary Adaptive Refinement, BAR)를 제안한다. BAR는 교차 모달 정렬 평가자로 맞춤형 보상을 제공하여 슬라이딩 윈도우 없이 경계가 민감한 시간 영역을 적응적으로 정밀화한다. 이는 Charades-STA 및 ActivityNet에서 최신 기술 수준(SOTA) 성능을 달성하며, 일부 완전 지도 학습 방법을 초월한다.

ABSTRACT

Temporal grounding of natural language in untrimmed videos is a fundamental yet challenging multimedia task facilitating cross-media visual content retrieval. We focus on the weakly supervised setting of this task that merely accesses to coarse video-level language description annotation without temporal boundary, which is more consistent with reality as such weak labels are more readily available in practice. In this paper, we propose a \emph{Boundary Adaptive Refinement} (BAR) framework that resorts to reinforcement learning (RL) to guide the process of progressively refining the temporal boundary. To the best of our knowledge, we offer the first attempt to extend RL to temporal localization task with weak supervision. As it is non-trivial to obtain a straightforward reward function in the absence of pairwise granular boundary-query annotations, a cross-modal alignment evaluator is crafted to measure the alignment degree of segment-query pair to provide tailor-designed rewards. This refinement scheme completely abandons traditional sliding window based solution pattern and contributes to acquiring more efficient, boundary-flexible and content-aware grounding results. Extensive experiments on two public benchmarks Charades-STA and ActivityNet demonstrate that BAR outperforms the state-of-the-art weakly-supervised method and even beats some competitive fully-supervised ones.

연구 동기 및 목표

  • 비정형 영상에서 오직 영상 수준의 언어 기술서만 제공되는 조건에서 시간적 지정의 과제를 해결하기 위해.
  • 제안-순서 프레임워크에서 고정된 슬라이딩 윈도우 접근 방식의 한계를 극복하기 위해, 경계의 민감성과 콘텐츠 인식 능력이 부족한 점을 해결하기 위해.
  • 세부적인 애너테이션 없이도 교차 모달 정렬을 향해 시간 경계를 적응적으로 정밀화할 수 있는 강화학습 기반 프레임워크를 설계하기 위해.
  • 쌍별 경계 지도 정보가 없는 상황에서 정책 학습을 이끄는 데 사용할 수 있는 교차 모달 정렬 점수 기반의 보상 메커니즘을 설계하기 위해.
  • 일반적인 슬라이딩 윈도우 스캔 방식을 대체하여 동적이고 환경 인식적인 정밀화 과정을 도입함으로써 정확도와 효율성을 동시에 향상시키기 위해.

제안 방법

  • 강화학습 에이전트가 방향 및 스텝 크기 조작을 위한 액션을 사용하여 반복적으로 시간 경계를 조정한다.
  • 상황 인식 특징 추출기가 현재 상태, 즉 영상 세그먼트와 쿼리 임베딩을 포함하여 의사결정을 지원한다.
  • 적응형 액션 플래너는 현재 상태와 정렬 점수를 기반으로 경계 조정을 선택하여 윈도우 크기의 민감한 조정을 가능하게 한다.
  • 교차 모달 정렬 평가자는 상호 영상 간 및 내부 영상 간 순위 손실을 사용하여 영상 세그먼트와 쿼리 간의 의미적 매칭을 추정한다.
  • 정렬 평가자는 연속적인 세그먼트-쿼리 쌍의 정렬 점수를 비교하여 조밀하고 연속적인 보상 신호를 제공함으로써 효과적인 정책 최적화를 가능하게 한다.
  • 과도하게 길거나 짧은 세그먼트를 방지하기 위해 길이 페널티를 적용하여 수렴성과 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1정확한 경계 애너테이션이 제공되지 않는 상황에서 강화학습이 약한 지도 학습 기반의 시간적 지정에 효과적으로 적용될 수 있는가?
  • RQ2쌍별 세그먼트-쿼리 지도 정보가 없는 상황에서 신뢰할 수 있고 정보적인 보상 함수를 어떻게 설계할 수 있는가?
  • RQ3경계 적응형 정밀화 전략은 고정된 슬라이딩 윈도우 접근 방식에 비해 정확도와 효율성 측면에서 뛰어나게 작용할 수 있는가?
  • RQ4내부 영상 순위 손실을 통합할 경우 정렬 및 지정 성능에 얼마나 기여하는가?
  • RQ5길이 페널티 및 정지 신호 전략은 정밀화 과정의 수렴성과 강건성에 어떤 영향을 미치는가?

주요 결과

  • BAR는 Charades-STA 및 ActivityNet에서 최신 기술 수준의 성능을 달성하며, 기존의 약한 지도 학습 방법을 뛰어넘고 일부 완전 지도 학습 기반 보다도 뛰어난 성능을 보였다.
  • Charades-STA에서 컨텍스트 정보를 포함할 경우 tIoU@0.5는 2.53% 향상되고 tIoU@0.7는 2.35% 향상되어 콘텐츠 인식 모델링의 유용성을 입증하였다.
  • 제거 실험 결과, 내부 영상 순위 손실(L_intra)을 제거할 경우 tIoU@0.3는 51.64%에서 46.82%로 감소하여 정렬 정확도에서 핵심적인 역할을 한다는 것을 입증하였다.
  • 정렬 점수 S와 진짜 IoU 간의 상관계수(CC)는 0.79에 도달하여 S가 매칭 품질의 신뢰할 수 있는 대체 지표임을 확인하였다.
  • BAR는 평균 추론 시간을 0.068초로 단축하고 영상당 평균 후보 제안 수를 1개로 줄였으며, TGA 대비 0.104초와 65.11개의 후보 제안에 비해 뚜렷한 효율성 향상을 보였다.
  • 최적의 초모수는 δ = 0.35 및 τ = 0.5이며, 이 값들이 너무 크거나 너무 작아지면 성능이 크게 떨어짐을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.