[논문 리뷰] Multi-Scale Self-Contrastive Learning with Hard Negative Mining for Weakly-Supervised Query-based Video Grounding
이 논문은 프레임 단위 일치 점수 예측과 하드 음성 샘플링을 통한 다중 척도 자기 대비 학습 프레임워크를 제안하여, 중복되는 세그먼트 제안 없이 비디오 수준의 레이블만으로 프레임 단위 일치 점수 예측이 가능한 약한 감독 기반 쿼리 기반 비디오 거시를 실현한다. 군중에서부터 세밀한 단계로 점진적으로 하드 음성 샘플을 채굴함으로써, 방법은 구분력 있는 프레임 수준 표현을 학습하며, 두 개의 벤치마크에서 기존 최고 성능를 달성한다.
Query-based video grounding is an important yet challenging task in video understanding, which aims to localize the target segment in an untrimmed video according to a sentence query. Most previous works achieve significant progress by addressing this task in a fully-supervised manner with segment-level labels, which require high labeling cost. Although some recent efforts develop weakly-supervised methods that only need the video-level knowledge, they generally match multiple pre-defined segment proposals with query and select the best one, which lacks fine-grained frame-level details for distinguishing frames with high repeatability and similarity within the entire video. To alleviate the above limitations, we propose a self-contrastive learning framework to address the query-based video grounding task under a weakly-supervised setting. Firstly, instead of utilizing redundant segment proposals, we propose a new grounding scheme that learns frame-wise matching scores referring to the query semantic to predict the possible foreground frames by only using the video-level annotations. Secondly, since some predicted frames (i.e., boundary frames) are relatively coarse and exhibit similar appearance to their adjacent frames, we propose a coarse-to-fine contrastive learning paradigm to learn more discriminative frame-wise representations for distinguishing the false positive frames. In particular, we iteratively explore multi-scale hard negative samples that are close to positive samples in the representation space for distinguishing fine-grained frame-wise details, thus enforcing more accurate segment grounding. Extensive experiments on two challenging benchmarks demonstrate the superiority of our proposed method compared with the state-of-the-art methods.
연구 동기 및 목표
- 완전 감독 기반 쿼리 기반 비디오 거시의 높은 주석 비용 문제를 비디오 수준의 레이블만을 활용하여 해결한다.
- 기존의 약한 감독 기반 방법들이 낮은 프레임 수준의 구분력을 가지는 중복된 사전 정의된 세그먼트 제안에 의존하는 한계를 극복한다.
- 정확한 지표가 없는 프레임 수준 표현 학습을 향상시켜, 정답 경계 근처의 유사한 음성 프레임을 구분할 수 있도록 한다.
- 로컬 프레임 척도와 글로벌 세그먼트 척도에서 점진적으로 더 어려운 음성 샘플을 채굴하는 코arse-to-fine 대비 학습 전략을 개발한다.
제안 방법
- 세그먼트 제안에 의존하지 않고, 어텐션 메커니즘을 사용하여 각 프레임의 전경 가능성 예측을 위한 프레임 단위 일치 점수 예측을 제안한다.
- 예측 점수 기반으로 동적으로 양성 및 음성 샘플을 정의하는 다중 척도 자기 대비 학습 파라다임을 도입한다.
- 샘플링 범위를 점진적으로 업데이트하여 점차 더 유사한 음성 프레임을 대상으로 하는 코arse-to-fine 반복적 하드 음성 샘플링 전략을 구현한다.
- 로컬 프레임 척도와 비국소적 세그먼트 척도에서 하드 음성 샘플을 탐색하여 다중 척도 내재 특징을 학습한다.
- 학습 가능한 하이퍼파ram터(λ_fra 및 λ_seg)를 사용하여 프레임 수준 및 세그먼트 수준 손실을 균형 잡아 거시 정확도를 최적화한다.
- 학습 가능한 임계값을 사용하여 연속적인 고점수 프레임을 그룹화하여 최종 예측 세그먼트를 구성한다.
실험 결과
연구 질문
- RQ1약한 감독 기반 비디오 거시에서, 프레임 단위 일치 점수 예측이 중복된 세그먼트 제안을 대체할 수 있는가?
- RQ2프레임 수준 주석이 없는 상황에서 반복적 하드 음성 샘플링을 통한 자기 대비 학습이 어떻게 프레임 수준 표현의 구분력을 향상시키는가?
- RQ3다중 척도(프레임 및 세그먼트) 하드 음성 샘플링이 유사한 전경 및 배경 프레임을 구분하는 데 어떤 영향을 미치는가?
- RQ4일회성 음성 샘플링 대비 점진적으로 더 어려운 음성 샘플을 채굴하는 전략이 거시 성능에 어떤 영향을 미치는가?
- RQ5학습 목표에서 프레임 수준과 세그먼트 수준 손실 성분 간 최적의 균형은 무엇인가?
주요 결과
- 제안된 MSCL 프레임워크는 약한 감독 설정 하에서 Charades-STA 및 ActivityNet-Caption 벤치마크에서 모두 최고 성능를 달성한다.
- SCN 및 VGN+CCL과 같은 기존 방법보다 우수하며, 특히 더 높은 정확도로 세그먼트 경계를 국소화할 수 있도록 하드 음성 프레임의 구분력 향상 덕분이다.
- 최적의 하이퍼파ram터 설정은 λ_fra = 10 및 λ_seg = 5이며, 이는 프레임 수준 및 세그먼트 수준 감독 간 균형을 맞추는 것이 성능에 매우 중요하다는 것을 시사한다.
- 배치 크기가 16일 때 최고 성능를 기록하며, 기존 대비 학습 방법과 달리 배치 크기 변화에 대해 뛰어난 내구성을 보였다.
- 시각화 결과는 반복적 하드 음성 샘플링 과정이 점차 정답 세그먼트에 가까운 샘플을 선택하는 경향을 보이며, 동적 샘플링 전략의 효과성을 확인한다.
- 프레임 단위 점수 곡선은 정확한 세그먼트에 대해 상한선 $b_u$ 이상의 최고 점수를 예측함으로써, 정확한 세그먼트 국소화가 가능하다는 것을 검증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.