[논문 리뷰] Weak Supervision and Referring Attention for Temporal-Textual Association Learning
이 논문은 영상의 비디오 수준 자연어 기술서만을 supervision으로 사용하여 시간-텍스트 연관을 위한 약한 지도 학습 프레임워크 WSRA를 제안한다. 내영상 세그먼트 신호, 하드 음성 마이닝, 교차 영상 시각 유사도를 활용함으로써 WSRA는 DiDeMo 및 Charades-STA와 같은 벤치마크에서 완전 지도 학습 모델과 경쟁하는 성능을 달성하며, 기존의 약한 지도 학습 방법보다 최대 18% 높은 Recall 성능을 기록한다.
A system capturing the association between video frames and textual queries offer great potential for better video analysis. However, training such a system in a fully supervised way inevitably demands a meticulously curated video dataset with temporal-textual annotations. Therefore we provide a Weak-Supervised alternative with our proposed Referring Attention mechanism to learn temporal-textual association (dubbed WSRA). The weak supervision is simply a textual expression (e.g., short phrases or sentences) at video level, indicating this video contains relevant frames. The referring attention is our designed mechanism acting as a scoring function for grounding the given queries over frames temporally. It consists of multiple novel losses and sampling strategies for better training. The principle in our designed mechanism is to fully exploit 1) the weak supervision by considering informative and discriminative cues from intra-video segments anchored with the textual query, 2) multiple queries compared to the single video, and 3) cross-video visual similarities. We validate our WSRA through extensive experiments for temporally grounding by languages, demonstrating that it outperforms the state-of-the-art weakly-supervised methods notably.
연구 동기 및 목표
- 프레임 수준의 애너테이션이 없는 영상에서 시간-텍스트 연관을 학습하는 데 도전하는 것.
- 비디오 수준의 자연어 기술서만을 supervision으로 사용하는 효과적인 약한 지도 학습 프레임워크를 개발하는 것.
- 내영상 세그먼트에서의 유용한 신호, 다중 쿼리, 교차 영상 시각 유사도를 활용하여 지능형 지도 학습의 성능을 향상시키는 것.
- 대조 학습과 하드 음성 샘플링을 활용하여 쿼리를 관련 영상 세그먼트에 동적으로 지정하는 새로운 주의 메커니즘을 설계하는 것.
- 표준 벤치마크(DiDeMo, Charades-STA)에서 프레임워크를 검증하고 기존의 약한 지도 및 완전 지도 학습 방법보다 뛰어난 성능을 입증하는 것.
제안 방법
- 참조 주의 메커니즘은 쿼리 기반으로 관련이 없는 프레임을 식별하고 억제함으로써 관련 세그먼트에 집중력을 높인다.
- 대조 학습 구성 요소는 쿼리와 관련된 전경 특징와 관련이 없는 배경 특징를 구분함으로써 특징의 분류 성능을 향상시킨다.
- 하드 음성 마이닝을 통합하여 학습 중에 관련이 없는 텍스트 기술서를 샘플링함으로써 모델의 노이즈나 애매한 supervision에 대한 강건성을 높인다.
- 교차 영상 시각 유사도 손실은 문맥적으로 유사한 텍스트 쿼리가 있는 서로 다른 영상의 시각 특징을 정렬함으로써 일반화 능력을 향상시킨다.
- Top/Last-K 샘플링 전략은 대조 학습에서 허위 양성 및 정보가 적은 샘플을 걸러내어 학습 안정성과 성능을 향상시킨다.
- 프레임워크는 Kinetics 사전 학습된 모델에서 추출한 I3D 특징를 사용하고, 추론 시 슬라이딩 윈도우 샘플링을 통해 모멘트 후보를 생성한다.
실험 결과
연구 질문
- RQ1비디오 수준의 자연어 기술서만을 사용하여 약한 지도 학습 모델이 강력한 성능을 달성할 수 있는가?
- RQ2내영상 세그먼트 신호와 교차 영상 의미 유사도를 어떻게 활용하여 약한 지도 학습의 성능을 향상시킬 수 있는가?
- RQ3텍스트 기술서의 하드 음성 마이닝이 약한 지도 학습 하에서 모델 일반화 능력 향상에 어떤 역할을 하는가?
- RQ4제안된 참조 주의 메커니즘은 기존의 대조 학습 접근법에 비해 특징 분류 성능 및 정확도 측면에서 어떻게 비교되는가?
- RQ5약한 지도 학습 모델이 모멘트 검색 및 언어 기반 지정 작업에서 완전 지도 학습 모델에 비해 어느 정도 성능을 따라하거나 초월할 수 있는가?
주요 결과
- DiDeMo 데이터셋에서 WSRA는 TGA보다 R@1에서 5.5%, R@5에서 11% 높은 성능을 기록했다.
- Charades-STA 데이터셋에서 WSRA는 IoU 임계치 0.3일 때 R@1에서 TGA보다 18% 향상되었고, IoU 0.5일 땐 12% 향상되었다.
- WSRA는 완전 지도 학습 모델인 CCA 및 LSTM 기반 방법들과 비교해도 유사한 성능을 달성하였으며, 오직 약한 supervision만을 사용하였다.
- 제거 실험 결과, 참조 주의 메커니즘의 각 구성 요소—배경 모델링, 대조 학습, 교차 영상 유사도—가 성능 향상에 기여하는 것으로 확인되었다.
- Top/Last-K 샘플링 전략은 노이즈가 많은 허위 양성 샘플을 효과적으로 걸러내어 학습 안정성과 최종 정확도를 향상시켰다.
- Charades-STA에서의 정성적 결과는 WSRA가 긴 영상에서도 복잡하고 자유형의 쿼리조차도 성공적으로 지정함을 보여주었으며, 언어적 다양성에 대한 강건성을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.