[논문 리뷰] Contrastive Video-Language Learning with Fine-grained Frame Sampling
FineCo는 비디오-텍스트 쌍 간의 의미적 유사도를 기반으로 프레임 선택기를 사용해 의미적으로 관련성이 높은 비디오 프레임을 샘플링한 후, 이 프레임-텍스트 쌍에 대해 대비 손실을 적용함으로써 비디오-언어 표현을 향상시키는 세분화된 대비 학습 방법을 제안한다. 이는 YouCookII에서 최고 성능을 기록하고 있으며, 특히 약한 비디오-텍스트 대응 관계를 가지는 장시간 비디오에서 경쟁적인 성능을 보인다.
Despite recent progress in video and language representation learning, the weak or sparse correspondence between the two modalities remains a bottleneck in the area. Most video-language models are trained via pair-level loss to predict whether a pair of video and text is aligned. However, even in paired video-text segments, only a subset of the frames are semantically relevant to the corresponding text, with the remainder representing noise; where the ratio of noisy frames is higher for longer videos. We propose FineCo (Fine-grained Contrastive Loss for Frame Sampling), an approach to better learn video and language representations with a fine-grained contrastive objective operating on video frames. It helps distil a video by selecting the frames that are semantically equivalent to the text, improving cross-modal correspondence. Building on the well established VideoCLIP model as a starting point, FineCo achieves state-of-the-art performance on YouCookII, a text-video retrieval benchmark with long videos. FineCo also achieves competitive results on text-video retrieval (MSR-VTT), and video question answering datasets (MSR-VTT QA and MSR-VTT MC) with shorter videos.
연구 동기 및 목표
- 비디오-언어 표현 학습에서 비디오와 텍스트 간의 약한 또는 희박한 대응 관계를 해결하기 위해.
- 전체 비디오 클립을 균일한 단위로 취급하는 대신 의미적으로 관련성이 높은 프레임에 집중하여 이중 모odal 정렬을 향상시키기 위해.
- 표준 쌍 수준의 대비 학습에서 무관한 프레임이 장시간 비디오에서 학습 신호를 약화시키는 영향을 완화하기 위해.
- 프레임 수준의 애너테이션을 필요로 하지 않으면서도 비디오 표현을 향상시키는 프레임 수준의 대비 목표를 개발하기 위해.
- 세분화된 프레임 샘플링이 특히 YouCookII와 같은 장시간 비디오 데이터셋에서 성능 향상에 기여함을 입증하기 위해.
제안 방법
- 프레임-텍스트 유사도 점수를 기반으로 텍스트와 높은 의미적 유사도를 가진 프레임을 식별하고 샘플링하는 프레임 선택기가 훈련된다.
- 선택된 긍정적 프레임과 선택되지 않은 부정적 프레임 간에 세분화된 대비 손실이 적용되어 관련된 시각적 콘텐츠가 텍스트와 정렬되도록 유도된다.
- 이 방법은 비디오 및 텍스트 인코더를 사용하는 VideoCLIP 프레임워크에 통합되며, 쌍 수준과 프레임 수준의 대비 목표를 함께 엔드 투 엔드로 훈련한다.
- 긍정적 프레임 수(k)는 개발 세트에서 튜닝된 하이퍼파라미터로 간주되며, 고정-k 전략을 사용해 텍스트와 유사도가 가장 높은 k개의 프레임을 선택한다.
- 시간적 애너테이션을 필요로 하지 않아, 느슨하게 정렬된 비디오-텍스트 쌍을 가진 데이터셋에 적용 가능하다.
- 대비 손실 이전에 프레임 샘플링이 수행되어, 더 정보가 풍부한 프레임을 추출함으로써 비디오 표현을 향상시킬 수 있다.

실험 결과
연구 질문
- RQ1비디오-텍스트 쌍 수준의 애너테이션만 존재할 때, 프레임 수준의 대비 학습이 비디오-언어 표현을 향상시킬 수 있는가?
- RQ2비디오에서 의미적으로 가장 관련성이 높은 프레임만 샘플링하는 것이 모든 프레임을 사용하는 것보다 더 나은 이중 모달 정렬을 이끌어내는가?
- RQ3특히 희박한 대응 관계를 가지는 장시간 비디오에서, 프레임 수준의 대비 학습 성능은 다양한 비디오 길이를 가진 데이터셋에서 어떻게 변화하는가?
- RQ4비디오-언어 검색 향상에 있어, 세분화된 프레임 샘플링이 단어 수준의 샘플링보다 더 효과적인가?
- RQ5제안된 방법이 대비 학습 기반의 다양한 비디오-언어 프레임워크에 일반화 가능한가?
주요 결과
- FineCo는 YouCookII 텍스트-비디오 검색 벤치마크에서 최고 성능을 기록하며, 특히 장시간 비디오에서 뛰어난 성능을 보였다.
- YouCookII에서 FineCo는 R@1이 32.1, R@5가 62.6, R@10가 75.5를 기록하여 기본 VideoCLIP 모델보다 뚜렷이 향상된 성능을 보였다.
- MSR-VTT MC(다중 선택)에서 FineCo는 k=25일 때 최고 성능을 기록하여 짧은 비디오에서도 효과적임을 입증했다.
- 제거 실험 결과, MSR-VTT QA에서는 k=20, MSR-VTT MC에서는 k=25로 고정-k 샘플링이 최적의 성능을 내며, 적절한 긍정 프레임 수 선택의 중요성을 확인했다.
- 프레임 수준의 샘플링이 단어 수준의 샘플링보다 성능이 뛰어나며, 단어를 제거하면 문장 의미가 손상되지만, 프레임은 더 높은 재현성과 필터링에 적합하기 때문이다.
- 질적 예시에서는 FineCo가 핵심 프레임에 초점을 맞춰 정확하게 비디오를 검색하는 것을 보여주지만, 짧거나 덜 다이나믹한 비디오에서는 프레임 선택이 덜 효과적이어서 실패하는 경우도 있었다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.