Skip to main content
QUICK REVIEW

[논문 리뷰] Probabilistic Representations for Video Contrastive Learning

Jungin Park, Jiyoung Lee|arXiv (Cornell University)|2022. 04. 08.
Human Pose and Action Recognition인용 수 5
한 줄 요약

이 논문은 데이터 증강에 의존하지 않고 비디오 클립을 정규 분포로 모델링함으로써 불확실성 인식이 가능한 대비 학습을 가능하게 하는 자기지도 학습 비디오 표현 학습 방법 ProViCo를 제안한다. Mixture of Gaussians(MoG)를 사용하여 비디오 클립을 확률 분포로 표현하고, 이러한 확률적 임bedding에서 샘플링하여 확률적 대비 손실을 적용함으로써, UCF101과 HMDB51에서 행동 인식 및 비디오 검색 작업에서 최신 기준 성능을 달성한다.

ABSTRACT

This paper presents Probabilistic Video Contrastive Learning, a self-supervised representation learning method that bridges contrastive learning with probabilistic representation. We hypothesize that the clips composing the video have different distributions in short-term duration, but can represent the complicated and sophisticated video distribution through combination in a common embedding space. Thus, the proposed method represents video clips as normal distributions and combines them into a Mixture of Gaussians to model the whole video distribution. By sampling embeddings from the whole video distribution, we can circumvent the careful sampling strategy or transformations to generate augmented views of the clips, unlike previous deterministic methods that have mainly focused on such sample generation strategies for contrastive learning. We further propose a stochastic contrastive loss to learn proper video distributions and handle the inherent uncertainty from the nature of the raw video. Experimental results verify that our probabilistic embedding stands as a state-of-the-art video representation learning for action recognition and video retrieval on the most popular benchmarks, including UCF101 and HMDB51.

연구 동기 및 목표

  • 복잡하고 노이즈가 많은 비디오 분포에서 높은 불확실성을 반영하지 못하는 결정론적 비디오 임베딩의 한계를 해결하기 위해.
  • 비디오 콘텐츠를 왜곡하거나 성능에 악영향을 미칠 수 있는 신중한 데이터 증강 전략에 의존하지 않도록 하기 위해.
  • 전체 비디오 분포를 확률적 혼합 분포로 모델링하여, 불확실성 인식 샘플링을 통한 강건한 대비 학습을 가능하게 하기 위해.
  • 노이즈가 많거나 불확실한 샘플의 영향을 최소화하면서도, 비디오 간 의미적으로 관련된 쌍으로부터 학습하여 표현 품질을 향상시키기 위해.
  • 불확실성 추정을 원리적으로 제공하고, 이를 모델 성능과 연관지켜 실패 분석 및 난이도 추정이 가능하게 하기 위해.

제안 방법

  • 비디오 클립을 신경망을 통해 학습된 평균과 분산을 가진 정규 분포로 표현한다.
  • 클립 수준의 분포를 조합하여 전체 비디오를 Mixture of Gaussians(MoG)로 모델링함으로써 시간적 동적 분포를 포괄한다.
  • 결정론적 점 쌍이 아닌, MoG 분포에서 샘플링한 샘플 간의 확률적 거리 기반으로 양성 및 음성 쌍을 구성한다.
  • 높은 분산(노이즈가 많은) 샘플의 영향을 감소시키기 위해 불확실성을 고려한 확률적 대비 손실을 도입하였으며, 이는 소프트 대비 학습에서 영감을 받았다.
  • 추론 시 각 비디오당 K=10개의 임베딩을 몬테카를로 샘플링하여 전체 MoG 분포를 근사하고, 강건성을 향상시킨다.
  • 분포의 뭉치 정도와 분류 능력 간의 균형을 맞추기 위해 하이퍼파ram터 β를 사용한 KL 발산 정규화를 적용하였으며, β=10−4가 최적의 성능을 보였다.

실험 결과

연구 질문

  • RQ1결정론적 점 임베딩 대비 비디오 클립을 확률 분포로 모델링하는 것이 자기지도 학습 비디오 표현 학습에 성능 향상을 가져오는가?
  • RQ2불확실성 인식 대비 학습이 노이즈가 많거나 잘못 증강된 비디오 샘플이 표현 품질에 악영향을 미치는 것을 줄이는가?
  • RQ3데이터 증강에 의존하지 않고도 확률적 임베딩이 서로 다른 비디오 간의 의미 있는 관계를 포착할 수 있는가?
  • RQ4비디오 표현의 불확실성과 최종 성능 간의 상관관계는 어떻게 되며, 이를 통해 모델 신뢰도나 실패 가능성 추정이 가능한가?
  • RQ5제안된 방법이 시공간적 데이터 증강 없이도 UCF101 및 HMDB51와 같은 표준 벤치마크에서 최신 기준 성능을 달성하는가?

주요 결과

  • ProViCo는 ResNet-50 백본을 사용하여 UCF101에서 94.8%의 최신 기준 행동 인식 정확도와 HMDB51에서 72.1%의 정확도를 달성하였으며, 이는 이전 자기지도 학습 방법들을 능가한다.
  • 최적의 KL 발산 정규화 하이퍼파ram터 β=10−4는 분포의 뭉치 정도와 분류 능력 간의 균형을 잘 맞추며, β가 너무 작거나 너무 크면 성능이 떨어짐을 확인하였다.
  • 샘플링된 임베딩 수 K를 늘릴수록 MoG의 몬테카를로 근사가 향상되어 성능 향상이 이루어지며, K=10은 계산적 트레이드오프로 선택된 최적 값이다.
  • 비디오 불확실성과 검색 성능 간에 부정적 상관관계가 존재함을 확인하였으며, 불확실성이 높아질수록 상위-1 정확도가 감소함으로써 불확실성이 예측 난이도의 신뢰할 수 있는 지표임을 검증하였다.
  • 학습 과정에서 모델이 불확실성을 점차 줄이며, 이 감소와 함께 UCF101에서의 검색 성능 향상과 상관관계를 보였다.
  • 시각화 및 추상화 실험을 통해 제안된 방법이 복잡한 비디오 분포를 효과적으로 모델링하고, 노이즈가 많거나 손상된 샘플에 대한 민감도를 감소시킴을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.