[논문 리뷰] Contrastive Language-Action Pre-training for Temporal Localization
이 논문은 비정형 영상에서 마스킹된 대비 학습을 사용하여 고정된 영상 인코더를 미세조정하는 후기 pre-training 방법인 대비 언어-행동 전훈(CLAP)을 제안한다. 이는 시각적 표현을 배경 클립과 함께 전경 행동의 언어 기술과 정렬한다. CLAP는 영상 인코더를 훈련 중에 고정하지 않고 교차 모odal 관계를 학습함으로써 시간적 행동 국소화, 소수 샘플 시간적 행동 국소화, 영상 언어 기반 작업에서 최신 기술 성능을 향상시킨다.
Long-form video understanding requires designing approaches that are able to temporally localize activities or language. End-to-end training for such tasks is limited by the compute device memory constraints and lack of temporal annotations at large-scale. These limitations can be addressed by pre-training on large datasets of temporally trimmed videos supervised by class annotations. Once the video encoder is pre-trained, it is common practice to freeze it during fine-tuning. Therefore, the video encoder does not learn temporal boundaries and unseen classes, causing a domain gap with respect to the downstream tasks. Moreover, using temporally trimmed videos prevents to capture the relations between different action categories and the background context in a video clip which results in limited generalization capacity. To address these limitations, we propose a novel post-pre-training approach without freezing the video encoder which leverages language. We introduce a masked contrastive learning loss to capture visio-linguistic relations between activities, background video clips and language in the form of captions. Our experiments show that the proposed approach improves the state-of-the-art on temporal action localization, few-shot temporal action localization, and video language grounding tasks.
연구 동기 및 목표
- 정형 영상에서의 pre-training과 최종 시간적 국소화 작업 사이의 도메인 갭을 해결하기 위해.
- 배경 컨텍스트와 언어 감독을 통합하여 장시간 영상 이해를 위한 영상 표현 학습을 향상시키기 위해.
- 최종 작업에서 알려지지 않은 행동 카테고리와 자유형 언어 질의에 대한 더 나은 일반화를 가능하게 하기 위해.
- 영상 인코더를 고정하지 않고 끝에서 끝까지 적응 가능한 시각-언어 관계를 학습할 수 있는 후기 pre-training 방법을 개발하기 위해.
- 대규모 데이터셋에 대한 의존도를 줄이기 위해 대체로 합성 및 실제 캡션을 활용하여 대비 학습을 수행하기 위해.
제안 방법
- 초기 행동 분류 pre-training 이후에 후기 pre-training 단계를 도입하여, 영상 인코더를 대비 학습을 통해 끝에서 끝까지 미세조정한다.
- 실제 영상 캡션과 행동 레이블에서 유도된 합성 언어 템플릿을 사용하여 전경 및 배경 클립을 기술한다.
- 배경 영상-언어 쌍을 대비 목표에서 제외하는 마스킹된 대비 학습 손실을 적용하여 의미적으로 유사한 세그먼트를 서로 멀어지게 하지 않는다.
- 공통 임bedding 공간에서 전경 클립, 배경 클립, 그리고 해당 언어 기술의 표현을 대비한다.
- 여러 클립 간의 시간적 관계를 모델링하기 위해 비정형 영상을 활용하여 장시간 영상 이해를 향상시킨다.
- 하류 평가를 위해 2D-TAN 기반 프레임워크를 사용하며, 원래 영상 인코더를 CLAP로 미세조정한 것으로 교체한다.
실험 결과
연구 질문
- RQ1영상 인코더를 고정하지 않는 후기 pre-training 방법이 표준 pre-training을 초월하여 시간적 행동 국소화 성능을 향상시킬 수 있는가?
- RQ2pre-training 단계에서 배경 영상 클립과 언어 기술을 통합할 경우, 알려지지 않은 행동과 언어 질의에 대한 일반화 성능에 어떤 영향을 미치는가?
- RQ3배경 쌍을 제외하는 마스킹된 대비 학습이 표준 대비 접근 방식에 비해 표현 학습 성능을 향상시키는가?
- RQ4제한된 pre-training 데이터로 CLAP가 소수 샘플 시간적 행동 국소화 및 영상 언어 기반 작업에서 최신 기술 성능을 달성할 수 있는가?
- RQ5합성 프롬프트와 실제 캡션 간의 선택이 다양한 데이터셋 간 전이 성능에 어떤 영향을 미치는가?
주요 결과
- CLAP는 Charades-STA에서 IoU@0.5 기준 49.24의 리콜을 달성하여, 동일한 설정에서 2D-TAN(42.8)과 TSP(51.71)를 초월한다.
- TACoS에서 CLAP는 평균 IoU 25.70을 기록하여 TSP(24.91)와 2D-TAN(평균 IoU 없음)을 능가한다.
- CLAP (mask)는 Charades-STA에서 IoU@0.5 기준 53.14의 리콜을 기록하여 TSP(51.71)와 2D-TAN(47.59)을 뛰어넘는다.
- 합성 프롬프트를 전경 및 배경 클립에 사용하는 CLAP† 버전은 Charades-STA(25.70)와 TACoS(25.70)에서 가장 높은 평균 IoU를 기록하여 일반화 성능 향상을 입증한다.
- CLAP는 더 나은 교차 모달 정렬과 시간적 맥락 모델링을 학습함으로써 소수 샘플 시간적 행동 국소화 성능을 향상시킨다.
- 모델은 강력한 제로샷 일반화 성능을 보이며, TSP보다 로프 스트레칭과 같은 행동을 더 일찍 국소화하여 활동 맥락에 대한 향상된 의미 이해를 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.