Skip to main content
QUICK REVIEW

[논문 리뷰] Look at What I'm Doing: Self-Supervised Spatial Grounding of Narrations in Instructional Videos

Reuben Tan, Bryan A. Plummer|arXiv (Cornell University)|2021. 10. 20.
Multimodal Machine Learning Applications참고 문헌 56인용 수 13
한 줄 요약

이 논문은 대조 학습을 통한 다층 교차 모달 주의망을 활용하여 지도 학습이 아닌 방법으로 지침 영상 내에 묘사된 상호작용을 공간적으로 국소화하는 자기지도 학습 방법을 제안한다. 문장 간 대비 손실을 최적화하고 모달 간 및 모달 내 주의를 번갈아 적용함으로써, 이미지 내 문장 국소화에서 최고 성능을 기록하고, YouCook2 영상 내 국소화된 상호작용을 위한 새로운 데이터셋에서도 베이스라인을 능가한다.

ABSTRACT

We introduce the task of spatially localizing narrated interactions in videos. Key to our approach is the ability to learn to spatially localize interactions with self-supervision on a large corpus of videos with accompanying transcribed narrations. To achieve this goal, we propose a multilayer cross-modal attention network that enables effective optimization of a contrastive loss during training. We introduce a divided strategy that alternates between computing inter- and intra-modal attention across the visual and natural language modalities, which allows effective training via directly contrasting the two modalities' representations. We demonstrate the effectiveness of our approach by self-training on the HowTo100M instructional video dataset and evaluating on a newly collected dataset of localized described interactions in the YouCook2 dataset. We show that our approach outperforms alternative baselines, including shallow co-attention and full cross-modal attention. We also apply our approach to grounding phrases in images with weak supervision on Flickr30K and show that stacking multiple attention layers is effective and, when combined with a word-to-region loss, achieves state of the art on recall-at-one and pointing hand accuracies.

연구 동기 및 목표

  • 인간이 수동으로 공간 레이블을 부여하지 않은 복잡하고 조합적인 묘사된 상호작용을 영상에서 국소화하는 문제를 해결하기 위해.
  • 자동으로 변환된 묘사가 포함된 대규모 지침 영상에서 자기지도 학습을 가능하게 하기 위해.
  • 구조화된 주의 메커니즘을 통해 자연어 문장과 시공간적 영상 영역 간의 교차 모달 정렬을 향상시키기 위해.
  • 동일한 아키텍처를 사용하여 약한 지도 학습 기반의 이미지 내 문장 국소화에 일반화할 수 있도록 하기 위해.
  • 지침 영상 내 묘사된 상호작용에 대한 공간 레이블이 포함된 새로운 평가 데이터셋을 제안하기 위해.

제안 방법

  • 교차 모달 간 및 모달 내 주의를 번갈아 적용하여 교차 모달 표현을 개선하는 대비 다층 다중모달 주의망(CoMMA) 모듈을 제안한다.
  • 문장 수준의 대비 손실을 사용하여 언어 모달과 시각 모달의 문장 수준 표현을 정렬함으로써, 묘사된 동작과 해당 영상 영역 간의 전역 정렬을 장려한다.
  • 모달 간 주의를 번갈아 계층에서 계산함으로써, 한 모달이 다른 모달을 지배하는 잠재적인 트ivial한 해법을 방지하기 위해 분할된 학습 전략을 적용한다.
  • 전체 묘사의 집계된 표현과 영상 클립 간의 대비를 고려하는 문장 수준의 손실을 도입하여 장거리 의존성 모델링을 향상시킨다.
  • 단어-지역 매칭 손실과 문장 수준의 대비 손실을 조합하여 약한 지도 학습 기반의 문장 국소화에 모델을 적용한다.
  • 자기지도 학습을 통해 HowTo100M에서 종합적으로 학습하고, 공간 레이블이 포함된 새로 수집한 YouCook2 기반 데이터셋에서 평가한다.

실험 결과

연구 질문

  • RQ1인간이 수동으로 공간 레이블을 제공하지 않은 영상 내 묘사된 상호작용을 자기지도 학습 모델이 효과적으로 국소화할 수 있는가?
  • RQ2표준 공통 주의 또는 전체 교차 주의와 비교해 볼 때, 교차 모달 간 및 모달 내 주의를 번갈아 적용하는 것이 교차 모달 정렬을 향상시키는가?
  • RQ3대조 학습을 통한 다층 주의망이 복잡하고 조합적인 문장을 영상에서 국소화하는 데 있어 얕은 주의 모델보다 성능이 뛰어나게 되는가?
  • RQ4모델은 이미지 내 약한 지도 학습 기반의 문장 국소화에 어떻게 일반화되며, 이 설정에서 문장 수준의 손실은 어떤 역할을 하는가?
  • RQ5여러 개의 주의 레이어를 쌓는 것이 영상 상호작용 국소화 및 이미지 문장 국소화 작업 양쪽에서 성능 향상에 기여하는가?

주요 결과

  • 제안된 CoMMA 모델은 Flickr30K에서 약한 지도 학습 기반의 문장 국소화 작업에서 R@1과 손가락 가리키기 정확도에서 최고 성능을 기록하며, 이전 방법들을 능가한다.
  • 두 번째 교차 주의 레이어를 추가함으로써 R@1은 49.99%에서 53.80%로, 손가락 가리키기 정확도는 74.97%에서 76.78%로 향상되어 깊이 있는 주의의 유용성을 입증한다.
  • 새로운 YouCook2 기반 데이터셋에서 국소화된 상호작용 국소화 작업에서, 얕은 공통 주의 및 전체 교차 주의 베이스라인을 모두 능가한다.
  • 문장 수준의 대비 손실은 전역 정렬과 성능 향상에 크게 기여하며, 특히 다수의 객체와 동작을 포함하는 복잡한 영상 상호작용에서 두드러진다.
  • 이미지 문장 국소화에서는 단어-지역 매칭 손실이 핵심이지만, 영상 상호작용 국소화에서는 그 효과가 떨어지므로 서로 다른 모달 간 정렬 요구 사항을 시사한다.
  • 문장 수준의 손실을 함께 학습할 경우, 여러 주의 레이어를 쌓는 것이 성능 향상에 기여함을 보여주어 깊이 있는 아키텍처가 복잡한 국소화 작업에 유리함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.