Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Visual-Linguistic Reference Resolution in Instructional Videos

De-An Huang, Joseph J. Lim|arXiv (Cornell University)|2017. 03. 07.
Multimodal Machine Learning Applications참고 문헌 61인용 수 9
한 줄 요약

이 논문은 지도학습이 아닌 그래프 최적화 프레임워크를 제안하여 시각적 및 언어적 신호를 동시에 모델링함으로써 지침 영상 내 동작과 실체 간의 모호한 참조를 해결한다—예를 들어 '요거트를 섞는다'는 표현을 '요거트를 섞는다'로 연결하는 것—기존의 언어 모델에 비해 정밀도와 재현율 모두 9% 향상시키며, 다중모odal 정렬이 참조 해석과 영상-음성 정렬 모두에 기여함을 보여준다.

ABSTRACT

We propose an unsupervised method for reference resolution in instructional videos, where the goal is to temporally link an entity (e.g., "dressing") to the action (e.g., "mix yogurt") that produced it. The key challenge is the inevitable visual-linguistic ambiguities arising from the changes in both visual appearance and referring expression of an entity in the video. This challenge is amplified by the fact that we aim to resolve references with no supervision. We address these challenges by learning a joint visual-linguistic model, where linguistic cues can help resolve visual ambiguities and vice versa. We verify our approach by learning our model unsupervisedly using more than two thousand unstructured cooking videos from YouTube, and show that our visual-linguistic model can substantially improve upon state-of-the-art linguistic only model on reference resolution in instructional videos.

연구 동기 및 목표

  • 시각적 모습과 언어적 표현이 시간에 따라 변화함에 따라 지침 영상 내 동작과 실체 간의 모호한 참조를 해결하는 데 도전한다.
  • 참조 수준의 지도 데이터가 없이도 YouTube 요리 영상과 같은 비정형 영상 데이터를 활용해 지도학습이 없는 방법을 개발함으로써 데이터 레이블 부족 문제를 해결한다.
  • 상태 변화와 참조 표현의 이동으로 인한 모호성을 해소하기 위해 시각적 신호와 언어적 신호를 동시에 모델링함으로써 참조 해석의 강건성을 향상시킨다.
  • 참조 해석이 영상-음성 정렬을 향상시킬 수 있음을 입증한다—특히 '그것'이나 '혼합물'과 같은 대명사나 모호한 표현에 대해 효과적이다.

제안 방법

  • 노드가 동작과 실체를 나타내고, 간선이 시간적 참조를 나타내는 그래프 최적화 문제로 참조 해석을 수식화한다.
  • 프레임 간의 세밀한 시각적 및 언어적 관계를 캡처하는 동작 그래프 임베딩을 도입하여, 외관과 표현 변화에도 불구하고 교차 모odal 정렬을 가능하게 한다.
  • 공통 그래프 구조를 사용해 시각적 특징과 언어적 표현을 번갈아 최적화하는 통합 시각-언어 모델을 사용한다.
  • 행동 그래프 임베딩으로 강화된 프레임 수준 유사도 함수(예: FES)를 적용하여 전체 프레임 유사도를 넘어서 참조 해석 성능을 향상시킨다.
  • 영상과 음성 녹취록 간의 시간 정렬(Z)을 약한 지도 신호로 활용하여 노이즈를 줄이고 모델 일반화 능력을 향상시킨다.
  • 어느 것도 참조 레이블이 없는 2,000개 이상의 비정형 요리 영상 데이터를 사용해 지도학습 없이 종단 간(end-to-end)으로 모델을 훈련시킨다.

실험 결과

연구 질문

  • RQ1비지도 시각-언어 모델이 시각적 및 언어적 모호성에도 불구하고 지침 영상 내 동작과 실체 간의 참조를 효과적으로 해석할 수 있는가?
  • RQ2시각적 및 언어적 신호를 동시에 모델링할 경우 단일 모odal 접근법에 비해 참조 해석 성능가 어떻게 향상되는가?
  • RQ3참조를 해석하는 것이 비정형 영상 녹취록과 해당 영상 세그먼트 간의 정렬에 얼마나 기여하는가?
  • RQ4제안된 그래프 기반 최적화 프레임워크는 실생활 지침 영상에서의 상태 변화와 참조 표현 이동을 다룰 수 있는가?

주요 결과

  • 제안된 비지도 통합 시각-언어 모델은 지침 영상 내 참조 해석에서 기존 최고 수준의 언어 모델 대비 정밀도와 재현율 모두 9% 향상시켰다.
  • 모델은 단일 모달 기반 베이스라인보다 뚜렷한 성능 향상을 보였다—시각 모델은 언어적 정규화가 부족해 실패하고, 언어 모델은 시각적 모호성으로 어려움을 겪는다.
  • 행동 그래프 임베딩은 FES 기반 프레임 유사도 방법 대비 참조 해석 성능을 10% 향상시켜 상태 변화에 따른 세밀한 실체 추적을 더 잘 수행할 수 있도록 했다.
  • 시간 정렬(Z)을 통한 통합 최적화로 시각적 지도 신호의 노이즈가 감소하고 참조 해석 및 영상-음성 정렬 성능이 모두 향상되었다.
  • 참조 해석이 영상-음성 정렬을 향상시킴을 입증—표준 문장 임베딩 방법에 비해 F1 및 IOU 점수를 향상시켰으며, 특히 '그것'과 같은 모호한 대명사에 대해 뛰어난 성능을 보였다.
  • 정성적 결과는 모델이 '혼합물'이 재료의 조합을 의미하거나 '소스'가 변형된 실체를 의미할 때조차도, 시각적 및 언어적 변화가 심한 상황에서도 참조를 성공적으로 해석함을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.