Skip to main content
QUICK REVIEW

[논문 리뷰] P3IV: Probabilistic Procedure Planning from Instructional Videos with Weak Supervision

He Zhao, Isma Hadji|arXiv (Cornell University)|2022. 05. 04.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 시간적 영상 주석이 비용이 많이 들기 때문에, 사전에 학습된 텍스트-비디오 임베딩을 사용하여 언어 지도를 활용하는, 약한 지도 학습 기반의 확률적 절차 계획 프레임워크인 P3IV를 제안한다. 단일 브랜치 트랜스포머에 메모리 모듈과 확률적 생성 모듈을 통합하여, 동시에 다양한 고품질의 동작 시퀀스를 생성하며, 계획의 불확실성을 효과적으로 모델링함으로써 여러 지표에서 완전히 지도 학습된 최신 기술보다 뛰어난 성능을 달성한다.

ABSTRACT

In this paper, we study the problem of procedure planning in instructional videos. Here, an agent must produce a plausible sequence of actions that can transform the environment from a given start to a desired goal state. When learning procedure planning from instructional videos, most recent work leverages intermediate visual observations as supervision, which requires expensive annotation efforts to localize precisely all the instructional steps in training videos. In contrast, we remove the need for expensive temporal video annotations and propose a weakly supervised approach by learning from natural language instructions. Our model is based on a transformer equipped with a memory module, which maps the start and goal observations to a sequence of plausible actions. Furthermore, we augment our model with a probabilistic generative module to capture the uncertainty inherent to procedure planning, an aspect largely overlooked by previous work. We evaluate our model on three datasets and show our weaklysupervised approach outperforms previous fully supervised state-of-the-art models on multiple metrics.

연구 동기 및 목표

  • 지침 영상에서의 지도 학습 절차 계획에 따른 높은 주석 비용 문제를 해결하기 위해.
  • 비용이 많이 드는 중간 단계 시간적 영상 주석에 의존하는 것을 줄이고, 자연어 지시문을 약한 지도 학습으로 활용하기 위해.
  • 확률적 생성 모듈을 통해 절차 계획의 불확실성을 모델링하여 다수의 타당한 계획을 생성하기 위해.
  • 모든 단계를 동시에 생성하는 비자기적(single-branch) 트랜스포머 아키텍처를 사용하여 계획 성능을 향상시키기 위해.
  • KL 발산, NLL, ModeRec, ModePrec와 같은 지표를 사용하여 예측된 계획의 품질과 다양성을 평가하기 위해.

제안 방법

  • 모델은 시작 및 목표 시각적 관측을 동작 시퀀스로 매핑하기 위해 메모리 모듈이 있는 트랜스포머 기반 디코더를 사용한다.
  • 비용이 많이 드는 중간 단계 시각적 주석 대신, 지침 단계의 사전 학습된 텍스트-비디오 임베딩을 통해 언어 지도를 활용한다.
  • 불확실성을 모델링하고 다수의 타당한 계획을 포착하기 위해 K=1500개의 동작 시퀀스를 샘플링하는 확률적 생성 모듈을 사용한다.
  • 모델은 시각적 및 언어적 표현 쌍에 대해 대비 학습을 통해 훈련되며, 계획 품질은 KL 발산과 NLL로 평가된다.
  • 샘플 간 다양성은 코사인 거리로 측정되며, 계획의 다양성과 커버리지 평가에는 모드 재현율**(ModeRec)과 모드 정밀도**(ModePrec)를 사용한다.
  • 일괄 추론 기반의 한 번의 추론 메커니즘을 사용하여, 순차적으로 추론하는 대신 모든 중간 동작을 동시에 생성한다.

실험 결과

연구 질문

  • RQ1지침 영상의 중간 단계에 대한 비용이 많이 드는 시간적 주석이 없이도 최신 기술 수준의 절차 계획 성능을 달성할 수 있는가?
  • RQ2사전 학습된 텍스트-비디오 임베딩을 약한 지도 학습으로 활용하면 강한 시각적 지도 학습보다 더 나은 일반화 및 계획 품질을 달성할 수 있는가?
  • RQ3비자기적, 단일 브랜치 트랜스포머 모델이 동시에 다양한 정확한 동작 시퀀스를 효과적으로 생성할 수 있는가?
  • RQ4확률적 샘플링을 통한 불확실성 모델링이 결정론적 계획에 비해 계획의 다양성과 커버리지에 어떻게 기여하는가?
  • RQ5KL 발산, NLL, ModeRec, ModePrec와 같은 지표들이 예측된 계획의 품질과 분포 일치도를 효과적으로 평가할 수 있는가?

주요 결과

  • 우리의 확률적 접근는 T=3일 때 기준으로 기존 결정론적 모델 대비 더 낮은 KL 발산(2.11 vs. 2.31)과 NLL(4.89 vs. 5.13)을 기록하여, 진짜 계획 분포와의 일치도가 더 높음을 시사한다.
  • 확률적 모델은 T=3일 때 모드 재현율**(ModeRec)을 9.89% 향상시키고, 모드 정밀도**(ModePrec)를 9.00% 향상시켜, 진짜 모드의 커버리지와 정확도가 더 뛰어남을 보여준다.
  • T=3일 때 샘플 간 코사인 거리는 0.384로 측정되어, 생성된 계획의 다양성이 매우 높음을 나타내며, 이는 결정론적 모델로는 달성할 수 없는 성능이다.
  • 모델는 오직 약한 언어 지도 학습만을 사용하고도 완전히 지도 학습된 최신 기술 모델을 여러 지표에서 능가하며, 제안된 접근의 효과성을 입증한다.
  • 결과는 확률적 샘플링을 통한 불확실성 모델링이 다수의 타당한 동작 시퀀스가 존재하는 상황에서 더 견고하고 현실적인 계획 수립에 기여함을 확인한다.
  • 사전 학습된 텍스트-비디오 임베딩을 지도로 활용함으로써 주석 비용을 크게 줄일 수 있었으며, 성능은 유지 또는 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.