Skip to main content
QUICK REVIEW

[논문 리뷰] Procedure Planning in Instructional Videos

Chien-Yi Chang, De-An Huang|arXiv (Cornell University)|2019. 07. 02.
Multimodal Machine Learning Applications참고 문헌 43인용 수 10
한 줄 요약

이 논문은 상태와 동작 간의 공액 관계를 활용하여 비구조적 지침 영상에서 구조적이고 계획 가능한 잠재 표현을 학습하는 Dual Dynamics Networks (DDN) 프레임워크를 제안한다. DDN은 절차 계획 및 워크스루 계획에서 기존 방법들을 능가하며, 행동 시퀀스와 중간 상태를 예측하는 데 있어 뛰어난 일반화 능력과 정확도를 보여준다.

ABSTRACT

In this paper, we study the problem of procedure planning in instructional videos, which can be seen as a step towards enabling autonomous agents to plan for complex tasks in everyday settings such as cooking. Given the current visual observation of the world and a visual goal, we ask the question "What actions need to be taken in order to achieve the goal?". The key technical challenge is to learn structured and plannable state and action spaces directly from unstructured videos. We address this challenge by proposing Dual Dynamics Networks (DDN), a framework that explicitly leverages the structured priors imposed by the conjugate relationships between states and actions in a learned plannable latent space. We evaluate our method on real-world instructional videos. Our experiments show that DDN learns plannable representations that lead to better planning performance compared to existing planning approaches and neural network policies.

연구 동기 및 목표

  • 비구조적 지침 영상에서 비구조적이고 계획 가능한 상태 및 행동 공간을 직접 학습함으로써, 주방과 같은 실제 세계의, 빌드업된 시각적 환경에서 장기적인, 목표 조건에 따른 계획을 수행할 수 있는 자율 에이전트를 가능하게 한다.
  • 사전 정의된 기호 도메인 없이, 비구조적 지침 영상에서 직접 구조적이고 계획 가능한 상태 및 행동 공간을 학습하는 문제에 대응한다.
  • 학습된 잠재 공간에서 상태와 행동 간의 공액 관계를 명시적으로 모델링하여 계획 성능을 향상시킨다.
  • 실제 영상 데이터를 사용하여 절차 계획과 관련된 작업인 워크스루 계획 모두에 대해 방법을 평가한다.
  • 시작 및 목표 관찰의 새로운 변형에 대한 일반화 능력을 입증한다.

제안 방법

  • DDN은 두 개의 공동으로 훈련되는 모듈을 사용한다: 주어진 행동에 따라 상태 전이를 예측하는 전방 동역학 모델과 상태 및 행동 표현 간의 일관성을 강제하는 공액 동역학 모델.
  • 이 프레임워크는 상태가 행동의 역사를 나타내고, 행동이 현재 상태에 조건화되는 분리된 잠재 공간을 학습하며, 공액 제약 조건을 통해 구조적 사전 지식을 통합한다.
  • 재구성 손실, 대비 손실, 그리고 새로운 공액 일관성 손실을 조합하여 훈련함으로써, 행동이 후속 상태의 유효한 전제 조건이 되도록 보장한다.
  • DDN은 사전 훈련된 비디오 인코더에서 추출한 시각적 특징을 사용하고, 잠재 공간에서 행동 시퀀스와 중간 상태 표현을 예측한다.
  • 해당 방법은 절차 계획(시작 프레임에서 목표 프레임까지)과 워크스루 계획(비디오 클립의 순서 정하기)에 모두 평가되며, 히민 거리와 쌍별 정확도와 같은 지표를 사용한다.
  • 수동으로 주석 처리된 기호 행동 술어나 행동 레이블이 필요 없이, 비구조적 지침 영상에서 엔드 투 엔드로 훈련된다.

실험 결과

연구 질문

  • RQ1딥 러닝 모델은 사전 정의된 기호 행동 공간 없이, 비구조적이고 시각적으로 풍부한 지침 영상에서 복잡한 장기적 작업을 계획할 수 있는가?
  • RQ2상태와 행동 간의 공액 관계는 학습된 잠재 표현의 구조성과 계획 가능성에 어떻게 기여할 수 있는가?
  • RQ3상태와 행동의 공동 동역학을 학습하는 것이 별도로 학습하는 것보다 더 나은 계획 성능을 이끌어내는가?
  • RQ4학습된 표현은 시작 및 목표 관찰의 새로운 변형에 일반화되는가?
  • RQ5비디오 클립의 순서를 재정렬하는 것과 같은 관련 작업으로 프레임워크를 전이할 수 있는가?

주요 결과

  • DDN은 절차 계획 및 워크스루 계획 양 측면에서 모든 베이스라인을 뛰어넘으며, 테스트 세트에서 가장 높은 쌍별 정확도와 가장 낮은 히민 거리를 기록한다.
  • 절단 실험 결과, 공액 동역학 모듈을 제거한 경우(Ours w/o T) 성능이 저하됨을 확인하여, 잠재 공간 내의 구조적 사전 지식의 중요성을 입증한다.
  • 놀랍게도, 정책 헤드가 없는 변종(Ours w/o P)이 동역학 헤드가 없는 변종(Ours w/o T)보다 워크스루 계획에서 더 뛰어난 성능을 보이며, 순서 정리 작업에서는 상태 전이 모델링이 더 중요하다는 것을 시사한다.
  • 시각화 결과, DDN은 올바른 순서로 중간 상태의 시퀀스를 정확히 예측하는 반면, 베이스라인은 복잡한 절차에서 도구 수거와 같은 핵심 단계를 포착하지 못함을 확인한다.
  • 시작 및 목표 프레임의 새로운 변형에 대해 잘 일반화되며, 실제 영상의 시각적 및 의미적 다양성에 대해 강건함을 보여준다.
  • DDN은 절차 계획 데이터로만 훈련되었음에도 불구하고, 워크스루 계획으로 성공적으로 전이되었으며, Visual Ordering 및 Causal InfoGAN과 같은 기존 방법들을 능가한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.