[논문 리뷰] Learning and Verification of Task Structure in Instructional Videos
이 논문은 전역 작업 맥락을 사용하여 단계를 마스킹하고 예측하는 방식으로 지침 영상에서 문맥화된 단계 표현을 학습하는 VideoTaskformer라는 비디오 모델을 소개한다. 이 모델은 하류 작업에서 최고 성능을 기록하며, 특히 실수 탐지 및 장기 예측에서 뛰어난 성능을 보이며, 영상의 작업 구조 이해 평가를 위한 세 가지 새로운 벤치마크를 도입한다.
Given the enormous number of instructional videos available online, learning a diverse array of multi-step task models from videos is an appealing goal. We introduce a new pre-trained video model, VideoTaskformer, focused on representing the semantics and structure of instructional videos. We pre-train VideoTaskformer using a simple and effective objective: predicting weakly supervised textual labels for steps that are randomly masked out from an instructional video (masked step modeling). Compared to prior work which learns step representations locally, our approach involves learning them globally, leveraging video of the entire surrounding task as context. From these learned representations, we can verify if an unseen video correctly executes a given task, as well as forecast which steps are likely to be taken after a given step. We introduce two new benchmarks for detecting mistakes in instructional videos, to verify if there is an anomalous step and if steps are executed in the right order. We also introduce a long-term forecasting benchmark, where the goal is to predict long-range future steps from a given step. Our method outperforms previous baselines on these tasks, and we believe the tasks will be a valuable way for the community to measure the quality of step representations. Additionally, we evaluate VideoTaskformer on 3 existing benchmarks -- procedural activity recognition, step classification, and step forecasting -- and demonstrate on each that our method outperforms existing baselines and achieves new state-of-the-art performance.
연구 동기 및 목표
- 지역 클립 수준의 의미가 아닌 전역 작업 구조를 반영하는 지침 영상 내 단계 표현을 학습하는 것.
- 비디오가 작업을 올바르게 수행하고 있는지 확인할 수 있도록, 잘못된 단계와 잘못된 단계 순서를 탐지할 수 있도록 하는 것.
- 주어진 시점에서 장기적인 미래 단계를 예측하여 이전의 단기 예측 방법을 초월하는 것.
- 지침 영상 내 단계 표현의 품질을 평가하기 위한 새로운 벤치마크를 도입하는 것.
- 전역 맥락 인식 표현이 여러 하류 작업에서 지역적, 클립 간 의존성이 없는 방법보다 우수한 성능을 보임을 입증하는 것.
제안 방법
- 비디오의 무작위 단계를 마스킹하고 나머지 단계의 시각적 특징에서 단계 레이블을 예측하는 방식으로, 마스킹된 단계 모델링 목적함수를 사용해 VideoTaskformer를 사전 훈련한다.
- 모든 단계를 동시에 인코딩할 수 있도록 트랜스포머 기반 아키텍처를 사용하여 전체 작업에 걸친 문맥 이해를 가능하게 한다.
- 사전 훈련된 모델들(예: TimeSformer, S3D)의 비디오 특징을 활용하고, 하류 작업에서 전체 네트워크를 엔드 투 엔드로 미세조정한다.
- 실제 작업 레이블(예: '천장 선풍기를 설치하기')을 입력 임bedding으로 통합하여 실수 탐지 및 장기 예측과 같은 과제에서 성능을 향상시킨다.
- 학습된 표현의 전이 가능성 평가를 위해 선형 프로브 및 전체 미세조정 설정을 모두 평가한다.
- COIN 데이터셋에서 단계를 유사한 것으로 교체하거나 순서를 재배열하여 실수 탐지 데이터셋을 합성한다.
![Figure 1: Prior work [ 13 , 12 ] learns step representations from single short video clips, independent of the task, thus lacking knowledge of task structure. Our model, VideoTaskformer, learns step representations for masked video steps through the global context of all surrounding steps in the vid](https://ar5iv.labs.arxiv.org/html/2303.13519/assets/x1.png)
실험 결과
연구 질문
- RQ1전역 비디오 맥락을 사용한 단계 마스킹 모델링이 지역 클립 수준 모델링에 비해 지침 영상 내 단계 표현 학습에 더 나은 성능을 보일 수 있는가?
- RQ2학습된 표현이 지침 영상에서 잘못된 단계와 잘못된 단계 순서를 모두 탐지할 수 있는가?
- RQ3주어진 단계에서 장거리 미래 단계를 얼마나 잘 예측할 수 있는가?
- RQ4작업 수준의 레이블을 통합하면 실수 탐지 및 예측과 같은 하류 작업에서 성능 향상이 이루어지는가?
- RQ5학습된 표현이 기존의 프로시저 액티비티 인식, 단계 분류, 단계 예측 벤치마크에 얼마나 잘 전이되는가?
주요 결과
- VideoTaskformer는 장기 예측 작업에서 최고의 베이스라인 대비 5% 향상된 성능을 기록하여 먼 미래 단계로의 일반화 능력이 뛰어나다는 것을 입증한다.
- 실수 단계 탐지에서 4% 향상되고, 실수 순서 탐지에서도 4% 향상되어 이전 방법보다 이 새로운 벤치마크에서 뛰어난 성능을 보였다.
- 프로시저 액티비티 인식 작업에서는 기존 최고의 베이스라인 대비 1% 향상된 성능을 기록했으며, 분포 매칭 손실가 단계 분류 손실보다 略적으로 더 우수한 성능를 보였다.
- 선형 프로브 평가 결과 경쟁적인 성능를 기록하여 사전 훈련된 표현이 하류 작업으로 매우 잘 전이된다는 것을 확인했다.
- 작업 레이블을 통합함으로써 세 가지 새로운 벤치마크 전반에서 성능 향상이 이루어졌으며, 고수준의 작업 맥락의 가치를 입증했다.
- 정성적 결과는 VideoTaskformer가 잘못된 단계를 정확히 식별하고 정답과 일치하는 미래 단계를 예측하는 반면, 베이스라인 LwDS는 복잡한 구조적 추론에서 실패한다는 것을 확인했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.