[논문 리뷰] Unsupervised Action Segmentation for Instructional Videos
이 논문은 지도 학습이 불필요한 원자적 동작 분할을 위한 방법을 제안하며, Gumbel-Softmax 샘플링을 사용한 확률적 순환 자동재귀 모델을 통해 다수의 후보 동작 시퀀스를 생성한다. 동작 발생, 일관된 지속 시간, 시각적 타당성과 같은 자기 부여된 제약 조건을 통해 이러한 시퀀스를 순위 매김함으로써, 지도 데이터 없이도 모델이 반복적으로 자기 레이블을 부여하고 정확한 분할로 수렴한다. 이는 기존의 지도 학습 및 일부 약한 지도 학습 방법보다도 벤치마크 데이터셋에서 뛰어난 성능을 달성한다.
In this paper we address the problem of automatically discovering atomic actions in unsupervised manner from instructional videos, which are rarely annotated with atomic actions. We present an unsupervised approach to learn atomic actions of structured human tasks from a variety of instructional videos based on a sequential stochastic autoregressive model for temporal segmentation of videos. This learns to represent and discover the sequential relationship between different atomic actions of the task, and which provides automatic and unsupervised self-labeling.
연구 동기 및 목표
- 인간이 레이블링한 동작 경계나 레이블이 전혀 없는 지침 영상에서 원자적 동작를 탐지하기 위해.
- 행동가지가 예측 가능하지만 순서가 변동성이 있는 복잡한 작업의 시간적 구조를 모델링하기 위해.
- 영상 수준의 제약 조건을 사용해 타당한 동작 시퀀스를 생성하고 순위 매기는 자기 지도 학습 메커니즘을 개발하기 위해.
- 자기 레이블링 기반의 EM 유사 반복 최적화 절차를 통해 반복적으로 동작 분할을 개선함으로써 지도 학습 없이도 학습을 가능하게 하기 위해.
- 영상 입력만을 사용하여 기존의 지도 학습 및 약한 지도 학습 방법보다 우수한 성능을 내는 것을 목표로 한다.
제안 방법
- 완전 연결층과 Gumbel-Softmax를 사용해 확률적 전이 규칙를 구현한 상태, 출력 기호, 그리고 확률적 전이 규칙를 갖는 순차적 확률적 자동재귀 모델.
- 입력 영상 프레임은 CNN(예: VGG 또는 AssembleNet)을 통해 특징 시퀀스로 인코딩되며, 이는 자동재귀적으로 처리되어 동작 시퀀스를 생성한다.
- Gumbel-Softmax를 통한 다양한 규칙 샘플링을 통해 각 영상마다 다수의 후보 동작 시퀀스를 생성함으로써 런타임 간의 확률적 특성을 도입한다.
- 순위 매김 함수는 세 가지 제약 조건에 기반해 시퀀스를 평가한다: (1) 각 동작이 적어도 한 번 이상 나타나야 하며, (2) 동일한 작업에 속한 영상 간에 동작 지속 시간이 일관되어야 하며, (3) 동작 기호가 시각적 특징과 일치해야 한다.
- 상위 순위의 시퀀스는 의사 레이블로 사용되어 모델을 훈련하고, 이 과정은 EM 유사 반복 최적화 루프로 반복된다.
- 순위 매김 함수의 구성 요소를 조합한 미분 가능한 손실 함수를 사용해 엔드 투 엔드로 모델을 훈련함으로써 기울기 기반 최적화를 가능하게 한다.
실험 결과
연구 질문
- RQ1확률적 자동재귀 모델은 비정형 지침 영상에서 다수의 타당한 동작 시퀀스를 학습하여 생성할 수 있는가?
- RQ2행동 발생, 지속 시간 일관성 등의 구조적 제약 조건 기반 자기 레이블링 전략이 레이블이 없는 환경에서 얼마나 효과적인가?
- RQ3무 supervision 동작 분할 성능이 얼마나 강한 supervision 및 약한 supervision 기반 기준선에 도달하거나 초월할 수 있는가?
- RQ4사용자가 지정한 하이퍼파라미터인 동작 수(k)에 대해 이 방법의 민감도는 어느 정도인가?
- RQ5Gumbel-Softmax 샘플링을 사용함으로써 결정적 또는 무작위 선택 대비 자기 레이블링 품질이 유의미하게 향상되는가?
주요 결과
- 제안된 비지도 학습 방법은 50-Salads, Breakfast, NIV 데이터셋에서 최신 기준 성능을 달성하며, 기존의 비지도 학습 방법뿐 아니라 일부 약한 지도 학습 방법보다도 뛰어난 성능을 보였다.
- NIV 데이터셋에서 AssembleNet 특징을 사용할 경우 F1 스코어 0.457을 달성하여 이전의 방법들(예: Alayrac 등 [1]의 0.238, Kukleva 등 [8]의 0.283)을 뛰어넘었다.
- 절단 분석 결과, 손실 함수의 세 구성 요소인 동작 발생, 지속 시간 일관성, 시각적 타당성 모두 성능 향상에 기여하였으며, 전체 조합을 사용했을 경우 50-Salads에서는 F1 33.4, Breakfast에서는 F1 29.8를 기록했다.
- 후보 시퀀스를 무작위로 선택하거나 Gumbel-Softmax를 비활성화한 경우 성능이 열악해졌으며, 50-Salads에서 F1이 각각 12.5와 10.5로 떨어져, 효과적인 자기 레이블링을 위해 확률적 샘플링이 필수적임을 확인했다.
- 모델은 k(동작 수)의 선택에 대해 상대적으로 강인했으며, 진짜 동작 수 근처에서 성능이 최고조에 도달했고, 그림 5에서 이를 확인할 수 있었다.
- VGG 특징를 AssembleNet 대신 사용했을 때도 강력한 성능을 기록했으며, NIV에서 F1 0.376를 기록하여 이 방법이 다양한 특징 추출기 간에 일반화 가능함을 시사했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.