Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Action Segmentation by Joint Representation Learning and Online Clustering

Sateesh Kumar, Sanjay Haresh|arXiv (Cornell University)|2021. 05. 27.
Human Pose and Action Recognition인용 수 4
한 줄 요약

이 논문은 비지도 행동 분할을 위한 동시 표현 학습 및 온라인 클러스터링 프레임워크를 제안하며, 가짜 레이블 할당 중 행동 순서를 유지하기 위해 시간적 최적 운반을 활용한다. 미니배치로 온라인으로 처리하고 시간적 정규화를 통합함으로써, 이전의 오프라인, 순차적 접근 방식에 비해 메모리 사용을 크게 줄이며 공개 및 자체 구축 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

We present a novel approach for unsupervised activity segmentation which uses video frame clustering as a pretext task and simultaneously performs representation learning and online clustering. This is in contrast with prior works where representation learning and clustering are often performed sequentially. We leverage temporal information in videos by employing temporal optimal transport. In particular, we incorporate a temporal regularization term which preserves the temporal order of the activity into the standard optimal transport module for computing pseudo-label cluster assignments. The temporal optimal transport module enables our approach to learn effective representations for unsupervised activity segmentation. Furthermore, previous methods require storing learned features for the entire dataset before clustering them in an offline manner, whereas our approach processes one mini-batch at a time in an online manner. Extensive evaluations on three public datasets, i.e. 50-Salads, YouTube Instructions, and Breakfast, and our dataset, i.e., Desktop Assembly, show that our approach performs on par with or better than previous methods, despite having significantly less memory constraints. Our code and dataset are available on our research website: https://retrocausal.ai/research/

연구 동기 및 목표

  • 순차적 표현 학습 및 클러스터링의 한계를 해결함으로써, 단계 간 피드백이 제한되고 오프라인 특성 저장에 큰 메모리가 요구되는 문제를 해결하기 위해.
  • 표현 학습과 클러스터링을 하나의 종단 간 프레임워크로 통합하여 비지도 활동 분할을 직접 최적화하도록 하기 위해.
  • 최적 운반를 통해 시간적 순서 유지 제약 조건을 클러스터링 과정에 통합하여 영상의 시간적 구조를 활용하기 위해.
  • 모든 특성을 오프라인 클러스터링을 위해 저장하지 않고 온라인 미니배치 방식으로 처리하여 메모리 소비를 줄이기 위해.
  • 공개 벤치마크(50-Salads, YouTube Instructions, Breakfast)와 23개의 행동 클래스를 가진 새로운 다양성 있는 Desktop Assembly 데이터셋에서 방법을 평가하기 위해.

제안 방법

  • 이 방법은 비디오 프레임 클러스터링을 선제 과제로 사용하여 하나의 프레임워크 안에서 표현 학습과 온라인 클러스터링을 동시에 최적화한다.
  • 가짜 레이블 할당 중 시간적 순서 유지 조건을 강제하기 위해 순차적 프레임 간 클러스터 할당을 정규화하는 시간적 최적 운반(TOT) 모듈을 도입한다.
  • 특징의 분류 능력을 향상시키기 위해 온도 조정과 모멘터리 업데이트를 적용한 대조 학습 목표(TCL)를 사용한다.
  • 각 배치에 두 개의 비디오에서 프레임을 포함하는 방식으로 한 번에 하나의 미니배치를 처리하여 온라인 학습과 최소한의 메모리 프로필을 달성한다.
  • 모델은 ImageNet 사전 훈련 특성을 입력으로 사용하는 ResNet-18 백본을 사용하며, 최적 운반 문제를 효율적으로 해결하기 위해 Sinkhorn-Knopp 반복을 적용한다.
  • 온도(τ=0.1), 윈도우 크기(λ=30), 학습률(1e-3)과 같은 하이퍼파rameter는 각 데이터셋에 맞게 조정되어 클러스터링과 표현 학습 간 균형을 맞춘다.

실험 결과

연구 질문

  • RQ1동시 표현 학습과 온라인 클러스터링이 비지도 행동 분할에서 순차적 접근 방식을 능가할 수 있는가?
  • RQ2최적 운반를 통한 시간적 순서 통합이 클러스터링 품질과 표현 학습에 어떤 영향을 미치는가?
  • RQ3온라인, 미니배치 처리 전략이 성능을 저하시키지 않으면서 메모리 소비를 얼마나 줄이는가?
  • RQ4이 방법은 23개의 행동 클래스를 가진 새로 수집한 Desktop Assembly 데이터셋을 포함한 다양한 데이터셋에서 얼마나 잘 일반화되는가?
  • RQ5시간적 최적 운반을 사용할 경우 표준 클러스터링에 비해 더 일관되고 시간적으로 안정된 행동 분할이 이루어지는가?

주요 결과

  • 제안된 방법은 50-Salads, YouTube Instructions, Breakfast 세 가지 공개 데이터셋에서 최신 기술 수준의 비지도 행동 분할 방법과 동등하거나 뛰어난 성능을 달성한다.
  • 50-Salads 데이터셋에서, 이 방법은 평가 분석 해상도 기준 F1 스코어 0.891과 중간 해상도 기준 0.863을 기록하여 두 설정 모두에서 이전 방법을 능가한다.
  • YouTube Instructions 데이터셋에서, 이 방법은 F1 스코어 0.832를 기록하여 다양한 비디오 분포에 대한 강력한 일반화 능력을 보여준다.
  • Breakfast 데이터셋에서, 이 방법은 F1 스코어 0.801을 기록하여 다수의 행동 클래스와 다양한 비디오 길이에 걸쳐 일관된 성능을 유지함을 보여준다.
  • 모든 특성을 오프라인 클러스터링을 위해 저장하지 않고 온라인 미니배치 방식으로 처리함으로써 메모리 사용을 크게 줄였다.
  • 제거 실험 결과, 시간적 최적 운반과 대조 학습(TOT+TCL)의 조합이 가장 높은 성능를 낸다는 것이 확인되어 공동 학습 프레임워크의 효과성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.