Skip to main content
QUICK REVIEW

[논문 리뷰] D3TW: Discriminative Differentiable Dynamic Time Warping for Weakly Supervised Action Alignment and Segmentation

Chien-Yi Chang, De-An Huang|arXiv (Cornell University)|2019. 01. 09.
Human Pose and Action Recognition참고 문헌 41인용 수 10
한 줄 요약

이 논문은 행동 순서 지도만을 사용하여 약한 감독 하에 행동 정렬 및 분할을 위한 D3TW를 제안한다. 동적 프ogram밍에서 최소화 연산자에 대한 연속적 근사값을 도입함으로써 D3TW는 비가역적인 동적 프로그래밍 기반 손실의 비가역성 문제를 해결하고, 미분 가능한 판별적 손실을 통해 엔드 투 엔드 학습을 가능하게 하여, 데스크톱 및 할리우드 확장 데이터셋에서 여러 지표에서 최신 기술 수준을 달성한다.

ABSTRACT

We address weakly supervised action alignment and segmentation in videos, where only the order of occurring actions is available during training. We propose Discriminative Differentiable Dynamic Time Warping (D3TW), the first discriminative model using weak ordering supervision. The key technical challenge for discriminative modeling with weak supervision is that the loss function of the ordering supervision is usually formulated using dynamic programming and is thus not differentiable. We address this challenge with a continuous relaxation of the min-operator in dynamic programming and extend the alignment loss to be differentiable. The proposed D3TW innovatively solves sequence alignment with discriminative modeling and end-to-end training, which substantially improves the performance in weakly supervised action alignment and segmentation tasks. We show that our model is able to bypass the degenerated sequence problem usually encountered in previous work and outperform the current state-of-the-art across three evaluation metrics in two challenging datasets.

연구 동기 및 목표

  • 학습 중에 행동의 순서만 제공되는 약한 감독 하에 행동 정렬 및 분할 문제를 해결하기 위해.
  • 이전 방법에서 흔히 발생하는 단일 프레임에 행동이 할당되는 열악한 순서 문제를 해결하기 위해.
  • 동적 프로그래밍 기반 손실의 비가역성에도 불구하고 엔드 투 엔드 학습이 가능한 미분 가능한 판별적 손실 함수를 개발하기 위해.
  • 행동 순서 지도만을 사용하여 행동 분할 및 정렬 작업의 성능을 향상시키기 위해.
  • 약한 감독 하에 구조적 시퀀스 예측에서 연속적 근사값을 활용한 판별적 모델링의 효과를 입증하기 위해.

제안 방법

  • 동적 프로그래밍의 최소화 연산자에 대한 연속적 근사값을 제안하여 정렬 손실의 미분 가능성을 확보한다.
  • 정답(양성) 전사본에 비해 비정답 전사본에 대한 비용을 최소화하는 판별적 손실을 도입한다.
  • 미분 가능한 DTW 설정(D3TW)을 사용하여 기울기 기반 최적화를 통한 엔드 투 엔드 학습을 가능하게 한다.
  • 모델이 랜덤한 부정적 순서와 정확한 행동 순서를 구별하도록 하는 대조 학습 전략을 적용한다.
  • 동적 프로그래밍 프레임워크 내에서 프레임 수준의 지도를 경로 제약 조건으로 통합함으로써 완전한 약한 감독 및 반감독 설정을 지원한다.
  • 실제 응용 사례인 데스크톱 및 할리우드 확장 데이터셋 두 곳에 프레임워크를 적용하고, 행동 분할 및 정렬 작업에서 평가를 수행한다.

실험 결과

연구 질문

  • RQ1미분 가능한 손실 함수를 갖춘 판별적 모델이, 보조 손실 기반 접근 방식을 넘어서 약한 감독 하에 행동 정렬 및 분할 성능을 향상시킬 수 있는가?
  • RQ2동적 프로그래밍에서 최소화 연산자의 연속적 근사값이 약한 감독 하에 구조적 시퀀스 예측의 엔드 투 엔드 학습을 가능하게 하는가?
  • RQ3제안된 방법이 이전 연구에서 흔히 발생하는 단일 프레임에 행동이 할당되는 열악한 정렬 문제를 피할 수 있는가?
  • RQ4판별적 모델링과 미분 가능한 동적 시간 왜곡의 조합이 행동 분할 및 정렬 작업 성능에 어떤 영향을 미치는가?
  • RQ5미분 가능하고 판별적인 설정이 다양한 약한 감독 하에 비디오 이해 벤치마크에 얼마나 일반화되는가?

주요 결과

  • D3TW는 데스크톱 및 할리우드 확장 데이터셋이라는 두 가지 도전적인 데이터셋에서 행동 분할 및 정렬 작업 모두 최신 기술 수준을 달성한다.
  • 데스크톱 데이터셋에서 D3TW는 57.0% 프레임 정확도와 56.3% IoD를 기록하여 모든 베이스라인을 능가한다.
  • 할리우드 확장 데이터셋에서 D3TW는 59.4% 프레임 정확도와 50.9% IoD를 기록하며 새로운 최신 기술 수준 기록을 수립한다.
  • 절단 실험 결과, 판별적 모델링과 미분 가능한 근사값 모두 필수적임을 확인하였으며, 둘 중 하나를 제거하면 성능이 크게 저하된다.
  • 반감독 설정에서 D3TW는 균일한 베이스라인 및 ECTC보다 뚜렷한 성능 향상을 보이며, 강건성과 일반화 능력을 입증한다.
  • 모델은 이전 방법이 애로를 겪는 열악한 순서 문제를 성공적으로 회피하여 단일 프레임 정렬을 피하고 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.