Skip to main content
QUICK REVIEW

[논문 리뷰] On Evaluating Weakly Supervised Action Segmentation Methods

Yaser Souri, Alexander Richard|arXiv (Cornell University)|2020. 05. 19.
Human Pose and Action Recognition참고 문헌 16인용 수 4
한 줄 요약

이 논문은 전사본을 사용한 약한 감독 하에 행동 분할에서의 성능 변동성과 특징 민감도를 조사한다. 여러 훈련 런에 걸친 표준편차가 유의미하게 나타나며(1–2.51%), 놀랍게도 I3D 특징(고수준)이 Breakfast 데이터셋에서 IDT 특징(저수준)보다 성능이 열 劣하다는 점이 드러나, 약한 감독 학습에서 특징 품질에 대한 기대를 도전한다.

ABSTRACT

Action segmentation is the task of temporally segmenting every frame of an untrimmed video. Weakly supervised approaches to action segmentation, especially from transcripts have been of considerable interest to the computer vision community. In this work, we focus on two aspects of the use and evaluation of weakly supervised action segmentation approaches that are often overlooked: the performance variance over multiple training runs and the impact of selecting feature extractors for this task. To tackle the first problem, we train each method on the Breakfast dataset 5 times and provide average and standard deviation of the results. Our experiments show that the standard deviation over these repetitions is between 1 and 2.5% and significantly affects the comparison between different approaches. Furthermore, our investigation on feature extraction shows that, for the studied weakly-supervised action segmentation methods, higher-level I3D features perform worse than classical IDT features.

연구 동기 및 목표

  • 다른 랜덤 시드를 사용한 여러 훈련 런에 걸쳐 약한 감독 하에 행동 분할 방법의 성능 변동성을 조사하기 위해.
  • 특징 추출기의 영향—구체적으로 IDT 대비 I3D—을 약한 감독 하에 행동 분할 모델의 성능에 평가하기 위해.
  • IDT 특징에 대해 설계된 최신 기법이 적응 없이 I3D 특징으로도 효과적으로 일반화되는지 평가하기 위해.
  • 단일 런이 아닌 여러 런에 걸친 평균과 표준편차를 보고하여 더 신뢰할 수 있는 평가 프로토콜을 제공하기 위해.
  • 높은 수준의 표현과 대규모 영상 데이터에서 사전 훈련된 I3D 특징가 왜 성능이 열 劣하는지 잠재적 원인을 규명하기 위해.

제안 방법

  • 다양한 랜덤 시드를 사용해 Breakfast 데이터셋에서 공개된 네 가지 약한 감독 하에 행동 분할 모델—NNV, ISBA, CDFL, MuCon—을 각각 다섯 번 훈련하여 성능 변동성을 평가했다.
  • 다섯 번의 런에 걸친 평균 프레임 당 평균(MoF)의 평균과 표준편차를 보고하여 모델의 안정성과 변동성을 정량화했다.
  • Breakfast 데이터셋 영상에서 프레임당 2048차원의 I3D(RGB 및 플로우) 특징을 추출하고, 이러한 특징을 사용해 모델 성능을 평가했다.
  • I3D 특징의 차원을 2048에서 64로 감소시켜 원래 모델에서 사용된 입력 차원과 일치시키기 위해 주성분 분석(PCA)을 적용하여 PCA-I3D 특징을 생성했다.
  • NNV 모델의 GRU 입력의 시간적 수용 영역(특징 윈도우 크기)을 수정하여 PCA-I3D 특징을 사용할 때 국소 시간적 맥락에 대한 민감도를 테스트했다.
  • IDT, I3D, PCA-I3D 특징 간 성능을 비교하여 Breakfast 데이터셋의 스플릿 1에서 MoF를 평가 지표로 사용했다.

실험 결과

연구 질문

  • RQ1다른 랜덤 시드를 사용한 여러 훈련 런에 걸쳐 약한 감독 하에 행동 분할 모델의 성능이 얼마나 변동하는가?
  • RQ2Breakfast 데이터셋에서 약한 감독 하에 행동 분할에 대해 고수준 I3D 특징이 전통적인 IDT 특징보다 성능을 향상시키는가?
  • RQ3기존의 IDT 특징에 대해 훈련된 약한 감독 하에 행동 분할 모델이 성능 저하 없이 I3D 특징에 직접 적용될 수 있는가?
  • RQ4PCA를 통해 I3D 특징의 차원을 감소시키면 Breakfast 데이터셋에서 모델 성능이 향상되는가?
  • RQ5PCA-I3D 특징을 사용할 때 시간적 맥락 윈도우 크기는 모델 성능에 어떻게 영향을 미치는가?

주요 결과

  • 다섯 번의 훈련 런에 걸친 성능 표준편차는 1.0%에서 2.51% 사이로 나타나 높은 변동성을 보이며, 단일 런이 아닌 평균과 표준편차를 보고하는 것이 바람직하다고 제안한다.
  • I3D 특징을 사용하면 성능이 급격히 떨어지며, NNV의 MoF는 IDT일 때 40.6%에서 I3D일 때 11.4%로 감소하여 이 특징 유형으로의 일반화가 열 劣함을 보였다.
  • PCA로 감소된 I3D 특징(PCA-I3D)은 성능 향상을 보였지만 여전히 IDT 특징보다 열 劣했으며, CDFL은 PCA-I3D에서 38.0% MoF, IDT에서 48.9% MoF를 기록했다.
  • MuCon은 IDT 특징에서는 성능이 열 劣했지만(Imp. 40.2%), I3D(48.3%)와 PCA-I3D(47.7%)에서는 크게 향상되어 모델별로 특징 유형에 대한 민감도가 다름을 보였다.
  • NNV에서 PCA-I3D 특징을 사용할 때 작은 시간 윈도우 크기(예: 1 프레임)가 성능 향상을 가져왔으며, 이는 I3D 특징을 사용할 경우 국소 시간적 맥락이 더 중요함을 시사한다.
  • 결과는 현재의 약한 감독 하에 행동 분할 모델이 특징 분포의 변화에 취약하며, I3D 특징는 아키텍처나 초모수 조정 없이 Breakfast 데이터셋에 적합하지 않을 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.