Skip to main content
QUICK REVIEW

[논문 리뷰] COIN: A Large-scale Dataset for Comprehensive Instructional Video Analysis

Yansong Tang, Dajun Ding|arXiv (Cornell University)|2019. 03. 07.
Human Pose and Action Recognition참고 문헌 37인용 수 14
한 줄 요약

이 논문은 12개의 일상 생활 도메인에서 180개의 작업을 포함하고, 11,827개의 지침 영상으로 구성된 대규모이고 계층적인 데이터셋인 COIN을 소개한다. 각 영상은 단계 기반 설명과 시간 경계로 주석 처리되어 있다. 본 논문은 작업 수준의 맥락을 활용하여 단계 국소화 성능을 향상시키는 작업일致성 방법을 제안하며, 행동 검출 벤치마크에서 성능을 크게 향상시킨다. COIN에서 mAP는 8.12에 도달했고, 이는 Breakfast의 15.84와 THUMOS14의 29.10보다 낮지만, 대규모이고 다양한 지침 영상 데이터셋에서의 성능 향상 가능성을 보여준다.

ABSTRACT

There are substantial instructional videos on the Internet, which enables us to acquire knowledge for completing various tasks. However, most existing datasets for instructional video analysis have the limitations in diversity and scale,which makes them far from many real-world applications where more diverse activities occur. Moreover, it still remains a great challenge to organize and harness such data. To address these problems, we introduce a large-scale dataset called "COIN" for COmprehensive INstructional video analysis. Organized with a hierarchical structure, the COIN dataset contains 11,827 videos of 180 tasks in 12 domains (e.g., vehicles, gadgets, etc.) related to our daily life. With a new developed toolbox, all the videos are annotated effectively with a series of step descriptions and the corresponding temporal boundaries. Furthermore, we propose a simple yet effective method to capture the dependencies among different steps, which can be easily plugged into conventional proposal-based action detection methods for localizing important steps in instructional videos. In order to provide a benchmark for instructional video analysis, we evaluate plenty of approaches on the COIN dataset under different evaluation criteria. We expect the introduction of the COIN dataset will promote the future in-depth research on instructional video analysis for the community.

연구 동기 및 목표

  • 요리 외의 실제 세계 작업을 포함하는 대규모이고 다양한 지침 영상 데이터셋이 부족한 문제를 해결하기 위해.
  • 도메인, 작업, 단계의 세 수준 계층적 구조를 통해 지침 영상의 종합적 분석을 가능하게 하기 위해.
  • 기존 영상 모드 주석 방식 대비 73.2%의 주석 시간 감소를 달성하는 효율적인 주석 도구 상자 개발을 위해.
  • 다양하고 실제 세계의 지침 영상들을 사용하여 단계 국소화 및 행동 검출에 대한 벤치마크를 수립하기 위해.
  • 작업 수준의 맥락을 모델링하여 단계 간 의존성을 활용함으로써 단계 국소화 성능을 향상시키는 작업일치성 방법을 제안하기 위해.

제안 방법

  • COIN 데이터셋은 계층적 분류 체계를 갖추고 있으며, 12개의 도메인(예: 차량, 가전제품), 180개의 작업, 그리고 시간 경계가 주석 처리된 46,354개의 단계로 구성되어 있다.
  • 새로운 프레임 모드 주석 도구 상자가 영상 모드 주석 시간의 26.8%로 주석 시간을 단축시켜 대규모 레이블링을 효율적으로 가능하게 한다.
  • 작업일치성 방법은 제안 점수에서 작업 레이블을 하향식으로 예측한 후, 상향식으로 정밀도를 향상시키기 위해 개선하는 하향식 보정 전략을 사용한다.
  • 이 방법은 기존의 제안 기반 행동 검출 모델(예: SSN)과 통합되며, 초모수 α를 사용해 작업 수준 예측과 단계 제안을 융합한다.
  • 이 프레임워크는 단계 간 내재된 의존성을 활용하여 예측된 작업에 일치하지 않는 제안을 걸러내어 국소화의 강건성을 향상시킨다.
  • 다양한 기준(예: mAP, 정확도)을 사용하여 영상 분류 및 행동 검출 작업 모두에서 평가가 수행된다.

실험 결과

연구 질문

  • RQ1최신 행동 검출 모델의 성능는 COIN과 같이 대규모이고 다양한 지침 영상 데이터셋에서 어떻게 일반화되는가?
  • RQ2작업 수준의 맥락을 모델링함으로써 지침 영상 내 개별 단계의 국소화 성능는 얼마나 향상되는가?
  • RQ3제안된 주석 도구 상자는 기존 영상 모드 주석 방식과 비교해 효율성과 확장성 면에서 어떻게 다른가?
  • RQ4도메인의 다양성과 시각적 유사성은 단계 국소화 성능에 어떤 영향을 미치는가?
  • RQ5작업일치성 방법은 다양한 작업 간에 잘못된 경고(양성 오류)를 어떻게 줄이는가?

주요 결과

  • COIN 데이터셋은 12개의 도메인에서 180개의 작업을 포함하며, 11,827개의 영상, 46,354개의 단계 수준 주석 및 시간 경계를 포함하고 있어, 기존의 지침 영상 벤치마크의 규모와 다양성을 크게 확장했다.
  • 제안된 주석 도구 상자는 영상 모드에서 88.30분에서 23.43분으로 평균 주석 시간을 73.2% 감소시켜 높은 효율성을 입증했다.
  • 작업일치성 방법은 COIN에서 단계 국소화 mAP를 8.12로 향상시켰으며, 기준 모델을 능가하고 다양한 도메인에서 강건성을 보였다.
  • 시각적 다양성이 높은 작업(예: 설탕을 불태우기, 쿠르링하기)은 mAP가 15% 이상을 기록한 반면, 유사한 환경을 가진 작업(예: soaps를 만들기, 시계 줄을 교체하기)은 mAP가 10% 미만으로 낮아, 시각적 유사성이 주요 과제임을 확인했다.
  • 유튜브에서 가장 많은 조회수를 기록한 작업인 '프렌치 프라이 만들기'는 1.7×10⁸번의 조회수를 기록하여 선택된 작업들이 실제 세계에서의 관련성과 실용적 가치를 지닌다는 것을 입증했다.
  • COIN에서 영상 분류 정확도는 88.02%에 도달했으며, Breakfast(15.84 mAP)와 같은 더 작은 벤치마크보다 높아, 데이터셋의 복잡성과 대표성을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.