Skip to main content
QUICK REVIEW

[논문 리뷰] RareAct: A video dataset of unusual interactions

Antoine Miech, Jean-Baptiste Alayrac|arXiv (Cornell University)|2020. 08. 03.
Human Pose and Action Recognition참고 문헌 4인용 수 13
한 줄 요약

이 논문은 흔하지 않은 동사-명사 조합(예: '휴대폰 믹서에 넣기', '신발을 전자레인지에 넣기')로 구성된 희귀한 인간-물체 상호작용을 담은 비디오 데이터셋인 RareAct를 소개한다. 이는 행동 인식 모델의 제로샷 및 패스트샷 구성성 평가를 위해 제작되었다. HowTo100M으로 사전 훈련된 비디오-텍스트 모델을 사용하여, 동사-명사 조합의 공동 모델링이 별도 탐지보다 유의미하게 뛰어나다는 것을 입증하였다. 이는 구성성이 여전히 영상 이해 분야에서 주요 과제임을 시사한다.

ABSTRACT

This paper introduces a manually annotated video dataset of unusual actions, namely RareAct, including actions such as "blend phone", "cut keyboard" and "microwave shoes". RareAct aims at evaluating the zero-shot and few-shot compositionality of action recognition models for unlikely compositions of common action verbs and object nouns. It contains 122 different actions which were obtained by combining verbs and nouns rarely co-occurring together in the large-scale textual corpus from HowTo100M, but that frequently appear separately. We provide benchmarks using a state-of-the-art HowTo100M pretrained video and text model and show that zero-shot and few-shot compositionality of actions remains a challenging and unsolved task.

연구 동기 및 목표

  • 희귀하고 비일상적인 일반 동사와 명사 조합에 대해 행동 인식 모델의 구성성을 평가하기 위해.
  • 기존 데이터셋이 빈번한 행동에만 집중하는 점을 보완하여, 희귀하고 이국적인 상호작용을 위한 벤치마크를 제공하기 위해.
  • 모델 일반화 능력을 시험하기 위해 동사 또는 명사 중 하나를 공유하는 하드 네거티브를 포함한 표준화된 평가 프로토콜을 제공하기 위해.
  • 현재 최고 성능 모델들이 여전히 영상 이해에서 제로샷 및 패스트샷 구성성에 어려움을 겪고 있음을 입증하기 위해.
  • 공개된 데이터셋을 통해 향후 영상 행동 인식 분야의 구성적 일반화 연구를 가능하게 하기 위해.

제안 방법

  • HowTo100M에서 흔히 나타나지 않지만 개별적으로 빈번한 동사-명사 조합을 선별하여 RareAct를 구성함으로써, 의미적 타당성과 인식 난이도를 확보함.
  • 각 동사-명사 조합에 대해 검색 기반으로 영상 공유 플랫폼에서 영상을 수집한 후, 10초 클립으로 분할함.
  • 7단계의 애너테이션 체계를 활용함: 긍정(동사가 명사에 적용됨), 하드 네거티브(단지 동사, 단지 명사, 또는 동사와 명사가 상호작용하지 않음), 부정(둘 다 아님), 모호함, 또는 기각된 클립.
  • 영상 내 다중 클립으로 인한 편향을 줄이기 위해 역비디오 빈도 가중치를 사용하여 mWAP 및 mSAP를 부분 샘플링함.
  • HowTo100M에서 사전 훈련된 S3D 텍스트-비디오 모델을 사용하여, 동사, 명사, 동사-명사 조합의 유사도 점수를 계산함.
  • 세 가지 베이스라인을 평가함: 동사 및 명사 점수의 곱셈, 덧셈, 그리고 공동 모델링 방식으로, 하드 네거티브 포함 여부를 고려함.

실험 결과

연구 질문

  • RQ1행동 인식 모델은 일반적인 동사와 명사의 희귀한, 새로운 조합에 대해 영상에서 일반화할 수 있는가?
  • RQ2동사 또는 명사를 공유하는 하드 네거티브 예제를 포함할 경우, 희귀 조합에 대한 모델 성능에 어떤 영향을 미치는가?
  • RQ3동사-명사 조합의 공동 모델링이 별도의 탐지 및 동사-명사 점수의 조합보다 우수한가?
  • RQ4최고 성능의 비디오-텍스트 모델에서 제로샷 및 패스트샷 구성성이 얼마나 여전히 도전 과제로 남아 있는가?
  • RQ5다양한 평가 지표(mWAP, mSAP)는 희귀 행동 인식에서 구성적 일반화 평가에 어떤 영향을 미치는가?

주요 결과

  • 공동 모델링 접근법 $ s((Verb,Noun)|X) $ 는 40.7 mWAP 및 44.6 mSAP를 기록하여, 덧셈 및 곱셈 베이스라인보다 유의미하게 뛰어난 성능을 보였다.
  • 덧셈 베이스라인 $ s(Verb|X) + s(Noun|X) $ 는 곱셈보다 더 나은 성능을 보였으며, 이는 희귀 조합에 대해 덧셈 방식이 논리적 AND 연산보다 효과적임을 시사한다.
  • 하드 네거티브를 포함시켰을 때 모든 베이스라인에서 성능이 감소하여, 구성적 일반화 평가에 있어 하드 네거티브의 중요성을 확인함.
  • 하드 네거티브를 포함한 공동 모델은 30.5 mWAP 및 34.8 mSAP를 기록하여, 심지어 최첨단 모델이라도 희귀 조합에 대해 어려움을 겪고 있음을 시사함.
  • 최고 성능의 공동 모델과 덧셈 베이스라인 간의 성능 격차는 영상 이해에서 더 나은 구성적 추론이 필요함을 강조한다.
  • 데이터셋 분석 결과, 현재 모델들은 대규모 영상-텍스트 데이터로 훈련된 후에도 여전히 희귀한 인간-물체 상호작용에 대해 구성적으로 일반화하지 못함을 드러냄.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.