Skip to main content
QUICK REVIEW

[논문 리뷰] Opening the Vocabulary of Egocentric Actions

Dibyadip Chatterjee, Fadime Şener|arXiv (Cornell University)|2023. 08. 22.
Human Pose and Action Recognition인용 수 4
한 줄 요약

이 논문은 에고세트릭 비디오를 위한 오픈 뷰어티 셰이프 액션 인식을 소개하며, 객체에 의존하지 않는 동사 인코더와 활성 객체를 위한 CLIP 기반 프롬프트 학습 방법을 사용하여 모델이 새로운 객체에 동사를 일반화할 수 있도록 한다. 이는 EPIC-KITCHENS-100 및 Assembly101 벤치마크에서 최신 기술 수준의 성능을 달성하며, 기존의 클로즈드 세트 방법에 비해 새로운 동사-객체 조합을 인식하는 데서 뚜렷한 승리를 거두었다.

ABSTRACT

Human actions in egocentric videos are often hand-object interactions composed from a verb (performed by the hand) applied to an object. Despite their extensive scaling up, egocentric datasets still face two limitations - sparsity of action compositions and a closed set of interacting objects. This paper proposes a novel open vocabulary action recognition task. Given a set of verbs and objects observed during training, the goal is to generalize the verbs to an open vocabulary of actions with seen and novel objects. To this end, we decouple the verb and object predictions via an object-agnostic verb encoder and a prompt-based object encoder. The prompting leverages CLIP representations to predict an open vocabulary of interacting objects. We create open vocabulary benchmarks on the EPIC-KITCHENS-100 and Assembly101 datasets; whereas closed-action methods fail to generalize, our proposed method is effective. In addition, our object encoder significantly outperforms existing open-vocabulary visual recognition methods in recognizing novel interacting objects.

연구 동기 및 목표

  • 에고세트릭 액션 데이터셋에서 동사-객체 조합의 희소성 문제를 해결하여, 새로운 객체로의 일반화 능력을 제한하는 요소를 제거한다.
  • 액션 인식 모델이 훈련 중에 볼 수 없었던 오픈 뷰어티 셰이프 객체로 동사를 일반화할 수 있도록 한다.
  • 에고세트릭 비디오 이해에서 장기적 꼬리 분포와 정적 프레임 표현으로 인한 편향을 극복한다.
  • 혼잡한 환경에서 방해 요소가 존재하더라도 상태 변화를 겪는 활성 객체를 신뢰성 있게 인식할 수 있는 방법을 개발한다.
  • 기본 클래스를 초월한 일반화 능력을 평가하기 위해, EPIC-KITCHENS-100 및 Assembly101에 대해 실제적인 오픈 뷰어티 셰이프 벤치마크를 구축한다.

제안 방법

  • 에고세트릭 비디오에 적합한 감독형 대비 손실과 작업별 지도 증강 기법을 사용한 객체 무관 재학습(OAP) 전략을 통해 동사와 객체 예측을 분리한다.
  • 시간적 운동과 객체 상호작용을 유지하는 지도 증강 기법을 설계하여 카메라 운동과 방해 요소에 대한 강건성을 향상시킨다.
  • CLIP이 에고세트릭 장면에서 활성 객체를 식별하도록 도와주는 학습 가능한, 동사 조건에 의존하는 프롬프트 메커니즘인 활성 객체 프롬프팅(AOP)을 제안한다.
  • 각 객체 클래스별로 학습 가능한 워드 임베딩을 CLIP의 텍스트 인코더에 미세조정하여 시각적 특징과 오픈 뷰어티 셰이프 객체 레이블 간의 정렬을 향상시킨다.
  • 두 가지 브랜치 아키텍처를 사용한다: OAP로 훈련된 객체에 무관한 표현을 학습하는 동사 인코더와, AOP를 사용한 CLIP 기반의 제로샷 일반화를 위한 객체 인코더.
  • EPIC-KITCHENS-100 및 Assembly101의 기존 분할을 재사용하여 오픈 뷰어티 셰이프 벤치마크를 구축하며, 추론 시에 새로운 객체 클래스를 도입한다.

실험 결과

연구 질문

  • RQ1에고세트릭 비디오에서 새로운 객체로의 일반화를 가능하게 하기 위해 동사 표현을 객체 특성에서 분리시킬 수 있는가?
  • RQ2혼잡한 에고세트릭 장면에서 방해 요소가 존재하더라도 상태 변화를 겪는 활성 객체를 신뢰성 있게 인식할 수 있는가?
  • RQ3CLIP 기반 시각-언어 모델이 프롬프트 학습을 통해 에고세트릭 액션 인식에서 새로운 상호작용 객체를 인식하도록 얼마나 잘 적응할 수 있는가?
  • RQ4지속적인 증강 기법을 사용한 객체에 무관한 훈련이 새로운 객체로의 동사 제로샷 일반화 능력을 향상시키는가?
  • RQ5실제 에고세트릭 데이터셋에서 제로샷 설정에서 제안된 방법이 클로즈드 세트 기반 모델에 비해 얼마나 효과적인가?

주요 결과

  • 제안된 방법은 HOI 컷 분석에서 10.8의 하모니케이티드 미디언(HM)을 달성하여 전체 프레임 기반 베이스라인(HM=7.5)보다 뚜렷이 뛰어나, 국소화된 객체 및 손의 컷팅 기법의 효과를 입증한다.
  • 각 객체당 m=5개의 학습 가능한 워드 임베딩을 사용할 경우, 모델은 최고의 신규 클래스 성능를 기록하며, 이는 프롬프트 어휘를 미세조정함으로써 새로운 객체로의 일반화 능력 향상이 가능함을 시사한다.
  • 지속적인 증강 기법을 사용한 객체에 무관한 동사 인코더는 표준 대비 손실 학습 대비 더 높은 성능을 보이며, 새로운 객체 조합에 대한 일반화 능력 향상을 입증한다.
  • 활성 객체 프롬프팅(AOP)은 복잡한 에고세트릭 장면에서 다수의 객체가 존재하더라도 오직 하나의 객체만 상태 변화를 겪는 경우에도 정확히 활성 객체를 식별할 수 있도록 CLIP 모델을 도와준다.
  • 해석 가능성 분석 결과, 미세조정된 프롬프트가 종종 수식어의 수(예: 'eggs' 대신 'egg')나 동의어(예: 'faucet' 대신 'tap')를 수정하여 자연어와의 정렬을 향상시킨다.
  • 이 방법은 EPIC-KITCHENS-100 및 Assembly101 양쪽 모두에서 클로즈드 액션 인식 기반 모델보다 뚜렷이 뛰어난 성능를 보이며, 오픈 뷰어티 셰이프 일반화의 효과성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.