[논문 리뷰] Predicting the Next Action by Modeling the Abstract Goal
이 논문은 시각적 특징과 동작 표현에서 잠재 목표 분포를 추론하기 위해 변동형 순환 네트워크를 사용하여 행동 예측을 위한 새로운 스토케스틱 추상 목표 모델링 방법을 제안한다. 후보 행동들 중 가장 타당한 다음 행동을 선택하기 위해 목표 일관성 기준을 도입함으로써, 이 방법은 Epic-Kitchens55, EK100, EGTEA Gaze+ 데이터셋에서 최신 기술 수준을 초월하는 성능을 달성하였으며, EK55의 본 적 있는 주방에서 Top-1 동사, 명사, 행동 정확도 각각 +13.69, +11.24, +5.19의 절대적 향상을 기록하였다.
The problem of anticipating human actions is an inherently uncertain one. However, we can reduce this uncertainty if we have a sense of the goal that the actor is trying to achieve. Here, we present an action anticipation model that leverages goal information for the purpose of reducing the uncertainty in future predictions. Since we do not possess goal information or the observed actions during inference, we resort to visual representation to encapsulate information about both actions and goals. Through this, we derive a novel concept called abstract goal which is conditioned on observed sequences of visual features for action anticipation. We design the abstract goal as a distribution whose parameters are estimated using a variational recurrent network. We sample multiple candidates for the next action and introduce a goal consistency measure to determine the best candidate that follows from the abstract goal. Our method obtains impressive results on the very challenging Epic-Kitchens55 (EK55), EK100, and EGTEA Gaze+ datasets. We obtain absolute improvements of +13.69, +11.24, and +5.19 for Top-1 verb, Top-1 noun, and Top-1 action anticipation accuracy respectively over prior state-of-the-art methods for seen kitchens (S1) of EK55. Similarly, we also obtain significant improvements in the unseen kitchens (S2) set for Top-1 verb (+10.75), noun (+5.84) and action (+2.87) anticipation. Similar trend is observed for EGTEA Gaze+ dataset, where absolute improvement of +9.9, +13.1 and +6.8 is obtained for noun, verb, and action anticipation. It is through the submission of this paper that our method is currently the new state-of-the-art for action anticipation in EK55 and EGTEA Gaze+ https://competitions.codalab.org/competitions/20071#results Code available at https://github.com/debadityaroy/Abstract_Goal
연구 동기 및 목표
- 관측된 시각적 특징과 동작 시퀀스로부터 암묵적으로 추상 목표를 모델링하여 행동 예측의 불확실성을 줄이는 것.
- 시각적 및 동작 표현에 기반한 변동형 추론을 사용하여 잠재 목표 분포를 학습하는 스토케스틱 프레임워크를 개발하는 것.
- 특징 기반 및 동작 기반 추상 목표 분포 간의 일관성을 강제하여 다음 행동 예측 성능을 향상시키는 것.
- 예측되지 않은 환경, 예를 들어 Epic-Kitchens100의 예측되지 않은 주방과 같은 환경으로 일반화하는 것.
- 비스시프트, 이고세트릭 비디오 환경에서 기존의 결정론적 및 스토케스틱 모델을 모두 능가하는 것.
제안 방법
- 모델은 관측된 동작 시퀀스에서 유도된 시각적 특징에 조건부로 작동하는 변동형 순환 네트워크(VRNN)를 사용하여 특징 기반 추상 목표 분포를 학습한다.
- 관측된 동작과 샘플링된 추상 목표에 조건부로 작동하는 분포에서 다수의 후보 다음 행동 표현을 샘플링한다.
- 예측된 다음 행동 표현에 기반하여 생성적 변동형 프레임워크를 사용해 동작 기반 추상 목표 분포를 학습한다.
- 특징 기반 및 동작 기반 추상 목표 분포 간의 발산을 측정하는 새로운 목표 일관성 손실를 도입하여 가장 타당한 다음 행동을 선택한다.
- 행동 예측을 위한 교차 엔트로피 손실, 잠재 변수 정규화를 위한 KL 발산, 목표 일관성 손실를 조합하여 엔드 투 엔드로 모델을 훈련시킨다.
- 다수의 행동 후보를 샘플링하고, 목표 일관성을 최대화하는 것을 선택하여 예측된 다음 행동으로 삼는다.
실험 결과
연구 질문
- RQ1시각적 특징과 동작 시퀀스로부터 추상 목표를 모델링하면 행동 예측 성능이 향상되는가?
- RQ2특징 기반 및 동작 기반 추상 목표 간의 일관성을 강제하면 예측 정확도가 어떻게 향상되는가?
- RQ3스토케스틱이고 변동형 접근법을 통해 추상 목표 모델링이 예측되지 않은 환경, 예를 들어 예측되지 않은 주방과 같은 환경으로 일반화될 수 있는가?
- RQ4각 손실 구성 요소—다음 행동 예측, 추상 목표 정규화, 목표 일관성—의 상대적 기여도는 무엇인가?
- RQ5제안된 방법은 비스시프트 및 트랜스포머 기반 모델을 포함한 결정론적 및 스토케스틱 베이스라인을 모두 능가하는가?
주요 결과
- 기존 최신 기술 수준 대비 Epic-Kitchens55의 본 적 있는 주방(S1) 분할에서 Top-1 동사 정확도가 +13.69 점 향상되었다.
- 동일한 S1 분할에서 EK55의 Top-1 명사 및 Top-1 행동 예측 정확도는 각각 +11.24 및 +5.19 점 향상되었다.
- EK55의 예측되지 않은 주방(S2) 분할에서, 모델은 Top-1 동사 정확도를 +10.75, 명사 정확도를 +5.84, 행동 정확도를 +2.87 향상시켰다.
- EGTEA Gaze+에서, 모델은 Top-1 명사, 동사, 행동 예측 정확도 각각 +9.9, +13.1, +6.8 점 향상되었다.
- 단절 분석 결과, 목표 일관성 손실가 가장 영향력 있는 구성 요소임을 확인하였으며, 네 가지 손실 항목(Na, Og, Ng, Gc) 모두 성능 향상에 기여하였다.
- 모델은 다양한 예측 수평에서 강력한 성능 유지를 보였으며, 0.5초 시점에서 Top-5 행동 정확도가 44.26%였고, 2초 시점에서는 42.90%였으며, RU-LSTM 및 시계열 집계 베이스라인을 모두 능가하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.