Skip to main content
QUICK REVIEW

[논문 리뷰] First Person Action-Object Detection with EgoNet

Gedas Bertasius, Hyun Soo Park|arXiv (Cornell University)|2016. 03. 15.
Human Pose and Action Recognition참고 문헌 58인용 수 16
한 줄 요약

이 논문은 첫 번째인성 RGBD 영상에서 시각적 또는 촉각적 상호작용에 관여하는 행동-물체를 탐지하기 위해 시각적 외관과 3D 공간적 힌트를 첫 번째인성 좌표 임베딩과 융합하는 이중 스트림 딥러닝 모델인 EgoNet을 제안한다. EgoNet은 다양한 첫 번째인성 데이터셋에서 최신 기술 수준의 성능과 강력한 제로샷 일반화 성능을 달성하며, 평균 F1과 평균 정밀도 모두 이전 방법들을 능가한다.

ABSTRACT

Unlike traditional third-person cameras mounted on robots, a first-person camera, captures a person's visual sensorimotor object interactions from up close. In this paper, we study the tight interplay between our momentary visual attention and motor action with objects from a first-person camera. We propose a concept of action-objects---the objects that capture person's conscious visual (watching a TV) or tactile (taking a cup) interactions. Action-objects may be task-dependent but since many tasks share common person-object spatial configurations, action-objects exhibit a characteristic 3D spatial distance and orientation with respect to the person. We design a predictive model that detects action-objects using EgoNet, a joint two-stream network that holistically integrates visual appearance (RGB) and 3D spatial layout (depth and height) cues to predict per-pixel likelihood of action-objects. Our network also incorporates a first-person coordinate embedding, which is designed to learn a spatial distribution of the action-objects in the first-person data. We demonstrate EgoNet's predictive power, by showing that it consistently outperforms previous baseline approaches. Furthermore, EgoNet also exhibits a strong generalization ability, i.e., it predicts semantically meaningful objects in novel first-person datasets. Our method's ability to effectively detect action-objects could be used to improve robots' understanding of human-object interactions.

연구 동기 및 목표

  • 단지 첫 번째인성 영상 데이터만을 사용하여 의식적인 시각적 또는 촉각적 상호작용을 유도하는 행동-물체를 탐지하는 도전 과제를 해결하기 위해.
  • 제3자 카메라나 웨어러블 센서의 한계를 극복하기 위해 단지 첫 번째인성 시각 신호만을 활용하기 위해.
  • 작업에 특화된 적응 없이 사람과 행동-물체 사이의 특징적인 3D 공간적 관계(거리 및 방향)를 모델링하기 위해.
  • 다양하고 알려지지 않은 활동과 물체 카테고리에 걸쳐 행동-물체를 탐지할 수 있는 일반화 가능한 모델을 개발하기 위해.
  • 기준 측정을 위해 프레임별 행동-물체 마스크가 포함된 새로운 주석 처리된 첫 번째인성 RGBD 데이터셋을 제공하기 위해.

제안 방법

  • RGB(시각적 외관)와 깊이/높이(3D 공간적 구조) 입력을 병렬로 처리하는 공동 이중 스트림 네트워크 아키텍처를 설계하기 위해.
  • 시각자신의 시점에서 상대적인 행동-물체의 공간 분포를 인코딩하는 첫 번째인성 좌표 임베딩 레이어를 통합하기 위해.
  • 실생활 작업 중 카메라 사용자가 주석 처리한 프레임별 이진 마스크를 사용하여 엔드 투 엔드 네트워크를 훈련하기 위해.
  • 양쪽 스트림의 특징을 통합하기 위한 공통 융합 경로를 사용하여 프레임별 행동-물체 발생 가능성 예측하기 위해.
  • 기존의 RGB 전용 데이터셋(GTEA Gaze+, Social Children Interaction 등)을 사전 훈련된 단안 깊이 추정 모델을 사용하여 깊이 예측으로 보강하기 위해.
  • 픽셀 단위 분류를 위해 소프트맥스 출력과 함께 교차 엔트로피 손실을 최적화하여 모델을 최적화하기 위해.

실험 결과

연구 질문

  • RQ1가시 추적 장치나 웨어러블 센서에 의존하지 않고도 첫 번째인성 영상만으로 행동-물체를 정확하게 탐지할 수 있는가?
  • RQ2첫 번째인성 영상에서 행동-물체를 탐지하기 위해 시각적 외관과 3D 공간적 힌트를 융합하는 것이 얼마나 효과적인가?
  • RQ3기본적인 공간 인코딩과 비교했을 때 첫 번째인성 좌표 임베딩이 탐지 성능 향상에 얼마나 기여하는가?
  • RQ4일부 첫 번째인성 활동에 대해 훈련된 모델이 새로운, 알려지지 않은 활동과 물체 카테고리로 일반화될 수 있는가?
  • RQ5다양한 첫 번째인성 데이터셋에서 EgoNet이 기존 방법과 비교해 정확도와 강건성 측면에서 어떻게 성능을 내는가?

주요 결과

  • 제안된 First-Person Action-Object RGBD 데이터셋에서 EgoNet은 평균 F1 점수 0.396과 평균 정밀도 0.313을 기록하며 베이스라인 방법들을 능가한다.
  • 첫 번째인성 좌표 임베딩을 제거하면 평균 F1은 0.313으로, 평균 정밀도는 0.202로 감소하여, 성능 향상에 있어 이 요소의 핵심적 역할을 입증한다.
  • GTEA Gaze+ 데이터셋(RGB 전용, 깊이 없음)에서 EgoNet은 평균 F1 0.513과 평균 정밀도 0.443을 기록하며, 두 번째로 좋은 방법보다 평균 F1에서 6.5% 높은 성능을 보였다.
  • Social Children Interaction 데이터셋에서 EgoNet은 평균 F1 0.285와 평균 정밀도 0.185를 기록하며, 두 번째로 좋은 방법(평균 F1 0.254, 평균 정밀도 0.106)을 크게 능가했다.
  • 정성적 결과 분석에서 EgoNet은 여러 데이터셋에서 DeepLab-FCN 기반 모델보다 더 정확하고 더 잘 로컬라이징된 행동-물체 예측을 생성하는 것으로 나타났다.
  • 탐지된 행동-물체의 3D 시각화 결과는 모델이 인간의 상호작용 패tern과 일치하는 공간적 구성 요소를 회복함을 보여주며, 향후 로봇 조작 응용 가능성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.