[논문 리뷰] Affordance Transfer Learning for Human-Object Interaction Detection
이 논문은 인지 가능한 기능(affordance)과 물체 간의 상호작용을 분리하여, 기존의 기능 특징과 새로운 물체 특징을 조합함으로써 새로운 물체에 대해 제로샷(HOI) 탐지를 가능하게 하는 기능 전이 학습(affordance transfer learning, ATL)을 제안한다. 이 방법은 희귀하거나 미리 보지 않은 상호작용에 대해 성능을 향상시키며, 약한 지도 학습 기반의 물체 기능 인식도 가능하게 하여, HICO-DET 및 HOI-COCO 데이터셋에서 최신 기술보다 뛰어난 성능을 보인다.
Reasoning the human-object interactions (HOI) is essential for deeper scene understanding, while object affordances (or functionalities) are of great importance for human to discover unseen HOIs with novel objects. Inspired by this, we introduce an affordance transfer learning approach to jointly detect HOIs with novel objects and recognize affordances. Specifically, HOI representations can be decoupled into a combination of affordance and object representations, making it possible to compose novel interactions by combining affordance representations and novel object representations from additional images, i.e. transferring the affordance to novel objects. With the proposed affordance transfer learning, the model is also capable of inferring the affordances of novel objects from known affordance representations. The proposed method can thus be used to 1) improve the performance of HOI detection, especially for the HOIs with unseen objects; and 2) infer the affordances of novel objects. Experimental results on two datasets, HICO-DET and HOI-COCO (from V-COCO), demonstrate significant improvements over recent state-of-the-art methods for HOI detection and object affordance detection. Code is available at https://github.com/zhihou7/HOI-CL
연구 동기 및 목표
- 시각적 장면에서 새로운 또는 미리 보지 않은 물체를 가진 인간-물체 상호작용(HOI)을 탐지하는 문제를 해결하기 위해.
- 기존의 기능 표현을 새로운 물체에 전이하여 제로샷 일반화를 가능하게 하기 위해 HOI 탐지에 기능 표현을 전이하기 위해.
- 통합적이고 조합적인 프레임워크를 사용하여 HOI 탐지와 물체 기능 인식을 동시에 향상시키기 위해.
- 희귀하거나 새로운 상호작용에 대해 완전히 애너테이션된 데이터에 의존하는 것을 줄이기 위해 기능 전이를 활용하기 위해.
제안 방법
- 공유 백본 네트워크를 사용하여 HOI 표현을 분리된 기능과 물체 특징으로 분해한다.
- HOI 데이터셋에서 추출한 기능 특징과 추가적인 물체 검출 데이터셋에서의 물체 특징을 조합하여 새로운 HOI 샘플을 생성한다.
- 사전 학습된 기능 표현의 특징 백업을 사용하여 새로운 물체에 대한 제로샷 추론을 가능하게 한다.
- 물체 검출기의 미세조정이 HICO-DET에서 이루어지고, 기능 특징이 조합을 통해 전이되는 이중 단계 검출 파이프라인을 구현한다.
- 동일한 HOI 분류기를 사용하여 조합된 HOI 샘플을 분류함으로써 약한 지도 학습 기반의 기능 인식을 수행한다.
- HOI 및 물체 검출 데이터셋 간의 도메인 차이를 완화하기 위해 도메인 적응 기법을 적용한다.
실험 결과
연구 질문
- RQ1기존 HOI 데이터에서 유도된 기능 표현이 새로운 물체에 효과적으로 전이되어 제로샷 HOI 탐지가 가능할 수 있는가?
- RQ2기능 특징과 물체 특징을 조합함으로써 희귀하거나 새로운 상호작용에 대한 탐지 성능이 어떻게 향상되는가?
- RQ3HOI 탐지 모델이 약한 지도 학습 기반의 물체 기능 인식에 얼마나 효과적으로 활용될 수 있는가?
- RQ4물체 검출 박스의 품질에 따라 기능 전이 학습의 민감도는 어느 정도인가?
- RQ5HOI와 물체 검출 데이터셋 간의 도메인 차이가 기능 전이의 성능을 떨어뜨리는가?
주요 결과
- 미세조정된 물체 검출기를 사용할 경우, HICO-DET 테스트 세트에서 제안된 ATL 방법은 30.79%의 mAP를 달성하여 베이스라인(23.44%)과 COCO 검출기 베이스라인(20.08%)을 크게 능가한다.
- 정답 물체 박스를 사용할 경우, ATL은 HICO-DET에서 44.27%의 mAP를 기록하여 이상적인 조건에서도 뛰어난 성능을 보인다.
- HOI-COCO 데이터셋에서, COCO 이미지의 일부에서 추출한 물체 특징을 사용할 경우, 전반적인 HOI에 대해 24.74%의 mAP를 달성하여 도메인 간 전이 가능성도 입증한다.
- ATL은 모든 신뢰도 임계값에서 물체 기능 인식 F1 점수를 향상시키며, 특히 낮은 검출 신뢰도에서 기존의 물체 검출 결과 기반 방법보다 뛰어나다.
- 이 방법은 물체 검출 품질에 매우 민감하다: 도메인 차이로 인해 COCO 검출기를 사용할 경우 성능이 크게 떨어지며, 이는 ATL에서 고성능의 물체 검출이 필수적임을 시사한다.
- 정성적 결과에서는, 기준 모델이 완전히 실패하는 경우(예: '호랑이 타기')에도 ATL이 성공적으로 새로운 HOI를 탐지함을 확인하여 제로샷 일반화 능력을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.