[논문 리뷰] Interact as You Intend: Intention-Driven Human-Object Interaction Detection
이 논문은 인간의 시선과 신체 자세를 활용하여 탐지 정확도를 향상시키는 의도 기반 프레임워크인 iHOI를 제안한다. 주의 유도적 문맥 영역과 물체에 대한 상대적 관절 거리를 모델링하고, 어려운 음성 트리플릿 마이닝 전략을 사용함으로써, iHOI는 V-COCO와 HICO-DET에서 최신 기술 수준의 성능을 달성한다. 특히 시선과 자세를 함께 모델링할 경우 V-COCO에서 +4.28 mAP 향상이 이루어졌다.
The recent advances in instance-level detection tasks lay strong foundation for genuine comprehension of the visual scenes. However, the ability to fully comprehend a social scene is still in its preliminary stage. In this work, we focus on detecting human-object interactions (HOIs) in social scene images, which is demanding in terms of research and increasingly useful for practical applications. To undertake social tasks interacting with objects, humans direct their attention and move their body based on their intention. Based on this observation, we provide a unique computational perspective to explore human intention in HOI detection. Specifically, the proposed human intention-driven HOI detection (iHOI) framework models human pose with the relative distances from body joints to the object instances. It also utilizes human gaze to guide the attended contextual regions in a weakly-supervised setting. In addition, we propose a hard negative sampling strategy to address the problem of mis-grouping. We perform extensive experiments on two benchmark datasets, namely V-COCO and HICO-DET. The efficacy of each proposed component has also been validated.
연구 동기 및 목표
- 시선과 신체 자세와 같은 관찰 가능한 시각적 신호를 통해 인간의 의도를 모델링하여 인간-물체 상호작용 탐지 성능을 향상시키는 것.
- 오류로 인한 잘못된 그룹화 문제를 해결하기 위해 어려운 음성 트리플릿 마이닝 전략을 도입하는 것.
- 인간의 시선에 의해 유도되는 관련 문맥 영역을 활용하여 탐지의 강인성과 정확도를 향상시키는 것.
- 의도 인식 시각 추론을 인스턴스 수준의 HOI 탐지에 통합하는 계산 프레임워크를 제공하는 것.
- 의도 모델링이 정확한 예측 신뢰도 향상과 잠재적 오진 억제에 어떻게 기여하는지 검증하는 것.
제안 방법
- 프레임워크는 두 가지 핵심 구성 요소를 사용하여 인간의 의도를 모델링한다: 시선 유도 주의를 통해 정보성 있는 문맥 영역을 선택하고, 물체에 대한 상대적 관절 거리를 통해 자세 기반 의도를 표현한다.
- 약한 지도 학습 설정을 활용하여 시선 예측을 활용하며, 시선 히트맵을 기반으로 상위 5개의 가장 관련성이 높은 영역을 동적으로 선택한다.
- 신체 자세는 인간의 관절에서 물체 인스턴스까지의 상대적 거리로 표현되어 의도를 나타내는 공간적 관계를 캡처한다.
- 새로운 어려운 음성 트리플릿 마이닝 전략은 오해의 소지가 있는 또는 분류가 어려운 트리플릿에 초점을 맞춰 잘못 그룹화된 HOI 후보를 타겟으로 한다.
- 모델은 V-COCO와 HICO-DET에서 엔드 투 엔드로 훈련되며, HOI 트리플릿 분류와 의도 모델링을 함께 최적화한다.
- 프레임워크는 인간과 물체 특징를 처리하기 위한 이중 스트림 아키텍처를 사용하며, 상호작용 예측과 의도 신호를 정렬하기 위해 교차 주의 메커니즘을 적용한다.

실험 결과
연구 질문
- RQ1시선과 신체 자세는 HOI 탐지에서 의도 모델링을 위한 신뢰할 수 있고 계산적으로 활용 가능한 신호로 기능할 수 있는가?
- RQ2의도 모델링을 통합할 경우, 복잡한 사회적 상황에서 HOI 탐지의 정확도와 강인성이 어떻게 향상되는가?
- RQ3전체 장면 특징에 비해 시선 유도 문맥 영역 선택은 탐지 성능 향상에 얼마나 기여하는가?
- RQ4잘못된 그룹화 위험을 기반으로 한 어려운 음성 트리플릿 마이닝은 일반화 능력 향상과 예측 환각 억제에 기여하는가?
- RQ5의도 모델링은 모호한 동작이나 잘못된 물체 위치로 인한 오진을 억제할 수 있는가?
주요 결과
- 시선과 자세를 함께 모델링할 경우, 기준 모델인 VTransE-HO에 비해 V-COCO에서 +4.28 mAP 향상, HICO-DET에서 +1.42 mAP 향상이 이루어졌다.
- 상위 5개의 시선 유도 문맥 영역을 사용할 경우 최적의 성능을 달성하였으며, 이는 시선 오류에 대한 강인성과 노이즈 감소를 균형 있게 확보한다.
- 관절-물체 간 상대적 거리 표현을 통합할 경우, 좌표 기반 자세 인코딩에 비해 V-COCO에서 +0.80 mAP 향상, HICO-DET에서 +0.53 mAP 향상이 이루어졌다.
- 제안된 어려운 음성 트리플릿 마이닝 전략은 마이닝 없이 비교할 경우 V-COCO에서 mAP 하락을 3.42점 감소시켜 상호작용 환각을 크게 억제한다.
- 정성적 결과는 의도 모델링이 오진 억제에 효과적임을 보여주며, 예를 들어 목표 물체와의 정렬이 이루어지지 않을 경우 '킥' 동작을 거부하는 데 성공한다.
- 의도 신호(시선과 자세)가 행동과 모순될 경우, '다른 사람의 케이크를 먹는다'와 같은 잘못된 트리플릿도 성공적으로 거부한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.