[논문 리뷰] Human-Object Interaction Detection via Disentangled Transformer
이 논문은 인코더와 디코더를 분리하여 인간-객체 쌍 검출과 상호작용 분류를 별도로 처리하는 새로운 HOI 감지 프레임워크인 Disentangled Transformer (DisTR)를 제안한다. 기반 디코더를 통한 통합 표현과 주의 집중형 융합을 통한 군집에서의 정 fine-tuning 전략을 통해 DisTR는 V-COCO와 HICO-DET에서 최신 기술 수준의 성능을 달성하며, FLOPs와 파라미터 수를 효율적으로 유지하면서도 이전 방법들에 비해 뚜렷한 성능 향상을 보였다.
Human-Object Interaction Detection tackles the problem of joint localization and classification of human object interactions. Existing HOI transformers either adopt a single decoder for triplet prediction, or utilize two parallel decoders to detect individual objects and interactions separately, and compose triplets by a matching process. In contrast, we decouple the triplet prediction into human-object pair detection and interaction classification. Our main motivation is that detecting the human-object instances and classifying interactions accurately needs to learn representations that focus on different regions. To this end, we present Disentangled Transformer, where both encoder and decoder are disentangled to facilitate learning of two sub-tasks. To associate the predictions of disentangled decoders, we first generate a unified representation for HOI triplets with a base decoder, and then utilize it as input feature of each disentangled decoder. Extensive experiments show that our method outperforms prior work on two public HOI benchmarks by a sizeable margin. Code will be available.
연구 동기 및 목표
- 기존 HOI 트랜스포머가 인간-객체 인스턴스와 상호작용 간의 공동 모델링 부족과 잘못된 그룹화 오류를 겪는 문제를 해결하기 위해.
- 인간-객체 쌍과 상호작용에 대해 분리된 표현을 학습하여 HOI 감지의 정확성과 해석 가능성 향상.
- 객체 쌍과 상호작용 동사 예측을 분리함으로써 희귀 HOI 카테고리에 대한 일반화 능력 향상.
- 기반 디코더를 통한 통합 연결 메커니즘 설계 및 분리된 디코더 간의 소통을 가능하게 하여 예측을 정교화.
제안 방법
- 모델은 인코더와 디코더가 각각 두 개의 스트림으로 나뉘는 분리된 트랜스포머 아키텍처를 도입한다. 하나는 인간-객체 쌍 검출을 위한 인스턴스 스트림이고, 다른 하나는 동사 분류를 위한 상호작용 스트림이다.
- 기반 디코더가 먼저 모든 HOI 삼중항에 대한 통합 표현을 생성한 후, 이는 군집에서의 정 fine-tuning 방식으로 분리된 디코더를 개선하는 데 사용된다.
- 인스턴스 디코더와 상호작용 디코더 간의 정보 교환을 가능하게 하기 위해 주의 집중형 융합 블록을 도입하여 다중 작업 이해 능력을 향상시킨다.
- 개별 객체가 아닌 상호작용하는 인간-객체 쌍을 직접 예측하도록 인스턴스 디코더를 재정의함으로써 잘못된 그룹화 오류를 감소시킨다.
- 크로스 어텐션 기반의 쿼리 기반 세트 예측 메커니즘을 사용하며, 각 디코더가 서로 다른 공간 영역에 주의를 기울인다. 이는 주의 시각화를 통해 검증되었다.
- 학습은 엔드 투 엔드로 이루어지며, 학습 가능한 쿼리 세트와 이분 매칭 손실을 사용하여 예측과 진짜 삼중항 간의 정렬을 보장한다.
실험 결과
연구 질문
- RQ1HOI 삼중항 예측을 인간-객체 쌍 검출과 상호작용 분류로 분리함으로써 정확도 향상과 잘못된 그룹화 오류 감소가 가능한가?
- RQ2인코더와 디코더 구성 요소를 모두 분리함으로써 HOI 감지의 별도 하위 작업에 대한 표현 학습이 향상되는가?
- RQ3기반 디코더를 통한 통합 표현을 활용한 군집에서의 정 fine-tuning 전략이 인간-객체 쌍과 상호작용 동사 간의 정렬을 향상시키는가?
- RQ4주의 집중형 융합 블록은 작업 전용 집중을 해치지 않으면서 분리된 디코더 간의 소통을 얼마나 효과적으로 가능하게 하는가?
- RQ5개선된 분리와 표현 학습 덕분에 제안된 방법이 희귀 HOI 카테고리에 대해 더 나은 일반화 성능을 보이는가?
주요 결과
- V-COCO 테스트 세트에서 DisTR는 시나리오 #1 조건 하에 기존 방법들인 QPIC(58.8)과 HOTR(55.2)를 크게 앞서는 새로운 최고 성능 mAP 66.2를 달성하였다.
- HICO-DET 벤치마크에서 DisTR는 mAP 47.8을 기록하며, 이는 QPIC(44.0)과 HOTR(45.1)를 초월한 이전 최고 성능 방법들을 능가하였다.
- 제거 실험 결과, 통합 표현을 학습 가능한 쿼리로 대체한 경우(V-COCO에서 1.3%, HICO-DET에서 0.66% 감소)는 군집에서의 정 fine-tuning 전략의 효과를 확인하였다.
- 크로스 어텐션 맵의 시각화 결과, 인스턴스 디코더는 객체의 끝부분에 주의를 기울이고 상호작용 디코더는 상호작용 영역에 집중하는 것으로 확인되어 분리된 표현 학습이 검증되었다.
- 모델는 효율적인 계산을 유지하였으며, ResNet-50 기준 QPIC 대비 뿐만 아니라 7% 정도의 추가 FLOPs만을 소비하여 정확도-효율성의 우수한 트레이드오프를 보였다.
- 분리된 인코더와 디코더 설계 덕분에 더 나은 해석 가능성과 긴 꼬리 분포를 보이는 HOI 카테고리에서의 성능 향상이 이루어졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.