Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Two-Stage Detection of Human-Object Interactions with a Novel Unary-Pairwise Transformer

Frederic Z. Zhang, Dylan Campbell|arXiv (Cornell University)|2021. 12. 03.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

이 논문은 단일 GPU에서 실시간 추론, 더 빠른 훈련, 더 낮은 메모리 사용량을 바탕으로 HICO-DET 및 V-COCO에서 최신 기술 성능을 달성하는 새로운 이단계 Human-Object Interaction (HOI) 검출 모델을 제안한다. 이는 단일 단계 검출기보다도 경량 훈련 파라다임을 사용하고도 성능이 뛰어나다. 모델은 개별 인스턴스(일원)와 그 상호작용(쌍방향)을 별도로 인코딩하는 유니어리-페어와이즈 트랜스포머를 사용한다.

ABSTRACT

Recent developments in transformer models for visual data have led to significant improvements in recognition and detection tasks. In particular, using learnable queries in place of region proposals has given rise to a new class of one-stage detection models, spearheaded by the Detection Transformer (DETR). Variations on this one-stage approach have since dominated human-object interaction (HOI) detection. However, the success of such one-stage HOI detectors can largely be attributed to the representation power of transformers. We discovered that when equipped with the same transformer, their two-stage counterparts can be more performant and memory-efficient, while taking a fraction of the time to train. In this work, we propose the Unary-Pairwise Transformer, a two-stage detector that exploits unary and pairwise representations for HOIs. We observe that the unary and pairwise parts of our transformer network specialise, with the former preferentially increasing the scores of positive examples and the latter decreasing the scores of negative examples. We evaluate our method on the HICO-DET and V-COCO datasets, and significantly outperform state-of-the-art approaches. At inference time, our model with ResNet50 approaches real-time performance on a single GPU.

연구 동기 및 목표

  • 단일 단계 HOI 검출기가 큰 트랜스포머 디코더에 크게 의존함에 따라 발생하는 비효율성과 높은 메모리 비용 문제를 해결하기 위해.
  • DETR와 같은 현대적인 백본을 사용하는 이단계 HOI 검출기가 정확도와 효율성 면에서 단일 단계 모델을 능가할 수 있는지 조사하기 위해.
  • 개선된 HOI 검출을 위해 상호보완적인 일원 및 쌍방향 표현을 활용하는 새로운 트랜스포머 아키텍처를 설계하기 위해.
  • 일원 및 쌍방향 레이어의 어텐션 메커니즘이 양성 예측을 강화하고 가짜 양성(false positives)을 억제하는 데 기여하는 방식을 분석하기 위해.
  • 고정된 객체 검출기 가중치를 갖는 이단계 설계가 정확도를 유지하면서도 더 빠르고 메모리 효율적인 훈련을 가능하게 하는지 증명하기 위해.

제안 방법

  • 모델은 이단계 파이프라인을 사용한다: 먼저 DETR 백본이 인간과 물체 인스턴스를 검출하고, 그 후 새로운 일원-쌍방향 트랜스포머가 이들의 특징을 처리한다.
  • 일원 토큰은 개별 인간 및 물체 인스턴스를 나타내며, 이 스트림 내의 자기 어텐션(self-attention)이 양성 HOI 쌍의 점수를 향상시킨다.
  • 쌍방향 토큰은 모든 인간-물체 쌍을 나타내며, 이 토큰들 사이의 자기 어텐션은 가짜 양성(false positives)을 줄이기 위해 소프트 비최대 억제(soft non-maximum suppression) 기능을 수행한다.
  • 훈련과 평가 간의 불일치 문제를 해결하기 위해, 평가와 일치하는 이중 매칭 손실(bipartite matching loss)을 사용한다.
  • 어텐션 맵을 시각화하고 분석함으로써, 일원 어텐션은 양성 쌍 점수를 향상시키고, 쌍방향 어텐션은 음성 쌍을 억제함을 검증한다.
  • 사전 훈련된 DETR 가중치를 사용하고, 상호작용 헤드만 미세조정(fine-tune)함으로써 계산 비용과 환경 영향을 감소시킨다.

실험 결과

연구 질문

  • RQ1현대 트랜스포머 백본을 갖춘 이단계 HOI 검출기가 정확도와 효율성 면에서 최신 기술의 단일 단계 검출기보다 뛰어날 수 있는가?
  • RQ2트랜스포머 내 일원 및 쌍방향 어텐션 메커니즘이 HOI 검출 성능에 어떻게 다른 영향을 미치는가?
  • RQ3일원 스트림 내 어텐션이 양성 인간-물체 상호작용 쌍의 점수를 얼마나 향상시키는가?
  • RQ4쌍방향 스트림 내 어텐션은 어떻게 소프트 비최대 억제 메커니즘으로 작용하여 음성 쌍을 억제하는가?
  • RQ5객체 검출기와 상호작용 헤드를 분리함으로써 더 빠르고 메모리 효율적인 훈련이 가능해지며, 정확도를 유지할 수 있는가?

주요 결과

  • 제안된 이단계 모델은 ResNet-50를 사용할 경우 HICO-DET에서 31.66 mAP, ResNet-101을 사용할 경우 32.31 mAP를 기록하여 최신 기술의 단일 단계 검출기보다 뚜렷이 뛰어난 성능을 달성한다.
  • 모델은 단일 GPU에서 실시간 추론 속도를 달성하여, 높은 정확도를 유지하면서도 강력한 효율성을 입증한다.
  • 절단 실험(ablation studies) 결과, 양성 일원 쌍 간의 어텐션을 비활성화하면 상호작용 점수가 8% 감소함을 확인하여, 이가 참 양성(true positives)을 강화하는 데 기여함을 입증한다.
  • 음성 쌍에서 우세한 양성 쌍으로의 어텐션을 0으로 설정하면 점수는 11% 감소함을 확인하여, 경쟁 레이어의 억제 행동이 타당함을 검증한다.
  • 마찬가지로 트랜스포머 백본을 사용하더라도, 이단계 검출기의 훈련 속도는 단일 단계 검출기보다 뚜렷이 빠르고, 더 낮은 메모리 사용량을 보인다.
  • 부정확도나 저자료 시나리오에서 성능 저하가 발생함을 확인하여, 희귀하거나 애매한 동작에 대한 일반화 능력의 한계를 드러낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.