Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Human-Object Interaction Detection via Phrase Learning and Label Composition

Zhimin Li, Cheng Zou|arXiv (Cornell University)|2021. 12. 14.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 언어 사전 지식을 활용하여 인간-객체 상호작용(HOI) 감지를 향상시키기 위해 다중 작업 프레임워크인 PhraseHOI를 제안한다. 이는 기존의 HOI 분류기와 새로운 관계적 어절 학습 분류기를 함께 학습함으로써 이루어지며, word2vec 임베딩과 의미적 이웃 기반 레이블 조합 방법을 통해 HOI의 긴 꼬리 분포 문제를 해결한다. PhraseHOI는 HICO-DET에서 최신 기술 수준(SoTA)을 달성하며, Full 및 NonRare 분할에서 각각 29.29%의 AP를 기록하여 이전 방법을 초월한다.

ABSTRACT

Human-Object Interaction (HOI) detection is a fundamental task in high-level human-centric scene understanding. We propose PhraseHOI, containing a HOI branch and a novel phrase branch, to leverage language prior and improve relation expression. Specifically, the phrase branch is supervised by semantic embeddings, whose ground truths are automatically converted from the original HOI annotations without extra human efforts. Meanwhile, a novel label composition method is proposed to deal with the long-tailed problem in HOI, which composites novel phrase labels by semantic neighbors. Further, to optimize the phrase branch, a loss composed of a distilling loss and a balanced triplet loss is proposed. Extensive experiments are conducted to prove the effectiveness of the proposed PhraseHOI, which achieves significant improvement over the baseline and surpasses previous state-of-the-art methods on Full and NonRare on the challenging HICO-DET benchmark.

연구 동기 및 목표

  • 기존의 HOI 애너테이션에서 유도된 새로운 관계적 어절 학습 작업을 통해 언어 사전 지식을 활용하여 인간-객체 상호작용 감지 성능을 향상시키는 것.
  • 레이블 공간 내 의미적 이웃을 활용한 레이블 조합 방법을 통해 HOI 데이터셋의 긴 꼬리 분포 문제를 해결하는 것.
  • 다중 작업 아키텍처를 통해 HOI 감지와 어절 학습을 동시에 최적화하여 특징의 구분 능력과 일반화 능력을 향상시키는 것.
  • 언어 임베딩에서의 지식 정제가 추가 애너테이션 없이도 HOI 성능 향상에 기여하는지 실험적으로 입증하는 것.

제안 방법

  • 기존 HOI 애너테이션에서 자동으로 유도된 진술을 기반으로 인간-객체 상호작용을 묘사하는 자연어 어절을 생성하는 관계적 어절 학습 작업을 도입한다.
  • 공유된 트랜스포머 기반 백본과 두 개의 병렬 브랜치(하나는 HOI 감지, 다른 하나는 어절 임베딩 예측)를 갖춘 다중 작업 네트워크인 PhraseHOI를 제안한다.
  • 학습된 어절 임베딩를 자연어 어절로 디코딩하기 위해 Look-Up-Table(LUT)을 사용한다.
  • 예측된 어절 임베딩를 사전에 학습된 word2vec 임베딩과 일치시키기 위해 정제 손실을 적용하여 전반적인 의미적 구조를 유지한다.
  • 의미적으로 유사하지만 다른 어절 간의 국소적 구분 능력을 향상시키기 위해 균형 잡힌 트리플릿 손실을 적용한다.
  • 동사나 객체를 의미적 이웃으로 교체하여 새로운 HOI 레이블을 생성하는 레이블 조합 방법을 개발하여 희귀 카테고리의 레이블 공간을 효과적으로 확장한다.

실험 결과

연구 질문

  • RQ1기존 HOI 애너테이션에서 파생된 관계적 어절 학습이 다중 작업 학습을 통해 HOI 감지 성능 향상에 기여할 수 있는가?
  • RQ2사전에 학습된 단어 임베딩에서 유도된 언어 사전 지식을 HOI 감지 파이프라인에 효과적으로 정제할 수 있는가?
  • RQ3의미적 이웃 기반 레이블 조합이 HOI 데이터셋의 긴 꼬리 분포 문제를 완화하는 데 기여하는가?
  • RQ4HOI와 어절 학습의 공동 최적화가 더 나은 일반화 능력과 제로샷 성능 향상에 기여하는가?

주요 결과

  • PhraseHOI는 HICO-DET 벤치마크의 Full 분할에서 29.29%의 평균 정밀도(AP), NonRare 분할에서 31.46%의 AP를 기록하여 새로운 최신 기술 수준을 확립하였다.
  • 제거 실험 결과, 정제 손실과 트리플릿 손실을 모두 적용한 어절 브랜치 사용 시 Full 분할에서 1.19% AP 향상, Rare 분할에서 3.39% 향상됨을 확인하여 손실 설계의 효과성을 입증하였다.
  • 언어 모델에 의해 인코딩된 임베딩보다 어울림 임베딩 방법이 더 뛰어난 구분 능력을 보이며, 29.29% AP 대비 22.64% AP로 성능이 떨어지지 않음으로써 임베딩 공간 내의 구분 능력 향상 효과를 입증하였다.
  • word2vec 임베딩를 무작위 임베딩으로 교체할 경우 성능이 21.90% AP로 떨어지며, 이는 언어 사전 지식 자체가 성능 향상의 핵심 요소임을 확인한다.
  • 레이블 조합 방법은 희귀 카테고리의 성능 향상에 효과적이며, 트리플릿 손실에서 m=0.50을 사용할 경우 Rare 분할에서 3.39%의 AP 향상이 이루어졌다.
  • 어절 브랜치는 언어 공간에서의 지식 정제를 가능하게 하여, 추론 시 어절 브랜치를 사용하지 않더라도 HOI 브랜치의 성능 향상에 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.