Skip to main content
QUICK REVIEW

[논문 리뷰] Video-based Human-Object Interaction Detection from Tubelet Tokens

Danyang Tu, Wei Sun|arXiv (Cornell University)|2022. 06. 04.
Human Pose and Action Recognition인용 수 8
한 줄 요약

이 논문은 시각 트랜스포머를 활용한 비디오 기반 인간-물체 상호작용(V-HOI) 검출을 위한 TUTOR를 제안한다. TUTOR는 공간과 시간에 걸쳐 선택적 어텐션과 집적을 통해 학습되는 튜브릿 토큰을 사용하여 압축되고 표현력 있는 시공간 표현을 생성한다. 이 방법은 VidHOI에서 상대적 mAP 향상 16.14%를 달성하고 기존 방법 대비 4배 빠른 속도를 기록하여 뛰어난 정확도와 효율성을 입증한다.

ABSTRACT

We present a novel vision Transformer, named TUTOR, which is able to learn tubelet tokens, served as highly-abstracted spatiotemporal representations, for video-based human-object interaction (V-HOI) detection. The tubelet tokens structurize videos by agglomerating and linking semantically-related patch tokens along spatial and temporal domains, which enjoy two benefits: 1) Compactness: each tubelet token is learned by a selective attention mechanism to reduce redundant spatial dependencies from others; 2) Expressiveness: each tubelet token is enabled to align with a semantic instance, i.e., an object or a human, across frames, thanks to agglomeration and linking. The effectiveness and efficiency of TUTOR are verified by extensive experiments. Results shows our method outperforms existing works by large margins, with a relative mAP gain of $16.14\%$ on VidHOI and a 2 points gain on CAD-120 as well as a $4 imes$ speedup.

연구 동기 및 목표

  • 패치 기반 토크나이제이션의 한계를 해결하기 위해, 비디오 기반 HOI 검출에서 개체 수준의 의미를 포착하지 못하고 부작용과 희소성 문제를 겪는 문제를 해결한다.
  • 종합적인 토크나이제이션과 연결을 통해 끝에서 끝까지 토크나이제이션과 상호작용 예측을 동시에 최적화하는 시공간 트랜스포머를 개발한다.
  • 비디오를 압축되고 표현력 있는 튜브릿 토큰으로 구조화하여 V-HOI 검출의 정확도와 추론 효율성을 향상시킨다.
  • 기존 방법들과 비교해 장거리 의존성과 시간적 상호작용을 더 잘 모델링할 수 있도록 한다.

제안 방법

  • TUTOR는 이중 단계 토크나이제이션 프로세스를 사용한다: 먼저 선택적 어텐션을 통해 공간에서 의미적으로 관련된 패치 토큰을 식별하고, 이후 이를 집적하여 부작용을 줄이는 개체 수준의 토큰으로 변환한다.
  • 토크나이제이션 집적은 고정 크기의 풀링을 피하기 위해 의미적으로 유사한 토큰을 선택적으로 병합하는 학습 가능한 비정규 창 적용 방식을 사용한다.
  • 시간 연쇄는 프레임 간 개체 토큰을 연결하여 시간에 따라 동적 인간-물체 개체와 정렬되는 튜브릿 토큰을 형성한다.
  • 공간과 시간 위치 인코딩을 별도로 통합한다—공간 집적에는 2차원, 시간 연쇄에는 1차원을 사용하여 시공간 동역학을 더 잘 모델링한다.
  • 학습 가능한 프로젝션 헤드를 통해 집적된 토큰의 차원을 증가시켜 기능의 풍부함과 성능 향상을 높인다.
  • 프레임워크는 종단 간 훈련을 통해 토큰 생성과 상호작용 예측을 함께 최적화할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1학습 가능한 유연한 토크나이제이션 전략이 비디오 기반 HOI 검출에서 고정된 패치 기반 토크나이제이션을 능가할 수 있는가?
  • RQ2공간적 선택적 어텐션과 집적을 통해 비디오 특징의 표현 압축성과 부작용 감소를 개선할 수 있는가?
  • RQ3프레임 간 개체 토큰의 시간 연쇄가 동적 인간-물체 상호작용과의 정렬을 향상시킬 수 있는가?
  • RQ4제안된 튜브릿 토크나이제이션 전략이 최신 기술 수준 방법 대비 상당한 mAP 향상과 추론 속도 향상을 이끌 수 있는가?

주요 결과

  • TUTOR는 기존 최신 기술 수준 방법 대비 VidHOI 데이터셋에서 상대적 mAP 향상 16.14%를 달성한다.
  • CAD-120 데이터셋에서 F1 스코어가 2점 향상되어 소규모 벤치마크에서의 강력한 일반화 능력을 입증한다.
  • 기존 트랜스포머 기반 V-HOI 방법 대비 추론 시간에서 4배 빠른 속도 향상을 기록하여 높은 효율성을 보였다.
  • 제거 분석 결과, 집적된 토큰의 차원을 증가시키면 mAP가 6% 이상 향상됨을 확인하여 기능의 풍부함의 중요성을 입증한다.
  • k-means 클러스터링을 학습 가능한 집적으로 대체하면 성능 향상이 뚜렷하게 향상되어 종단 간 최적화의 유용성을 보여준다.
  • 공간 모듈과 시간 모듈에 각각 별도의 2차원 및 1차원 위치 인코딩을 사용하면 표준 3차원 인코딩보다 더 높은 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.