Skip to main content
QUICK REVIEW

[논문 리뷰] Unseen Action Recognition with Multimodal Learning

AJ Piergiovanni, Michael S. Ryoo|arXiv (Cornell University)|2018. 06. 21.
Multimodal Machine Learning Applications참고 문헌 2인용 수 3
한 줄 요약

이 논문은 쌍체 데이터와 비쌍체 데이터를 모두 활용하여, 적대적 훈련 전략을 통해 텍스트와 비디오 데이터를 공유 표현 공간에 동시 통합하는 다중모달 학습 프레임워크를 제안한다. 이 방법은 기존에 보지 못한 동작에 대해 더 강건하고 일반화 능력이 뛰어난 표현을 학습함으로써, 제로샷 행동 분류, 비지도 활동 탐지, 그리고 알려지지 않은 활동에 대한 설명 생성에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

We present a method to learn a joint multimodal representation space that enables recognition of unseen activities in videos. We first compare the effect of placing various constraints on the embedding space using paired text and video data. We also propose a method to improve the joint embedding space using an adversarial formulation, allowing it to benefit from unpaired text and video data. By using unpaired text data, we show the ability to learn a representation that better captures unseen activities. In addition to testing on publicly available datasets, we introduce a new, large-scale text/video dataset. We experimentally confirm that using paired and unpaired data to learn a shared embedding space benefits three difficult tasks (i) zero-shot activity classification, (ii) unsupervised activity discovery, and (iii) unseen activity captioning, outperforming the state-of-the-arts.

연구 동기 및 목표

  • 텍스트와 비디오에서 쌍체 데이터를 기반으로 공동 다중모달 표현을 학습하여 영상 내에서 새로운 동작을 인식하는 데 도전하는 것.
  • 비쌍체 텍스트와 비디오 데이터를 학습 과정에 통합하여 새로운 활동에 대한 일반화 능력을 향상시키는 것.
  • 쌍체 및 비쌍체 데이터의 이점을 모두 활용하여 제로샷 및 비지도 학습 과제를 위한 표현 학습을 향상시키는 방법을 개발하는 것.
  • 실제 조건에서 알려지지 않은 행동 인식을 평가하기 위한 새로운 대규모 텍스트/비디오 데이터셋을 제안하는 것.
  • 제로샷 활동 분류, 비지도 활동 탐지, 그리고 알려지지 않은 활동 설명 생성에서 기존 방법들을 능가하는 것.

제안 방법

  • 모델은 쌍체 데이터를 사용하여 텍스트와 비디오의 공동 임베딩 공간을 학습하며, 임베딩 공간에 제약 조건을 적용하여 정렬을 향상시킨다.
  • 비쌍체 텍스트와 비디오 임베딩의 주변 분포를 정렬하기 위해 적대적 설정을 도입하여 비쌍체 데이터로부터 지식 전이를 가능하게 한다.
  • 적대적 훈련 구성 요소는 새로운 동작에 대해 더 잘 일반화되는 공유 표현을 학습하도록 모델을 유도한다.
  • 모델은 쌍체 데이터에 대한 대비 학습 목표와 비쌍체 데이터에 대한 도메인 적대적 정렬을 사용하여 엔드 투 엔드로 훈련된다.
  • 프레임워크는 공개 벤치마크와 새로 도입된 대규모 텍스트/비디오 데이터셋 모두에서 평가된다.
  • 공동 표현 학습을 위해 공통 인코더 아키텍처와 모odal별 헤드를 사용한다.

실험 결과

연구 질문

  • RQ1비쌍체 텍스트와 비디오 데이터를 효과적으로 정렬하기 위해 적대적 설정을 적용할 경우, 새로운 동작에 대한 표현 학습이 향상되는가?
  • RQ2쌍체 및 비쌍체 데이터를 결합할 경우 제로샷 행동 분류 성능에 어떤 영향을 미치는가?
  • RQ3공동 임베딩 공간은 비지도 활동 탐지 및 알려지지 않은 활동 설명 생성에 얼마나 향상시키는가?
  • RQ4기존 최신 기술 수준의 접근법에 비해 제안된 방법이 새로운 동작에 대해 더 잘 일반화되는가?
  • RQ5비쌍체 데이터는 새로운 활동을 포괄하는 표현 학습에 어떤 기여를 하는가?

주요 결과

  • 이 방법은 쌍체 및 비쌍체 데이터를 모두 활용함으로써 제로샷 행동 분류에서 최신 기술 수준의 성능을 달성한다.
  • 비쌍체 텍스트 데이터의 사용은 공동 임베딩 공간 내에서 새로운 동작에 대한 일반화 능력을 크게 향상시킨다.
  • 적대적 훈련 구성 요소는 텍스트 및 비디오 특징의 주변 분포를 효과적으로 정렬하여 표현 품질을 향상시킨다.
  • 비지도 활동 탐지 과제에서 기존 방법들을 능가하며, 새로운 동작의 클러스터링 성능이 향상됨을 보여준다.
  • 제안된 방법은 알려지지 않은 활동 설명 생성에서 뛰어난 성능을 달성하여 보다 정확하고 관련성이 높은 기술을 생성한다.
  • 새로운 대규모 텍스트/비디오 데이터셋은 실제적이고 다양한 조건에서 알려지지 않은 행동 인식 평가를 더 견고하게 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.