Skip to main content
QUICK REVIEW

[논문 리뷰] PromptonomyViT: Multi-Task Prompt Learning Improves Video Transformers using Synthetic Scene Data

Roei Herzig, Ofir Abramovich|arXiv (Cornell University)|2022. 12. 08.
Human Pose and Action Recognition인용 수 4
한 줄 요약

PromptonomyViT는 실세계 비디오 이해 성능을 햖스키기 위해 합성 시나리오 데이터를 활용하는 비디오 트랜스포머를 위한 다중 작업 프롬프트 학습 프레임워크를 제안한다. 깊이, 세분화, 법선 추정과 같은 시나리오 수준의 보조 작업을 위한 작업별 프롬프트를 도입함으로써, 합성 작업 간의 공유된 시공간적 구조를 포착하고 도메인 적응 없이 다운스트림 행동 인식 성능을 향상시킨다. 이는 여러 벤치마크에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Action recognition models have achieved impressive results by incorporating scene-level annotations, such as objects, their relations, 3D structure, and more. However, obtaining annotations of scene structure for videos requires a significant amount of effort to gather and annotate, making these methods expensive to train. In contrast, synthetic datasets generated by graphics engines provide powerful alternatives for generating scene-level annotations across multiple tasks. In this work, we propose an approach to leverage synthetic scene data for improving video understanding. We present a multi-task prompt learning approach for video transformers, where a shared video transformer backbone is enhanced by a small set of specialized parameters for each task. Specifically, we add a set of "task prompts", each corresponding to a different task, and let each prompt predict task-related annotations. This design allows the model to capture information shared among synthetic scene tasks as well as information shared between synthetic scene tasks and a real video downstream task throughout the entire network. We refer to this approach as "Promptonomy", since the prompts model task-related structure. We propose the PromptonomyViT model (PViT), a video transformer that incorporates various types of scene-level information from synthetic data using the "Promptonomy" approach. PViT shows strong performance improvements on multiple video understanding tasks and datasets. Project page: \url{https://ofir1080.github.io/PromptonomyViT}

연구 동기 및 목표

  • 깊이, 세분화, 3D 구조와 같은 복잡한 시나리오 수준 레이블을 실비디오 데이터셋에 수동으로 레이블링하는 데 드는 높은 비용을 해결하기 위해.
  • 풍부한 시나리오 레이블을 가진 합성 데이터가 실세계 작업에서 비디오 이해 모델의 성능을 효과적으로 향상시킬 수 있는지 탐색하기 위해.
  • 다양한 합성 시나리오 작업과 실세계 다운스트림 행동 인식 작업을 동시에 학습할 수 있도록 통합된 프레임워크를 개발하기 위해.
  • 모든 네트워크를 관통해 정보를 전파하는 작업별 프롬프트를 통합함으로써 도메인 간 격차 문제를 최소화하기 위해.
  • 프롬프트 기반 다중 작업 학습이 자원이 제한된 환경에서 기존의 피지컬 튜닝 및 도메인 적응 기법보다 우수한 성능을 낼 수 있음을 입증하기 위해.

제안 방법

  • 각 보조 시나리오 수준 작업을 위한 작업별 가속 가능한 프롬프트를 입력층에 삽입한 공유된 비전 트랜스포머(ViT) 백본을 사용하여 비디오 클립을 처리한다.
  • 각 작업 프롬프트는 비디오 토큰에 주목하면서 깊이 맵, 세분화 또는 법선 벡터와 같은 작업별 출력을 예측하는 작은 학습 가능한 파라미터 집합이다.
  • 다양한 소스(예: PHAV, HyperSim, KIST SynADL, EHOI)에서 제공하는 합성 데이터를 사용하여 엔드 투 엔드로 프롬프트를 훈련한다. 각 소스는 서로 다른 종류의 시나리오 수준 감독을 제공한다.
  • 행동 인식 헤드는 CLS 토큰을 사용하여 실세계 데이터에서 훈련되며, 작업 프롬프트는 각각의 합성 레이블에 의해 감독되어 지식 전이가 가능해진다.
  • 아키텍처는 초기 레이어를 통해 다중 작업 간의 정보 흐름을 가능하게 하여, 합성 작업 간에 공유된 표현이 형성되고 실세계 다운스트림 작업에 기여하도록 한다.
  • 작업 간 상호작용을 관리하고 통합된 트랜스포머 프레임워크에서 다중 작업 학습을 가능하게 하기 위해 'Promptonomy'이라는 이름을 붙였다.

실험 결과

연구 질문

  • RQ1다양한 종류의 레이블이 포함된 합성 시나리오 데이터가 실세계 행동 인식 작업에서 비디오 이해 모델의 성능을 향상시킬 수 있는가?
  • RQ2합성 데이터와 실세계 데이터 간의 도메인 격차를 줄이기 위해 다중 작업 프롬프트 학습이 표준 피지컬 튜닝 또는 도메인 적응 기법보다 얼마나 효과적인가?
  • RQ3작업별 프롬프트가 다양한 합성 시나리오 수준 작업 간에 공유된 표현을 얼마나 잘 포착하고 실세계 다운스트림 작업으로 전이할 수 있는가?
  • RQ4깊이, 세분화, 법선과 같은 다수의 보조 작업을 포함함으로써 단일 작업 사전 훈련보다 더 나은 일반화 성능를 달성할 수 있는가?
  • RQ5작업별 헤드나 도메인 적응 모듈 없이도 통합된 프롬프트 기반 아키텍처가 다양한 시나리오 수준 작업을 효과적으로 관리할 수 있는가?

주요 결과

  • PromptonomyViT는 Something-Something V2, Diving48, Ego4D, AVA 벤치마크에서 표준 피지컬 튜닝 및 도메인 적응 기반 모델을 능가하는 최신 기술 수준의 성능을 달성한다.
  • 도메인 적응 없이도 합성 데이터를 사용한 다중 작업 프롬프트 사전 훈련을 통해 행동 인식 성능에 뚜렷한 정확도 향상이 이루어진다.
  • 질적 결과는 학습 중에 실세계 레이블을 전혀 보지 못한 상태에서도 작업 프롬프트가 실비디오 프레임에 대해 의미 있고 일관된 예측(예: 깊이, 세분화, 손-객체 박스)을 생성함을 보여준다.
  • 제거 실험을 통해 전용 프롬프트를 가진 다수의 합성 작업을 사용할 경우 한두 개의 작업만 사용하는 것보다 성능이 뛰어나다는 것이 확인되었다.
  • 다중 작업 프롬프트에서 유도된 공유된 인덕티브 바이어스 덕분에 다양한 비디오 도메인(예: 이고세트릭, 다중 시점, 인간-물체 상호작용 비디오)으로 잘 일반화됨을 보였다.
  • 작업 프롬프트의 사용은 합성 데이터에서 실세계 데이터로의 효과적인 지식 전이를 가능하게 하며, 자원이 제한된 환경에서도 성능 향상이 관찰되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.