[논문 리뷰] Few-Shot Temporal Action Localization with Query Adaptive Transformer
이 논문은 배경 컨텍스트를 유지하는 트림되지 않은 지원 영상(untirmped support videos)을 사용하여 맥락 이해력과 모델 일반화 능력을 향상시키기 위해 새로운 소수의 시퀀스 행동 탐지(Few-shot Temporal Action Localization, FS-TAL) 설정을 제안한다. 이는 질의 영상(query video)마다 기초 분류기를 동적으로 적응시키는 쿼리 적응형 트랜스포머(Query Adaptive Transformer, QAT)를 도입하여, ActivityNet 및 THUMOS에서 단일 및 크로스 도메인 설정 모두에서 기존 방법 대비 1/5샷 설정에서 4.8–6.2 mAP@0.5의 성능 향상을 달성한다.
Existing temporal action localization (TAL) works rely on a large number of training videos with exhaustive segment-level annotation, preventing them from scaling to new classes. As a solution to this problem, few-shot TAL (FS-TAL) aims to adapt a model to a new class represented by as few as a single video. Exiting FS-TAL methods assume trimmed training videos for new classes. However, this setting is not only unnatural actions are typically captured in untrimmed videos, but also ignores background video segments containing vital contextual cues for foreground action segmentation. In this work, we first propose a new FS-TAL setting by proposing to use untrimmed training videos. Further, a novel FS-TAL model is proposed which maximizes the knowledge transfer from training classes whilst enabling the model to be dynamically adapted to both the new class and each video of that class simultaneously. This is achieved by introducing a query adaptive Transformer in the model. Extensive experiments on two action localization benchmarks demonstrate that our method can outperform all the state of the art alternatives significantly in both single-domain and cross-domain scenarios. The source code can be found in https://github.com/sauradip/fewshotQAT
연구 동기 및 목표
- 기존 소수의 TAL 방법이 트림된 영상에 의존함으로써 유용한 배경 컨텍스트를 손실하는 한계를 해결하기 위해.
- 새로운 클래스가 시간적 태그가 부여된 트림되지 않은 영상으로 표현되는 더 실용적인 FS-TAL 설정을 제안하기 위해.
- 새로운 클래스뿐 아니라 각 개별 질의 영상에 맞게 배경/전경 분류기를 동적으로 적응시키기 위해.
- 트림되지 않은 영상의 컨텍스트 신호를 활용하여 보이는 클래스에서 보이지 않는 클래스로의 지식 전이를 향상시키기 위해.
- 저샷 조건에서 내부 클래스 불변성 모델링을 향상시키는 쿼리 적응형 트랜스포머 메커니즘을 개발하기 위해.
제안 방법
- 지원 세트가 전체 시간적 태그가 부여된 트림되지 않은 영상로 구성되며, 배경 컨텍스트를 유지하는 새로운 FS-TAL 설정을 제안한다.
- 질의 영상 특징과 분류기 가중치를 입력으로 받아 영상 별 분류기 적응을 생성하는 쿼리 적응형 트랜스포머(Query Adaptive Transformer, QAT)를 설계한다.
- 지원 세트에서 훈련된 스플릿 수준 이진 분류기를 사용하여 전경 및 배경 스플릿을 구분한다.
- 메타 학습을 활용하여 QAT 모듈을 훈련함으로써 새로운 클래스 간에 일반화하고 추론 시 신속하게 적응할 수 있도록 한다.
- GTAD 또는 BMN과 같은 영상 임베딩 네트워크와 QAT 모듈을 통합하여 트림되지 않은 영상에서 컨텍스트 특징을 추출한다.
- 트림된 영상 및 트림되지 않은 영상 설정을 모두 지원하여 기존 벤치마크와의 후행 호환성을 확보한다.
실험 결과
연구 질문
- RQ1트림되지 않은 지원 영상에서 훈련된 소수의 TAL 모델이 트림된 영상에서 훈련된 경우보다 더 높은 성능을 달성할 수 있는가?
- RQ2트림되지 않은 영상에서 배경 컨텍스트를 통합할 경우, 저샷 설정에서 내부 클래스 변동성을 다루는 데 모델의 능력이 향상되는가?
- RQ3쿼리 적응형 트랜스포머 메커니즘이 각 질의 영상에 맞게 기초 분류기를 동적으로 적응시켜 정확도를 향상시킬 수 있는가?
- RQ4ActivityNet에서 THUMOS로, 또는 그 반대로 도메인 간 전이 시 제안된 방법이 어떻게 일반화되는가?
- RQ5기존 최신 기술 수준의 접근법 대비 제안된 방법의 계산 효율성은 어떠한가?
주요 결과
- 제안된 방법은 ActivityNet에서 1샷 설정에서 [Yang et al., 2020] 대비 4.8% 향상된 mAP@0.5 성능을 달성했으며, 5샷 설정에선 6.2% 향상되었다.
- ActivityNet에서 THUMOS로의 크로스 도메인 전이 설정에서, 1샷일 경우 45.9% mAP@0.5, 5샷일 경우 54.4% mAP@0.5를 기록하여 기존 최신 기술 수준 대비 각각 4.8점과 6.2점 향상되었다.
- 단일 RTX2080Ti GPU에서 1개 작업당 약 0.83초의 추론 속도를 유지하여 [Yang et al., 2020]과 유사한 속도를 확보하였으며, 효율성에 손해가 없음을 시사한다.
- GTAD 기반 모델의 깊은 층(예: 레이어-5)가 浅층보다 더 우수한 성능을 보였으며, 비용 효율성이 높아 최적의 임베딩 레이어로 선정되었다.
- 제거 분석(ablation study) 결과, 쿼리 적응형 트랜스포머가 내부 클래스 변동성을 다양한 영상 컨텍스트에서 다룰 때 특히 성능 향상에 기여함을 확인하였다.
- 모델은 도메인 간 전이에서 우수한 일반화 성능을 보였으며, ActivityNet→THUMOS 및 THUMOS→ActivityNet 양방향 전이 모두에서 일관된 성능 향상을 기록하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.