[논문 리뷰] Relaxed Transformer Decoders for Direct Action Proposal Generation
이 논문은 앵커 기반 및 히우리스틱 매칭 방법을 대체하기 위해 경계에 주목하는 인코더, 유연한 매칭 방식, 세 분지 탐지 헤드를 갖춘 직접적인 시간 행동 제안 생성을 위한 완화된 Transformer 디코더 프레임워크인 RTD-Net을 제안한다. 이 방법은 THUMOS14 및 ActivityNet-1.3에서 최신 기술 성능을 달성하며, 추론 속도가 빠르고 비최대 억제(NMS)가 필요하지 않다.
Temporal action proposal generation is an important and challenging task in video understanding, which aims at detecting all temporal segments containing action instances of interest. The existing proposal generation approaches are generally based on pre-defined anchor windows or heuristic bottom-up boundary matching strategies. This paper presents a simple and efficient framework (RTD-Net) for direct action proposal generation, by re-purposing a Transformer-alike architecture. To tackle the essential visual difference between time and space, we make three important improvements over the original transformer detection framework (DETR). First, to deal with slowness prior in videos, we replace the original Transformer encoder with a boundary attentive module to better capture long-range temporal information. Second, due to the ambiguous temporal boundary and relatively sparse annotations, we present a relaxed matching scheme to relieve the strict criteria of single assignment to each groundtruth. Finally, we devise a three-branch head to further improve the proposal confidence estimation by explicitly predicting its completeness. Extensive experiments on THUMOS14 and ActivityNet-1.3 benchmarks demonstrate the effectiveness of RTD-Net, on both tasks of temporal action proposal generation and temporal action detection. Moreover, due to its simplicity in design, our framework is more efficient than previous proposal generation methods, without non-maximum suppression post-processing. The code and models are made available at https://github.com/MCG-NJU/RTD-Action.
연구 동기 및 목표
- 수동으로 설계된 앵커 기반 및 경계 매칭 방법의 한계를 해결하기 위해, 소음에 민감한 설계에 의존하는 방법의 문제점을 해결한다.
- 영상 행동 제안 생성에 맞게 Transformer 아키텍처를 적응시켜, 특징의 느린 변화와 모호한 시간 경계와 같은 과제를 극복한다.
- 세 분지 헤드를 통해 일관된 제안 점수를 학습시켜 비최대 억제(NMS)가 필요 없도록 한다.
- tIoU 추정 헤드를 통해 완전성의 명시적 모델링을 통해 제안 품질을 향상시킨다.
- 엔드 투 엔드 훈련과 추론이 가능한 세트 예측 파ragram을 사용하여 제안 생성 파이프라인을 단순화한다.
제안 방법
- 표준 Transformer 인코더를 대체로 장기적인 시간적 의존성을 더 잘 포착하고 느린 특징 변화로 인한 과도한 평탄화를 줄이기 위해 경계에 주목하는 모듈을 도입한다.
- 단일 정답에 여러 예측을 할당할 수 있도록 허용하는 유연한 매칭 방식을 도입하여, 모호하거나 노이즈가 있는 애너테이션의 영향을 줄인다.
- 경계 상자 좌표, 분류 점수, 완전성 점수(tIoU)를 동시에 예측하는 세 분지 탐지 헤드를 설계하여 제안의 신뢰도 추정을 향상시킨다.
- 완전성 헤드에 tIoU 손실을 사용하여 훈련을 정규화하고 더 정확하고 완전한 제안을 향해 모델을 이끌도록 한다.
- 유연한 매칭을 사용한 세트 기준으로 엔드 투 엔드로 모델을 훈련시켜 앵커 생성이나 후처리 없이 직접적으로 행동 제안을 예측하도록 한다.
- 디코더의 자기주의 주목을 활용하여 제안 간 상호 관계를 전역적으로 모델링하고, 맥락적 추론을 통해 국소화 정확도를 향상시킨다.

실험 결과
연구 질문
- RQ1앵커 및 히우리스틱 매칭 메커니즘을 회피하면서, 영상에서 직접적인 시간 행동 제안 생성을 위한 Transformer 기반 아키텍처가 효과적으로 적용될 수 있는가?
- RQ2영상 특징의 본질적 느린 변화와 모호한 시간 경계 문제를 Transformer 기반 프레임워크에서 어떻게 해결할 수 있는가?
- RQ3엄격한 일대일 할당 방식에 비해, 유연한 매칭 전략이 제안 생성에서 훈련 안정성과 일반화 능력을 향상시키는가?
- RQ4tIoU 손실을 통한 명시적 완전성 추정이 제안 품질 향상에 기여하고 NMS의 필요성을 제거할 수 있는가?
- RQ5기본 벤치마크에서 앵커 기반 및 바텀업 경계 기반 방법과 비교해, 제안된 프레임워크는 효율성과 정확도 면에서 어떤가?
주요 결과
- RTD-Net은 ActivityNet-1.3에서 AR@100이 61.11%이며, HACS Segments에서 AR@1이 16.34%를 기록했고, 단지 100개의 쿼리만으로도 BSN보다 AR@1에서 뛰어난 성능을 내며 더 적은 제안 수로도 성능을 냈다.
- HACS Segments에서 AUC가 53.41%를 기록하여 BSN의 AUC와 동일했고, NMS 없이도 성능을 내어 낮은 제안 수에서 더 높은 효율성을 보였다.
- 초기 융합 RGB 및 옵티컬 플로우 특징을 사용하면 THUMOS14에서 AR@50이 41.52%로 향상되었으며, RGB 전용(37.28%) 및 플로우 전용(38.75%) 특징보다 뛰어났다.
- 완전성 헤드가 제안 품질을 크게 향상시켰고, 점수는 항상 품질 기반으로 제안을 순위 매기며 NMS 없이도 추론이 가능하게 했다.
- 유연한 매처는 노이즈가 많거나 모호한 애너테이션이 있는 데이터셋에서 특히 수렴성과 일반화 능력을 향상시켰다.
- 경계에 주목하는 인코더는 느린 특징 변화로 인한 과도한 평탄화를 효과적으로 완화하여 경계 국소화 정확도를 향상시켰다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.