[논문 리뷰] End-to-End Video Object Detection with Spatial-Temporal Transformers
이 논문은 수작업으로 설계된 구성 요소들인 광학 흐름과 순환 신경망을 제거한 공간-시간 트랜스포머 아키텍처를 기반으로 한 엔드 투 엔드 비디오 객체 검출 프레임워크인 TransVOD를 제안한다. 시간 가변형 변형 트랜스포머 디코더와 새로운 코arse-to-fine 쿼리 집약 전략을 도입함으로써 TransVOD는 ImageNet VID에서 변형 DETR보다 3%-4% mAP 향상을 달성하며, 수작업 구성 요소 없이 깔끔한 엔드 투 엔드 파이프라인으로 최신 기술 수준의 성능을 보여준다.
Recently, DETR and Deformable DETR have been proposed to eliminate the need for many hand-designed components in object detection while demonstrating good performance as previous complex hand-crafted detectors. However, their performance on Video Object Detection (VOD) has not been well explored. In this paper, we present TransVOD, an end-to-end video object detection model based on a spatial-temporal Transformer architecture. The goal of this paper is to streamline the pipeline of VOD, effectively removing the need for many hand-crafted components for feature aggregation, e.g., optical flow, recurrent neural networks, relation networks. Besides, benefited from the object query design in DETR, our method does not need complicated post-processing methods such as Seq-NMS or Tubelet rescoring, which keeps the pipeline simple and clean. In particular, we present temporal Transformer to aggregate both the spatial object queries and the feature memories of each frame. Our temporal Transformer consists of three components: Temporal Deformable Transformer Encoder (TDTE) to encode the multiple frame spatial details, Temporal Query Encoder (TQE) to fuse object queries, and Temporal Deformable Transformer Decoder to obtain current frame detection results. These designs boost the strong baseline deformable DETR by a significant margin (3%-4% mAP) on the ImageNet VID dataset. TransVOD yields comparable results performance on the benchmark of ImageNet VID. We hope our TransVOD can provide a new perspective for video object detection. Code will be made publicly available at https://github.com/SJTU-LuHe/TransVOD.
연구 동기 및 목표
- 광학 흐름, RNN, 관계 네트워크와 같은 복잡한 수작업 설계 구성 요소들을 제거함으로써 비디오 객체 검출을 단순화한다.
- 디테일 기반 검출 파라다임을 비디오로 확장하기 위해 트랜스포머를 활용해 장거리 시간적 의존성을 모델링한다.
- 통합된 주목적 기반 아키텍처를 통해 Seq-NMS나 튜브릿 재평가와 같은 후처리 병목 현상을 제거한다.
- 시간 주목적 기반으로 프레임 간 공간 객체 쿼리와 특징 메모리의 융합 효과를 탐색한다.
- 자기 주목적 메커니즘을 사용해 새로운 깔끔하고 효과적인 비디오 객체 검출 기준점을 수립한다.
제안 방법
- 변형 주목적을 사용해 다중 프레임 공간 특징을 인코딩하는 시간 가변형 변형 트랜스포머 인코더(TDTE)를 도입한다.
- 기준 프레임 간 공간 객체 쿼리의 코어스-투-파인 집약을 수행하는 시간 쿼리 인코더(TQE)를 제안한다. 이를 통해 시간적 객체 쿼리를 생성한다.
- 시간적 객체 쿼리와 특징 메모리를 사용해 현재 프레임의 검출 결과를 생성하는 시간 가변형 변형 트랜스포머 디코더(TDTD)를 활용한다.
- 최종 디코더 출력에서 바운딩 박스와 클래스 점수를 예측하기 위해 공유된 피드포워드 네트워크(FFN)를 사용한다.
- DETR에서 유도된 객체 쿼리 초기화를 활용해 NMS나 후처리 없이 엔드 투 엔드 학습을 가능하게 한다.
- 공간 및 시간 인코더에서 모두 변형 주목적을 적용해 프레임과 공간 위치 간 관련 특징을 효율적으로 주목한다.

실험 결과
연구 질문
- RQ1수작업 구성 요소 없이 트랜스포머 기반 아키텍처가 비디오 객체 검출에서 장거리 시간적 의존성을 효과적으로 모델링할 수 있는가?
- RQ2TQE에서 제안된 코어스-투-파인 쿼리 집약 전략은 프레임 간 특징 융합에 어떻게 기여하는가?
- RQ3비디오 검출에서 시간적 모델링을 위한 최적의 기준 프레임 수와 인코더/디코더 레이어 수는 얼마인가?
- RQ4엔드 투 엔드 트랜스포머 기반 검출기가 광범위하게 사용되는 이중 단계 기반 모델인 변형 DETR보다 비디오 벤치마크에서 성능을 뛰어넘을 수 있는가?
- RQ5순수 주목적 기반 설계에서 Seq-NMS와 튜브릿 재평가와 같은 후처리 단계를 제거하면 성능이 떨어지는가?
주요 결과
- TransVOD는 ImageNet VID 검증 세트에서 강력한 기준 모델인 변형 DETR보다 3%-4% mAP 향상을 달성한다.
- TDTE 인코더 레이어의 최적 수는 1개로, 더 깊은 시간적 인코딩이 성능 향상에 기여하지 않는다는 것을 시사한다.
- TDTD에서 디코더 레이어가 1개로 충분함을 확인하여 깊은 디코딩이 효과적인 검출을 위해 필수적이지 않음을 나타낸다.
- TQE의 코어스-투-파인 쿼리 집약 전략은 코어스-투-코어스 및 파인-투-파인 선택 전략보다 우수하며, 깊은 레이어에서 100개의 top-k 쿼리로 79.8% mAP를 달성한다.
- 8개 이상의 기준 프레임에서 성능이 안정화되며, 14개 기준 프레임에서 mAP가 79.3%로 최고치를 기록한다.
- 광학 흐름, RNN, 복잡한 후처리인 튜브릿 스코링을 사용하지 않아도 ImageNet VID에서 최신 기술 수준의 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.