[논문 리뷰] SeqFormer: Sequential Transformer for Video Instance Segmentation
SeqFormer는 프레임별 개별 인스턴스 쿼리를 사용해 시간에 따라 움직이는 객체에 주의를 기울이는 순차적 Transformer 아키텍처를 제안한다. 이는 추적 브랜치나 후처리가 필요 없는 엔드 투 엔드 마스크 및 박스 예측을 가능하게 하며, ResNet-101을 사용할 경우 YouTube-VIS에서 49.0 AP를 달성하고, Swin Transformer를 사용할 경우 59.3 AP를 기록하여 이전 방법들보다 뚜렷이 뛰어난 성능을 보였다.
In this work, we present SeqFormer for video instance segmentation. SeqFormer follows the principle of vision transformer that models instance relationships among video frames. Nevertheless, we observe that a stand-alone instance query suffices for capturing a time sequence of instances in a video, but attention mechanisms shall be done with each frame independently. To achieve this, SeqFormer locates an instance in each frame and aggregates temporal information to learn a powerful representation of a video-level instance, which is used to predict the mask sequences on each frame dynamically. Instance tracking is achieved naturally without tracking branches or post-processing. On YouTube-VIS, SeqFormer achieves 47.4 AP with a ResNet-50 backbone and 49.0 AP with a ResNet-101 backbone without bells and whistles. Such achievement significantly exceeds the previous state-of-the-art performance by 4.6 and 4.4, respectively. In addition, integrated with the recently-proposed Swin transformer, SeqFormer achieves a much higher AP of 59.3. We hope SeqFormer could be a strong baseline that fosters future research in video instance segmentation, and in the meantime, advances this field with a more robust, accurate, neat model. The code is available at https://github.com/wjf5203/SeqFormer.
연구 동기 및 목표
- 추적 브랜치나 후처리가 별도로 필요 없는 깔끔하고 엔드 투 엔드의 비디오 인스턴스 세그멘테이션 프레임워크를 개발하기 위해.
- 공유된 인스턴스 쿼리를 프레임 수준의 쿼리로 분해하여 각 프레임에서 독립적인 주의 메커니즘을 가능하게 하여 프레임 간 시간적 관계를 모델링하기 위해.
- 프레임 간 특징의 가중 평균을 통해 강력한 비디오 수준의 인스턴스 표현을 학습하여 추적 및 세그멘테이션 정확도를 향상시키기 위해.
- 미래의 비디오 인스턴스 세그멘테이션 연구를 위한 강력하고 효율적이며 일반화 능력이 뛰어난 기준 기반 설정을 수립하기 위해.
제안 방법
- 단일 인스턴스 쿼리를 프레임 수준의 박스 쿼리로 분해하여 각 프레임에서 독립적인 주의 메커니즘을 가능하게 하여 시간에 따라 움직이는 객체와의 정렬을 도모한다.
- Deformable DETR와 유사하게 거친 것에서부터 정교한 방식으로 반복적 개선을 통해 박스 시퀀스를 예측하고 개선하는 디코더를 사용한다.
- 박스 임베딩에서 유도된 학습 가능한 가중치를 사용해 프레임 간 정렬된 인스턴스 영역의 특징을 집계하여 통합된 비디오 수준의 인스턴스 표현을 형성한다.
- 정밀해진 인스턴스 표현을 사용해 마스크 헤드의 동적 컨볼루션 가중치를 생성하여 각 프레임에서 정확한 마스크 예측을 가능하게 한다.
- 완전한 공간-시간 특징 차원을 유지하고 평탄화를 방지하여 성능 향상에 필수적임을 입증한다.
- 다른 프레임의 특징을 가중합으로 집계하며, 박스 임베딩에서 엔드 투 엔드로 학습된 주의 가중치를 사용해 정보 손실을 방지한다.
실험 결과
연구 질문
- RQ1각 프레임에서 독립적으로 주의를 기울일 때, 단일 공유 인스턴스 쿼리가 장시간 비디오 시퀀스 동안 인스턴스 관계를 효과적으로 모델링할 수 있는가?
- RQ2특징의 완전한 공간-시간 차원을 유지하는 것이 평탄화되거나 다중 해상도 접근 방식과 비교해 비디오 인스턴스 세그멘테이션 성능에 어떤 영향을 미치는가?
- RQ3프레임 간 엔드 투 엔드로 학습된 주의 가중치는 단순한 합산 또는 평균 집계 방식보다 인스턴스 표현 및 마스크 예측 성능을 향상시킬 수 있는가?
- RQ4제한된 수의 프레임으로 훈련된 마스크 헤드가 비디오의 미리보지 않은 프레임으로 일반화할 수 있는 정도는 어느 정도인가?
- RQ5제안된 쿼리 분해 기법이 명시적인 추적 브랜치나 후처리 없이 자연스럽게 인스턴스 추적을 가능하게 하는가?
주요 결과
- SeqFormer는 ResNet-50 백본을 사용할 경우 YouTube-VIS에서 47.4 AP를 기록하고, ResNet-101을 사용할 경우 49.0 AP를 달성하여 이전 최고 기록보다 각각 4.6 및 4.4 AP 높은 성능을 보였다.
- ResNeXt-101 백본을 사용할 경우 SeqFormer는 51.2 AP를 기록하여 YouTube-VIS에서 50 AP를 초과한 최초의 알고리즘이 되었다.
- Swin Transformer와 통합되었을 경우 SeqFormer는 59.3 AP를 기록하여 고급 백본에서의 강력한 확장성과 성능 향상을 입증하였다.
- 단일 프레임으로만 인스턴스 표현을 생성할 경우 38.1 AP를 기록하고, 다섯 프레임을 사용할 경우 44.6 AP를 기록하여, 비디오의 새로운 프레임으로의 일반화 능력이 뛰어나다는 것을 보였다.
- 완전한 공간-시간 특징 차원을 유지할 경우 평탄화 방식 대비 7.4 AP 향상이 있었고, 다중 해상도 특징은 추가로 2.6 AP 향상을 가져왔으며, 이는 시간적 모델링의 중요성을 입증한다.
- 프레임 간 특징의 가중합 집계는 합산(30.6 AP)과 평균(43.2 AP)을 모두 뛰어넘는 45.1 AP를 기록하여 핵심 인스턴스 신호를 유지하는 데 효과적임을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.