[논문 리뷰] SiamMask: A Framework for Fast Online Object Tracking and Segmentation
SiamMask는 오프라인 사전 훈련 기간 동안 분류, 바운딩 박스 회귀, 이진 분할을 공동으로 학습함으로써 단일 바운딩 박스 초기화로 실시간으로 시각적 객체 추적과 비디오 객체 분할을 동시에 수행하는 프레임워크를 제안한다. 온라인 적응 또는 비용이 많이 드는 후처리 없이도 55 FPS의 추론 속도를 달성하며, 추적 및 분할 벤치마크에서 최신 기술 수준의 정확도를 확보한다.
In this paper we introduce SiamMask, a framework to perform both visual object tracking and video object segmentation, in real-time, with the same simple method. We improve the offline training procedure of popular fully-convolutional Siamese approaches by augmenting their losses with a binary segmentation task. Once the offline training is completed, SiamMask only requires a single bounding box for initialization and can simultaneously carry out visual object tracking and segmentation at high frame-rates. Moreover, we show that it is possible to extend the framework to handle multiple object tracking and segmentation by simply re-using the multi-task model in a cascaded fashion. Experimental results show that our approach has high processing efficiency, at around 55 frames per second. It yields real-time state-of-the-art results on visual-object tracking benchmarks, while at the same time demonstrating competitive performance at a high speed for video object segmentation benchmarks.
연구 동기 및 목표
- 실시간 시각적 객체 추적과 고정확도 비디오 객체 분할(VOS) 간의 격차를 해소하기 위해 양자 모두를 하나의 프레임워크로 통합한다.
- 기존에 바운딩 박자만 출력하는 완전 컨volution 신경망 기반 시앙에이즈 추적기의 표현 능력을 향상시키기 위해 픽셀 수준의 분할을 통합한다.
- 단일이고 간단한 초기화로 실시간 성능(55 FPS)을 유지를 하면서도 추적 및 분할 벤치마크에서 높은 정확도를 확보한다.
- 각 시퀀스별 적응 또는 미세조정이 필요 없이 계단식 모델 설계를 통해 다중 객체 추적 및 분할로 프레임워크를 확장한다.
- 훈련 중에 분할 지도를 통한 엔드 투 엔드 다중 작업 학습이 온라인 업데이트 없이도 강력한 온라인 추론 성능을 가능하게 한다는 것을 입증한다.
제안 방법
- 분류(객체 위치 식별용), 바운딩 박스 회귀(RPN을 통한), 클래스 무관 이진 분할(픽셀 수준 마스크 예측용)의 세 개의 병렬 브랜치를 갖는 시앙에이즈 네트워크 아키텍처를 제안한다.
- YouTube-VOS와 같은 대규모 데이터셋에서의 오프라인 사전 훈련 기간 동안 분류, 회귀, 분할 손실을 통합한 복합 손실 함수를 사용해 모델을 엔드 투 엔드로 훈련한다.
- 템플릿(첫 번째 프레임)과 검색 영역(현재 프레임)에서 공유 백본 CNN을 사용해 특징을 추출한 후, 각 브랜치에 특화된 헤드를 적용한다.
- 추론 과정에서 객체 위치는 오직 분류 브랜치가 결정하며, 분할 브랜치는 점수 최고의 영역에 대한 최종 이진 마스크를 생성한다.
- 두 번째 모델이 첫 번째 모델의 분할 출력에서 식별된 객체를 추적하도록 두 개의 SiamMask 모델을 계단식으로 연결함으로써 다중 객체 추적을 가능하게 한다.
- 온라인 적응을 피하기 위해 오직 오프라인 다중 작업 사전 훈련에 의존함으로써 단일 바운딩 박스 초기화로 실시간 추론을 가능하게 한다.
실험 결과
연구 질문
- RQ1완전 컨volution 신경망 기반 시앙에이즈 네트워크는 실시간 추론 속도를 유지하면서도 정확한 픽셀 수준의 분할 마스크를 생성할 수 있는가?
- RQ2분류, 회귀, 분할 작업을 공동으로 훈련하면 단일 작업 시앙에이즈 추적기보다 추적 및 분할 성능이 향상되는가?
- RQ3온라인 적응 없이도 단일이고 간단한 바운딩 박스 초기화로 고정확도 추적과 세밀한 분할을 동시에 지원할 수 있는가?
- RQ4제안된 다중 작업 프레임워크는 시각적 객체 추적 및 비디오 객체 분할을 위한 표준 벤치마크에서 어떻게 성능을 내는가?
- RQ5미세조정 없이도 최소한의 아키텍처 변경으로 다중 객체 추적 및 분할로 확장할 수 있는가?
주요 결과
- SiamMask는 소비자용 단일 GPU에서 55 FPS의 추론 속도를 달성하여 현재까지 보고된 바 중 가장 빠른 VOS 방법이 되었다.
- VOT-2018 벤치마크에서 SiamMask는 실시간 시각적 객체 추적 분야에서 새로운 최고 기록을 수립하였으며, 기존 실시간 추적기들보다 정확도에서 뛰어난 성능을 보였다.
- DAVIS-2016 및 DAVIS-2017 벤치마크에서 SiamMask는 속도를 고려할 때도 경쟁력 있는 비디오 객체 분할 성능을 달성하였으며, 상위 메서드 중 하나로 평가되었다.
- 어려운 시퀀스에서의 정성적 결과를 통해 복잡한 변형, 운동 왜곡, 조명 변화, 배경 혼잡성에 잘 일반화됨을 확인하였다.
- 두 단계 식 SiamMask 변형은 다중 객체 추적 및 분할을 성공적으로 처리하였으며, 계단식 추론을 통해 확장성을 입증하였다.
- SiamMask는 광범위하게 사용되는 최신 VOS 방법에서 요구하는 옵티컬 플로우, 데이터 증강, 또는 미세조정을 사용하지 않아도 강력한 성능을 발휘하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.