[논문 리뷰] SiamCorners: Siamese Corner Networks for Visual Tracking
SiamCorners는 Siamese 네트워크에 수정된 코너 풀링 레이어를 통합하여 직접적으로 대상의 왼쪽 위 및 오른쪽 아래 코너를 예측하는 앵커 기반 시각 추적 프레임워크를 제안한다. 앵커 박스를 제거하고 계층적 특징 통합 및 페널티 함수를 통합함으로써 UAV123에서 61.4% AUC의 최고 성능을 달성하면서도 높은 속도(42 FPS)를 유지한다.
The current Siamese network based on region proposal network (RPN) has attracted great attention in visual tracking due to its excellent accuracy and high efficiency. However, the design of the RPN involves the selection of the number, scale, and aspect ratios of anchor boxes, which will affect the applicability and convenience of the model. Furthermore, these anchor boxes require complicated calculations, such as calculating their intersection-over-union (IoU) with ground truth bounding boxes.Due to the problems related to anchor boxes, we propose a simple yet effective anchor-free tracker (named Siamese corner networks, SiamCorners), which is end-to-end trained offline on large-scale image pairs. Specifically, we introduce a modified corner pooling layer to convert the bounding box estimate of the target into a pair of corner predictions (the bottom-right and the top-left corners). By tracking a target as a pair of corners, we avoid the need to design the anchor boxes. This will make the entire tracking algorithm more flexible and simple than anchorbased trackers. In our network design, we further introduce a layer-wise feature aggregation strategy that enables the corner pooling module to predict multiple corners for a tracking target in deep networks. We then introduce a new penalty term that is used to select an optimal tracking box in these candidate corners. Finally, SiamCorners achieves experimental results that are comparable to the state-of-art tracker while maintaining a high running speed. In particular, SiamCorners achieves a 53.7% AUC on NFS30 and a 61.4% AUC on UAV123, while still running at 42 frames per second (FPS).
연구 동기 및 목표
- 앵커 박스 설계로 인한 초모수 민감도 및 학습 불균형 문제와 같은 앵커 기반 Siamese 추적자들의 한계를 해결하기 위해.
- 고정된 척도와 종횡비를 가진 사전 정의된 앵커 박스가 필요 없도록 하여 모델의 유연성과 일반화 능력을 향상시키기 위해.
- 바운딩 박스가 아닌 직접적으로 대상의 코너를 회귀하는 단순한 엔드 투 엔드 학습 가능한 추적 프레임워크를 개발하기 위해.
- 계층적 특징 통합 및 최적의 박스 선택을 위한 새로운 페널티 함수를 통해 성능을 향상시키기 위해.
- 다중 스케일 테스트나 복잡한 앵커 설계 없이도 높은 정확도와 추론 속도를 유지하기 위해.
제안 방법
- 초기 대상 바운딩 박스에서 상단, 좌측, 하단, 우측의 네 개 경계 이미지를 추출하여 Siamese 네트워크의 템플릿 입력으로 사용한다.
- 개별 특징 맵에서 왼쪽 위 및 오른쪽 아래 코너의 히트맵과 오프셋을 예측하기 위해 수정된 코너 풀링(MCP) 레이어를 사용한다.
- 다양한 특징 수준(예: conv4 및 conv5)의 예측을 통합하는 계층적 특징 통합 전략을 도입하여 강건성을 향상시킨다.
- 네트워크 스트라이드로 인한 오차를 완화하기 위해 오프셋 예측 헤드를 활용한다.
- 프레임 간 중심, 너비, 높이 변동을 제약하여 후보 코너에서 최적의 바운딩 박스를 선택하기 위해 페널티 함수(PPF)를 적용한다.
- 온라인 적응 또는 앵커 기반 분류 없이 대규모 이미지 쌍에서 전체 네트워크를 엔드 투 엔드로 사전 학습한다.

실험 결과
연구 질문
- RQ1앵커 박스 또는 영역 제안 네트워크에 의존하지 않고도 Siamese 네트워크 기반 추적자가 높은 정확도를 달성할 수 있는가?
- RQ2코너 기반 회귀는 정확도와 추론 속도 측면에서 앵커 기반 검출에 비해 어떻게 비교되는가?
- RQ3계층적 특징 통합 및 오프셋 보정은 코너 예측 성능에 어떤 영향을 미치는가?
- RQ4제안된 페널티 함수는 다수의 후보 코너에서 최적의 추적 박스를 선택하는 데 얼마나 효과적인가?
- RQ5앵커 기반 설계 없이도 높은 속도를 유지하면서 최신 기술 수준의 앵커 기반 추적자와 동등하거나 이를 초월할 수 있는가?
주요 결과
- SiamCorners는 UAV123 벤치마크에서 61.4% AUC를 달성하여 단일 레이어 기반 모델보다 2.7% 높은 성능을 보이며, 최신 앵커 기반 추적자와 동등한 성능을 기록했다.
- 엔드 투 엔드 학습 및 다중 수준 특징 융합에도 불구하고 42 FPS의 높은 추론 속도를 유지하여 강력한 효율성을 입증했다.
- 각 경계를 별도로 처리하는 네 템플릿(FRT) 설계는 통합 템플릿 대비 UAV123에서 6.3%, LaSOT에서 6.9% 향상된 성능을 기록했다.
- 수정된 코너 풀링(MCP) 레이어는 원본 코너 풀링 대비 UAV123에서 2.1%, LaSOT에서 2.5% 향상된 성능을 기록했다.
- 오프셋 예측 헤드는 UAV123에서 1.5%, LaSOT에서 3.9% 향상된 성능을 기여하여 스트라이드로 인한 오차를 감소시키는 데 중요한 역할을 한다.
- 페널티 함수(PPF)는 UAV123에서 1.4%, LaSOT에서 1.7% 향상된 정확도를 기록하여 후보 코너에서 최적의 바운딩 박스를 선택하는 데 효과적임을 확인했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.