Skip to main content
QUICK REVIEW

[논문 리뷰] FANet: Quality-Aware Feature Aggregation Network for Robust RGB-T Tracking

Yabin Zhu, Chenglong Li|arXiv (Cornell University)|2018. 11. 24.
Video Surveillance and Tracking Methods참고 문헌 50인용 수 6
한 줄 요약

이 논문은 품질 인식 특징 집합 네트워크인 FANet을 제안하며, 각 모odal 내에서 계층적 다중 해상도 특징을 융합하고 신뢰도에 따라 RGB 및 열화상 특징을 적응적으로 통합함으로써 특징 표현을 향상시켜 저명도, 가림, 변형 등의 악조건에서도 강건한 RGB-T 추적을 달성한다. 제안된 방법은 대규모 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, 정확도에서 기존 방법보다 최대 5.5% 향상되었고, 19 FPS의 실시간 추론 속도를 유지한다.

ABSTRACT

This paper investigates how to perform robust visual tracking in adverse and challenging conditions using complementary visual and thermal infrared data (RGBT tracking). We propose a novel deep network architecture called qualityaware Feature Aggregation Network (FANet) for robust RGBT tracking. Unlike existing RGBT trackers, our FANet aggregates hierarchical deep features within each modality to handle the challenge of significant appearance changes caused by deformation, low illumination, background clutter and occlusion. In particular, we employ the operations of max pooling to transform these hierarchical and multi-resolution features into uniform space with the same resolution, and use 1x1 convolution operation to compress feature dimensions to achieve more effective hierarchical feature aggregation. To model the interactions between RGB and thermal modalities, we elaborately design an adaptive aggregation subnetwork to integrate features from different modalities based on their reliabilities and thus are able to alleviate noise effects introduced by low-quality sources. The whole FANet is trained in an end-to-end manner. Extensive experiments on large-scale benchmark datasets demonstrate the high-accurate performance against other state-of-the-art RGBT tracking methods.

연구 동기 및 목표

  • 저명도, 가림, 변형 등의 악조건에서 RGB 및 열화상 적외선 데이터를 활용한 강건한 시각 추적 문제를 해결하기 위해.
  • 기존 RGB-T 추적기들이 수작업으로 설정하거나 고도로 의미적인 특징에 의존하는 데서 비롯되는 한계를 극복하여, 국소화 정밀도와 의미적 분류 능력 간의 균형을 이루지 못하는 문제를 해결하기 위해.
  • 엔드 투 엔드 방식으로 RGB 및 열화상 특징의 신뢰도를 인식하는 가중치를 학습함으로써 모달 융합의 불확실성을 감소시키기 위해.
  • 다양한 네트워크 레이어를 통해 계층적 특징을 집합함으로써 공간 해상도를 유지하고 중복을 줄이며 특징 표현을 향상시키기 위해.

제안 방법

  • FANet는 각 모달 내에서 다수의 합성곱 레이어로부터 계층적 특징을 집합하며, 최대 풀링을 사용해 해상도를 통일하고 1×1 합성곱을 통해 특징 차원을 압축한다.
  • 모달 신뢰도 평가를 위해 공간 정보를 채널 기반 기술자로 압축하기 위해 전역 평균 풀링 레이어를 사용한다.
  • 적응형 집합 서브넷은 완전 연결 레이어와 SoftMax를 활용해 학습된 신뢰도 기반으로 모달 가중치를 예측하며, 이는 RGB 및 열화상 특징의 동적 융합을 가능하게 한다.
  • 전체 네트워크는 엔드 투 엔드로 훈련되어 특징 학습과 모달 융합을 함께 최적화함으로써 추적 성능을 향상시킨다.
  • 멀티 도메인 학습 프레임워크 내에서 이진 분류를 사용해 프레임 간 객체 위치를 예측한다.

실험 결과

연구 질문

  • RQ1심층 네트워크에서 유도된 계층적 다중 해상도 특징을 효과적으로 집합하여 RGB-T 추적의 강건성을 향상시킬 수 있는가?
  • RQ2노이즈가 많거나 품질이 낮은 조건에서, 엔드 투 엔드 방식으로 모달 신뢰도를 추정함으로써 융합 성능을 향상시킬 수 있는가?
  • RQ3신뢰도 기반 적응형 융합 전략이 어려운 추적 환경에서 고정 또는 히وري스틱 융합 전략보다 우수한 성능을 낼 수 있는가?
  • RQ4다양한 레이어를 통해 浅층 및 심층 특징을 통합할 경우 추적 정확도와 강건성에 어떤 영향을 미치는가?

주요 결과

  • FANet는 RGBT234 벤치마크에서 PR 78.7%와 SR 55.3%를 달성하여, 다음으로 우수한 방법보다 각각 5.0%와 5.3% 향상된 성능을 보였다.
  • 제안된 계층적 특징 집합 방법은 추적 성능 향상에 크게 기여하였으며, FANet-C13과 FANet-C23는 단일 레이어 특징 사용 대비 뛰어난 성능을 보였다.
  • FANet는 단일 GPU에서 실시간 추론 속도 19 FPS를 달성하여 높은 정확도와 함께 뛰어난 효율성을 입증했다.
  • 절단 실험 결과, 적응형 집합 서브넷을 포함한 전체 FANet 아키텍처가 최적 성능을 내기 위해 필수적임을 확인하였으며, FANet-FA 및 FANet-MA는 성능 저하가 발생했다.
  • 크기 변화가 큰 경우나 카메라 진동이 있는 시퀀스를 성공적으로 처리하였지만, 극도로 빠른 운동이나 블러 상황에서는 실패 사례가 발생했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.