Skip to main content
QUICK REVIEW

[논문 리뷰] How Drones Look: Crowdsourced Knowledge Transfer for Aerial Video Saliency Prediction.

Kui Fu, Jia Li|arXiv (Cornell University)|2018. 11. 14.
Visual Attention and Saliency Detection참고 문헌 73인용 수 4
한 줄 요약

이 논문은 지상 수준의 시각적 주목 모델에서 유래한 지식을 전이하여 항공 영상에서의 시공간 주목도 예측 성능을 햖थ다. 1,000개의 항공 영상에서 24명의 참가자로부터 확보한 눈동자 추적 데이터를 융합함으로써, 전통적인 모델로 초기화된 다중 경로 아키텍처를 사용하는 CMNet는 유 representative 경로를 선별하고 시간적 보정을 통한 공동 미세조정을 수행하여 항공 영상 주목도 예측에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

In ground-level platforms, many saliency models have been developed to perceive the visual world as the human does. However, they may not fit a drone that can look from many abnormal viewpoints. To address this problem, this paper proposes a Crowdsourced Multi-path Network (CMNet) that transfer the ground-level knowledge for spatiotemporal saliency prediction in aerial videos. To train CMNet, we first collect and fuse the eye-tracking data of 24 subjects on 1,000 aerial videos to annotate the ground-truth salient regions. Inspired by the crowdsourced annotation in eye-tracking experiments, we design a multi-path architecture for CMNet, in which each path is initialized under the supervision of a classic ground-level saliency model. After that, the most representative paths are selected in a data-driven manner, which are then fused and simultaneously fine-tuned on aerial videos. In this manner, the prior knowledge in various classic ground-level saliency models can be transferred into CMNet so as to improve its capability in processing aerial videos. Finally, the spatial predictions given by CMNet are adaptively refined by incorporating the temporal saliency predictions via a spatiotemporal saliency optimization algorithm. Experimental results show that the proposed approach outperforms ten state-of-the-art models in predicting visual saliency in aerial videos.

연구 동기 및 목표

  • 비정상적이고 인간과 다름없는 시점이 적용된 항공 영상에 지상 수준의 주목도 모델을 적응시키는 도전 과제를 해결한다.
  • 공동으로 수집한 눈동자 추적 데이터를 활용하여 항공 영상의 고품질이고 인간이 직접 작성한 주목도 지도를 생성한다.
  • 기존의 지상 수준 주목도 모델에서 유래한 사전 지식을 항공 영상 영역으로 전이할 수 있도록 다중 경로 신경망 아키텍처를 설계한다.
  • 최적화 알고리즘을 통해 공간적 예측과 시간적 예측을 융합하여 시공간 주목도 예측 성능을 향상시킨다.
  • 기존의 최신 기술 모델들에 비해 항공 영상 주목도 예측에서 뛰어난 성능을 보여준다.

제안 방법

  • 24명의 참가자가 1,000개의 항공 영상 시청 시 확보한 눈동자 추적 데이터를 수집하고 융합하여 진정도 높은 주목도 지도를 생성한다.
  • 각 경로가 사전 학습된 지상 수준 주목도 모델로 초기화된 다중 경로 네트워크(CMNet)를 설계하여 사전 지식를 통합한다.
  • 성능과 다양성을 바탕으로 데이터 기반 방식으로 가장 유 representative인 경로를 선별하여 중복을 줄인다.
  • 선택된 경로의 융합은 연결(concatenation)과 함께 항공 영상 데이터에서 공동 미세조정을 통해 항공 시점에 적합하게 조정된다.
  • 시공간 주목도 최적화 알고리즘을 적용하여 영상 시퀀스의 시간적 맥락을 활용해 공간적 예측을 정밀하게 보완한다.
  • 공동으로 수집한 주목도 애너테이션을 지도로 사용하여 전체 CMNet를 지도 학습 방식으로 엔드 투 엔드로 훈련한다.

실험 결과

연구 질문

  • RQ1지상 수준 주목도 모델에서 유래한 지식이 항공 영상에서의 주목도 예측 성능 향상에 효과적으로 전이될 수 있는가?
  • RQ2다양한 지상 수준 모델로 초기화된 다중 경로 아키텍처가 항공 영상 주목도 예측 성능 향상에 어떻게 기여하는가?
  • RQ3시간적 동적 특성을 통합할 경우 항공 영상 시퀀스에서 공간적 주목도 예측 성능 향상에 어느 정도 기여하는가?
  • RQ4공동으로 수집한 눈동자 추적 데이터가 항공 영상 이해 분야의 딥 러닝 모델 훈련에 신뢰할 수 있는 지도로 기능할 수 있는가?
  • RQ5제안된 CMNet는 기존의 최신 기술 모델들에 비해 항공 영상 주목도 예측에서 정확도와 강인성 측면에서 어떻게 비교되는가?

주요 결과

  • 제안된 CMNet는 항공 영상에서 시각적 주목도를 예측하는 데 있어 10개의 최신 기술 모델을 모두 능가하며, 더 뛰어난 일반화 능력과 정확도를 입증한다.
  • 24명의 참가자로부터 확보한 공동으로 수집한 눈동자 추적 데이터의 활용은 주목도 지도의 품질과 인간 유사성 측면에서 뚜렷한 향상을 이끌었다.
  • 데이터 기반 경로 선택 방식을 적용한 다중 경로 아키텍처는 고전적인 지상 수준 모델들로부터 유래한 다양한 사전 지식을 효과적으로 활용한다.
  • 선택된 경로들을 항공 영상 데이터에서 공동으로 미세조정함으로써 비표준적인 항공 시점에 효과적으로 적응할 수 있었다.
  • 시공간 최적화 단계는 영상 프레임 간의 시간적 일관성을 통합함으로써 예측 정확도를 향상시켰다.
  • 다양한 평가 지표에서 최신 기술 수준의 성능을 달성하여, 항공 영상 이해 분야에서 지식 전이와 다중 경로 학습의 효과성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.