Skip to main content
QUICK REVIEW

[논문 리뷰] ATSal: An Attention Based Architecture for Saliency Prediction in 360 Videos

Yasser Dahou, Marouane Tliba|arXiv (Cornell University)|2020. 11. 20.
Visual Attention and Saliency Detection참고 문헌 43인용 수 8
한 줄 요약

ATSal은 360° 영상 색시얼리티 예측을 위한 새로운 듀얼스트림 어텐션 기반 기법을 제안한다. 이는 어텐션 모듈을 통해 전역적 맥락 특징을 통합하고, 국소적인 패치 수준의 전문 모델을 활용하여 공간적 및 시간적 모델링을 향상시킨다. 이는 Salient360! 및 VR-EyeTracking 데이터셋에서 최신 기술(SOTA)을 초월하는 성능을 달성하며, 모든 평가 지표에서 기존 방법을 능가하면서도 빠른 추론 속도를 유지한다.

ABSTRACT

The spherical domain representation of 360 video/image presents many challenges related to the storage, processing, transmission and rendering of omnidirectional videos (ODV). Models of human visual attention can be used so that only a single viewport is rendered at a time, which is important when developing systems that allow users to explore ODV with head mounted displays (HMD). Accordingly, researchers have proposed various saliency models for 360 video/images. This paper proposes ATSal, a novel attention based (head-eye) saliency model for 360\degree videos. The attention mechanism explicitly encodes global static visual attention allowing expert models to focus on learning the saliency on local patches throughout consecutive frames. We compare the proposed approach to other state-of-the-art saliency models on two datasets: Salient360! and VR-EyeTracking. Experimental results on over 80 ODV videos (75K+ frames) show that the proposed method outperforms the existing state-of-the-art.

연구 동기 및 목표

  • 딥 러닝을 활용하여 360° 영상에서 인간의 머리 및 눈의 시선 집중 패턴을 예측하는 문제에 대응하기 위해.
  • 구형 영역에서 전역적 시각적 주의를 명시적으로 모델링하여 색시얼리티 예측 성능을 향상시키기 위해.
  • 연속된 프레임에 걸친 패치 수준 표현에 전문 모델을 적용하여 국소적 특징 학습을 향상시키기 위해.
  • 가상현실 스트리밍과 같은 실시간 응용 프로그램에 적합한 계산 효율성이 높은 아키텍처를 제공하기 위해.
  • 미래 연구를 지원하기 위해 VR-EyeTracking 데이터셋의 사전 처리된 시선 지도를 공개하기 위해.

제안 방법

  • 모델은 듀얼스트림 아키텍처를 활용한다: 한 스트림은 수신장이 확대된 자기 어텐션 메커니즘을 사용하여 전역적 특징을 처리하여 맥락적 공간 정보를 인코딩한다.
  • 두 번째 스트림은 국소 이미지 패치에서 색시얼리티를 학습하기 위해 전문 모델을 사용하며, 예측 결과를 픽셀 단위 곱셈을 통해 보정하여 과도한 추정을 억제한다.
  • 시간적 특징에 대해 지수이동평균(EMA)을 적용하여 영상 프레임 간의 운동 동역학을 모델링한다.
  • 어텐션 모듈은 브로치 레이어에 삽입되어 전역 맥락을 모든 공간 위치로 전파함으로써 특징 표현을 향상시킨다.
  • 모델은 정적 360° 이미지에서 사전 학습하고 영상 데이터에서 미세 조정하여 일반화 성능을 향상시킨다.
  • 최종 색시얼리티 맵은 어텐션 모odulated 전역 특징과 전문 모델 기반 국소 예측을 융합하여 생성된다.

실험 결과

연구 질문

  • RQ1전역 시각적 맥락을 모델링하는 어텐션 기반 기법이 360° 영상의 색시얼리티 예측 성능 향상에 기여하는가?
  • RQ2전역 어텐션과 국소 전문 모델을 융합했을 때 360° 영상 색시얼리티 벤치마크에서 성능에 어떤 영향을 미치는가?
  • RQ3제안된 아키텍처가 다양한 360° 영상 콘텐츠와 시선 패턴에 대해 얼마나 일반화되는가?
  • RQ4기존의 360° 색시얼리티 모델과 비교했을 때 모델의 추론 속도는 어떻게 되며, 특히 실시간 응용에서 어떤가?
  • RQ5EMA를 통한 시간 동적 요소 통합이 색시얼리티 예측의 시간적 일관성 향상에 얼마나 기여하는가?

주요 결과

  • ATSal은 AUC-J, NSS, EMD, MAE를 포함한 다섯 가지 평가 지표에서 Salient360! 및 VR-EyeTracking 데이터셋에서 모든 경쟁 모델을 능가한다.
  • Salient360! 데이터셋에서 ATSal은 특히 영상 시퀀스에서 정량적 성능 향상이 뚜렷하여 다양한 시나리오에서 뛰어난 강건성을 보였다.
  • 전문 모델 스트림 없이도 높은 성능를 유지함으로써 전역 어텐션 기반 기법 자체의 강력함을 입증했다.
  • ATSal은 VR-EyeTracking 벤치마크에서 Two-stream 모델 대비 9배 이상 빠른 속도를 기록했으며, NVIDIA GTX 1080에서 프레임당 추론 시간이 0.230초였다.
  • 정성적 결과 분석에서 ATSal은 더 정확하고 포괄적인 색시얼리티 맵을 생성했으며, 실제 지도 분포와 유사하고 등반 편향을 피하는 경향을 보였다.
  • 어텐션 모듈과 전문 모델의 융합은 기존 기반 모델 대비 과도한 추정을 줄이고 더 집중적이고 일관된 색시얼리티 영역을 생성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.