[논문 리뷰] Bridge the Gap Between VQA and Human Behavior on Omnidirectional Video: A Large-Scale Dataset and a Deep Learning Model
이 논문은 관찰자의 머리 동작(HM) 및 눈 동작(EM) 데이터와 함께 주관적 품질 점수를 통합한 대규모 전방위 영상 데이터셋인 VQA-OV를 소개한다. 인간의 행동 데이터를 통합한 딥러닝 모델을 제안하여 객관적 시각 품질 평가 성능을 향상시켰으며, 실제 행동 데이터를 사용하여 PCC 0.81과 SRCC 0.83의 최신 기술 수준 성능을 달성하였다. 이는 인간의 행동이 인식되는 영상 품질에 상당한 영향을 미친다는 것을 입증한다.
Omnidirectional video enables spherical stimuli with the $360 imes 180^ \circ$ viewing range. Meanwhile, only the viewport region of omnidirectional video can be seen by the observer through head movement (HM), and an even smaller region within the viewport can be clearly perceived through eye movement (EM). Thus, the subjective quality of omnidirectional video may be correlated with HM and EM of human behavior. To fill in the gap between subjective quality and human behavior, this paper proposes a large-scale visual quality assessment (VQA) dataset of omnidirectional video, called VQA-OV, which collects 60 reference sequences and 540 impaired sequences. Our VQA-OV dataset provides not only the subjective quality scores of sequences but also the HM and EM data of subjects. By mining our dataset, we find that the subjective quality of omnidirectional video is indeed related to HM and EM. Hence, we develop a deep learning model, which embeds HM and EM, for objective VQA on omnidirectional video. Experimental results show that our model significantly improves the state-of-the-art performance of VQA on omnidirectional video.
연구 동기 및 목표
- 전방위 영상 시청에서 주관적 시각 품질 평가(VQA)와 인간 행동 간 격차를 메우기 위해.
- 주관적 품질 점수뿐만 아니라 관찰자의 머리 동작(HM) 및 눈 동작(EM) 데이터를 포함한 대규모 데이터셋을 수집하기 위해.
- 전방위 영상에서 인간 행동 패턴(HM 및 EM)과 인식되는 시각 품질 간의 상관관계를 조사하기 위해.
- HM 및 EM 데이터를 통합하여 예측 정확도를 향상시키는 딥러닝 기반 객관적 VQA 모델을 개발하기 위해.
- 인간 행동을 모델링할 경우 객관적 VQA 성능 향상이 이루어지는지 입증하기 위해.
제안 방법
- 저자들은 60개의 기준 영상 및 540개의 손상된 전방위 영상 시퀀스를 포함하는 VQA-OV 데이터셋을 구축하였으며, 참가자들로부터 주관적 DMOS 점수, HM 및 EM 데이터를 수집하였다.
- 데이터셋은 압축 및 지ap로젝션에 의한 다양한 콘텐츠, 지속 시간, 해상도 및 손상 유형을 포함하고 있다.
- 영상 프레임과 예측 또는 실제 값(HM 및 EM) 지ap을 입력으로 사용하여 객관적 품질 점수를 추정하는 딥러닝 모델을 제안하였다.
- 모델는 DeepQA(Kim and Lee, 2017a)에서 유도된 컨volutional 신경망(CNN) 아키텍처를 활용하며, HM 및 EM 지도는 추가 입력 채널로 통합되었다.
- 실제 구현을 위해 기존 모델(Xu et al., 2018; Pan et al., 2017)을 사용하여 HM 및 EM 지도를 예측하였으며, 부가 분석에서는 실제 값 지도를 사용하였다.
- 표준 평가 지표인 PCC, SRCC, RMSE 및 MAE를 사용하여 성능을 평가하였으며, 객관적 점수와 주관적 점수 간의 일치를 위해 비선형 회귀를 적용하였다.
실험 결과
연구 질문
- RQ1전방위 영상의 주관적 시각 품질은 머리 동작(HM) 및 눈 동작(EM) 행동과 어떻게 관련이 있는가?
- RQ2HM 및 EM 데이터를 딥러닝 모델에 통합할 경우 전방위 영상의 객관적 VQA 정확도가 향상되는가?
- RQ3인간 행동을 고려하지 않는 최신 기술 수준의 방법에 비해 행동 인식 기반 VQA 모델은 어떤 성능 향상을 달성하는가?
- RQ4HM 및 EM 예측 정확도가 최종 객관적 VQA 성능에 어떤 영향을 미치는가?
- RQ5실제 HM 및 EM 지도를 사용할 경우 행동 인식 기반 VQA 모델의 상한 성능는 얼마인가?
주요 결과
- 제안된 딥러닝 모델은 예측된 HM 및 EM 지도를 사용할 경우 기존 최신 기술 수준의 접근 방식을 크게 능가하여 PCC 0.77과 SRCC 0.80을 달성하였다.
- 실제 값(HM 및 EM) 지도를 사용할 경우 PCC 0.81과 SRCC 0.83을 달성하여 해당 접근 방식의 상한 성능를 입증하였다.
- 기본 모델인 DeepQA 모델(이미지 특징만 사용)에 비해 RMSE는 1.20 감소하고 MAE는 0.95 감소시켰다.
- 결과는 주관적 VQA 점수와 관찰자 행동, 특히 HM 및 EM 간 강한 상관관계가 있음을 확인하였으며, 인간 인지 모델링의 중요성을 입증하였다.
- 부가 분석 결과, 실제 값 지도를 사용할 경우 예측 지도를 사용할 경우보다 성능 향상이 이루어졌으며, 이는 예측 정확도가 모델 성능에 핵심 요소임을 시사한다.
- 객관적 점수 대 주관적 점수의 산점도에서 제안된 모델은 회귀선 주변으로 더 조밀한 분포를 보이며 인간 인지와의 일치도가 뛰어나다는 것을 보여주었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.