Skip to main content
QUICK REVIEW

[논문 리뷰] Blindly Assess Quality of In-the-Wild Videos via Quality-aware Pre-training and Motion Perception

Bowen Li, Weixia Zhang|arXiv (Cornell University)|2021. 08. 19.
Image and Video Quality Assessment인용 수 4
한 줄 요약

이 논문은 영상 품질 평가(IQA) 데이터베이스에서의 품질 인식 사전 훈련과 동작 인식 모델로부터의 운동 인식을 활용하여 상보적인 시공간 특징을 학습하는 뇌물 없는 영상 품질 평가(BVQA) 방법을 제안한다. 이러한 표현을 혼합 리스트 기반 순위 매기기 손실과 조합함으로써, 여섯 개인 실외 환경 VQA 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, 특히 GPU 가속을 통해 빠른 추론이 가능한 강력한 일반화 능력과 효율성을 입증한다.

ABSTRACT

Perceptual quality assessment of the videos acquired in the wilds is of vital importance for quality assurance of video services. The inaccessibility of reference videos with pristine quality and the complexity of authentic distortions pose great challenges for this kind of blind video quality assessment (BVQA) task. Although model-based transfer learning is an effective and efficient paradigm for the BVQA task, it remains to be a challenge to explore what and how to bridge the domain shifts for better video representation. In this work, we propose to transfer knowledge from image quality assessment (IQA) databases with authentic distortions and large-scale action recognition with rich motion patterns. We rely on both groups of data to learn the feature extractor. We train the proposed model on the target VQA databases using a mixed list-wise ranking loss function. Extensive experiments on six databases demonstrate that our method performs very competitively under both individual database and mixed database training settings. We also verify the rationality of each component of the proposed method and explore a simple manner for further improvement.

연구 동기 및 목표

  • 정확한 기준 영상이 제공되지 않으며 왜곡이 다양하고 실제적인 실외 환경에서의 뇌물 없는 영상 품질 평가 도전 과제를 해결하기 위해.
  • IQA 데이터베이스에서의 품질 인식 사전 훈련을 통해 소스(예: 이미지 분류)와 타겟(실외 VQA) 도메인 간 도메인 이탈을 줄이기 위해.
  • 사전 훈련된 3D 동작 인식 모델에서의 운동 인식을 통합하여 영상 표현을 향상시키기 위해.
  • PLCC와 SRCC를 동시에 최적화하는 혼합 리스트 기반 순위 매기기 손실 함수를 통해 일반화 능력과 성능을 향상시키기 위해.
  • 특히 고해상도 영상에서의 빠른 추론을 고려한 실시간 배포에 적합한 높은 효율성과 확장성 확보하기 위해.

제안 방법

  • 인간이 평가한 품질 점수를 포함한 여러 IQA 데이터베이스에서 프레임 수준의 특징 추출기를 사전 훈련하여 인간의 인지적 의미를 갖는 공간적 특징을 학습하기 위해.
  • 동작 인식 데이터셋에서 사전 훈련된 3D 컨volution 신경망(I3D 등)을 활용하여 운동 인식 시공간 특징을 추출하기 위해.
  • 품질 인식 공간 특징과 운동 특징을 연결 또는 어텐션 메커니즘을 통해 융합하여 종합적인 영상 표현을 형성하기 위해.
  • 피어슨 선형 상관 계수(PLCC)와 스피어만 순위 상관 계수(SRCC)를 동시에 최적화하는 혼합 리스트 기반 순위 매기기 손실을 사용하여 전체 BVQA 모델을 훈련하기 위해.
  • 소스(IQA 및 동작 인식)와 타겟(실외 VQA) 도메인 간의 도메인 이탈을 줄이기 위해 모델 기반 전이 학습을 적용하기 위해.
  • 목표 VQA 데이터베이스에서의 종단 간 미세 조정을 통해 진정한 왜곡에 효과적으로 적응할 수 있도록 모델을 최적화하기 위해.

실험 결과

연구 질문

  • RQ1IQA 데이터베이스에서의 품질 인식 사전 훈련이 실외 환경에서의 뇌물 없는 영상 품질 평가를 위한 특징 표현을 향상시키는가?
  • RQ2동작 인식 모델에서의 운동 인식을 통합함으로써 진정한 왜곡 상황에서 BVQA 모델의 성능 향상이 이루어지는가?
  • RQ3혼합 리스트 기반 순위 매기기 손실이 다양한 VQA 데이터베이스에서 인간 평가 점수와의 상관관계 향상에 얼마나 효과적인가?
  • RQ4제안된 방법이 개별 및 혼합 훈련 설정 모두에서 여러 실외 VQA 데이터베이스 간에 얼마나 잘 일반화되는가?
  • RQ5특히 GPU 가속을 통해 고해상도 영상에서의 계산 효율성은 어떻게 변화하는가?

주요 결과

  • 제안된 방법은 여섯 개인 실외 환경 VQA 벤치마크에서 최신 기술 수준의 성능을 달성하며, 모든 데이터셋에서 일관되게 높은 SRCC 및 PLCC 값을 기록한다.
  • 모델은 개별 데이터베이스 및 혼합 데이터베이스 훈련 설정 모두에서 경쟁적인 성능을 보이며 강력한 일반화 능력을 입증한다.
  • 품질 인식 사전 훈련과 운동 인식의 융합은 공간적 특징만 사용하거나 표준 ImageNet 사전 훈련을 사용하는 모델 대비 뚜렷한 성능 향상을 이룬다.
  • 혼합 리스트 기반 순위 매기기 손실 함수는 인간 평가 점수와의 선형 상관과 순위 상관을 동시에 최적화함으로써 성능을 추가로 향상시킨다.
  • GPU 가속 추론은 2160p 해상도에서 TLVQM 대비 최대 16배의 속도 향상을 보이며, 해상도 증가에 따라 확장성 또한 뛰어나다.
  • CPU에서도 높은 정확도를 유지하지만, 특히 고해상도에서 GPU 가속이 뚜렷한 효율성 이점을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.