[논문 리뷰] HVS Revisited: A Comprehensive Video Quality Assessment Framework
이 논문은 도메인 융합 아키텍처에 시각적 촉각성, 콘텐츠 의존성, 에지 마스킹, 운동 인식, 시간적 히스테리시스의 다섯 가지 핵심 특성을 통합하여 인간 시각 시스템(HVS)을 재고한 no-reference 영상 품질 평가 프레임워크인 HVS-5M를 제안한다. 이 프레임워크는 SAMNet, ConvNeXt, SlowFast, TempHyst를 사용하여 공간적 및 시간적 특징을 추출하고 융합하여 다양한 데이터셋에서 최신 기술 수준의 성능을 달성하며, 뛰어난 일반화성과 강건성을 확보한다.
Video quality is a primary concern for video service providers. In recent years, the techniques of video quality assessment (VQA) based on deep convolutional neural networks (CNNs) have been developed rapidly. Although existing works attempt to introduce the knowledge of the human visual system (HVS) into VQA, there still exhibit limitations that prevent the full exploitation of HVS, including an incomplete model by few characteristics and insufficient connections among these characteristics. To overcome these limitations, this paper revisits HVS with five representative characteristics, and further reorganizes their connections. Based on the revisited HVS, a no-reference VQA framework called HVS-5M (NRVQA framework with five modules simulating HVS with five characteristics) is proposed. It works in a domain-fusion design paradigm with advanced network structures. On the side of the spatial domain, the visual saliency module applies SAMNet to obtain a saliency map. And then, the content-dependency and the edge masking modules respectively utilize ConvNeXt to extract the spatial features, which have been attentively weighted by the saliency map for the purpose of highlighting those regions that human beings may be interested in. On the other side of the temporal domain, to supplement the static spatial features, the motion perception module utilizes SlowFast to obtain the dynamic temporal features. Besides, the temporal hysteresis module applies TempHyst to simulate the memory mechanism of human beings, and comprehensively evaluates the quality score according to the fusion features from the spatial and temporal domains. Extensive experiments show that our HVS-5M outperforms the state-of-the-art VQA methods. Ablation studies are further conducted to verify the effectiveness of each module towards the proposed framework.
연구 동기 및 목표
- 기존 영상 품질 평가(VQA) 방법이 인간 시각 시스템(HVS)을 완전히 모델링하지 못하고 특성 간 연결을 제대로 구현하지 못하는 한계를 해결하기 위해.
- 에지 마스킹 및 강화된 시각적 촉각성과 같은 미충분하게 탐색된 HVS 특성을 통합하여 실세계 영상에서의 성능을 향상시키기 위해.
- 공간적 및 시간적 특징을 효과적으로 융합하기 위한 도메인 융합 설계 철학을 기반으로 한 강건하고 일반화 가능한 VQA 프레임워크를 개발하기 위해.
- 제거 실험을 통해 각 구성 요소의 효과를 검증하고 최신 기술 수준의 방법보다 프레임워크의 우수성을 입증하기 위해.
제안 방법
- HVS-5M 프레임워크는 시각적 촉각성, 콘텐츠 의존성, 에지 마스킹, 운동 인식, 시간적 히스테리시스의 다섯 가지 특성을 통합한 재고된 HVS 모델에 기반한다.
- 공간 도메인에서는 SAMNet을 사용하여 촉각성 지apap을 생성하고, 이는 ConvNeXt 기반의 콘텐츠 의존성 및 에지 마스킹 모듈의 특징을 주의 기반으로 가중한다.
- 시간 도메인에서는 SlowFast 네트워크를 통해 운동 인식을 캡처하여 동적 특징을 추출하고, TempHyst 모듈을 사용하여 인간 기억 효과를 시뮬레이션함으로써 시간적 히스테리시스를 모델링한다.
- 공간적 및 시간적 특징은 융합되어 완전 연결층을 통해 처리되어 최종 영상 품질 점수를 예측한다.
- 프레임워크는 도메인 융합 설계를 채택하여 공간적 및 시간적 표현의 공동 최적화를 가능하게 하여 품질 추정 성능을 향상시킨다.
- 특징 표현 및 시간 모델링을 향상시키기 위해 ConvNeXt 및 TempHyst와 같은 고급 아키텍처를 통합한다.
실험 결과
연구 질문
- RQ1다양한 상호연관 특성을 통합함으로써 영상 품질 평가에서 인간 시각 시스템(HVS)을 더욱 종합적으로 모델링할 수 있는 방법은 무엇인가?
- RQ2정제된 기준이 없는 상황에서 에지 마스킹과 시각적 촉각성이 영상 품질 예측에 기여하는 정도는 어떠한가?
- RQ3시간적 히스테리시스의 통합이 no-reference VQA 모델의 강건성과 정확도를 어떻게 향상시키는가?
- RQ4공간적 및 시간적 특징의 도메인 융합 설계가 다양한 영상 데이터셋 간의 일반화 능력을 얼마나 향상시키는가?
주요 결과
- HVS-5M는 LIVE-VQC, KoNViD-1k, CVD2014를 포함한 다섯 가지 주요 영상 품질 평가 데이터셋에서 최신 기술 수준의 성능을 달성한다.
- 제거 실험 결과, 시각적 촉각성 모듈을 비활성화할 경우 여섯 데이터셋 중 네 개에서 성능 저하가 발생하여 주목적 기반 특징 가중의 핵심적 역할을 확인한다.
- 에지 마스킹 모듈은 중요한 기여를 하며, 비활성화 시 평균 SRCC가 2.5% 감소하여 고대비 또는 무늬가 뚜렷한 영역에서의 중요성을 입증한다.
- TempHyst 모듈을 완전 연결 네트워크로 대체할 경우 KoNViD-1k에서 SRCC가 16.6% 감소하여 시간 기억 모델링이 정확한 품질 예측을 위해 필수적임을 입증한다.
- 핵심 모듈에서 ConvNeXt 대신 ResNet-50를 사용할 경우 평균 SRCC가 3.5% 감소하여 이 프레임워크에서 ConvNeXt가 특징 추출에 있어 우월함을 보여준다.
- 범주형, 교차 데이터셋, 혼합 데이터셋 평가에서 프레임워크는 강력한 일반화 능력을 보이며 분포 이탈에 대한 강건성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.