[논문 리뷰] A strong baseline for image and video quality assessment
이 논문은 단일 ResNet-18 백본을 사용하여 전역 특징을 추출하고, 훈련 최적화 기법을 결합하여 이미지 및 동영상 품질 평가를 위한 단순하면서도 강력한 통합 딥러닝 모델을 제안한다. 공개 및 비공개 데이터셋에서 최신 기준 성능을 달성하며, VGG-19 및 ResNet-50와 같은 표준 기준 모델을 초월한다. 압축 처리된 UGC, PGC, 게임 동영상과 같은 실세계 응용 분야에 적합한 세 가지 사전 훈련된 모델을 공개한다.
In this work, we present a simple yet effective unified model for perceptual quality assessment of image and video. In contrast to existing models which usually consist of complex network architecture, or rely on the concatenation of multiple branches of features, our model achieves a comparable performance by applying only one global feature derived from a backbone network (i.e. resnet18 in the presented work). Combined with some training tricks, the proposed model surpasses the current baselines of SOTA models on public and private datasets. Based on the architecture proposed, we release the models well trained for three common real-world scenarios: UGC videos in the wild, PGC videos with compression, Game videos with compression. These three pre-trained models can be directly applied for quality assessment, or be further fine-tuned for more customized usages. All the code, SDK, and the pre-trained weights of the proposed models are publicly available at https://github.com/Tencent/CenseoQoE.
연구 동기 및 목표
- 복잡한 아키텍처 없이도 기존 방법을 능가하는 강력하고 단순하며 효과적인 기준 모델을 이미지 및 동영상 품질 평가 분야에 구축하기.
- 다중 브랜치 특징 융합 또는 과도하게 복잡한 네트워크에 의존하는 이전 모델의 한계를 해결하여 산업적 구현에 적합한 모델을 제공하기.
- 사용자 생성 콘텐츠, 압축 처리된 전문 콘텐츠, 게임 스트리밍과 같은 다양한 상업적 환경에서의 실세계 품질 평가에 실용적인 솔루션을 제공하기.
- 즉시 사용하거나 미세조정이 가능한 사전 훈련된 모델과 코드를 공개하여 산업 및 연구 분야에서의 활용을 지원하기.
- 훈련 기법의 성능 향상 외에 성능 향상이 발생하지 않는 공정한 벤치마킹을 가능하게 하기 위해 견고한 기준 모델을 제공하기.
제안 방법
- 모델은 입력 이미지 또는 동영상 프레임에서 전역 특징 표현을 추출하기 위해 단일 ResNet-18 백본을 사용하며, 다중 브랜치 또는 복잡한 아키텍처를 회피한다.
- 일반화 성능 향상을 위해 훈련 중에 무작위 수평 뒤집기 및 무작위 컷팅과 같은 데이터 증강 기법을 적용한다.
- 학습 안정성 향상과 과적합 방지를 위해 가중치 감소와 운동량을 적용한 코시 안내 학습률 스케줄링을 사용한다.
- 예측된 품질 점수와 인간이 평가한 점수 간의 차이를 최소화하는 손실 함수를 사용하여 평균 관점 점수(MOS) 회귀를 수행한다.
- 초기 학습률 1e-4와 최소 학습률 1e-7, L2 가중치 감소 5e-4를 포함한 하이퍼파ram터 튜닝을 포함한 훈련 과정을 수행한다.
- 최종 모델은 세 가지 서로 다른 실세계 데이터셋에서 미세조정된다: 자연스러운 UGC 동영상, 압축 처리된 PGC 동영상, 압축 처리된 게임 동영상.
실험 결과
연구 질문
- RQ1단순하고 단일 브랜치 딥러닝 모델이 다중 브랜치 특징 융합이나 복잡한 아키텍처 없이도 이미지 및 동영상 품질 평가에서 뛰어난 성능을 달성할 수 있는가?
- RQ2공개 및 비공개 데이터셋에서 인간의 인지와의 상관관계 측면에서 제안된 모델이 VGG-19 및 ResNet-50와 같은 기존 기준 모델에 비해 어떻게 성능을 냈는가?
- RQ3다양한 실세계 동영상 시나리오에서 훈련된 통합 모델이 압축 및 자연스러운 왜곡과 같은 다양한 품질 저하 유형에 대해 얼마나 잘 일반화되는가?
- RQ4데이터 증강, 학습률 스케줄링 등의 표준 훈련 기법이 단순 기초 훈련에 비해 성능 향상에 상당한 기여를 하는가?
- RQ5제안된 모델이 향후 연구 및 산업적 구현을 위한 신뢰할 수 있는 고성능 기준 모델로 활용될 수 있는가?
주요 결과
- LIVE-VQC 데이터셋에서 제안된 모델은 PLCC 0.7575와 SRCC 0.7390을 기록하여 VGG-19보다 PLCC 0.04, SRCC 0.08 높은 성능을 보였다.
- KoNViD-1K 데이터셋에서 모델은 PLCC 0.8245와 SRCC 0.8185를 기록하여 비교된 방법들 중 두 번째로 높은 순위를 기록했다.
- YouTube-UGC 데이터셋에서 모델은 PLCC 0.7691과 SRCC 0.7554를 기록하여 사용자 생성 콘텐츠에 대한 뛰어난 일반화 성능을 입증했다.
- 비공개 데이터셋에서 모델은 압축 처리된 게임 동영상에 대해 PLCC 0.971과 SRCC 0.968을 기록하여 고압축 환경에서 뛰어난 성능을 보였다.
- 압축 처리된 PGC 동영상에 대해 PLCC 0.961과 SRCC 0.959, 자연스러운 UGC 동영상에 대해 PLCC 0.902와 SRCC 0.880를 기록하여 실세계 조건에서의 강건성을 확인했다.
- UGC, PGC, 게임 동영상 시나리오를 위한 공개된 사전 훈련된 모델은 즉시 사용하거나 미세조정이 가능하며, 코드와 가중치가 모두 공개되어 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.