[논문 리뷰] UNQA: Unified No-Reference Quality Assessment for Audio, Image, Video, and Audio-Visual Content
이 논문은 단일 아키텍처를 사용하여 음성, 이미지, 비디오 및 오디오-비디오 콘텐츠의 감각적 품질을 동시에 예측하는 최초의 통합형 무기준 품질 평가 모델인 UNQA를 제안한다. 서로 다른 데이터베이스 간의 품질 척도가 다름에도 불구하고, 다중 모odal 학습 전략을 통해 이를 보정함으로써 모델 복잡도를 감소시키면서도 다양한 미디어 유형에 걸쳐 뛰어난 일반화 능력과 최신 기술 수준(SOTA)의 성능을 달성한다.
As multimedia data flourishes on the Internet, quality assessment (QA) of multimedia data becomes paramount for digital media applications. Since multimedia data includes multiple modalities including audio, image, video, and audio-visual (A/V) content, researchers have developed a range of QA methods to evaluate the quality of different modality data. While they exclusively focus on addressing the single modality QA issues, a unified QA model that can handle diverse media across multiple modalities is still missing, whereas the latter can better resemble human perception behaviour and also have a wider range of applications. In this paper, we propose the Unified No-reference Quality Assessment model (UNQA) for audio, image, video, and A/V content, which tries to train a single QA model across different media modalities. To tackle the issue of inconsistent quality scales among different QA databases, we develop a multi-modality strategy to jointly train UNQA on multiple QA databases. Based on the input modality, UNQA selectively extracts the spatial features, motion features, and audio features, and calculates a final quality score via the four corresponding modality regression modules. Compared with existing QA methods, UNQA has two advantages: 1) the multi-modality training strategy makes the QA model learn more general and robust quality-aware feature representation as evidenced by the superior performance of UNQA compared to state-of-the-art QA methods. 2) UNQA reduces the number of models required to assess multimedia data across different modalities. and is friendly to deploy to practical applications.
연구 동기 및 목표
- 다양한 미디어 모odal을 동시에 평가할 수 있는 통합형 품질 평가 모델의 부재를 해결하기 위해.
- 다양한 QA 데이터베이스 간의 일관되지 않은 감각적 품질 척도(예: [0,5] 대비 [0,100]) 문제를 해결하기 위해.
- 음성, 이미지, 비디오 및 오디오-비디오 콘텐츠 전반에 걸쳐 일반화 가능한 단일의 파rameter 효율적인 모델을 개발하기 위해.
- 미디어가 완전하지 않거나 다중 모달일 수 있는 실제 응용 환경에서의 강건성과 구현 가능성을 향상시키기 위해.
제안 방법
- UNQA는 모달별 특징 추출 모듈(이미지용 공간적, 비디오용 운동적, 음성용 음성적)을 갖춘 공통 백본을 사용한다.
- 공간적 특징 추출기에서 다중 헤드 자기주의를 적용하여 감각적으로 중요한 영역을 강조한다.
- 새로운 다중 모달 학습 전략을 통해 데이터베이스별 회귀 헤드에서 특징 추출기를 사전 학습하고, 이후 원시 MOS 값 대신 상대적 순위 손실을 사용하여 전체 모델을 미세 조정한다.
- 모달별 특징을 네 개의 전용 회귀 헤드를 통해 융합하여 각 모달 또는 통합 A/V 점수를 예측한다.
- Grad-CAM을 사용해 주의 맵을 시각화하여, UNQA가 사람, 텍스트, 구조물과 같은 감각적으로 중요한 영역에 집중하고 있음을 확인한다.
- 표준 GPU에서 계산 효율성을 평가하여, UNQA가 경쟁하는 딥러닝 모델들보다 낮은 추론 시간을 기록한다.
실험 결과
연구 질문
- RQ1단일의 통합 모델이 음성, 이미지, 비디오 및 오디오-비디오 콘텐츠 전반에 걸쳐 고성능의 무기준 평가를 달성할 수 있는가?
- RQ2여러 QA 데이터베이스 간의 다릅니다 품질 척도를 공동 학습 중 효과적으로 보정할 수 있는가?
- RQ3다양한 모달을 공동으로 학습함으로써 더 강건하고 일반화 능력이 뛰어난 품질 인식 표현을 얻을 수 있는가?
- RQ4통합 모델이 모달별 최신 기술 수준의 모델을 능가하면서도 모델 복잡도를 줄일 수 있는가?
주요 결과
- UNQA는 모든 네 가지 모달에서 최신 기술 수준의 성능을 달성하였으며, 이미지 QA에서 스피어만 상관계수(SRCC) 0.8037, 비디오에서 0.8901, 오디오-비디오에서 0.8791, 음성에서 0.7962를 기록하였다.
- 외부 데이터베이스 간 평가에서 UNQA는 7개의 외부 QA 데이터셋에서 20개의 SOTA 방법보다 뛰어난 일반화 성능을 보였다.
- UNQA는 계산 효율성이 뛰어나, 표준 1080p, 25fps 비디오에서 비교 모델들 중에서 가장 낮은 실행 시간을 기록하였다.
- Grad-CAM을 활용한 시각적 분석을 통해 UNQA가 얼굴, 텍스트, 건물과 같은 감각적으로 중요한 영역에 집중하고 있음을 확인하였으며, 인간의 인지와 일치하였다.
- 다중 모달 학습 전략은 MOS 값의 재샘플링이나 재가중치 조정 없이도 데이터베이스 간 척도 불일치 문제를 효과적으로 완화하였다.
- UNQA는 모달별로 별도의 모델이 필요했던 수를 하나의 통합 모델로 줄여, 실제 시스템에서의 구현 가능성을 향상시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.