[논문 리뷰] Boosting the Performance of Video Compression Artifact Reduction with Reference Frame Proposals and Frequency Domain Information
이 논문은 다중 프레임 영상 압축 아티팩트 감소를 향상시키기 위해 참조 프레임 제안(RFP) 전략과 FFT 기반 손실을 제안한다. 최적의 참조 프레임을 선택하고 주파수 도메인 세부 정보를 감시함으로써, 정밀도와 시각적 품질을 향상시켜 MFQE 2.0에서 최고 성능을 기록하였고, NTIRE 2021에서 트랙 1과 트랙 2에서 우수상을 수상하였다.
Many deep learning based video compression artifact removal algorithms have been proposed to recover high-quality videos from low-quality compressed videos. Recently, methods were proposed to mine spatiotemporal information via utilizing multiple neighboring frames as reference frames. However, these post-processing methods take advantage of adjacent frames directly, but neglect the information of the video itself, which can be exploited. In this paper, we propose an effective reference frame proposal strategy to boost the performance of the existing multi-frame approaches. Besides, we introduce a loss based on fast Fourier transformation~(FFT) to further improve the effectiveness of restoration. Experimental results show that our method achieves better fidelity and perceptual performance on MFQE 2.0 dataset than the state-of-the-art methods. And our method won Track 1 and Track 2, and was ranked the 2nd in Track 3 of NTIRE 2021 Quality enhancement of heavily compressed videos Challenge.
연구 동기 및 목표
- 기존의 다중 프레임 방법이 인접 프레임에만 의존하여 영상의 전체 시간적 맥락을 활용하지 못하는 한계를 해결한다.
- 이웃한 압축 프레임들 중에서 가장 정보가 풍부한 참조 프레임을 선별하는 전략을 제안하여 복원 품질을 향상시킨다.
- 딥러닝 기반 영상 향상에서 과도한 부드러움과 고주파 수치 손실을 줄이기 위해 주파수 도메인 감시 신호를 도입한다.
- 계산 비용을 크게 증가시키지 않으면서도 아키텍처 개선과 앙상블 기법을 통해 모델 성능을 향상시킨다.
제안 방법
- 목표 프레임에 비해 관련성이 높은 프레임을 기반으로 이웃한 압축 프레임들 중에서 최적의 참조 프레임을 선택하는 參照 프레임 제안(RFP) 전략을 제안한다.
- 기존의 다중 프레임 접근 방식(예: STDF)에 RFP 전략을 증분 모듈로 통합하여 아키텍처를 대체하지 않고 성능을 향상시킨다.
- 빠른 푸리에 변환(FFT) 기반의 손실 함수를 도입하여 주파수 도메인에서 고주파 세부 정보 복구를 감시한다.
- 공간 도메인 L1 손실과 주파수 도메인 FFT 손실을 조합하여 픽셀 수준 정확도와 스펙트럼 정밀도를 동시에 최적화한다.
- 확장된 특징을 가진 Ada-WDSR-A 블록 기반의 더 깊은 품질 향상(QE) 모듈을 도입하여 표현 능력을 향상시킨다.
- 자기 앙상블과 게이팅 퓨전 전략을 적용한다: 자기 앙상블은 데이터 증강과 다중 순차 전방 계산 평균을 통해 성능을 향상시키며, 게이팅 퓨전은 공식 및 추가 데이터(BiliTube4k)로 학습된 모델의 예측을 학습 가능한 마스크를 통해 융합한다.

실험 결과
연구 질문
- RQ1인접 프레임보다 더 정보가 풍부한 프레임을 선택함으로써 참조 프레임 제안 전략이 기존의 다중 프레임 영상 압축 아티팩트 감소 방법의 성능을 향상시킬 수 있는가?
- RQ2FFT 기반 손실을 통한 주파수 도메인 감시가 표준 L1 손실에 비해 과도한 부드러움을 줄이고 고주파 세부 정보를 더 효과적으로 복구하는가?
- RQ3아키텍처의 깊이와 앙상블 기법(자기 앙상블, 게이팅 퓨전)이 미리 보지 않은 데이터에 대한 모델 일반화 능력과 성능을 어느 정도 향상시킬 수 있는가?
- RQ4기본적으로 제안된 RFP와 FFT 손실이 벤치마크 데이터셋에서 정밀도와 시각적 품질 측면에서 최고 수준의 방법들과 비교해 어떤가?
주요 결과
- STDF에 적용된 제안된 RFP 전략은 인접 프레임을 직접 사용하는 것보다 성능 향상이 뚜렷하게 향상된다.
- FFT 기반 손실은 과도한 부드러움을 효과적으로 줄이고 세밀한 질감 및 고주파 세부 정보를 복구하며, 그 결과는 그림 1을 통해 시각적으로 확인되었다.
- RFP와 FFT 손실을 조합하면 PSNR와 LPIPS 모두에 상당한 향상이 이루어져 상호 보완적인 이점을 입증한다.
- MFQE 2.0 데이터셋에서 가장 높은 PSNR와 LPIPS 점수를 기록하여 최고 수준의 방법들을 압도했다.
- 중량이 무거운 영상의 품질 향상 대회에서 NTIRE 2021의 트랙 1과 트랙 2에서 우수상을 수상하였고, 트랙 3에서는 2위를 기록하였다.
- 더 깊은 IQE 모듈, 자기 앙상블, 게이팅 퓨전의 활용은 성능 향상에 기여하였으며, 검증 세트에서 PSNR가 0.12 dB 향상되었다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.