[논문 리뷰] A Convolutional Neural Network-Based Low Complexity Filter
이 논문은 깊이 분리 가능 합성곱(DSC)과 배치 정규화(BN)를 사용하여 계산 복잡도를 감소시키는 경량 합성곱 신경망(CNN)-기반 인라인 필터를 제안한다. 상호 프레임에서의 과도한 부드럽게 처리 문제를 완화하고 일반화 성능을 향상시키기 위해 새로운 프레임 수준 잔차 매핑(RM) 모듈을 도입하였다. 이로 인해 HEVC 및 VVC 기준에서 강력한 성능을 유지하면서 VR-CNN 대비 1.2% BD-rate 감소 및 79.1% 적은 FLOPs를 달성하였다.
Convolutional Neural Network (CNN)-based filters have achieved significant performance in video artifacts reduction. However, the high complexity of existing methods makes it difficult to be applied in real usage. In this paper, a CNN-based low complexity filter is proposed. We utilize depth separable convolution (DSC) merged with the batch normalization (BN) as the backbone of our proposed CNN-based network. Besides, a weight initialization method is proposed to enhance the training performance. To solve the well known over smoothing problem for the inter frames, a frame-level residual mapping (RM) is presented. We analyze some of the mainstream methods like frame-level and block-level based filters quantitatively and build our CNN-based filter with frame-level control to avoid the extra complexity and artificial boundaries caused by block-level control. In addition, a novel module called RM is designed to restore the distortion from the learned residuals. As a result, we can effectively improve the generalization ability of the learning-based filter and reach an adaptive filtering effect. Moreover, this module is flexible and can be combined with other learning-based filters. The experimental results show that our proposed method achieves significant BD-rate reduction than H.265/HEVC. It achieves about 1.2% BD-rate reduction and 79.1% decrease in FLOPs than VR-CNN. Finally, the measurement on H.266/VVC and ablation studies are also conducted to ensure the effectiveness of the proposed method.
연구 동기 및 목표
- 기존의 학습 기반 인라인 필터가 가지는 높은 계산 복잡도 문제를 해결하기 위해.
- 성능을 훼손하지 않고 모델 복잡도를 감소시켜 자원 제약이 있는 플랫폼에의 구현을 가능하게 하기 위해.
- 잔차가 최소한인 블록에 대한 반복적 필터링으로 인해 발생하는 상호 프레임에서의 과도한 부드럽게 처리 문제를 해결하기 위해.
- 통합된, 가벼운 아키텍처를 통해 내부 및 상호 프레임 간의 학습 기반 필터의 일반화 성능을 향상시키기 위해.
- H.266/VVC와 같은 기존 비디오 인코딩 표준과의 호환성을 확보하기 위해 효율적인 통합을 가능하게 하기 위해.
제안 방법
- 제안된 필터의 핵심은 깊이 분리 가능 합성곱(DSC)과 배치 정규화(BN)를 융합하여 FLOPs와 모델 크기를 감소시키는 것이다.
- 학습된 잔차에서 왜곡을 복원하기 위해 새로운 프레임 수준의 잔차 매핑(RM) 모듈을 도입하여 상호 프레임에서의 일반화 성능 향상과 과도한 부드럽게 처리 감소를 달성한다.
- 수렴 속도 향상과 학습 안정성 향상을 위해 주의 분포 전달(attention transfer, AT)을 통한 지식 증류를 사용하여 파라미터 초기화를 수행한다.
- 동일한 네트워크를 내부 및 상호 프레임 모두에 적용하여 별도의 모델이 필요 없도록 하여 저장 공간 부담을 줄였다.
- 모델은 전체 DIV2K 데이터셋으로 훈련되었고, H.266/VVC 호환성을 확보하기 위해 VTM-6.3 기반으로 평가되었다.
- 제거 분석을 통해 RM과 파라미터 초기화의 효과가 HEVC 및 VVC 테스트 시퀀스에서 입증되었다.
실험 결과
연구 질문
- RQ1VR-CNN과 같은 기존 방법 대비 상당히 감소된 FLOPs를 확보하면서도 경쟁적인 BD-rate 성능을 달성할 수 있는 경량 CNN 기반 인라인 필터는 가능한가?
- RQ2제안된 프레임 수준의 잔차 매핑(RM) 모듈은 상호 프레임에서의 과도한 부드럽게 처리를 줄이고 일반화 성능을 향상시키는 데 얼마나 효과적인가?
- RQ3주의 분포 전달을 통한 지식 증류는 학습 성능 향상과 수렴 속도 향상에 어느 정도 기여하는가?
- RQ4단일 통합 네트워크가 성능 저하 없이 내부 및 상호 프레임을 모두 효과적으로 처리할 수 있는가?
- RQ5최신 H.266/VVC 표준에서 HEVC 벤치마크 대비 제안된 필터는 어떤 성능을 보이는가?
주요 결과
- 제안된 방법은 HEVC 테스트 시퀀스에서 VR-CNN 기준선 대비 약 1.2% BD-rate 감소 및 FLOPs 79.1% 감소를 달성하였다.
- H.266/VVC 기준에서는 AI 설정 시 라이트성 성분에서 약 1.6% BD-rate 감소, RA 설정에서는 1.5% 감소를 기록하였다.
- RM 모듈은 테스트 시퀀스 전반에서 평균 0.8%의 BD-rate 향상을 이끌었으며, ClassC 시퀀스에서는 최대 1.9% 향상까지 기록하였다.
- 주의 분포 전달(AT)을 통한 파라미터 초기화는 기준선 학생 모델 대비 색채성 성분(V)에서 PSNR을 0.328 dB, 라이트성(Y)에서 0.329 dB 향상시켰다.
- 제거 분석 결과 RM 모듈이 고도로 무늬가 복잡한 시퀀스에서 특히 상호 프레임 성능 향상에 뚜렷한 기여를 한다는 것이 확인되었다.
- 모델은 인코딩 복잡도에 거의 영향을 주지 않으며, 디코딩 복잡도는 약 3배 증가할 뿐이므로 실세계 구현에 실용적이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.