[논문 리뷰] Explainable Machine Learning based Transform Coding for High Efficiency Intra Prediction
이 논문은 고효율 인트라 비디오 코딩을 위한 설명 가능 기계학습 기반 변환 코딩 프레임워크를 제안한다. 하위공간 근사법에 조정된 편향(Saab) 변환을 사용하며, 변환 설계를 에너지 압축 최적화 문제로 공식화하고, rate-distortion optimization(RDO)과 Saab 변환을 통합함으로써 기존 DCT 기반 코딩 대비 최대 10.00%의 비트레이트 감소를 달성한다. 테스트 시퀀스 전반에 걸쳐 평균 BDBR 향상은 -3.07%이다.
Machine learning techniques provide a chance to explore the coding performance potential of transform. In this work, we propose an explainable transform based intra video coding to improve the coding efficiency. Firstly, we model machine learning based transform design as an optimization problem of maximizing the energy compaction or decorrelation capability. The explainable machine learning based transform, i.e., Subspace Approximation with Adjusted Bias (Saab) transform, is analyzed and compared with the mainstream Discrete Cosine Transform (DCT) on their energy compaction and decorrelation capabilities. Secondly, we propose a Saab transform based intra video coding framework with off-line Saab transform learning. Meanwhile, intra mode dependent Saab transform is developed. Then, Rate Distortion (RD) gain of Saab transform based intra video coding is theoretically and experimentally analyzed in detail. Finally, three strategies on integrating the Saab transform and DCT in intra video coding are developed to improve the coding efficiency. Experimental results demonstrate that the proposed 8$ imes$8 Saab transform based intra video coding can achieve Bjønteggard Delta Bit Rate (BDBR) from -1.19% to -10.00% and -3.07% on average as compared with the mainstream 8$ imes$8 DCT based coding scheme.
연구 동기 및 목표
- 고정된 변환 방식인 DCT를 데이터 기반, 설명 가능한 기계학습 기반 변환으로 대체하여 영상 코딩 효율을 향상시키기.
- 다양한 인트라 예측 모드에서 영상 잔차의 다양한 통계적 특성을 포괄하지 못하는 기존 변환의 한계를 해결하기.
- 낮은 계산 및 메모리 오버헤드를 유지하면서도 상당한 레이트-왜곡(RD) 이득을 가능하게 하는 실용적이고 설명 가능한 변환 프레임워크 개발.
- 이론적 및 실험적 평가를 통해 Saab 변환의 성능을 분석하고 정량화하기.
- 최적의 RD 성능을 달성하기 위해 Saab 및 DCT 변환을 효과적으로 통합하는 전략 설계.
제안 방법
- 기계학습 기반 변환 설계를 에너지 압축과 분산 최소화를 극대화하는 최적화 문제로 공식화하고, 핵심 방법으로 하위공간 근사법에 조정된 편향(Saab) 변환을 사용.
- 사전 학습된 Saab 변환 커널을 사용하여 오프라인으로 Saab 변환 학습 프레임워크를 개발하며, 이를 인코딩 시 사용하기 위해 저장.
- 인트라 예측 모드 기반 Saab 변환을 도입하여, 잔차 특성에 맞게 각 모드에 맞는 다른 변환 커널을 선택.
- 각 블록에 대해 DCT와 Saab 변환 간의 RD 비용을 최소화하기 위해 비용-왜곡 최적화(Rate-Distortion Optimization, RDO)를 적용.
- Saab 및 DCT 변환을 통합하는 데 세 가지 전략(sI, sII, sIII)을 제안하며, sIII는 모드 기반 Saab 선택과 RDO 기반 결정을 사용.
- 양자화에 대한 성능에 대한 탄력성을 평가하기 위해 변환 계산에서 정밀도가 다른 부동소수점 산술(2~5자리)을 사용.
실험 결과
연구 질문
- RQ1설명 가능한 기계학습 기반 변환인 Saab가 영상 잔차 코딩에서 에너지 압축 및 분산 최소화 측면에서 표준 DCT를 능가할 수 있는가?
- RQ2Saab 변환의 성능은 다양한 인트라 예측 모드와 비디오 콘텐츠 유형 간에 어떻게 달라지는가?
- RQ3인트라 코딩에서 RD 이득을 극대화하기 위해 Saab 및 DCT 변환 간 최적의 통합 전략은 무엇인가?
- RQ4Saab 변환의 성능은 변환 계산에서 부동소수점 표현의 정밀도에 얼마나 민감한가?
- RQ5모드 기반 Saab 변환을 사용할 경우 단일 전역 변환 대비 코딩 효율이 얼마나 향상되는가?
주요 결과
- 제안된 8×8 Saab 변환은 DCT 기반 코딩 대비 Bjønset Delta Bit Rate(BDBR) 향상이 -1.19%에서 -10.00%이며, 테스트 시퀀스 전반에 걸쳐 평균 -3.07% 향상.
- QP=37일 때 'BasketballDrillText' 및 'RaceHorses' 시퀀스에서 80% 이상의 8×8 블록이 DCT 대비 최적의 선택으로 Saab 변환을 선택하여 잔차 특성에 대한 강력한 적응성 입증.
- 모든 QP에서 Saab 변환 사용 비율은 평균 46.05%이며, QP=37일 때 'BasketballDrillText'에서 최고 90.34% 기록.
- 부동소수점 정밀도를 3에서 5자리로 감소시켜도 비트레이트 절감 효과에 거의 영향을 주지 않아, 정밀도 감소에 대해 뛰어난 탄력성 확보.
- 모드 기반 Saab 선택과 RDO 기반 결정을 사용하는 통합 전략 sIII가 가장 우수한 종합 RD 성능을 보이며, DCT 및 단일 변환 기반 Saab 방식을 모두 초월.
- 특히 방향성 또는 복잡한 무늬 영역에서 DCT에 비해 Saab 변환이 뛰어난 에너지 압축 및 분산 최소화 능력을 보임.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.