Skip to main content
QUICK REVIEW

[논문 리뷰] High-Resolution Document Shadow Removal via A Large-Scale Real-World Dataset and A Frequency-Aware Shadow Erasing Net

Zinuo Li, Xuhang Chen|arXiv (Cornell University)|2023. 08. 27.
Digital Media Forensic DetectionComputer Science인용 수 3
한 줄 요약

이 논문은 7,000개의 고해상도 문서 이미지 쌍을 포함하는 대규모 실세계 데이터셋(SD7K)과 영상의 저주파 및 고주파 성분으로 분해하여 그림자 제거 성능을 향상시키는 주파수 인식 네트워크(FSENet)를 제안한다. FSENet는 트랜스포머 기반의 전역 모델링과 확장된 컨볼루션 모듈을 사용하여 세밀한 디테일을 유지하며, 고해상도 문서에서 시각적 품질과 정량적 지표 모두에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Shadows often occur when we capture the documents with casual equipment, which influences the visual quality and readability of the digital copies. Different from the algorithms for natural shadow removal, the algorithms in document shadow removal need to preserve the details of fonts and figures in high-resolution input. Previous works ignore this problem and remove the shadows via approximate attention and small datasets, which might not work in real-world situations. We handle high-resolution document shadow removal directly via a larger-scale real-world dataset and a carefully designed frequency-aware network. As for the dataset, we acquire over 7k couples of high-resolution (2462 x 3699) images of real-world document pairs with various samples under different lighting circumstances, which is 10 times larger than existing datasets. As for the design of the network, we decouple the high-resolution images in the frequency domain, where the low-frequency details and high-frequency boundaries can be effectively learned via the carefully designed network structure. Powered by our network and dataset, the proposed method clearly shows a better performance than previous methods in terms of visual quality and numerical results. The code, models, and dataset are available at: https://github.com/CXH-Research/DocShadow-SD7K

연구 동기 및 목표

  • 문서 그림자 제거를 위한 대규모 고해상도 실세계 데이터셋의 부족 문제를 해결하기 위해.
  • 고해상도 문서 이미지에서 글꼴과 그림과 같은 세밀한 디테일을 유지할 수 있는 딥러닝 모델을 개발하기 위해.
  • 기존 방법들이 저해상도 근사치나 약한 지도 학습에 의존함으로써 발생하는 아티팩트와 환각 현상을 극복하기 위해.
  • 주파수 분해 네트워크 아키텍처를 통해 다양한 조명 조건에서도 강건하고 고정밀한 그림자 제거를 가능하게 하기 위해.

제안 방법

  • 저자들은 수작업으로 그림자 마스크가 레이블링된 7,000개의 실세계 고해상도(2462×3699) 문서 이미지 쌍을 수집하여 SD7K 데이터셋을 구축한다.
  • 주파수 인식 네트워크인 FSENet는 라플라시안 피라미드 구조를 사용하여 입력 영상을 저주파 및 고주파 성분으로 분해한다.
  • 저주파 성분은 트랜스포머 기반 모듈(TRM)과 이중 특징 강화 모듈(DFE)을 통해 전역 조명 변화를 모델링한다.
  • 고주파 성분은 계단식 확장 컨볼루션 기반의 텍스처 복구 모듈(TRM)을 통해 복원되어 에지와 윤곽선과 같은 세밀한 디테일을 복구한다.
  • 저주파 및 고주파 브랜치에 대해 별도의 어텐션 메커니즘을 도입하여 도메인 특화의 특징 학습을 가능하게 한다.
  • 학습 데이터 증강 및 일반화 능력 향상을 위해 그림자 합성 파이프라인을 사용하며, 특히 소규모 벤치마크에서 효과가 뚜렷하다.

실험 결과

연구 질문

  • RQ1대규모 실세계 고해상도 데이터셋은 문서 그림자 제거 모델의 성능과 일반화 능력을 향상시키는가?
  • RQ2네트워크 아키텍처 내 주파수 분해가 고해상도 문서에서 글꼴과 그림과 같은 세밀한 디테일의 유지에 기여하는가?
  • RQ3제안된 FSENet는 기존의 지도 학습, 약한 지도 학습, 비지도 학습 방법과 비교해 시각적 품질과 정량적 지표에서 어떻게 성능을 내는가?
  • RQ4FSENet 아키텍처의 개별 구성 요소(예: TRM, DFE, DAT, 그림자 합성)가 최종 성능에 얼마나 기여하는가?

주요 결과

  • FSENet는 공개 벤치마크와 제안된 SD7K 데이터셋 모두에서 최신 기술 수준의 성능을 달성하며, PSNR, SSIM, RMSE 지표에서 기존 방법들을 능가한다.
  • 약한 지도 학습 및 비지도 학습 방법 대비 아티팩트와 환각 현상이 크게 감소하였으며, 특히 도메인 이동 조건에서 뚜렷한 개선이 관찰되었다.
  • 절단 실험 결과 라플라시안 피라미드 깊이를 증가시킬수록 성능 저하가 발생함을 확인하여, 최적의 분해 깊이는 3단계임을 시사한다.
  • DFE와 DAT 모듈의 조합이 저주파 그림자 제거 성능을 최고로 끌어올리며, TRM 모듈은 고주파 디테일 복구에 핵심적인 역할을 한다.
  • 그림자 합성 파이프라인을 제거할 경우 성능이 크게 하락하며, 특히 소규모 데이터셋에서 그 중요성이 뚜렷하게 드러난다. 이는 일반화 능력 향상에 필수적임을 확인한다.
  • 우수한 성능를 기록하지만, 높은 계산 비용과 큰 파rameter 수로 인해 엣지 디바이스에 배포하기에는 부적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.