Skip to main content
QUICK REVIEW

[논문 리뷰] PERT: A Progressively Region-based Network for Scene Text Removal

Yuxin Wang, Hongtao Xie|arXiv (Cornell University)|2021. 06. 24.
Handwritten Text Recognition Techniques참고 문헌 35인용 수 6
한 줄 요약

PERT는 영역 기반의 점진적 네트워크를 제안하여 장면 텍스트 제거를 위해 영역 기반 수정 전략(RegionMS)과 공유 파rameter를 활용한 균형 잡힌 다단계 제거를 통해 명시적 제거 가이던스를 도입한다. 오직 텍스트 영역에 집중하고 각 단계에서 동일한 진전을 보장함으로써, PERT는 71 FPS의 추론 속도와 이전 방법보다 최소 25% 낮은 파라미터 복잡도로 SOTA 성능(39.40 PSNR)을 달성하며, 적대적 훈련 없이도 성능을 유지한다.

ABSTRACT

Scene text removal (STR) contains two processes: text localization and background reconstruction. Through integrating both processes into a single network, previous methods provide an implicit erasure guidance by modifying all pixels in the entire image. However, there exists two problems: 1) the implicit erasure guidance causes the excessive erasure to non-text areas; 2) the one-stage erasure lacks the exhaustive removal of text region. In this paper, we propose a ProgrEssively Region-based scene Text eraser (PERT), introducing an explicit erasure guidance and performing balanced multi-stage erasure for accurate and exhaustive text removal. Firstly, we introduce a new region-based modification strategy (RegionMS) to explicitly guide the erasure process. Different from previous implicitly guided methods, RegionMS performs targeted and regional erasure on only text region, and adaptively perceives stroke-level information to improve the integrity of non-text areas with only bounding box level annotations. Secondly, PERT performs balanced multi-stage erasure with several progressive erasing stages. Each erasing stage takes an equal step toward the text-erased image to ensure the exhaustive erasure of text regions. Compared with previous methods, PERT outperforms them by a large margin without the need of adversarial loss, obtaining SOTA results with high speed (71 FPS) and at least 25% lower parameter complexity. Code is available at https://github.com/wangyuxin87/PERT.

연구 동기 및 목표

  • 암묵적인 전역 제거 가이던스로 인해 비텍스트 영역이 불필요하게 수정되는 과도한 제거 문제를 해결하기 위해.
  • 일단 단계 또는 비균형적인 다단계 제거 후 잔류하는 텍스트 흔적들이 남는 완전한 제거가 불가능한 문제를 해결하기 위해.
  • 오직 바운딩 박스 수준의 애너테이션만을 사용하여 영역별로 명시적인 제거 가이던스를 도입함으로써 복구 품질과 효율성을 향상시키기 위해.
  • 공유 파라미터와 최종 제거 이미지 향한 동일 단계의 진행을 통해 다단계 제거 과정에서 균형 잡힌 학습을 달성하기 위해.
  • 적대적 손실이 필요 없이도 높은 성능을 유지하면서 실시간 추론을 가능하게 하기 위해.

제안 방법

  • 예측된 텍스트 영역에만 영향을 주는 영역 기반 수정 전략(RegionMS)을 제안하여 배경 복구 네트워크(BRN)가 명시적으로 텍스트 영역만 수정하도록 유도함으로써 비텍스트 영역의 의도치 않은 변경을 줄인다.
  • 텍스트 로컬라이제이션과 배경 복구를 다단계 제거 블록 간에 경량화된 공유 아키텍처 설계로 분리한다.
  • 모든 제거 블록 간에 파라미터를 공유하고 최종 출력에만 감독함으로써 균형 잡힌 다단계 제거를 구현하여 각 단계가 최종 제거 이미지에 동일한 기여를 하도록 보장한다.
  • 지역적 및 전역적 지각 유사성을 모두 고려함으로써 특징 일관성과 시각적 품질을 향상시키기 위해 영역-전역 유사도 손실(RG loss)을 도입한다.
  • 피그먼트 수준의 마스크가 필요 없이 오직 바운딩 박스 수준의 애너테이션만을 사용하여 모델을 훈련함으로써 텍스트 로컬라이제이션 네트워크(TLN)에서 스트로크 수준의 인식을 가능하게 한다.
  • 각 단계가 최종 제거 이미지 향해 작은 균형 잡힌 단계를 밟는 점진적 정밀화 전략을 적용하여 복잡하거나 고밀도 텍스트의 완전한 제거를 가능하게 한다.

실험 결과

연구 질문

  • RQ1예측된 텍스트 영역 기반의 명시적 제거 가이던스가 장면 텍스트 제거에서 비텍스트 영역의 의도치 않은 수정을 줄일 수 있는가?
  • RQ2공유 파라미터를 활용한 균형 잡힌 다단계 제거가 모델 효율성을 유지하면서도 완전한 텍스트 제거를 향상시킬 수 있는가?
  • RQ3영역별 및 점진적 제거를 활용하여 적대적 훈련 없이도 고품질 복구를 달성할 수 있는가?
  • RQ4피그먼트 수준의 감독이 필요한 방법과 비교해 복구 정밀도 측면에서 오직 바운딩 박스 애너테이션만을 사용하는 명시적 가이던스의 성능은 어떻게 되는가?
  • RQ5다양한 단계 간의 파라미터 공유와 동일 단계의 진행 방식이 비균형적인 다단계 접근 방식에 비해 수렴성과 성능 향상에 얼마나 기여하는가?

주요 결과

  • PERT는 SCUT-EnsText 데이터셋에서 SOTA 성능인 39.40 PSNR를 달성하여 이전 방법들인 EraseNet(38.32)과 MTRNet++(34.55)을 크게 앞서간다.
  • 71 FPS의 실시간 추론 속도를 확보하여 실용적 구현에 적합한 높은 효율성을 보여준다.
  • 14.0M의 파라미터만을 사용함으로써 MTRNet++(18.7M)과 EraseNet(19.7M)과 같은 이전의 다단계 방법들보다 최소 25% 낮은 모델 복잡도를 달성한다.
  • 적대적 손실이 있는 기준 모델 대비 더 적은 에포크(80 vs. 120) 동안 더 빠르게 수렴하고 더 높은 성능(33.24 PSNR vs. 31.86)을 달성한다.
  • Region-Global Similarity Loss는 지역적 세부 사항과 전역 일관성을 균형 있게 유지함으로써 복구 결과의 지각 품질을 향상시킨다.
  • 정량적 및 정성적 분석을 통해 과도한 제거(예: 비텍스트 영역의 텍스처 왜곡)와 완전하지 못한 제거(예: 잔류하는 텍스트 흔적) 문제를 효과적으로 완화함을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.