[논문 리뷰] PERT: A Progressively Region-based Network for Scene Text Removal
PERT는 영역 기반의 점진적 네트워크를 제안하여 장면 텍스트 제거를 위해 영역 기반 수정 전략(RegionMS)과 공유 파rameter를 활용한 균형 잡힌 다단계 제거를 통해 명시적 제거 가이던스를 도입한다. 오직 텍스트 영역에 집중하고 각 단계에서 동일한 진전을 보장함으로써, PERT는 71 FPS의 추론 속도와 이전 방법보다 최소 25% 낮은 파라미터 복잡도로 SOTA 성능(39.40 PSNR)을 달성하며, 적대적 훈련 없이도 성능을 유지한다.
Scene text removal (STR) contains two processes: text localization and background reconstruction. Through integrating both processes into a single network, previous methods provide an implicit erasure guidance by modifying all pixels in the entire image. However, there exists two problems: 1) the implicit erasure guidance causes the excessive erasure to non-text areas; 2) the one-stage erasure lacks the exhaustive removal of text region. In this paper, we propose a ProgrEssively Region-based scene Text eraser (PERT), introducing an explicit erasure guidance and performing balanced multi-stage erasure for accurate and exhaustive text removal. Firstly, we introduce a new region-based modification strategy (RegionMS) to explicitly guide the erasure process. Different from previous implicitly guided methods, RegionMS performs targeted and regional erasure on only text region, and adaptively perceives stroke-level information to improve the integrity of non-text areas with only bounding box level annotations. Secondly, PERT performs balanced multi-stage erasure with several progressive erasing stages. Each erasing stage takes an equal step toward the text-erased image to ensure the exhaustive erasure of text regions. Compared with previous methods, PERT outperforms them by a large margin without the need of adversarial loss, obtaining SOTA results with high speed (71 FPS) and at least 25% lower parameter complexity. Code is available at https://github.com/wangyuxin87/PERT.
연구 동기 및 목표
- 암묵적인 전역 제거 가이던스로 인해 비텍스트 영역이 불필요하게 수정되는 과도한 제거 문제를 해결하기 위해.
- 일단 단계 또는 비균형적인 다단계 제거 후 잔류하는 텍스트 흔적들이 남는 완전한 제거가 불가능한 문제를 해결하기 위해.
- 오직 바운딩 박스 수준의 애너테이션만을 사용하여 영역별로 명시적인 제거 가이던스를 도입함으로써 복구 품질과 효율성을 향상시키기 위해.
- 공유 파라미터와 최종 제거 이미지 향한 동일 단계의 진행을 통해 다단계 제거 과정에서 균형 잡힌 학습을 달성하기 위해.
- 적대적 손실이 필요 없이도 높은 성능을 유지하면서 실시간 추론을 가능하게 하기 위해.
제안 방법
- 예측된 텍스트 영역에만 영향을 주는 영역 기반 수정 전략(RegionMS)을 제안하여 배경 복구 네트워크(BRN)가 명시적으로 텍스트 영역만 수정하도록 유도함으로써 비텍스트 영역의 의도치 않은 변경을 줄인다.
- 텍스트 로컬라이제이션과 배경 복구를 다단계 제거 블록 간에 경량화된 공유 아키텍처 설계로 분리한다.
- 모든 제거 블록 간에 파라미터를 공유하고 최종 출력에만 감독함으로써 균형 잡힌 다단계 제거를 구현하여 각 단계가 최종 제거 이미지에 동일한 기여를 하도록 보장한다.
- 지역적 및 전역적 지각 유사성을 모두 고려함으로써 특징 일관성과 시각적 품질을 향상시키기 위해 영역-전역 유사도 손실(RG loss)을 도입한다.
- 피그먼트 수준의 마스크가 필요 없이 오직 바운딩 박스 수준의 애너테이션만을 사용하여 모델을 훈련함으로써 텍스트 로컬라이제이션 네트워크(TLN)에서 스트로크 수준의 인식을 가능하게 한다.
- 각 단계가 최종 제거 이미지 향해 작은 균형 잡힌 단계를 밟는 점진적 정밀화 전략을 적용하여 복잡하거나 고밀도 텍스트의 완전한 제거를 가능하게 한다.
실험 결과
연구 질문
- RQ1예측된 텍스트 영역 기반의 명시적 제거 가이던스가 장면 텍스트 제거에서 비텍스트 영역의 의도치 않은 수정을 줄일 수 있는가?
- RQ2공유 파라미터를 활용한 균형 잡힌 다단계 제거가 모델 효율성을 유지하면서도 완전한 텍스트 제거를 향상시킬 수 있는가?
- RQ3영역별 및 점진적 제거를 활용하여 적대적 훈련 없이도 고품질 복구를 달성할 수 있는가?
- RQ4피그먼트 수준의 감독이 필요한 방법과 비교해 복구 정밀도 측면에서 오직 바운딩 박스 애너테이션만을 사용하는 명시적 가이던스의 성능은 어떻게 되는가?
- RQ5다양한 단계 간의 파라미터 공유와 동일 단계의 진행 방식이 비균형적인 다단계 접근 방식에 비해 수렴성과 성능 향상에 얼마나 기여하는가?
주요 결과
- PERT는 SCUT-EnsText 데이터셋에서 SOTA 성능인 39.40 PSNR를 달성하여 이전 방법들인 EraseNet(38.32)과 MTRNet++(34.55)을 크게 앞서간다.
- 71 FPS의 실시간 추론 속도를 확보하여 실용적 구현에 적합한 높은 효율성을 보여준다.
- 14.0M의 파라미터만을 사용함으로써 MTRNet++(18.7M)과 EraseNet(19.7M)과 같은 이전의 다단계 방법들보다 최소 25% 낮은 모델 복잡도를 달성한다.
- 적대적 손실이 있는 기준 모델 대비 더 적은 에포크(80 vs. 120) 동안 더 빠르게 수렴하고 더 높은 성능(33.24 PSNR vs. 31.86)을 달성한다.
- Region-Global Similarity Loss는 지역적 세부 사항과 전역 일관성을 균형 있게 유지함으로써 복구 결과의 지각 품질을 향상시킨다.
- 정량적 및 정성적 분석을 통해 과도한 제거(예: 비텍스트 영역의 텍스처 왜곡)와 완전하지 못한 제거(예: 잔류하는 텍스트 흔적) 문제를 효과적으로 완화함을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.