Skip to main content
QUICK REVIEW

[논문 리뷰] Implicit Transformer Network for Screen Content Image Continuous Super-Resolution

Jingyu Yang, Sheng Shen|arXiv (Cornell University)|2021. 12. 12.
Advanced Image Processing Techniques참고 문헌 25인용 수 32
한 줄 요약

본 논문은 화면 내용 이미지의 연속 규모 초해상도를 위한 암시적 트랜스포머 기반 방법인 ITSRN을 제안하며, 특히 선명하고 고대비 콘텐츠에서 기존의 연속 및 이산 SR 방법들보다 우수하다.

ABSTRACT

Nowadays, there is an explosive growth of screen contents due to the wide application of screen sharing, remote cooperation, and online education. To match the limited terminal bandwidth, high-resolution (HR) screen contents may be downsampled and compressed. At the receiver side, the super-resolution (SR) of low-resolution (LR) screen content images (SCIs) is highly demanded by the HR display or by the users to zoom in for detail observation. However, image SR methods mostly designed for natural images do not generalize well for SCIs due to the very different image characteristics as well as the requirement of SCI browsing at arbitrary scales. To this end, we propose a novel Implicit Transformer Super-Resolution Network (ITSRN) for SCISR. For high-quality continuous SR at arbitrary ratios, pixel values at query coordinates are inferred from image features at key coordinates by the proposed implicit transformer and an implicit position encoding scheme is proposed to aggregate similar neighboring pixel values to the query one. We construct benchmark SCI1K and SCI1K-compression datasets with LR and HR SCI pairs. Extensive experiments show that the proposed ITSRN significantly outperforms several competitive continuous and discrete SR methods for both compressed and uncompressed SCIs.

연구 동기 및 목표

  • 텍스트와 그래픽이 우세한 화면 콘텐츠(SCI)에 대해 임의의 배율 인자도 처리 가능한 고품질 SCI SR를 고안하고 촉진한다.
  • 샤프한 엣지와 높은 대비로 인해 자연 이미지 SR 방법이 SCI에 일반화되지 않는 문제를 해결한다.
  • 좌표(픽셀 값뿐만 아니라)를 활용하여 고충실도 SCI 결과를 렌더링하는 연속 규모 SR 프레임워크를 개발한다.
  • 다른 저하 조건에서 SCI SR 방법을 평가하기 위해 SCI1K 및 SCI1K-압축 벤치마크를 만든다.

제안 방법

  • 해상도 높은 공간의 쿼리 좌표를 저해상도 공간의 키 좌표 및 특징으로 매핑하여 픽셀 값을 생성하는 암시적 트랜스포머를 도입한다.
  • 좌표 차이와 스케일 토큰의 비선형 매핑을 통해 변환 가중치를 예측하여 좌표-값 학습을 가능하게 한다.
  • 유사한 이웃 픽셀 값을 통합하고 예측을 다듬기 위해 암시적 위치 인코딩으로 모델을 보강한다.
  • 특징 추출을 위해 CNN 백본(RDN 기반)을 사용하고, 특징 전개를 통해 수용 영역을 확장하며, 변환 가중치를 계산하는 MLP를 사용한다.
  • 학습 안정화 및 연속 확대를 가능하게 하려 좌표를 [-1,1] 범위로 정규화한다.
  • 코어스 SR 출력을 다듬기 위해 MLP로 학습된 로컬 3x3 이웃 인코딩(암시적 위치 인코딩)을 도입한다.

실험 결과

연구 질문

  • RQ1좌표에서 작동하는 암시적 트랜스포너가 화면 콘텐츠 이미지에서 기존의 연속 SR 방법(LIIF, MetaSR)을 능가할 수 있는가?
  • RQ2암시적 위치 인코딩의 도입이 임의의 배율에 걸친 SCI SR에서 엣지 보존과 엣지 선명도를 향상시키는가?
  • RQ3스케일 토큰과 IPE가 학습 중 및 학습 외 확대 요인에서 성능에 어떤 영향을 미치는가?
  • RQ4압축 및 비압축 SCI 데이터에서 암시적 위치 인코딩의 학습 가능한 이웃 가중치 대 고정 가중치 사용이 어떤 영향을 미치는가?

주요 결과

  • ITSRN은 다수의 배율에서 SCI1K 및 SCI1K-압축에서 지속적으로 연속 SR 방법(MetaSR, LIIF)과 이산 SR 기준(RDN, RCAN)을 능가한다.
  • 선별적 제거 실험으로 스케일 토큰과 암시적 위치 인코딩이 상당한 이득을 가져다주며( x4에서 약 0.39 dB PSNR; 학습 외 배율에서 0.06 dB ).
  • 암시적 위치 인코딩의 학습 가능한 가중치가 고정 거리보다 더 우수하며 특히 JPEG-압축 입력에서 두드러진다.
  • 다양한 스케일 범위로 학습하면 큰 확대 비율(x6–x10)에서 성능이 향상된다.
  • ITSRN은 얇은 문자에서 특히 고배율에서의 엣지 재구성이 경쟁 방법에 비해 더 우수하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.