Skip to main content
QUICK REVIEW

[논문 리뷰] TOM-Net: Learning Transparent Object Matting from a Single Image

Guanying Chen, Kai Han|arXiv (Cornell University)|2018. 03. 13.
Image Enhancement Techniques참고 문헌 19인용 수 8
한 줄 요약

TOM-Net는 다중 척도 인코더-디코더 네트워크와 잔차 보정 네트워크를 통해 단일 이미지에서 객체 마스크, 감쇠 마스크, 굴절 흐름 필드를 동시에 예측함으로써 투명 물체 마스킹을 추정하는 딥러닝 프레임워크이다. 이는 대규모 합성 데이터셋과 실세계 벤치마크에서 최신 기술 수준의 성능을 달성하며, 단일 프로세싱 패스 내에서 강건한 일반화 능력과 현실적인 복합 효과를 보여준다.

ABSTRACT

This paper addresses the problem of transparent object matting. Existing image matting approaches for transparent objects often require tedious capturing procedures and long processing time, which limit their practical use. In this paper, we first formulate transparent object matting as a refractive flow estimation problem. We then propose a deep learning framework, called TOM-Net, for learning the refractive flow. Our framework comprises two parts, namely a multi-scale encoder-decoder network for producing a coarse prediction, and a residual network for refinement. At test time, TOM-Net takes a single image as input, and outputs a matte (consisting of an object mask, an attenuation mask and a refractive flow field) in a fast feed-forward pass. As no off-the-shelf dataset is available for transparent object matting, we create a large-scale synthetic dataset consisting of 158K images of transparent objects rendered in front of images sampled from the Microsoft COCO dataset. We also collect a real dataset consisting of 876 samples using 14 transparent objects and 60 background images. Promising experimental results have been achieved on both synthetic and real data, which clearly demonstrate the effectiveness of our approach.

연구 동기 및 목표

  • 복잡한 빛 굴절 효과로 인해 매우 불안정한 문제이기 때문에 단일 이미지에서 투명 물체 마스킹을 해결하는 것.
  • 다중 이미지나 전용 하드웨어 없이도 환경 마스킹(객체 마스크, 감쇠 마스크, 굴절 흐름 필드 포함)을 추정할 수 있는 딥러닝 프레임워크 개발.
  • 투명 물체 마스킹을 위한 벤치마크로 사용할 수 있는 대규모 합성 데이터셋과 실세계 데이터셋 구축.
  • 이미지 편집 및 영화 제작 분야에서 실용적으로 적용 가능한 빠른 프리패스 추론을 가능하게 하는 것.

제안 방법

  • 단일 입력 이미지에서 빛 굴절 효과를 모델링하기 위해 투명 물체 마스킹을 굴절 흐름 추정 문제로 재정의.
  • 두 단계 아키텍처인 다중 척도 인코더-디코더를 통한 거친 예측과 잔차 네트워크를 통한 보정을 갖춘 TOM-Net 설계.
  • COCO 배경 앞에 렌더링된 투명 물체를 포함한 178,000장의 합성 이미지 데이터셋을 사용해 네트워크를 엔드 투 엔드로 훈련.
  • 14종의 투명 물체와 60장의 배경 이미지를 활용해 수집한 876개 샘플의 실세계 데이터셋을 활용해 일반화 능력 평가.
  • 구조적 정확성과 시각적 현실감을 유지하기 위해 L1 손실과 시각적 손실의 조합을 최적화에 활용.
  • 단일 프로세싱 패스 내에서 완전한 마스크를 생성하여 새로운 배경에 물체를 복합할 수 있도록 추론 기능 제공.

실험 결과

연구 질문

  • RQ1딥 네트워크는 단일 투명 물체 이미지에서 환경 마스킹을 정확하게 추정할 수 있는가?
  • RQ2다중 이미지나 특수 패턴이 필요 없이 투명 물체 마스킹을 굴절 흐름 추정 문제로 모델링하는 것이 가능한가?
  • RQ3합성 데이터셋으로 훈련된 모델은 실세계의 투명 물체에 대해 얼마나 잘 일반화되는가?
  • RQ4예측된 마스크를 사용해 새로운 배경에 물체를 복합했을 때 시각적으로 현실감 있는 결과를 낼 수 있는가?

주요 결과

  • 합성 데이터셋에서 TOM-Net는 유리 카테고리에 대해 PSNR 27.6과 SSIM 0.95를 기록하여 마스크 예측의 높은 정밀도를 입증했다.
  • 실세계 데이터에서 평균 PSNR는 21.84, SSIM는 0.890이었으며, 복잡한 형태일수록 투명 기저와 날카로운 에지로 인해 성능 저하가 발생했다.
  • 사용자 연구 결과, 1,380개의 복합 이미지 중 827개가 실제 사진과 구분되지 않아 강력한 시각적 현실감을 입증했다.
  • 단일 물체 샘플로 훈련된 TOM-Net는 다중 투명 물체 이미지에 대해서도 잘 일반화되어 있어 강건성과 전이 능력을 입증했다.
  • 정확한 굴절 흐름 추정을 통해 모델은 현실적인 굴절 효과를 성공적으로 생성했으며, 새로운 배경에 대한 고품질 복합 편집을 가능케 했다.
  • 제안된 합성 데이터셋과 실세계 데이터셋은 향후 투명 물체 마스킹 분야의 연구를 위한 유효한 벤치마크로 기능한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.