Skip to main content
QUICK REVIEW

[논문 리뷰] SketchyScene: Richly-Annotated Scene Sketches

Changqing Zou, Qian Yu|arXiv (Cornell University)|2018. 08. 07.
Advanced Vision and Imaging참고 문헌 28인용 수 6
한 줄 요약

이 논문은 29,000개 이상의 장면 스케치, 11,000개의 물체 스케치, 7,000개 이상의 스케치-사진 쌍을 포함하는, 풍부한 애너테이션을 갖춘 최초의 대규모 장면 스케치 데이터셋인 SketchyScene를 소개한다. 이 데이터셋은 기준 이미지를 기반으로 드래그 앤 드롭 방식의 객체 스케치를 사용하는 새로운 군중 활용 파이프라인을 통해 제작되었으며, 고품질의 다양성 있는 장면 스케치 생성을 가능하게 한다. 주요 기여는 도메인 적응 모델을 사용하여 스케치 기반 장면 이해에 있어 최신 기술 성능을 달성하는 새로운 애플리케이션을 가능하게 한 것으로, 스케치 분할, 이미지 검색, 색상 조정, 편집, 캡셔닝 등이 포함된다.

ABSTRACT

We contribute the first large-scale dataset of scene sketches, SketchyScene, with the goal of advancing research on sketch understanding at both the object and scene level. The dataset is created through a novel and carefully designed crowdsourcing pipeline, enabling users to efficiently generate large quantities of realistic and diverse scene sketches. SketchyScene contains more than 29,000 scene-level sketches, 7,000+ pairs of scene templates and photos, and 11,000+ object sketches. All objects in the scene sketches have ground-truth semantic and instance masks. The dataset is also highly scalable and extensible, easily allowing augmenting and/or changing scene composition. We demonstrate the potential impact of SketchyScene by training new computational models for semantic segmentation of scene sketches and showing how the new dataset enables several applications including image retrieval, sketch colorization, editing, and captioning, etc. The dataset and code can be found at https://github.com/SketchyScene/SketchyScene.

연구 동기 및 목표

  • 장면 수준 및 물체 수준에서 스케치 이해를 위한 대규모이고 풍부한 애너테이션을 갖춘 데이터셋의 부족을 해결하기 위해.
  • 효율적이고 고품질의 실제적이고 다양한 장면 스케치 생성을 가능하게 하는 확장 가능한 확장 가능한 군중 활용 파이프라인 개발을 위해.
  • 통합된 애너테이션 데이터셋을 사용하여 스케치 기반 이미지 검색, 의미 분할, 색상 조정, 편집, 캡처닝 분야의 연구를 촉진하기 위해.
  • 자연 이미지 분할 모델이 스케치 데이터로 이식 가능한지 조사하고, 효과적인 사전 훈련 전략을 규명하기 위해.

제안 방법

  • 사용자가 기준 이미지를 기반으로 사전 존재하는 물체 스케치를 드래그, 드롭, 스케일링하여 장면 템플릿에 배치할 수 있도록 하는 새로운 군중 활용 인터페이스를 설계하였다.
  • 모든 장면 스케치는 45개의 일반 카테고리에 걸쳐 정확한 국소화와 레이블링을 보장하기 위해 의미적 및 인스턴스 마스크로 애너테이션 처리되었다.
  • 데이터셋은 모듈러하고 확장 가능하여, 템플릿에 물체 스케치를 교체함으로써 새로운 구성 요소를 생성하고 데이터셋을 풍부하게 만들 수 있다.
  • DeepLab-v2는 SketchyScene에서 미세 조정되어 장면 스케치의 의미 분할을 수행하였으며, ImageNet, COCO, 에지 맵을 사용한 사전 훈련 전략에 대한 분석 실험을 수행하였다.
  • InceptionV3 기반의 트리플릿 랭킹 네트워크를 훈련하여 스케치 기반 이미지 검색을 수행하였으며, 물체 카테고리 정보를 활용하기 위해 보조 시그모이드 교차 엔트로피 손실을 통합하였다.
  • 분할 결과 및 인스턴스 수준 애너테이션을 사용하여 스케치 캡처닝, 편집, 색상 조정, 동적 장면 합성 등의 애플리케이션을 구현하였다.

실험 결과

연구 질문

  • RQ1대규모이고 풍부한 애너테이션을 갖춘 장면 스케치 데이터셋은 스케치 이해 작업, 예를 들어 의미 분할 및 이미지 검색의 성능을 크게 향상시킬 수 있는가?
  • RQ2자연 이미지나 에지 맵에서 사전 훈련된 모델이 스케치 데이터에 대해 미세 조정되었을 때 얼마나 효과적인가? 어떤 사전 훈련 전략이 가장 높은 성능을 낼 수 있는가?
  • RQ3SketchyScene은 스케치 색상 조정, 편집, 동적 장면 합성와 같은 새로운 응용 분야를 얼마나 잘 지원할 수 있는가?
  • RQ4SketchyScene의 모듈러하고 물체 중심의 설계는 향후 데이터셋 확장을 위한 확장성과 유연성을 얼마나 잘 지원하는가?

주요 결과

  • 자연 이미지와 스케치 사이의 큰 도메인 갭으로 인해 ImageNet 또는 COCO에서 사전 훈련하는 것은 스케치 분할 성능 향상에 기여하지 않았다.
  • 영역 기반 마스크가 포함된 에지 맵에서의 사전 훈련도 손실 노이즈가 스케치에서 발견되지 않는 점을 감안하면, 초기 학습보다 성능 향상이 없었다.
  • 경계 픽셀만 포함된 에지 맵에서 사전 훈련(버전-3)이 가장 높은 성능을 기록하였으며, 이는 목표 스케치 도메인과 가장 유사한 형태를 반영하였다.
  • SketchyScene을 사용한 스케치 기반 이미지 검색은 랭크 1에서 32.13%의 정확도, 랭크 10에서 69.48%의 정확도를 기록하여 데이터셋의 검색 작업 유용성을 입증하였다.
  • 분할 결과 및 인스턴스 수준 애너테이션을 활용하여 스케치 캡처닝과 편집을 성공적으로 시연하였으며, '닭'을 '오리'로 교체하는 의미 기반 편집이 가능했다.
  • 의미 레이블 기반 색상 할당을 통해 자동 스케치 색상 조정을 달성하였으며, 합성 파이프라인 내에서 동적 장면 시퀀스에 걸쳐 일관된 결과를 도출하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.