[논문 리뷰] Generating Embroidery Patterns Using Image-to-Image Translation
이 논문은 사용자가 업로드한 2차원 이미지에서 실시간으로 현실적인 자수 버전 미리보기를 생성하기 위해 딥러닝 기반의 두 가지 방법—split style transfer와 EmbGAN—을 제안한다. 신경망 스타일 전이와 사이클-일致 GAN을 수정함으로써, 쌍화된 훈련 데이터나 자수 전용 속성에 대한 지식 없이도 시각적으로 정확한 자수 시뮬레이션을 생성한다. EmbGAN은 터커 선호도 테스트에서 기준 모델 대비 91.5%의 선호도를 기록하며 인간 평가에서 우수한 성능을 보였다.
In many scenarios in computer vision, machine learning, and computer graphics, there is a requirement to learn the mapping from an image of one domain to an image of another domain, called Image-to-image translation. For example, style transfer, object transfiguration, visually altering the appearance of weather conditions in an image, changing the appearance of a day image into a night image or vice versa, photo enhancement, to name a few. In this paper, we propose two machine learning techniques to solve the embroidery image-to-image translation. Our goal is to generate a preview image which looks similar to an embroidered image, from a user-uploaded image. Our techniques are modifications of two existing techniques, neural style transfer, and cycle-consistent generative-adversarial network. Neural style transfer renders the semantic content of an image from one domain in the style of a different image in another domain, whereas a cycle-consistent generative adversarial network learns the mapping from an input image to output image without any paired training data, and also learn a loss function to train this mapping. Furthermore, the techniques we propose are independent of any embroidery attributes, such as elevation of the image, light-source, start, and endpoints of a stitch, type of stitch used, fabric type, etc. Given the user image, our techniques can generate a preview image which looks similar to an embroidered image. We train and test our propose techniques on an embroidery dataset which consist of simple 2D images. To do so, we prepare an unpaired embroidery dataset with more than 8000 user-uploaded images along with embroidered images. Empirical results show that these techniques successfully generate an approximate preview of an embroidered version of a user image, which can help users in decision making.
연구 동기 및 목표
- 패션 맞춤 제작에서 맞춤형 자수를 위한 자동화되고 실시간 가능한 미리보기 시스템의 부족을 해결하기 위해.
- 쌍화된 훈련 데이터나 자수 전용 메타데이터에 의존하지 않고 사용자가 업로드한 2차원 이미지의 시각적으로 현실적인 자수 버전을 생성하기 위해.
- 정확한 미리보기 시뮬레이션을 제공함으로써 의복 맞춤 제작에서 고객의 결정보다 향상시키기 위해.
- 생성된 자수 스타일 이미지의 정성 평가를 실제 디지털화된 버전과 비교하기 위해.
- 스티치 유형, 원단, 조명, 고도와 같은 요소에 의존하지 않는 방법을 개발하여 광범위한 적용 가능성을 확보하기 위해.
제안 방법
- 입력 이미지를 색상 기반으로 하위 이미지로 분할하고 각 영역에 별도의 자수 스타일을 적용하여 현실감을 향상시키기 위해 신경망 스타일 전이를 수정하였다.
- 사이클-일치 손실을 사용하여 자연 이미지와 자수 출력 간의 쌍화되지 않은 이미지 간 번역을 학습하기 위해 CycleGAN 프레임워크를 EmbGAN로 수정하였다.
- 8,000개 이상의 사용자 업로드 이미지와 수작업으로 디지털화된 자수 버전으로 구성된 쌍화되지 않은 데이터셋을 사용해 모델을 훈련시켰다.
- Amazon Mechanical Turk를 통한 정성 평가를 통해 생성된 이미지가 실제 이미지 및 기준 모델과 비교하여 평가되었다.
- 정형적이고 의미적인 콘텐츠를 번역 과정에서 유지하기 위해 조건부 적대적 프레임워크에 정체성 손실와 사이클 일관성 손실를 적용하였다.
- 스플릿 스타일 전이에서 색상 영역 별로 다수의 자수 스타일 이미지를 통합하여 스티치의 다양성과 질감을 시뮬레이션하였다.
실험 결과
연구 질문
- RQ1수정된 신경망 스타일 전이 방법이 표준 스타일 전이보다 더 현실적인 자수 스타일 미리보기를 생성할 수 있는가?
- RQ2쌍화되지 않은 이미지 간 번역 모델인 CycleGAN이 고해상도 자수 미리보기 생성에 효과적으로 적용될 수 있는가?
- RQ3제안된 EmbGAN 모델의 성능이 시각적 현실성 측면에서 표준 CycleGAN 및 스플릿 스타일 전이와 비교해 어떻게 다른가?
- RQ4인간 평가자가 생성된 자수 미리보기 결과를 기준 모델보다 얼마나 선호하는가?
- RQ5색상 기반으로 이미지를 분할하고 영역별 스타일 전이를 적용하는 것이 최종 자수 출력의 진정성 인식을 향상시키는가?
주요 결과
- 스플릿 스타일 전이가 표준 신경망 스타일 전이를 초월했으며, 터커의 67.5%가 스플릿 스타일 전이 결과가 표준 스타일 전이보다 더 현실적으로 평가했다.
- EmbGAN은 CycleGAN과 비교해 터커 평가에서 91.5%의 선호도를 기록하여 시각적 현실성 향상이 뚜렷하게 확인되었다.
- EmbGAN에서 생성된 이미지는 CycleGAN 결과보다 항상 더 진정성 있고 실제 디지털화된 자수 버전에 가까운 것으로 평가되었다.
- 정성 평가 결과 표준 신경망 스타일 전이가 실제 자수 패턴을 더 적게 반영하고 현실감이 떨어지는 결과를 낸 것으로 확인되었다.
- 쌍화되지 않은 훈련 설정과 사이클 일관성 손실를 통해 쌍화된 자수 데이터가 없어도 효과적인 번역이 가능해져 확장성이 향상되었다.
- 이 방법은 이미지 콘텐츠의 변동성에 강건하며, 스티치 유형, 원단, 조명 조건에 대한 입력이 필요하지 않다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.