[논문 리뷰] Language-Driven Image Style Transfer
이 논문은 자연어 기술서술에서 시각적 의미를 학습함으로써 텍스트 가이드 이미지 스타일 전이를 가능하게 하는 새로운 작업인 언어 기반 예술 스타일 전이(LDAST)를 소개한다. 제안된 대비적 언어 시각 예술가(CLVA) 모델은 패치 기반 스타일 판별기와 대비적 추론을 사용하여 언어 지시사항과 스타일 패턴을 정렬하며, DTD2 및 ArtEmis 데이터셋에서 자동 평가 지표와 인간 평가 모두에서 최신 기술 수준의 성능을 달성한다.
Despite having promising results, style transfer, which requires preparing style images in advance, may result in lack of creativity and accessibility. Following human instruction, on the other hand, is the most natural way to perform artistic style transfer that can significantly improve controllability for visual effect applications. We introduce a new task, language-driven artistic style transfer (LDAST), to manipulate the style of a content image, guided by a text. We propose contrastive language visual artist (CLVA) that learns to extract visual semantics from style instructions and accomplish LDAST by the patch-wise style discriminator. The discriminator considers the correlation between language and patches of style images or transferred results to jointly embed style instructions. CLVA further compares contrastive pairs of content images and style instructions to improve the mutual relativeness. The results from the same content image can preserve consistent content structures. Besides, they should present analogous style patterns from style instructions that contain similar visual semantics. The experiments show that our CLVA is effective and achieves superb transferred results on LDAST.
연구 동기 및 목표
- 기존 스타일 전이 기법의 한계를 해결하기 위해 사전 정의된 스타일 이미지가 필요로 하고 영향력이 떨어지며 창의성이 부족한 점을 해결한다.
- 자연어 지시사항을 입력으로 사용하여 예술 스타일 전이의 제어성과 접근성을 향상시킨다.
- 시각적 스타일에 대한 언어 기술서술과 그 정확한 시각적 실현 간 격차를 메운다.
- 텍스트로 기술된 복잡하고 의미가 풍부한 스타일을 전달하면서도 콘텐츠 구조를 유지하는 방법을 개발한다.
- 다양한 스타일 지시사항(시각적 특성과 정서적 효과 포함)에 대해 평가하여 더 넓은 적용 가능성을 확보한다.
제안 방법
- CLVA는 콘텐츠 구조를 유지하고 스타일 지시사항에서 시각적 의미를 추출하는 언어 시각 예술가(LVA) 모듈을 사용한다.
- 패치 기반 스타일 판별기를 사용하여 언어와 이미지 패치를 함께 임bedding함으로써 세밀한 수준의 스타일 정렬을 가능하게 한다.
- 대비적 추론(CR)은 콘텐츠 이미지와 스타일 지시사항의 쌍을 비교하여 콘텐츠 구조의 일관성과 의미적으로 관련된 지시사항에 대해 유사한 스타일 패턴을 강제로 부여한다.
- 모델는 콘텐츠와 스타일 표현 간 상호 관련성을 극대화하기 위해 대비 손실을 사용하여 엔드 투 엔드로 훈련된다.
- CLIP 기반의 시각-언어 정렬을 활용하여 미리 보지 않은 스타일 기술서술에 대한 제로샷 일반화 성능을 향상시킨다.
- 이 방법은 명시적인 시각적 특성(예: '워터컬러', '스케치')과 추상적인 정서적 효과(예: '평온한', '만족스러운')를 모두 포함한 스타일 지시사항을 지원한다.
실험 결과
연구 질문
- RQ1사전 정의된 스타일 이미지가 필요로 하지 않고 자연어 기술서술을 효과적으로 사용하여 예술 스타일 전이를 유도할 수 있는가?
- RQ2다양한 언어 기술서술(시각적 특성에서 정서적 효과에 이르기까지)을 어떻게 학습하여 해당하는 시각적 스타일 패턴으로 변환할 수 있는가?
- RQ3대비 학습이 다양한 언어 입력에 따라 스타일 전이의 일관성과 품질을 얼마나 향상시키는가?
- RQ4CLVA는 검색 기반 기준 모델과 기존 GAN 기반 스타일 전이 방법에 비해 스타일 충실도와 콘텐츠 보존 측면에서 어떻게 비교되는가?
- RQ5훈련 중에 볼 수 없었던 스타일 지시사항, 특히 추상적이거나 다중 개념을 포함한 기술서술에 대해 모델이 얼마나 잘 일반화되는가?
주요 결과
- CLVA는 시각적 특성 지시사항을 사용하여 DTD2에서 최고의 SSIM(36.65)과 VLS(24.00) 점수를 기록하며 모든 기준 모델을 압도한다.
- Car 및 Church 데이터셋에서 CLVA는 VLS 점수 23.68을 기록하여 검색 기반 기준 모델과 기존 방법(SANet, LST)을 모두 뛰어넘었다.
- 인간 평가 결과, CLVA가 생성한 결과는 지시사항과 반감성 지도 데이터에 더 강한 상관관계를 보이며 기준 모델보다 뛰어난 성능을 보였다.
- 동일한 콘텐츠 입력에서 여러 이미지에 걸쳐 콘텐츠 구조를 성공적으로 유지하며 일관된 스타일 전이를 보였다.
- 검색 기반 방법이 더 높은 SSIM를 기록했음에도 불구하고, CLVA는 VLS에서 24.00 대비 23.68로 더 높은 점수를 기록하여 지시사항 정렬 측면에서 더 나은 성능을 보였다.
- 추상적이고 다중 개념을 포함한 스타일 기술서술(예: '평온한', '워터컬러 스케치')에 대해 잘 일반화되어 있으며, 일관되고 의미적으로 관련된 스타일 전이 결과를 생성했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.