[논문 리뷰] Creatism: A deep-learning photographer capable of creating professional work
Creatism은 레이블이 없는 새로운 학습 방식을 통해 구성, 조명, 색상과 같은 다양한 미학적 요소를 별도로 학습함으로써 전문 수준의 사진을 생성하는 딥러닝 시스템이다. Google 스트리트 뷰에서 유도된 시뮬레이션 환경을 활용해 '드라마틱 마스크'와 같은 최적화된 이미지 연산을 적용함으로써, 맹목적인 투링 테스트 유사 평가에서 전문 사진작가들의 41.4%가 반려된 결과를 전문 수준으로 평가함으로써 우수한 성능을 입증하였다.
Machine-learning excels in many areas with well-defined goals. However, a clear goal is usually not available in art forms, such as photography. The success of a photograph is measured by its aesthetic value, a very subjective concept. This adds to the challenge for a machine learning approach. We introduce Creatism, a deep-learning system for artistic content creation. In our system, we break down aesthetics into multiple aspects, each can be learned individually from a shared dataset of professional examples. Each aspect corresponds to an image operation that can be optimized efficiently. A novel editing tool, dramatic mask, is introduced as one operation that improves dramatic lighting for a photo. Our training does not require a dataset with before/after image pairs, or any additional labels to indicate different aspects in aesthetics. Using our system, we mimic the workflow of a landscape photographer, from framing for the best composition to carrying out various post-processing operations. The environment for our virtual photographer is simulated by a collection of panorama images from Google Street View. We design a "Turing-test"-like experiment to objectively measure quality of its creations, where professional photographers rate a mixture of photographs from different sources blindly. Experiments show that a portion of our robot's creation can be confused with professional work.
연구 동기 및 목표
- 라벨이 없는 전후 이미지 쌍이나 명시적 미학 레이블에 의존하지 않고도 전문 수준의 사진을 생성할 수 있는 딥러닝 시스템을 개발하는 것.
- 미학적 품질을 구성, 조명, 색상과 같은 일부 상호수직적인 이미지 연산으로 분해하고, 각각을 별도로 최적화하는 것.
- 전문 사진작가들이 기계가 생성한 사진과 인간이 찍은 사진을 신뢰성 있게 구분할 수 없는 '투링 테스트' 유사 실험을 통해 시스템을 평가하는 것.
- 비지도 학습을 통해 레이블이 없는 데이터에서 '드라마틱 마스크'라는 새로운 이미지 연산을 학습하여 고대비, 드라마틱한 조명을 향상시키는 것.
- 객관적이고 맹목적인 전문가 평가를 통해 기계가 생성한 이미지가 반려 수준에서 전문 수준의 미학 기준에 도달할 수 있음을 입증하는 것.
제안 방법
- 전체적으로 레이블이 없는 전문 수준의 사진 데이터셋을 사용하여, 구성, 대비, 채도 등 서로 다른 미학적 요소를 위한 별도의 딥 네트워크를 학습한다.
- 각 미학적 요소는 크롭, HDR 조정, 드라마틱 마스크 등 서로 다른 미분 가능 이미지 연산과 연결되며, 각각 독립적이고 효율적으로 최적화될 수 있다.
- '드라마틱 마스크' 연산은 기존 필터의 조합을 통해 부정 예시를 생성함으로써, 쌍이 없는 데이터에서 고대비, 드라마틱한 조명을 향상시키는 방법을 학습할 수 있도록 한다.
- 가상의 사진작가 에이전트는 Google 스트리트 뷰 파노라마 기반의 시뮬레이션 환경을 사용하여 프레임 선택 및 후처리 연산을 순차적으로 적용한다.
- 예측된 미학 점수(Φ̄)를 사용하여 이미지 출력 결과를 순위 매기며, 높은 점수일수록 전문적 매력도가 높다고 간주한다.
- 맹목적 평가 프로토콜을 적용하여 전문 사진작가들이 기계가 생성한 사진과 인간이 찍은 사진을 혼합하여 네 단계의 미학 품질 수준으로 평가하며, 원천을 알 수 없도록 한다.
실험 결과
연구 질문
- RQ1딥러닝 시스템이 맹목적 평가 환경에서 전문가 수준의 사진과 구별이 가지 않는 사진을 생성할 수 있는가?
- RQ2라벨이 없는 전후 이미지 쌍이나 명시적 미학 애너테이션 없이도 사진의 다수의 독립적 요소를 학습할 수 있는가?
- RQ3예를 들어 조명 대비와 같은 특정한 미학적 품질을 향상시키기 위해 '드라마틱 마스크'와 같은 새로운 이미지 연산을 레이블이 없는 데이터에서 종단 간(end-to-end)으로 학습할 수 있는가?
- RQ4통제된 맹목적 환경에서 전문 사진작가들의 평가에 따라 기계 학습 시스템이 얼마나 전문 수준의 미학 품질을 달성할 수 있는가?
- RQ5예측된 미학 점수(Φ̄)가 실제 전문가 평가의 이미지 품질과 얼마나 상관이 있는가?
주요 결과
- 예측 점수 ≥2.9인 기계가 생성한 사진 중 약 41.4%가 맹목적 평가에서 최소 반려 수준(≥3.0)의 평가를 받았다.
- 높은 점수를 받은 결과물(Φ̄ ≥2.9) 중 13%가 3.5 이상의 평가를 받았으며, 이는 전문 수준의 상한부에 가까운 성과이다.
- 예측 점수 Φ̄는 전문가 평가와 강한 상관관계를 보였으며, 높은 Φ̄ 값일수록 평균 전문가 평가 점수가 유의미하게 높아졌다.
- AVA 데이터셋의 상위 5% 이미지(전문가 수준으로 간주됨)조차도 3.5 이상 평가를 받은 비율이 45%에 불과하여, 알고리즘 성능의 현실적인 한계를 시사한다.
- 시스템은 레이블이 없는 데이터에서 '드라마틱 마스크' 연산을 성공적으로 학습하여, 쌍이 없는 훈련 예제 없이도 조명 대비를 향상시켰다.
- 수동 필터링을 통해 심각한 결함(예: 블러, 정렬 오류)을 가진 결과물을 제거하였으며, 이후 최고의 결과물은 공개 전시 웹페이지로 정리하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.