Skip to main content
QUICK REVIEW

[논문 리뷰] Optical Illusions Images Dataset

Robert Max Williams, Roman V. Yampolskiy|arXiv (Cornell University)|2018. 09. 30.
Advanced Vision and Imaging참고 문헌 3인용 수 8
한 줄 요약

이 논문은 컴퓨터 시각 및 인간 인지 연구를 발전시키기 위해 두 개의 주요 웹사이트에서 수집한 6,725장의 시각적 착시도 이미지와 수작업으로 선별한 500장의 정제된 이미지 셋을 소개한다. 연구는 전이 학습 분류기가 랜덤보다 우수한 성능을 보임을 입증하였지만, 표준 GAN은 의미 있는 착시도를 생성하지 못함을 보여주며, 인간 시각 처리의 더 깊은 모델이 필요함을 시사한다.

ABSTRACT

Human vision is capable of performing many tasks not optimized for in its long evolution. Reading text and identifying artificial objects such as road signs are both tasks that mammalian brains never encountered in the wild but are very easy for us to perform. However, humans have discovered many very specific tricks that cause us to misjudge color, size, alignment and movement of what we are looking at. A better understanding of these phenomenon could reveal insights into how human perception achieves these feats. In this paper we present a dataset of 6725 illusion images gathered from two websites, and a smaller dataset of 500 hand-picked images. We will discuss the process of collecting this data, models trained on it, and the work that needs to be done to make it of value to computer vision researchers.

연구 동기 및 목표

  • 컴퓨터 시각 및 인지 연구를 위해 사용할 수 있는 정적 시각적 착시도 이미지의 포괄적이고 공개 가능한 데이터셋을 구축하기.
  • 기존의 기계 학습 모델이 다양한 유형의 착시도를 인식하고 일반화할 수 있는지 평가하기.
  • 현재의 생성 모델, 예를 들어 GAN과 같은 모델이 새로운 인간 유사 착시도를 학습하여 생성하는 데에서 겪는 한계를 조사하기.
  • 인공 시스템이 인간의 시각 인지 방식과 유사하게 착시도를 인지하도록 훈련시킬 수 있는지 탐구하기.
  • 현재의 딥 러닝 접근 방식이 인간의 시각 착시도를 모델링하는 데에서 겪는 격차를 식별하고 향후 연구 방향을 제안하기.

제안 방법

  • 웹 스크래퍼를 사용하여 Mighty Optical Illusions에서 6,436장, ViperLib에서 1,454장의 이미지를 수집하여 카테고리 및 페이지 제목과 같은 메타데이터를 유지했다.
  • 집중적인 분석을 위해 강한 명확한 시각 효과를 지닌 500장의 수작업으로 선별된 이미지 셋을 구성했다.
  • 일반 이미지 데이터셋의 특징을 활용하여 사전 훈련된 '버틀넥' 모델을 착시도 카테고리에 맞게 미세조정하여 전이 학습 분류기를 훈련시켰다.
  • 하이퍼파라미터 조정 없이, 무작위 노이즈 벡터를 입력으로 사용하여 데이터의 일부에 대해 HyperGAN을 사용해 GAN을 훈련해 보았다.
  • 분류 및 생성 품질 평가를 위해 혼동 행렬과 훈련 진행 상황의 시각화를 사용하여 모델 성능을 평가했다.
  • 향후 접근 방식으로 인간의 피드백을 통합하거나 인간 시각의 대체 지표를 사용해 착시도 생성을 향상시키는 것을 제안했다.

실험 결과

연구 질문

  • RQ1일반 이미지 특징으로 훈련된 딥 러닝 분류기는 다양한 유형의 시각적 착시도를 구분할 수 있는가?
  • RQ2표준 GAN 아키텍처는 정적 이미지의 제한된 데이터셋에서 새로운, 신뢰할 수 있는 착시도를 생성할 수 있는가?
  • RQ3시각적으로 두드러진 이미지로 훈련된 상태에서도 표준 생성 모델이 의미 있는 착시도를 생성하지 못하는 이유는 무엇인가?
  • RQ4인간의 피드백 또는 인간 시각의 대체 지표는 인공 시스템이 착시도를 생성하거나 인지하도록 학습시키는 데 어떤 역할을 하는가?
  • RQ5시각적 착시도의 구조적 및 인지적 특성은 현재의 딥 생성 모델의 적용 가능성을 어떻게 제한하는가?

주요 결과

  • 전이 학습 분류기는 착시도 카테고리 간의 구분에서 무작위보다 유의미하게 높은 성능을 보였으며, 이는 착시도의 시각적 특징이 딥 네트워크에 의해 탐지 가능하다는 것을 시사한다.
  • 분류기의 혼동 행렬은 예측의 의미 있는 군집화를 보였으며, 이는 모델이 특정 시각 패턴을 착시도 유형과 연관지운 것으로 나타났다.
  • 데이터셋의 일부에 대해 훈련된 GAN은 7시간의 훈련 후에도 일관되거나 다양한 착시도 유사 이미지를 생성하지 못했으며, 다양성이 낮고 인식 가능한 착시 효과가 없는 이미지를 생성했다.
  • GAN 훈련 진행 상황은 생성 출력의 다양성이 극도로 떨어지는 이상한 양상을 보였으며, 표준 훈련 파이프라인을 사용했음에도 불구하고 모드 붕괴 또는 최적화 부족을 시사했다.
  • GAN이 착시도를 생성하지 못한 것은 현재의 생성 모델가 인간의 시각 착시의 인지 원리를 이해하지 못하고 있음을 시사한다.
  • 데이터셋의 크기가 작고 착시도 유형의 다양성이 제한적이며, 아마도 수십 가지의 고유한 카테고리에 불과하여 효과적인 생성 모델 훈련에 큰 도전 과제를 제기한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.