Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Egocentric Visual Perception Combining Eye-tracking, a Software Retina and Deep Learning

Nina Hristozova, Piotr Ozimek|ENLIGHTEN (Jurnal Bimbingan dan Konseling Islam)|2018. 09. 05.
CCD and CMOS Imaging Sensors참고 문헌 5인용 수 4
한 줄 요약

이 논문은 인간의 시선 추적 데이터를 활용해 소프트웨어 망막 모델을 안내하는 효율적인 자기 중심 시각 인식 시스템을 제안한다. 이로 인해 입력 데이터가 16.7배 감소했으며, 9개 클래스의 물체 인식 작업에서 98.2%의 테스트 정확도를 달성하였다. 고유의 DCNN을 통해 생체 모방적 중심집중 시각과 딥러닝의 융합을 통해 높은 성능을 내며, 계산 부하를 크게 줄였다.

ABSTRACT

We present ongoing work to harness biological approaches to achieving highly efficient egocentric perception by combining the space-variant imaging architecture of the mammalian retina with Deep Learning methods. By pre-processing images collected by means of eye-tracking glasses to control the fixation locations of a software retina model, we demonstrate that we can reduce the input to a DCNN by a factor of 3, reduce the required number of training epochs and obtain over 98% classification rates when training and validating the system on a database of over 26,000 images of 9 object classes.

연구 동기 및 목표

  • 인간의 시선 추적 데이터를 활용해 시각 샘플링을 안내하는 효율적인 자기 중심 인식 시스템을 개발한다.
  • 고해상도 소프트웨어 망막 모델을 딥러닝과 통합하여 입력 데이터를 줄이고 계산 효율성을 향상시킨다.
  • 집중 지점 기반의 공간 가변적 이미지 샘플링을 통해 최신 기술 수준의 분류 성능을 입증한다.
  • 고정된 머리 안정화를 제거하고 예측적 집중 지점 모델링을 도입하여 제약 없는 데이터 수집을 가능하게 한다.
  • 등각적 변환과皮질 이미지 변환을 활용해 척도 및 회전에 강인한 특징 추출을 탐색한다.

제안 방법

  • Tobii Pro 2 시선 추적 안경을 사용해 인간 관측자가 주목하는 중요한 물체 영역을 중심으로 이미지를 촬영하였다.
  • 각 클래스의 1% 분할된 고정점 수를 기준으로 K-means(K = 1% of fixations per class)를 사용해 고정점 위치를 군집화하여 대표적인 중심시 영역을 식별하였다.
  • 50K개 노드로 구성된 소프트웨어 망막 모델이 복소로그 등각적 변환을 적용하여 전체 이미지를 399×752px 크기의 공간 가변적 피질 이미지로 변환하였다.
  • 7개의 3×3 컨볼루션 레이어, 맥스 풀링, 3개의 132노드 완전 연결 레이어를 포함한 고유의 DCNN을 피질 이미지에서 학습시켰다.
  • 피질 이미지와 원본 해상도의 고정점 코어를 사용한 성능을 비교하여 데이터 효율성과 정확도를 평가하였다.
  • 피질 이미지에 산산이 흩어진 데이터 포인트 격자 알고리즘을 적용하여 입력 크기를 추가로 줄였으며, 정확도 손실 없이 유지하였다.
Figure 1: Left, Tobii Pro2 Eye Tracker Glasses; Right, Fixation clustering following homography alignment
Figure 1: Left, Tobii Pro2 Eye Tracker Glasses; Right, Fixation clustering following homography alignment

실험 결과

연구 질문

  • RQ1인간의 시선 추적 데이터는 소프트웨어 망막을 효율적인 자기 중심 물체 인식에 안내하는 데 효과적으로 활용될 수 있는가?
  • RQ2소프트웨어 망막의 공간 가변적 샘플링은 분류 성능을 유지하면서 얼마나 많은 입력 데이터를 줄일 수 있는가?
  • RQ3피질 이미지에서 학습한 DCNN의 성능은 원본 해상도의 고정점 코어에서 학습한 모델과 비교해 어떻게 다른가?
  • RQ4소프트웨어 망막 출력에 직접 연결된 고유의 네트워크 레이어가 중간 피질 이미지 생성을 넘어서 효율성을 향상시킬 수 있는가?
  • RQ5보조 네트워크는 진단적 고정점을 예측하고, 제약 없는 자기 중심 환경에서의 데이터 수집을 가능하게 할 수 있는가?

주요 결과

  • 시선 추적 데이터에서 유도된 피질 이미지를 사용해 9개 클래스의 물체 인식 작업에서 98.2%의 테스트 정확도를 달성하였다.
  • 소프트웨어 망막의 공간 가변적 샘플링 덕분에 시각 데이터 입력이 16.7배 감소했으며, 정확도 손실는 최소한이었다.
  • 피질 이미지 기반의 DCNN은 테스트 세트를 분류하는 데 6초가 걸렸고, 원본 해상도 고정점 코어 모델은 12초가 소요되었다.
  • 원본 해상도 고정점 코어 모델은 99.5%의 테스트 정확도를 달성했지만, 더 큰 배치 크기와 더 긴 학습 시간이 필요했다.
  • 산산이 흩어진 데이터 포인트 격자 알고리즘을 통해 피질 이미지를 서브샘플링함으로써 입력 데이터를 10.8배 줄였지만 성능 손실 없이 유지되었다.
  • 진단적 고정점을 예측하고, 부분적으로 가려진 시야에서의 물체 세그멘테이션을 가능하게 하는 보조 네트워크 개발 중이다.
Efficient Egocentric Visual Perception Combining Eye-tracking, a Software Retina and Deep Learning

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.