Skip to main content
QUICK REVIEW

[논문 리뷰] Learning where to Attend with Deep Architectures for Image Tracking

Misha Denil, Loris Bazzani|arXiv (Cornell University)|2011. 09. 16.
Domain Adaptation and Few-Shot Learning참고 문헌 34인용 수 6
한 줄 요약

이 논문은 신경과학에 영감을 받은 双경로 아키텍처를 사용하여 객체 인식과 시선 제어를 동시에 학습하는 딥러닝 기반의 주의 기반 추적 시스템을 제안한다: 외형 모델링을 위한 인식(정체성) 경로(요소 분해된 RBM를 통한)와 시선 선택을 위한 제어 경로(입자 필터링과 베이지안 최적화를 통한)이다. 주요 기여는 부분 정보를 고려하는 연속적인 시선 정책을 가우시안 프로세스로 보상 표면을 모델링함으로써 이룰 수 있으며, 이는 불확실성 감소와 동작 공간의 유연성 측면에서 이산적이고 전체 정보 기반의 방법보다 뛰어나다.

ABSTRACT

We discuss an attentional model for simultaneous object tracking and recognition that is driven by gaze data. Motivated by theories of perception, the model consists of two interacting pathways: identity and control, intended to mirror the what and where pathways in neuroscience models. The identity pathway models object appearance and performs classification using deep (factored)-Restricted Boltzmann Machines. At each point in time the observations consist of foveated images, with decaying resolution toward the periphery of the gaze. The control pathway models the location, orientation, scale and speed of the attended object. The posterior distribution of these states is estimated with particle filtering. Deeper in the control pathway, we encounter an attentional mechanism that learns to select gazes so as to minimize tracking uncertainty. Unlike in our previous work, we introduce gaze selection strategies which operate in the presence of partial information and on a continuous action space. We show that a straightforward extension of the existing approach to the partial information setting results in poor performance, and we propose an alternative method based on modeling the reward surface as a Gaussian Process. This approach gives good performance in the presence of partial information and allows us to expand the action space from a small, discrete set of fixation points to a continuous domain.

연구 동기 및 목표

  • 인간의 시각 주의 메커니즘을 모방하는 공동 객체 추적 및 인식 시스템을 개발한다.
  • 제한된 관측만 가능할 때 시선 선택의 과제를 해결한다.
  • 이산적 고정점에서의 시선 제어를 연속 동작 공간으로 확장하여 추적의 강건성을 향상시킨다.
  • 가우시안 프로세스를 사용해 시선 선택의 보상 표면을 모델링하여 불확실성을 다루고 정책 학습을 향상시킨다.
  • 특히 복잡한 변화가 있는 실세계 영상 시퀀스에서 실시간으로 추적 정책을 적응시킬 수 있도록 베이지안 최적화를 활용한다.

제안 방법

  • 시스템은 이중 경로 아키텍처를 사용한다: 두 층의 요소 분해된 제한된 볼츠만 기계(RBM)를 통한 정체성 및 외형 모델링을 위한 복합 경로와 제어 및 국소화를 위한 제어 경로이다.
  • 목표의 상태에 대한 믿음 상태를 유지하는 입자 필터를 사용하여 객체의 위치, 스케일, 운동을 추정한다.
  • 시선 선택은 순차적 결정 문제로 모델링되며, 동작(고정점)은 추적 불확실성을 최소화하도록 선택된다.
  • 가우시안 프로세스는 연속적인 고정점 위치에서의 보상 표면(불확실성 감소)을 모델링하여 부분 정보 하에서 효율적인 최적화를 가능하게 한다.
  • 베이지안 최적화를 통해 시선 정책을 학습하며, 이는 연속 동작 공간에서 탐색과 이용의 균형을 이룬다.
  • 시스템은 사활성 및 운동 플로우를 통합하여 입자 필터링의 제안 분포를 생성함으로써 초기 상태 추정을 향상시킨다.

실험 결과

연구 질문

  • RQ1딥러닝 기반의 주의 메커니즘이 실시간 영상 시퀀스에서 적응적인 시선 선택을 통해 추적 불확실성을 효과적으로 줄일 수 있는가?
  • RQ2부분 정보 하에서 이산적 시선 정책을 연속 동작 공간으로 확장할 경우 성능은 어떻게 저하되는가?
  • RQ3가우시안 프로세스로 보상 표면을 모델링하면 전통적인 밴딧 방법에 비해 부분 관측 환경에서 정책 학습을 향상시킬 수 있는가?
  • RQ4베이지안 최적화가 복잡한 조명, 자세, 운동 변화가 있는 실세계 영상 데이터에서 효과적인 시선 정책을 학습할 수 있는가?
  • RQ5정체성 경로에서의 분류기 신뢰도를 활용하여 추적 실패를 복구할 수 있는가?

주요 결과

  • 가우시안 프로세스로 보상 표면를 모델링한 제안된 방법은 부분 정보 환경에서 이산 정책을 연속 동작으로 단순 확장한 것보다 유의미하게 뛰어난 성능을 보였다.
  • 알고리즘에 의해 학습된 최적의 고정점은 서로 가까이 뭉쳐져 있으며, 매우 구분 가능한 관측 결과를 생성하여 효과적인 주의 집중을 나타냈다.
  • 유튜브 유명인 데이터셋에서 베이지안 최적화는 시각적으로 타당하고 효과적인 추적 행동을 생성하는 시선 선택 정책을 성공적으로 학습했다.
  • 시스템은 실세계 영상 시퀀스에서 조명 변화, 표정 변화, 머리 자세 변화와 같은 시각적 변형에 대해 강건함을 보였다.
  • 믿음 상태의 불확실성을 시선 선택에 통합함으로써, 특히 불량한 고정점 선택 이후 탐색과 이용의 균형을 더 잘 이룰 수 있었다.
  • 이 방법은 연속적 시선 제어를 가능하게 하여 고정된 이산 고정점 외부의 동작 공간을 확장하면서도 높은 추적 정확도를 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.