Skip to main content
QUICK REVIEW

[논문 리뷰] Unifying Top-down and Bottom-up Scanpath Prediction Using Transformers

Zhibo Yang, Sounak Mondal|arXiv (Cornell University)|2023. 03. 16.
EEG and Brain-Computer InterfacesNeuroscience인용 수 3
한 줄 요약

이 논문은 고정점 이산화 없이 상향식 및 하향식 주의 사각형을 예측할 수 있는 통합된 트랜스포머 기반 모델인 HAT(Human Attention Transformer)를 제안한다. 푸코이드 망막 시뮬레이션과 조밀한 히트맵 예측을 통해 HAT는 목표 존재, 목표 부재, 자유 시선 조건에서 새로운 최고 성능를 달성하였으며, COCO-Search18에서 cNSS를 최대 83% 향상시켰다.

ABSTRACT

Most models of visual attention aim at predicting either top-down or bottom-up control, as studied using different visual search and free-viewing tasks. In this paper we propose the Human Attention Transformer (HAT), a single model that predicts both forms of attention control. HAT uses a novel transformer-based architecture and a simplified foveated retina that collectively create a spatio-temporal awareness akin to the dynamic visual working memory of humans. HAT not only establishes a new state-of-the-art in predicting the scanpath of fixations made during target-present and target-absent visual search and ``taskless'' free viewing, but also makes human gaze behavior interpretable. Unlike previous methods that rely on a coarse grid of fixation cells and experience information loss due to fixation discretization, HAT features a sequential dense prediction architecture and outputs a dense heatmap for each fixation, thus avoiding discretizing fixations. HAT sets a new standard in computational attention, which emphasizes effectiveness, generality, and interpretability. HAT's demonstrated scope and applicability will likely inspire the development of new attention models that can better predict human behavior in various attention-demanding scenarios. Code is available at https://github.com/cvlab-stonybrook/HAT.

연구 동기 및 목표

  • 단일 모델에서 목표 지향적(상향식) 및 자극 민감도 기반(하향식) 주의 사각형을 통합적으로 예측하는 것.
  • 이전 모델에서 고정점 이산화로 인한 정보 손실과 정확도 저하 문제를 해결하는 것.
  • 고해상도 입력에 적합한 계산 효율성이 높고 조밀한 예측 프레임워크를 개발하는 것.
  • 인지적으로 타당하고 인간의 시각 워킹 메모리 동역학을 반영하는 해석 가능한 주의 메커니즘을 갖춘 모델을 만드는 것.

제안 방법

  • HAT는 다양한 외부 거리에서 다중 척도 특징 맵을 추출하기 위해 이중 분지 CNN 인코더를 사용하여 푸코이드 망막을 시뮬레이션한다.
  • 학습 가능한 공간, 시간, 척도 임bedding을 갖춘 트랜스포머 인코더를 사용하여 시각 정보를 워킹 메모리에 동적으로 통합한다.
  • 각 단계에서 조밀한 고정점 히트맵을 예측하여 격자 셀에 고정점을 굵게 이산화하는 것을 방지한다.
  • 중앙 시각 정보를 나타내는 푸코이드 토큰과 주변 시각 정보를 나타내는 주변 토큰을 사용하며, 푸코이드 토큰은 이전 고정점의 역사를 인코딩한다.
  • 자기 주의 메커니즘이 워킹 메모리에서 정보를 집계하여 다음 고정점 위치를 예측한다.
  • 픽셀 단위의 지도 학습을 통해 엔드 투 엔드로 훈련되어 고해상도의 순차적 사각형 예측이 가능하다.

실험 결과

연구 질문

  • RQ1단일 딥러닝 모델이 별도의 아키텍처 없이 상향식 및 하향식 주의 사각형을 효과적으로 예측할 수 있는가?
  • RQ2고정점 이산화를 피할 경우 사각형 예측 모델의 정확도와 일반화 능력에 어떤 영향을 미치는가?
  • RQ3푸코이드 기반의 트랜스포머 기반 워킹 메모리는 사각형 예측에서 시간적·공간적 인식 능력을 얼마나 향상시키는가?
  • RQ4HAT의 주의 가중치는 인지적으로 타당하고 인간의 시각 기억 동역학을 얼마나 잘 반영하는가?
  • RQ5HAT 아키텍처의 어떤 구성 요소가 성능에 가장 기여하며, 그로 인해 해석 가능성은 어떻게 향상되는가?

주요 결과

  • HAT는 COCO-Search18 및 COCO-FreeView 데이터셋에서 새로운 최고 성능를 달성하였으며, 목표 존재 조건에서 cNSS를 83% 향상시키고, 목표 부재 조건에서 58%, 자유 시선 조건에서 72% 향상시켰다.
  • 제거 실험 결과, 푸코이드 토큰을 제거할 경우 성능 저하가 가장 심했으며(cIG 약 41% 감소), 이는 워킹 메모리 유지에 있어 그들의 핵심적 역할을 확인한다.
  • 공간 및 시간 임베딩은 각각 cIG가 21%와 14% 감소할 정도로 기여가 크며, 위치 및 시간 인식의 중요성을 강조한다.
  • 모델의 주의 맵은 목표 부재 탐색 후반기에는 최근 고정점이 지배적임을 보여주며, 자유 시선 패턴과 유사하여 인지적 일관성을 확인한다.
  • HAT의 조밀한 예측 접근 방식은 이산화 손실을 방지하고 고해상도 사각형 예측을 가능하게 하여, 이전 메서드가 사용하는 굵은 액션 격자에 비해 뛰어난 성능을 발휘한다.
  • 모델는 강력한 일반화 능력을 보이며, 목표 존재, 목표 부재, 자유 시선 세 가지 다른 주의 제어 제어 방식에서 모두 최고 성능를 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.