[논문 리뷰] Actions in the Eye: Dynamic Gaze Datasets and Learnt Saliency Models for Visual Recognition
이 논문은 할리우드-2 및 유에프씨 스포츠에서 영상 행동 인식 작업 중 인간의 시선 추적 데이터를 기반으로 한 대규모 동적 시선 데이터셋을 소개한다. 이를 통해 인간의 정착 지점을 예측하는 학습된 시각적 주목 모델의 개발이 가능해졌으며, 이러한 시각적 주목 모델을 엔드 투 엔드로 훈련 가능한 컴퓨터 비전 시스템에 통합함으로써 최신 기술 수준의 인식 성능를 달성하였다. 이는 인간과 유사한 주목 패턴이 시각적 행동 인식 정확도를 크게 향상시킬 수 있음을 보여준다.
Systems based on bag-of-words models from image features collected at maxima of sparse interest point operators have been used successfully for both computer visual object and action recognition tasks. While the sparse, interest-point based approach to recognition is not inconsistent with visual processing in biological systems that operate in `saccade and fixate' regimes, the methodology and emphasis in the human and the computer vision communities remains sharply distinct. Here, we make three contributions aiming to bridge this gap. First, we complement existing state-of-the art large scale dynamic computer vision annotated datasets like Hollywood-2 and UCF Sports with human eye movements collected under the ecological constraints of the visual action recognition task. To our knowledge these are the first large human eye tracking datasets to be collected and made publicly available for video, vision.imar.ro/eyetracking (497,107 frames, each viewed by 16 subjects), unique in terms of their (a) large scale and computer vision relevance, (b) dynamic, video stimuli, (c) task control, as opposed to free-viewing. Second, we introduce novel sequential consistency and alignment measures, which underline the remarkable stability of patterns of visual search among subjects. Third, we leverage the significant amount of collected data in order to pursue studies and build automatic, end-to-end trainable computer vision systems based on human eye movements. Our studies not only shed light on the differences between computer vision spatio-temporal interest point image sampling strategies and the human fixations, as well as their impact for visual recognition performance, but also demonstrate that human fixations can be accurately predicted, and when used in an end-to-end automatic system, leveraging some of the advanced computer vision practice, can lead to state of the art results.
연구 동기 및 목표
- 영상 행동 인식 작업 중 인간의 시각적 주목과 컴퓨터 비전 간 격차를 메우기 위해, 제어된 작업 조건 하에서 대규모의 태스크 제어형 인간의 눈동자 움직임 데이터를 수집한다.
- 다양한 주제와 영상 간 인간의 정착 패턴에서의 공간적 및 순차적 패턴을 분석하기 위해 새로운 일관성 및 정렬 측정법을 개발한다.
- 예측된 인간의 시각적 주목을 활용하여 향상된 행동 인식 성능를 달성하는 엔드 투 엔드로 훈련 가능한 컴퓨터 비전 시스템을 구축한다.
- 인간의 정착 패턴이 인식 정확도에 미치는 영향을 평가하고, 전통적인 컴퓨터 비전 샘플링 전략과 비교한다.
제안 방법
- 할리우드-2 및 유에프씨 스포츠 영상 데이터셋에서 497,107帧을 포함한 영상 프레임을 16명의 피험자가 제어된 행동 인식 작업 중에 시선 추적한 동적 눈동자 데이터를 수집하였다.
- 다양한 피험자 간에 정착 패턴의 공간적 및 시간적 안정성을 측정하기 위해 순차적 일관성 및 정렬 측정법을 도입하였다.
- 인간의 정착 패턴에서 유도된 시각적 주목 기반 샘플링 전략을 사용하여 엔드 투 엔드로 훈련 가능한 시각 인식 파이프라인을 훈련시켰으며, 예측된 시각적 주목 지도와 진짜 시각적 주목 지도를 모두 활용하였다.
- 백오프-오브-비주얼-워드 및 두 번째 차수 풀링 프레임워크를 사용하였으며, 히어스 코너, 균일 샘플링, 시각적 주목 기반 샘플링을 포함한 기술자 소견을 활용하였다.
- 추가적인 커널 없이도 효율적인 비선형 특징 인코딩을 가능하게 하기 위해 기술자 소견의 공분산 행렬에 행렬 로그 및 거듭제곱 스케일링을 적용하였다.
- 결과의 변동성과 강건성을 평가하기 위해 10개의 랜덤 시드를 사용한 리브-원-아웃 교차검증을 실시하였다.
실험 결과
연구 질문
- RQ1다양한 주제에서 인간의 정착 패턴은 동적 영상 행동 인식 작업 중 얼마나 일관된가?
- RQ2태스크 제약 조건이 영상 내에서 인간의 눈동자 움직임의 공간적 및 순차적 구조에 얼마나 영향을 미치는가?
- RQ3인간의 눈동자 추적 데이터를 기반으로 훈련된 시각적 주목 모델은 영상 자극에서 정착 위치를 정확하게 예측할 수 있는가?
- RQ4기존의 관심점 또는 균일 샘플링과 비교할 때, 시각적 주목 기반 샘플링은 인식 정확도에서 어떤가?
- RQ5예측된 인간의 시각적 주목을 활용하는 엔드 투 엔드로 훈련 가능한 시스템은 시각적 행동 인식에서 최신 기술 수준의 성능를 달성할 수 있는가?
주요 결과
- 사람의 정착 패턴은 태스크 제약 조건이 있더라도 주제 간에 높은 공간적 및 순차적 일관성을 보이며, 안정적인 시각적 탐색 행동을 나타낸다.
- 인간의 시선 데이터를 기반으로 훈련된 제안된 시각적 주목 모델은 영상 자극에서 정착 위치를 높은 정확도로 예측할 수 있다.
- 백오프-오브-비주얼-워드 프레임워크에서 예측된 시각적 주목을 활용한 관심점 샘플링 전략을 적용했을 때, 유에프씨 스포츠 데이터셋에서 인식 정확도가 87.5%로 향상되어 기준 방법을 초월하였다.
- 10개의 랜덤 시드를 기반으로 한 인식 정확도의 표준편차는 0.8% 이하로 낮아, 제안된 파이프라인의 낮은 변동성과 높은 강건성을 나타낸다.
- 시각적 주목 기반 샘플링은 히어스 코너(84.3%) 및 균일 샘플링(83.9%)과 같은 기존 방법보다 우수한 성능를 보이며, 인간의 주목 사전 지식의 가치를 입증한다.
- 시각적 주목 기반 샘플링을 사용한 두 번째 차수 풀링은 최신 기술 수준의 성능를 달성하였으며, 인간과 유사한 주목 메커니즘이 컴퓨터 비전 시스템의 성능 향상에 기여할 수 있음을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.