[논문 리뷰] Object-aware Gaze Target Detection
이 논문은 모든 객체를 검출하고 눈동자-객체 상호작용을 눈동자 원뿔을 통해 모델링함으로써 눈동자 히트맵, 눈동자 점, 그리고 눈을 쳐다본 객체의 클래스와 위치(두통까지 포함)를 동시에 예측하는 엔드 투 엔드 Transformer 기반 아키텍처를 제안한다. 이 방법은 최신 기준 성능을 달성하며, AUC가 최대 2.91% 높고, 눈동자 거리가 50% 감소하고, 프레임 외 평균 정밀도가 9% 향상되었으며, 눈을 쳐다본 객체 분류 성능도 11–13% 향상되었다.
Gaze target detection aims to predict the image location where the person is looking and the probability that a gaze is out of the scene. Several works have tackled this task by regressing a gaze heatmap centered on the gaze location, however, they overlooked decoding the relationship between the people and the gazed objects. This paper proposes a Transformer-based architecture that automatically detects objects (including heads) in the scene to build associations between every head and the gazed-head/object, resulting in a comprehensive, explainable gaze analysis composed of: gaze target area, gaze pixel point, the class and the image location of the gazed-object. Upon evaluation of the in-the-wild benchmarks, our method achieves state-of-the-art results on all metrics (up to 2.91% gain in AUC, 50% reduction in gaze distance, and 9% gain in out-of-frame average precision) for gaze target detection and 11-13% improvement in average precision for the classification and the localization of the gazed-objects. The code of the proposed method is publicly available.
연구 동기 및 목표
- 기존 눈동자 목표 탐지 방법은 눈동자 히트맵 회귀에만 집중하여 머리와 눈을 쳐다본 객체 간의 관계를 모델링하지 못하는 점을 해결한다.
- 수동으로 주석이 달린 머리 영역을 기반으로 하는 전통적인 이중 경로 접근 방식의 한계를 극복하여 다수의 사람을 효율적으로 처리할 수 있도록 한다.
- 단일 순방향 전파에서 머리, 눈을 쳐다본 객체, 눈동자 목표를 동시에 탐지함으로써 엔드 투 엔드로 설명 가능한 눈동자 분석을 가능하게 한다.
- 실제 환경에서의 응용에 매우 중요한 프레임 외 눈동자 탐지 및 주석 변동성에 대한 강건성을 향상시킨다.
- 추가 객체 검출기 없이도 눈동자 목표 탐지 및 눈을 쳐다본 객체 인식에서 뛰어난 성능을 달성한다.
제안 방법
- 단일 이미지 입력에서 모든 객체, 머리까지 포함하여 검출하는 객체 검출기 Transformer를 사용한다.
- 각 검출된 머리에 대해 눈동자 벡터를 예측하여 눈동자 원뿔을 정의함으로써 사람의 시야 범위 외의 객체를 걸러낸다.
- 각 머리의 눈동자 원뿔 내에서 머리와 객체 간의 상호작용을 모델링하기 위해 마스크된 눈동자 객체 Transformer를 활용한다.
- 눈동자 객체 Transformer에서 주목한 특징을 사용하여 눈동자 히트맵과 정밀한 눈동자 점 예측을 생성한다.
- 이미지 프레임 외의 눈동자 타겟 예측 여부를 전용 헤드로 예측하여 프레임 외 눈동자 탐지 능력을 향상시킨다.
- 눈동자 히트맵 회귀, 눈동자 점 회귀, 객체 분류, 위치 설정을 조합한 다중 작업 손실을 사용하여 전체 아키텍처를 엔드 투 엔드로 훈련시킨다.
실험 결과
연구 질문
- RQ1엔드 투 엔드 Transformer 기반 모델이 눈동자 목표를 동시에 탐지하고 눈을 쳐다본 객체의 클래스와 위치를 식별함으로써 눈동자 분석의 해석 가능성을 향상시킬 수 있는가?
- RQ2눈동자 원뿔을 통한 머리-객체 상호작용 모델링이 기존의 이중 경로 또는 통합 장면 모델링 방식에 비해 눈동자 목표 탐지 성능에 어떤 영향을 미치는가?
- RQ3제안된 방법이 이전 작업에 비해 주석 변동성에 대해 얼마나 강건한가?
- RQ4모델이 추가 객체 검출기를 요구하지 않고도 눈동자 목표 탐지에서 최신 기준 성능을 달성하면서 동시에 정확한 눈을 쳐다본 객체 분류 및 위치 설정을 수행할 수 있는가?
- RQ5실제 데이터셋에서 주석 불확실성 수준이 다양할 경우 모델의 성능은 어떻게 평가되는가?
주요 결과
- 제안된 방법은 이전 최신 기준 방법 [35]에 비해 GazeFollow 벤치마크에서 AUC가 2.91% 절대적으로 향상되어 뛰어난 눈동자 목표 탐지 성능을 입증했다.
- 모델은 [35]에 비해 평균 눈동자 거리를 50% 감소시켜 눈동자 점 정밀도가 훨씬 향상됨을 나타낸다.
- 프레임 외 평균 정밀도에서 9% 향상되어 이미지 외부의 눈동자 타겟 탐지 능력이 향상됨을 보여준다.
- COCO에서의 미세조정 없이도 기준 모델 대비 눈을 쳐다본 객체 분류 및 위치 설정에서 평균 정밀도가 11–13% 향상되었으며, 이는 성능 향상을 의미한다.
- 주석 변동성이 증가함에 따라 모델은 일관되게 [35]보다 높은 AUC를 유지하며 노이즈가 많은 인간 주석에 대한 강건성을 입증했다.
- COCO 객체 주석 없이 GazeFollow에서 훈련되었음에도 불구하고 모델은 COCO 객체 클래스로 일반화가 잘 되었으며, 정확도와 파rameter 효율성 측면에서 DETR 기반 기준 모델을 능가했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.