Skip to main content
QUICK REVIEW

[논문 리뷰] Understanding Embodied Reference with Touch-Line Transformer

Yang Li, Xiaoxue Chen|arXiv (Cornell University)|2022. 10. 11.
Hand Gesture Recognition Systems인용 수 6
한 줄 요약

이 논문은 눈에서 손가락 끝까지의 가상의 촉각선(VTL)을 사용하여 몸체 기반 참조 이해 성능을 향상시키는 Touch-Line Transformer를 제안한다. 기존의 팔꿈치-손목 선 대신 VTL을 도입함으로써, 객체의 바운딩 박스와 VTL 벡터를 동시 예측하고 일致성 손실를 통해 기하학적 공선성을 강제함으로써, YouRefIt 데이터셋에서 0.75 IoU 기준으로 정확도를 25.0% 향상시켰으며, 모델과 인간 성능 간 격차의 63.6%를 메워냈다.

ABSTRACT

We study embodied reference understanding, the task of locating referents using embodied gestural signals and language references. Human studies have revealed that objects referred to or pointed to do not lie on the elbow-wrist line, a common misconception; instead, they lie on the so-called virtual touch line. However, existing human pose representations fail to incorporate the virtual touch line. To tackle this problem, we devise the touch-line transformer: It takes as input tokenized visual and textual features and simultaneously predicts the referent's bounding box and a touch-line vector. Leveraging this touch-line prior, we further devise a geometric consistency loss that encourages the co-linearity between referents and touch lines. Using the touch-line as gestural information improves model performances significantly. Experiments on the YouRefIt dataset show our method achieves a +25.0% accuracy improvement under the 0.75 IoU criterion, closing 63.6% of the gap between model and human performances. Furthermore, we computationally verify prior human studies by showing that computational models more accurately locate referents when using the virtual touch line than when using the elbow-wrist line.

연구 동기 및 목표

  • 기존 몸체 기반 참조 이해 모델이 잘못된 제스처 표현인 팔꿈치-손목 선에 의존하는 한계를 해결하기 위해.
  • 비언어적 제스처 신호와 언어적 언급을 동시에 모델링하여 참조 대상의 정확한 국지를 향상시키기 위해.
  • 가상의 촉각선(VTL)이 인간의 손가락 가리키기 제스처에서 팔꿈치-손목 선(EWL)보다 더 정확한 제스처 신호임을 검증하기 위해.
  • 다수의 참조 대상이 존재하는 복잡하고 모호한 시각적 환경에서 인공 에이전트와 인간 간의 성능 격차를 줄이기 위해.

제안 방법

  • 눈과 손가락 끝을 연결하는 가상의 촉각선(VTL)을 추가하여 COCO 스타일의 관절 그래프를 보강함으로써 새로운 인간 자세 표현을 제안한다.
  • 시각적 입력과 텍스트 입력을 동시에 처리하여 참조 대상의 바운딩 박스와 VTL 벡터를 예측하는 다중모달 트랜스포머인 Touch-Line Transformer를 제안한다.
  • 예측된 참조 중심과 VTL 벡터 간의 공선성을 강제함으로써 공간 정렬을 향상시키는 기하학적 일致성 손실를 설계한다.
  • 테스트 케이스에서 머리가 가림을 처리하기 위해 이미지 복원 기법을 사용하여 머리가 보이지 않더라도 VTL 추정이 가능하도록 한다.
  • 참조 대상 중심의 진짜값과 예측값을 사용하여 VTL과 참조 방향 간의 코사인 유사도를 계산함으로써 VTL의 정확도를 검증한다.
  • 여러 개의 IoU 임계값 하에서 성능을 평가하고 GIoU를 사용하여 안정성을 확보하며, 자세 정보, EWL, VTL, 참조 정렬 손실 유무에 따른 아블레이션 변형을 비교한다.

실험 결과

연구 질문

  • RQ1가상의 촉각선(VTL)은 기존의 팔꿈치-손목 선(EWL)보다 참조 대상 국지화에 더 정확한 공간적 신호를 제공하는가?
  • RQ2비전-언어 모델이 제스처 신호(VTL)와 언어적 참조를 동시에 활용하여 몸체 기반 참조 이해를 향상시킬 수 있는가?
  • RQ3예측된 참조와 VTL 간의 기하학적 공선성을 강제함으로써 국지화 오차는 어느 정도 감소하는가?
  • RQ4다양한 객체 크기와 IoU 임계값에서 제안된 방법이 최신 기술 수준의 모델들과 비교해 성능 면에서 어떻게 나타나는가?

주요 결과

  • YouRefIt 데이터셋에서 0.75 IoU 기준으로 Touch-Line Transformer는 최신 기술 수준의 방법보다 정확도를 25.0% 향상시켰다.
  • 모델과 인간 성능 간 격차의 63.6%를 메워내어 인간-모델 격차를 크게 줄였다.
  • EWL에서 VTL로 전환함으로써 제스처 선과 참조 방향 간의 코사인 유사도가 0.9580에서 0.9901로 상승하여 VTL이 참조 대상과 더 잘 일치함을 확인했다.
  • 참조 정렬 손실는 IoU 임계값 0.25, 0.50, 0.75에서 각각 4.0, 4.5, 2.6점의 성능 향상을 이끌어내어 그 효과를 입증했다.
  • VTL를 사용할 경우 소형 객체에 대해 더 뛰어난 성능(0.75 IoU 기준 13.4%)을 보였으며, 이는 소형 참조 대상의 탐지 능력 향상을 시사한다.
  • GIoU 평가 기준에서 VTL 기반 모델은 0.75 IoU 기준으로 38.2%의 정확도를 기록하여 모든 아블레이션 변형보다 뛰어나며, 안정성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.