Skip to main content
QUICK REVIEW

[논문 리뷰] Can we cover navigational perception needs of the visually impaired by panoptic segmentation?

Wei Mao, Jiaming Zhang|arXiv (Cornell University)|2020. 07. 20.
Tactile and Sensory Interactions참고 문헌 31인용 수 7
한 줄 요약

이 논문은 실시간으로 '사람', '차량'과 같은 'things'(물체)와 '도로', '보도'와 같은 'stuff'(영역)를 동시에 인식함으로써 시각 장애인이 통합적이고 종합적인 장면 인식을 가능하게 하는 웨어러블 보조 시스템을 제안한다. 이 시스템은 단일 딥러닝 모델을 활용하여 풀 패널식 세분화를 통해 픽셀 수준의 의미적 및 인스턴스 인식 능력을 제공함으로써 기존의 세분화 방법을 뛰어넘어 이동 안전성과 환경 인식 능력을 크게 향상시킨다.

ABSTRACT

Navigational perception for visually impaired people has been substantially promoted by both classic and deep learning based segmentation methods. In classic visual recognition methods, the segmentation models are mostly object-dependent, which means a specific algorithm has to be devised for the object of interest. In contrast, deep learning based models such as instance segmentation and semantic segmentation allow to individually recognize part of the entire scene, namely things or stuff, for blind individuals. However, both of them can not provide a holistic understanding of the surroundings for the visually impaired. Panoptic segmentation is a newly proposed visual model with the aim of unifying semantic segmentation and instance segmentation. Motivated by that, we propose to utilize panoptic segmentation as an approach to navigating visually impaired people by offering both things and stuff awareness in the proximity of the visually impaired. We demonstrate that panoptic segmentation is able to equip the visually impaired with a holistic real-world scene perception through a wearable assistive system.

연구 동기 및 목표

  • 기존의 보조 시스템이 물체 중심의 모델에 의존하거나 배경 이해 능력이 부족하여 환경 인식 범위가 제한되어 있는 문제를 해결하고자 한다.
  • 세분화 가능한 물체('things')와 형태가 없는 영역('stuff')을 하나의 통합된 프레임워크에서 동시에 인식하여 장면 인식 능력을 향상시키고자 한다.
  • 패널식 세분화가 종합적인 시각적 장면 이해를 통해 실시간으로 통합된 픽셀 수준의 장면 이해를 제공함으로써 이동 인식 요구 사항을 종합적으로 충족시킬 수 있는지 평가하고자 한다.
  • 패널식 세분화를 RGB-D 센서와 통합하여 실시간 3D 인식 지원이 가능한 웨어러블 보조 시스템을 개발하고 검증하고자 한다.

제안 방법

  • 시스템은 각 픽셀에 클래스 레이블과 인스턴스 ID를 할당하는 딥러닝 기반의 패널식 세분화 모델을 사용하여 'things'와 'stuff'를 통합적으로 이해한다.
  • 웨어러블 RGB-D 카메라가 시각 장애인이 1인칭 시점에서 실시간으로 시각적 및 깊이 데이터를 촬영한다.
  • 패널식 세분화 결과는 객체 카테고리와 공간 거리와 같은 의미적 및 인스턴스 기반 정보를 추출하기 위해 처리된다.
  • 시스템은 세분화 결과를 음성 설명 등의 음성 피처로 변환하여 사용자에게 객체 유형, 위치 및 공간 관계를 전달한다.
  • 프레임워크는 도로, 다리, 원형 교차로 등 다양한 도시 환경에서의 이동 중에 촬영한 실세계 시퀀스를 기반으로 평가된다.
  • 깊이 데이터 통합은 거리 추정 기능을 가능하게 하여 3D 장면 이해를 향상시키고, 이는 이동 안전성에 매우 중요하다.

실험 결과

연구 질문

  • RQ1패널식 세분화는 실세계 장면에서 시각 장애인이 사용하는 'things'와 'stuff'를 통합적이고 종합적으로 인식할 수 있는가?
  • RQ2패널식 세분화는 시각 장애인의 이동 인식을 지원하는 데 있어 의미적 세분화와 인스턴스 세분화와 비교해 어떻게 성능을 발휘하는가?
  • RQ3웨어러블 패널식 세분화 시스템은 다양한 도시 이동 환경에서 얼마나 높은 강건성과 정확도를 유지할 수 있는가?
  • RQ4시스템은 음성 피드백을 통해 객체 식별 정보와 공간적 맥락을 효과적으로 전달하여 실시간 이동을 향상시킬 수 있는가?

주요 결과

  • 패널식 세분화는 의미적 세분화와 인스턴스 세분화를 성공적으로 통합하여 하나의 출력에서 클래스 수준과 인스턴스 수준의 이해를 동시에 제공함으로써 이전의 방법에 비해 한계를 극복한다.
  • 다양한 도시 환경, 특히 원형 교차로와 버스 정류장에서 도로, 보도, 차량, 보행자와 같은 핵심 이동 요소의 세분화 정확도가 높게 유지된다.
  • 시각화 결과는 패널식 세분화가 다양한 조도 조건과 가림 상황에서도 다수의 차량과 같은 명확한 물체와 보도, 도로와 같은 연속된 영역을 정확히 식별함을 보여준다.
  • RGB-D 카메라에서 얻은 깊이 데이터 통합은 거리 추정 기능을 가능하게 하여 공간 인식 능력을 향상시키며, 이는 안전한 이동에 매우 중요한 요소이다.
  • 시스템은 실세계 이동 시퀀스에서 뛰어난 성능을 보이며, 동적인 장면에서도 일관되고 신뢰할 수 있는 패널식 세분화 예측을 유지한다.
  • 결과는 패널식 세분화가 시각 장애인에게 종합적이고 실시간 환경 인식을 제공하는 데 실현 가능하고 효과적인 접근법임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.