Skip to main content
QUICK REVIEW

[논문 리뷰] ViTac: Feature Sharing between Vision and Tactile Sensing for Cloth Texture Recognition

Shan Luo, Wenzhen Yuan|arXiv (Cornell University)|2018. 02. 21.
Tactile and Sensory Interactions참고 문헌 19인용 수 15
한 줄 요약

이 논문은 시각 및 촉각 센서 간의 공유 잠재 공간을 학습하기 위해 심층 최대 공분산 분 析(DMCA)을 사용하는 딥 퓨전 프레임워크인 ViTac을 제안한다. 카메라 이미지와 GelSight 촉각 데이터의 특징을 DMCA를 통해 융합함으로써, 이 방법은 90% 이상의 인식 정확도를 달성하며, 양 모odal 간의 상보적 정보를 활용하여 단모달 성능을 향상시킨다.

ABSTRACT

Vision and touch are two of the important sensing modalities for humans and they offer complementary information for sensing the environment. Robots could also benefit from such multi-modal sensing ability. In this paper, addressing for the first time (to the best of our knowledge) texture recognition from tactile images and vision, we propose a new fusion method named Deep Maximum Covariance Analysis (DMCA) to learn a joint latent space for sharing features through vision and tactile sensing. The features of camera images and tactile data acquired from a GelSight sensor are learned by deep neural networks. But the learned features are of a high dimensionality and are redundant due to the differences between the two sensing modalities, which deteriorates the perception performance. To address this, the learned features are paired using maximum covariance analysis. Results of the algorithm on a newly collected dataset of paired visual and tactile data relating to cloth textures show that a good recognition performance of greater than 90\% can be achieved by using the proposed DMCA framework. In addition, we find that the perception performance of either vision or tactile sensing can be improved by employing the shared representation space, compared to learning from unimodal data.

연구 동기 및 목표

  • 시각 및 촉각 센싱을 융합하여 옷감 질감 인식을 향상시키기 위해 두 모달 간의 상보적 정보를 활용하는 도전 과제를 해결하기 위해.
  • 일조 조건, 색상 변동 및 힘에 의한 변형과 같은 모달 고유의 변동성을 완화하는 공동 잠재 공간을 학습하기 위해.
  • 고립된 상태에서 테스트할 경우, 공유 표현이 어느 모달에서도 인식 성능을 향상시킨다는 것을 입증하기 위해.
  • 옷감 질감 인식을 위한 새로운 쌍체 시각-촉각 데이터셋(ViTac)을 제안하기 위해.
  • 심층 특징이 최대 공분산 분석을 통해 효과적으로 정렬될 수 있다는 것을 검증하기 위해.

제안 방법

  • 심층 신경망을 사용하여 카메라 이미지 및 GelSight 촉각 센서 데이터에서 고차원 특징을 추출한다.
  • 심층 최대 공분산 분석(DMCA)을 적용하여 두 모달 간의 상관관계를 최대화하는 공유 저차원 잠재 공간을 학습한다.
  • DMCA 프레임워크는 두 모달 간의 공분산을 최대화하면서도 모달 고유의 노이즈와 분산을 감소시켜 특징을 정렬한다.
  • 쌍체 시각 및 촉각 데이터를 기반으로 학습하여, 추론 시에 쌍체 데이터가 필요하지 않은 공동 표현 학습을 가능하게 한다.
  • 테스트 시에 한 모달(시각 또는 촉각)만 이용 가능한 경우에도 공유 표현을 사용하여 분류 성능을 향상시킨다.
  • 이 프레임워크는 이중 모달 데이터로 학습하고 단모달 데이터로 테스트하여 일반화 능력과 성능 향상을 평가한다.

실험 결과

연구 질문

  • RQ1시각 및 촉각 센싱 간에 공유된 잠재 공간을 학습할 수 있는가? 이는 단모달 성능을 초월하여 옷감 질감 인식을 향상시킬 수 있는가?
  • RQ2학습 시 한 모달이 포함될 경우, 추론 시 다른 모달의 인식 정확도에 어떤 영향을 미치는가?
  • RQ3DMCA는 일조 조건, 힘, 색상 등의 모달 고유의 변동성을 어느 정도 감소시킬 수 있으며, 공유된 질감 정보는 유지되는가?
  • RQ4테스트 시 시각 또는 촉각 데이터만 사용할 경우, 제안된 DMCA 프레임워크가 단모달 기준선을 초월하는가?
  • RQ5이중 모달 데이터에서 학습된 공유 표현은 새로운, 알려지지 않은 옷감 질감으로 일반화되는데 효과적인가?

주요 결과

  • 공유 표현을 이중 모달 데이터에서 학습한 후, 카메라 이미지만으로 테스트했을 때 제안된 DMCA 프레임워크는 옷감 질감 인식 정확도 92.6%를 달성한다.
  • GelSight 촉각 데이터만으로 테스트했을 때 프레임워크는 90%의 정확도를 기록하여 단모달 기준선 대비 뚜렷한 향상을 보였다.
  • 단독으로 단모달 데이터로 학습한 경우, 시각 전용 모델은 GelSight 테스트 데이터에서 오직 16.7%의 정확도를 기록했고, 촉각 전용 모델은 카메라 데이터에서 오직 14.8%의 정확도를 기록했다. 이는 공유 표현의 이점이 뚜렷하게 드러난다.
  • 공유 표현을 사용할 경우 양 모달의 성능이 향상되며, 이는 한 모달의 상보적 특징이 다른 모달의 성능을 향상시킨다는 것을 시사한다.
  • 출력 차원이 20를 초과할 경우, 두 모달에 대해 DMCA의 분류 정확도가 약 90%로 수렴함을 확인하여 최적의 표현으로 수렴하는 것을 확인했다.
  • 결과는 MCA가 수작업 특징 외에도 다모달 학습에서 심층 신경망으로 학습된 특징에도 효과적이라는 것을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.