Skip to main content
QUICK REVIEW

[논문 리뷰] BatVision with GCC-PHAT Features for Better Sound to Vision Predictions

Jesper Haahr Christensen, Sascha Hornauer|arXiv (Cornell University)|2020. 06. 14.
Speech and Audio Processing참고 문헌 8인용 수 5
한 줄 요약

이 논문은 일반화된 상관관계를 통한 위상 변환(GCC-PHAT) 특징을 입력으로 사용하고, 잔차 내 잔차 밀집 블록 및 스펙트럼 정규화를 결합함으로써 이명파 에코 신호로부터 깊이 맵과 회색조 이미지 재구성 품질을 향상시킨 향상된 음성-시각 합성 시스템 BatVision을 제안한다. 이 방법은 원시 파형과 스펙트로그램에 비해 더 뛰어난 재구성 품질과 훈련 안정성을 달성하며, 저조도 조건에서 시각 외의 보조 또는 대체 모odal로 음향 중심의 환경 인식 가능성을 입증한다.

ABSTRACT

Inspired by sophisticated echolocation abilities found in nature, we train a generative adversarial network to predict plausible depth maps and grayscale layouts from sound. To achieve this, our sound-to-vision model processes binaural echo-returns from chirping sounds. We build upon previous work with BatVision that consists of a sound-to-vision model and a self-collected dataset using our mobile robot and low-cost hardware. We improve on the previous model by introducing several changes to the model, which leads to a better depth and grayscale estimation, and increased perceptual quality. Rather than using raw binaural waveforms as input, we generate generalized cross-correlation (GCC) features and use these as input instead. In addition, we change the model generator and base it on residual learning and use spectral normalization in the discriminator. We compare and present both quantitative and qualitative improvements over our previous BatVision model.

연구 동기 및 목표

  • 이명파 에코 신호만으로 3차원 깊이 맵과 타당한 회색조 레이아웃을 예측할 수 있는 기계 학습 시스템을 개발하는 것.
  • GCC-PHAT 특징이 음성-시각 생성에 있어 원시 파형과 스펙트로그램에 비해 우수한 성능을 보이는지 조사하는 것.
  • 잔차 내 잔차 밀집 블록 및 스펙트럼 정규화와 같은 아키텍처 혁신을 통해 훈련 안정성과 재구성 품질을 향상시키는 것.
  • 특히 저조도 조건에서 시각 외의 보조 또는 대체 모달리티로서 음향 중심의 환경 인식 가능성을 입증하는 것.

제안 방법

  • 시스템은 인공 귀에 장착된 두 개의 마이크에서 얻은 이명파 음성 신호를 사용하며, 훈련 중에는 카메라를 통해 촬영된 스테레오 RGB 및 깊이 맵 데이터와 동기화된다.
  • GCC-PHAT 특징은 주파수 도메인에서 각 귀의 신호를 전송된 치르프 신호와 상관시킨 후, 역 푸리에 변환을 통해 시간 도메인 상관 특징을 도출한다.
  • 이러한 GCC-PHAT 특징은 좌우 채널 간 연결되어 시간적 컨volution 인코더를 통해 잠재 음성 표현을 추출한다.
  • 생성자는 잔차 내 잔차 밀집 블록을 사용하여 특징 학습과 특징 재사용을 향상시켜 재구성 품질을 향상시킨다.
  • 판별자는 배치 정규화 대신 스펙트럼 정규화를 사용하여 훈련을 안정화시키고 GAN 수렴을 향상시킨다.
  • 모델는 복합 손실으로 훈련되며, 최소 제곱 GAN 손실, 가중치 인자 λ를 가진 적대적 손실, L1 재구성 손실이 포함된다.

실험 결과

연구 질문

  • RQ1원시 파형이나 스펙트로그램에 비해 GCC-PHAT 특징을 사용할 경우, 이명파 에코로부터 깊이 맵 및 회색조 이미지 예측 품질이 유의미하게 향상되는가?
  • RQ2잔차 내 잔차 밀집 블록의 사용은 생성자에게 세밀한 환경 구조 재구성 능력을 향상시키는가?
  • RQ3이 음성-시각 작업에 대해 PatchGAN 판별자에서 스펙트럼 정규화가 배치 정규화보다 더 안정적인 훈련을 이끌어내는가?
  • RQ4시각 입력 없이도 음성만으로 타당한 3차원 환경 레이아웃을 얼마나 잘 재구성할 수 있는가?
  • RQ5제안된 모델은 원래 BatVision 아키텍처에 비해 하이퍼파rameter 변화 및 데이터 증강에 대해 얼마나 강건한가?

주요 결과

  • GCC-PHAT 특징을 사용한 제안된 방법은 모든 구성 중에서 깊이 맵 예측에 가장 낮은 L1 손실(0.0645)을 기록했으며, 원래 BatVision의 파형 기반 구성(0.0880)을 능가했다.
  • GCC-PHAT 특징을 사용한 모델은 깊이 맵 정확도(δ<1.25³) 0.556을 기록했으며, 원래 BatVision의 파형 기반(0.484) 및 스펙트로그램 기반(0.521)을 모두 초월했다.
  • 재구성된 깊이 맵는 원래 BatVision 대비 훨씬 적은 노이즈와 더 정확한 공간 레이아웃을 보였으며, 가까운 물체와 먼 물체 간의 구분이 뚜렷했다.
  • 판별자에서 스펙트럼 정규화를 사용함으로써 훈련 과정이 더 안정적이었으며, 하이퍼파rameter 변화에 대한 민감도가 감소했다.
  • 정성적 결과는 제안된 모델이 정확한 외관 재구성을 음성만으로는 불가능하더라도, 일관된 자유 공간과 장애물 레이아웃을 가진 더 자연스럽고 인지적으로 타당한 회색조 이미지를 생성함을 보여주었다.
  • GCC-PHAT 특징과 새로운 아키텍처를 사용한 모델는 정량적 성능과 시각적 품질의 최적의 균형을 달성했으며, 제안된 구성 요소의 효과성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.