Skip to main content
QUICK REVIEW

[논문 리뷰] EasyCom: An Augmented Reality Dataset to Support Algorithms for Easy Communication in Noisy Environments

Jacob Donley, Vladimir Tourbabin|arXiv (Cornell University)|2021. 07. 09.
Speech and Audio Processing참고 문헌 28인용 수 32
한 줄 요약

이 논문은 노이즈가 섞인 사회적 환경에서 동기화된 다채널 오디오, 비디오 및 주석을 포함하는 대형 자가시점 AR 데이터셋 EasyCom을 소개하고, baseline 빔포밍 접근법과 평가를 제시한다.

ABSTRACT

Augmented Reality (AR) as a platform has the potential to facilitate the reduction of the cocktail party effect. Future AR headsets could potentially leverage information from an array of sensors spanning many different modalities. Training and testing signal processing and machine learning algorithms on tasks such as beam-forming and speech enhancement require high quality representative data. To the best of the author's knowledge, as of publication there are no available datasets that contain synchronized egocentric multi-channel audio and video with dynamic movement and conversations in a noisy environment. In this work, we describe, evaluate and release a dataset that contains over 5 hours of multi-modal data useful for training and testing algorithms for the application of improving conversations for an AR glasses wearer. We provide speech intelligibility, quality and signal-to-noise ratio improvement results for a baseline method and show improvements across all tested metrics. The dataset we are releasing contains AR glasses egocentric multi-channel microphone array audio, wide field-of-view RGB video, speech source pose, headset microphone audio, annotated voice activity, speech transcriptions, head bounding boxes, target of speech and source identification labels. We have created and are releasing this dataset to facilitate research in multi-modal AR solutions to the cocktail party problem.

연구 동기 및 목표

  • AR에서 칵테일 파티 효과를 완화하기 위해 현실적이고 자가시점의 다중 모달 데이터의 필요성을 제시한다.
  • 센서, 주석 및 취득 프로토콜을 포함하여 EasyCom 데이터셋을 설명한다.
  • 시끄러운 환경에서 다중 모달 AR 솔루션에 대한 연구를 가능하게 하도록 데이터셋을 공개적으로 배포한다.
  • AR 구도에서 대상 음성 향상을 평가하기 위한 기본 신호 처리 방법과 정량적 벤치마크를 제공한다.

제안 방법

  • 레스토랑과 유사한 방의 데이터 수집 구성(크기 6m x 7m x 3m)과 총 ~5시간 데이터의 12세션.
  • AR 안경 착용자와 헤드셋 마이크로폰 및 모션 트래킹으로 EGOCentric 다중 채널 마이크로폰 오디오 및 광시야(FOV) 비디오를 기록.
  • 사람 평가자와 자동 도구를 사용하여 음성 활동, 대화 전사, 화자의 대상 및 얼굴/헤드 바운딩 박스를 주석화.
  • 센서 융합 연구를 위한 보정 데이터와 자세/궤도 정보를 제공.
  • 대상 음성 소스를 강화하고 소음과 왜곡을 억제하기 위한 기본 다중 채널 빔포어를 제안(최대 DI 빔포머).
  • 추정된 d(omega)와 R(omega) 및 WOLA 처리 파이프라인을 사용한 빔포어 가중치의 계산을 개략적으로 제시.

실험 결과

연구 질문

  • RQ1다중 모달 AR 데이터가 AR 착용자의 칵테일 파티 문제 완화에 어떻게 활용될 수 있는가?
  • RQ2EasyCom 데이터에 대한 Baseline 최대 DI 빔포어가 SNR, 이해도, 품질 지표에서 어떤 성능 향상을 보이는가?
  • RQ3자가시점 동적 특성과 다중 센서 융합이 현실적인 노이즈 환경에서 음성 향상에 어떤 영향을 미치는가?

주요 결과

  • 데이터셋은 약 5시간 18분의 데이터를 323개의 1분 세그먼트로 포함하며(약 79 GB, CC-BY-NC-4.0).
  • Baseline 최대 DI 빔포어는 노이즈 및 간섭 조건에서 기준 마이크에 비해 여러 지표를 향상시킴(SNR: -9.27 to -6.62; SegSNR: -14.2 to -10.7; SDR: -8.98 to -7.79; STOI: 0.504 to 0.590; PESQ: 1.17 to 1.27; HASQI: 0.268 to 0.319).
  • 노이즈+간섭자 조건에서 baseline이 SNR을 -13.3에서 -10.1로 개선하고 기준 마이크에 비해 STOI/SDR 관련 지표를 더 높게 유지한다.
  • 데이터셋은 VO 활동 검출, 화자 구분, ASR, 오디오-비주얼 음성 처리 등 광범위한 목표에 대한 평가를 가능하게 하는 풍부한 주석 및 포즈 데이터를 제공한다.
  • Baseline 결과는 AR 착용자로부터의 ATF 및 상대 기하정보를 활용할 때 실시간 빔포어가 가능함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.