[논문 리뷰] STARSS23: An Audio-Visual Dataset of Spatial Recordings of Real Scenes with Spatiotemporal Annotations of Sound Events
이 논문은 다채널 음향, 동기화된 영상, 음향 이벤트의 시공간적 애너테이션을 갖춘 실생활 음향 환경을 담은 새로운 음성-시각 데이터셋 STARSS23을 소개한다. 음향 이벤트 국지화 및 탐지(이하 SELD) 작업을 제안하며, 시각적 객체 위치 정보를 활용해 도아(DOA) 추정 성능을 향상시킨다. 운동 캡처 데이터로부터 인간이 확인한 DOA 레이블을 사용해 음향 전용 기준 모델 대비 뚜렷한 성능 향상을 입증한다.
While direction of arrival (DOA) of sound events is generally estimated from multichannel audio data recorded in a microphone array, sound events usually derive from visually perceptible source objects, e.g., sounds of footsteps come from the feet of a walker. This paper proposes an audio-visual sound event localization and detection (SELD) task, which uses multichannel audio and video information to estimate the temporal activation and DOA of target sound events. Audio-visual SELD systems can detect and localize sound events using signals from a microphone array and audio-visual correspondence. We also introduce an audio-visual dataset, Sony-TAu Realistic Spatial Soundscapes 2023 (STARSS23), which consists of multichannel audio data recorded with a microphone array, video data, and spatiotemporal annotation of sound events. Sound scenes in STARSS23 are recorded with instructions, which guide recording participants to ensure adequate activity and occurrences of sound events. STARSS23 also serves human-annotated temporal activation labels and human-confirmed DOA labels, which are based on tracking results of a motion capture system. Our benchmark results demonstrate the benefits of using visual object positions in audio-visual SELD tasks. The data is available at https://zenodo.org/record/7880637.
연구 동기 및 목표
- 정확한 시공간 애너테이션을 갖춘 실생활 다모달 음성-시각 SELD 데이터셋의 부족을 보완하기 위해.
- 복잡한 자연 음향 환경에서 시각 모odal이 방향 도래(DOA) 추정 정확도에 미치는 영향을 조사하기 위해.
- 운동 캡처 시스템에서 유도된 인간이 확인한 DOA 레이블을 포함한 벤치마크 데이터셋을 제공하여 음성-시각 SELD 시스템의 신뢰성 있는 평가를 가능하게 하기 위해.
- 실제로 겹치고 동적인 음향 이벤트를 기반으로 한 음성-시각 상관관계, 소스 분리, 다중 모달 학습 연구를 가능하게 하기 위해.
제안 방법
- 16개의 실내 공간에서 57명의 참가자와 함께 다채널 음향을 마이크 어레이로, 360도 카메라로 동기화된 영상을 촬영한다.
- 다양하고 자연스럽고 겹치는 음향 이벤트(예: 발소리, 대화, 진공청소기 등)를 확보하기 위해 지침에 따라 음향 환경을 기록한다.
- 음향 소스의 물리적 위치를 추적하기 위해 운동 캡처 시스템을 사용하고, 각 음향 이벤트에 대한 지상 진리 DOA 레이블을 생성한다.
- 각 프레임에 대해 인간 평가자가 검증한 시간적 활성화 및 DOA를 타겟 음향 클래스별로 애너테이션한다.
- 음향 및 영상 입력을 기반으로 모델을 훈련시어 시공간적 음향 이벤트 활성화와 DOA를 예측하는 음성-시각 SELD 벤치마크를 구축한다.
- Zenodo를 통해 공개 접근성과 확장 가능성을 확보하기 위해 MIT 라이선스 하에 데이터셋을 배포하며, DOI 10.5281/zenodo.7709051를 제공한다.
실험 결과
연구 질문
- RQ1시각 정보의 통합이 실생활 음성-시각 환경에서 음향 이벤트 국지화 및 탐지 정확도에 어떻게 기여하는가?
- RQ2겹치거나 일시적인 음향 이벤트의 경우, 시각적 객체 위치 정보가 DOA 추정의 모호함을 어느 정도 줄이는가?
- RQ3움직이는 소스가 있는 복잡하고 동적인 환경에서 STARSS23으로 훈련된 음성-시각 모델이 음향 전용 모델을 초월할 수 있는가?
- RQ4운동 캡처 시스템에서 유도된 인간이 확인한 DOA 레이블이 실생활 음향 환경에서 얼마나 신뢰할 수 있는가?
- RQ5실제로 합성되지 않은 데이터에서 음성-시각 융합이 SELD 작업에서 음향 전용 기준 모델 대비 어떤 성능 향상을 이끌어내는가?
주요 결과
- STARSS23를 활용한 음성-시각 SELD 시스템은 음향 전용 모델 대비 뚜렷한 국지화 정확도 향상을 보이며, 시각 모달이 공간적 모호성을 줄이는 데 기여함을 입증한다.
- 이 데이터셋은 16개의 실내 공간에서 57명의 참가자로부터 촬영한 7시간 이상의 실생활 기록을 포함하며, 음향 이벤트의 자연스러운 시간적 동적 특성과 공간적 이동을 잘 반영한다.
- DOA 레이블은 운동 캡처 추적 기반이며 인간 평가자가 검증하여 물리적 소스 위치에 대한 높은 신뢰성과 정밀도를 확보한다.
- 벤치마크 결과는 시각적 정보가 특히 발소리나 두드리기 같은 일시적 또는 겹치는 이벤트의 탐지 및 국지화 성능을 크게 향상시킴을 보여준다.
- STARSS23는 음성-시각 SELD, 화자 DOA 추정, 음향 소스 국지화, 다중 모달 검색 등 다양한 작업을 지원한다.
- 이 데이터셋은 Zenodo를 통해 공개되며, DOI 10.5281/zenodo.7709051를 통해 MIT 라이선스 하에 접근 가능하여 재현 가능한 연구와 커뮤니티 기여를 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.