[논문 리뷰] AV-NeRF: Learning Neural Fields for Real-World Audio-Visual Scene Synthesis
AV-NeRF는 실제 영상 기록에서 현실적인 청각-시각 장면을 합성하기 위한 새로운 NeRF 기반 프레임워크를 제안한다. 음향 인지 기반 음성 생성, 기하학적 인지 기반 음향 전파, 음향 소스 중심의 좌표 변환을 통합한다. 실제 세계(RWAVS) 및 합성(SoundSpaces) 데이터셋에서 최신 기술을 초월하여 음질 측정 지표에서 최대 39% 향상된 성능을 달성한다.
Can machines recording an audio-visual scene produce realistic, matching audio-visual experiences at novel positions and novel view directions? We answer it by studying a new task -- real-world audio-visual scene synthesis -- and a first-of-its-kind NeRF-based approach for multimodal learning. Concretely, given a video recording of an audio-visual scene, the task is to synthesize new videos with spatial audios along arbitrary novel camera trajectories in that scene. We propose an acoustic-aware audio generation module that integrates prior knowledge of audio propagation into NeRF, in which we implicitly associate audio generation with the 3D geometry and material properties of a visual environment. Furthermore, we present a coordinate transformation module that expresses a view direction relative to the sound source, enabling the model to learn sound source-centric acoustic fields. To facilitate the study of this new task, we collect a high-quality Real-World Audio-Visual Scene (RWAVS) dataset. We demonstrate the advantages of our method on this real-world dataset and the simulation-based SoundSpaces dataset.
연구 동기 및 목표
- 실제 영상 기록에서 새로운 카메라 자세에서 일致하고 몰입감 있는 청각-시각 장면을 합성하는 문제를 해결하기 위해.
- 거리 감쇠 및 머리 방향에 따라 달라지는 바이너럴 촬영 신호를 반영하는 공간 음향을 모델링하기 위해.
- 시각 기하학 및 재질 특성과 음향 필드 학습을 융합한 다중모달 신경 필드를 개발하여 현실감을 향상시키기 위해.
- 이 새로운 작업을 위한 벤치마킹을 지원하기 위해 고품질의 실제 세계 청각-시각 데이터셋(RWAVS)을 구축하고 공개하기 위해.
- 실제 및 합성 환경에서 기존 베이스라인에 비해 제안된 방법의 우수성을 입증하기 위해.
제안 방법
- AV-NeRF는 시각 렌더링을 위한 V-NeRF와 청취자 위치 및 머리 방향에 기반한 연속적인 음향 필드 학습을 위한 A-NeRF를 포함하는 이중 브랜치 아키텍처를 사용한다.
- AV-Mapper 모듈은 V-NeRF에서 추출한 기하학적 및 재질 특징을 A-NeRF에 통합하여 물리적 음향 전파를 고려한 음향 인지 기반 음성 생성을 가능하게 한다.
- 시점 방향을 음향 소스 기준으로 표현하는 좌표 변환 메커니즘이 도입되어 모델이 음향 소스 중심의 음향 필드를 학습할 수 있도록 한다.
- 절대 좌표 또는 상대 좌표를 사용하는 것보다 방향성 청각 인지의 특성을 더 잘 반영하기 위해 위치 인코딩 대신 상대 각도 임베딩을 사용한다.
- 음성 합성은 3D 장면 기하학 및 재질 특성에 조건화되어 있어 거리 민감성과 방향 인지 기반 바이너럴 음향 생성이 가능하다.
- 프레임, 카메라 자세, 실제 영상 기록에서 확보한 바이너럴 음향을 사용하여 프레임워크를 엔드 투 엔드로 훈련한다.
실험 결과
연구 질문
- RQ1신경 필드 모델은 실제 세계의 청각-시각 장면에서 새로운 카메라 경로를 따라 일致하고 현실적인 바이너럴 음향과 영상을 생성할 수 있는가?
- RQ2에너지 감쇠 및 머리관련 전달 함수와 같은 음향 전파의 물리 원리를 신경 렌더링 프레임워크에 어떻게 통합할 수 있는가?
- RQ3음향 필드 학습에서 절대 좌표를 사용하는 것과 비교해 음향 소스 기준으로 방향을 표현하는 것이 어떤 영향을 미치는가?
- RQ4시각 기하학 및 재질 정보의 다중모달 융합은 음향 합성 품질에 어떤 영향을 미치는가?
- RQ5단일 신경 필드가 다양한 실내 및 실외 환경에서 시각 및 공간 음향 콘텐츠를 얼마나 잘 표현할 수 있는가?
주요 결과
- AV-NeRF는 MAG 음질 측정 지표에서 이전 최신 기술인 INRAS 대비 39% 상대적 향상을 달성했으며, 0.956 대비 1.504로, ENV 지표에서도 11.6% 향상되었다.
- SoundSpaces 데이터셋에서 AV-NeRF는 T60 지표를 INRAS 대비 21% 감소시켜 2.47로, INRAS의 3.14에 비해 향상되었다.
- AV-NeRF는 ViGAS에 비해 MAG에서 1.504, ENV에서 0.145 향상되어 다양한 시점에서의 일반화 능력이 뛰어나다는 것을 입증했다.
- 절단 실험 결과 AV-Mapper와 좌표 변환 기법이 모두 필수적임을 확인했으며, 이들을 제거할 경우 음질이 크게 악화되었다.
- 절대 또는 상대 각도에 대한 위치 인코딩보다 상대 각도 임베딩이 더 우수한 성능을 보였으며, 이는 청각 인지 기반 음향 표현의 중요성을 강조한다.
- 모델은 시각적 분석과 정량적 분석을 통해 참값과 유사한 신호 에너지 및 이어날 차이를 가지는 바이너럴 음향을 생성했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.