[논문 리뷰] VGGSound: A Large-scale Audio-Visual Dataset
이 논문은 309개 클래스에 걸쳐 200만 개의 YouTube 클립을 포함하는 대규모 음성-시각 데이터셋인 VGG-Sound를 소개한다. 이 데이터셋은 컴퓨터 비전 기반 파이프라인을 통해 음성-시각 일치를 보장하고 레이블 노이즈를 최소화하도록 총괄적으로 구성되었다. 이 방법은 이미지 분류, 음성 검증 및 모델 앙상블를 활용하여 데이터 총괄을 자동화하며, 스펙트로그램에 직접 적용된 컨볼루션 신경망(CNN)을 사용해 강력한 음성 인식 기준 성능을 달성한다.
Our goal is to collect a large-scale audio-visual dataset with low label noise from videos in the wild using computer vision techniques. The resulting dataset can be used for training and evaluating audio recognition models. We make three contributions. First, we propose a scalable pipeline based on computer vision techniques to create an audio dataset from open-source media. Our pipeline involves obtaining videos from YouTube; using image classification algorithms to localize audio-visual correspondence; and filtering out ambient noise using audio verification. Second, we use this pipeline to curate the VGGSound dataset consisting of more than 210k videos for 310 audio classes. Third, we investigate various Convolutional Neural Network~(CNN) architectures and aggregation approaches to establish audio recognition baselines for our new dataset. Compared to existing audio datasets, VGGSound ensures audio-visual correspondence and is collected under unconstrained conditions. Code and the dataset are available at http://www.robots.ox.ac.uk/~vgg/data/vggsound/
연구 동기 및 목표
- 오픈소스 비디오에서 인간의 정제된 레이블 최소화로 대규모 음성-시각 데이터셋을 수집하기 위한 확장 가능한 자동화 파이프라인 개발
- 음성-시각 일치와 낮은 레이블 노이즈를 갖춘 20만 개 이상의 비디오 클립을 포함하는 VGG-Sound 데이터셋 총괄
- 원시 스펙트로그램에 직접 적용된 깊은 컨볼루션 신경망(CNN) 아키텍처를 사용해 VGG-Sound에서 강력한 음성 인식 기준 성능 수립
- 제약 없는 실세계 조건에서 음성 인식 및 음성-시각 이해 연구를 가능하게 하기
제안 방법
- 파이프라인은 YouTube에서 비디오를 확보하고, 사전 학습된 이미지 분류 모델을 사용해 소리의 원천에 해당하는 시각 영역를 국소화한다.
- 음성-시각 일치는 음성 검증을 통해 클립을 필터링하여 확인되며, 소리의 원천이 시각적으로 존재함을 보장한다.
- 두 단계 모델 앙상블 과정을 사용한다: 먼저 반의 데이터로 음성 분류기를 훈련하고, 나머지 반의 데이터에 대해 예측을 수행하며, 상위 3개 예측에 포함된 클립을 고신뢰도 양성 샘플로 유지한다.
- 어려운 양성 샘플은 신뢰도가 높은 클립의 시각적 특징을 계산하고, 나머지 데이터셋에서 시각적으로 유사하지만 청각적으로 기각된 클립을 검색함으로써 추출한다.
- 최종 재학습 단계에서는 모든 확인된 양성 샘플을 결합하고 이전에 기각된 데이터에서 추가 클립을 검색하여 데이터셋의 크기와 다양성을 증가시킨다.
- 중복 제거는 서로 다른 YouTube ID를 가졌더라도 동일한 시각적 표현을 가진 클립을 제거함으로써 수행된다.

실험 결과
연구 질문
- RQ1컴퓨터 비전 기반 기법에 기반한 완전 자동 파이프라인이 인간의 간섭 최소화로 고품질의 음성-시각 데이터셋 총괄을 달성할 수 있는가?
- RQ2VGG-Sound에서 훈련된 음성 인식 모델의 성능은 AudioSet과 같은 다른 데이터셋에서 훈련된 모델과 비교해 어떻게 되는가?
- RQ3모델 앙상블 및 시각적 검색 기법이 약한 지도 학습 환경에서 양성 음성-시각 클립의 품질과 다양성에 얼마나 기여하는가?
- RQ4더 깊은 CNN 아키텍처는 VGG-Sound 데이터셋에서 얕은 모델에 비해 얼마나 더 높은 성능 향상을 보이는가?
주요 결과
- VGG-Sound 데이터셋은 309개 클래스에 걸쳐 총 200,467개의 비디오 클립을 포함하며, 각 클래스에 최소 200개의 클립이 있으며 총 길이는 550시간이다.
- 제안된 파이프라인은 시각적 일관성과 모델 앙상블를 활용해 레이블 노이즈를 감소시켜, 광범위한 수동 레이블링 없이도 고신뢰도 양성 클립 선택을 달성한다.
- 모델-D는 전체 VGG-Sound 데이터셋으로 훈련된 더 깊은 ResNet18이며, AStest 하위집합으로만 훈련된 모델-A보다 더 높은 mAP 및 AUC 점수를 기록하여 더 우수한 일반화 성능을 보였다.
- 모델-D와 모델-A 간의 Top-5 정확도 격차는 유의미하게 감소하여, 전체 VGG-Sound 데이터셋이 AStest 하위집합보다 더 복잡하고 다중 소리 예제를 더 잘 포괄하고 있음을 시사한다.
- 결과적으로 더 깊은 CNN 아키텍처가 VGG-Sound에서 얕은 모델보다 뛰어난 성능을 보였으며, 더 깊은 모델-C는 얕은 모델-B보다 더 높은 성능을 달성했다.
- 최종 데이터셋은 강력한 음성-시각 일치를 유지하고 있으며, 각 10초 클립은 소리의 시각적 원천을 명확히 보여주어 음성-시각 작업의 신뢰성 있는 훈련을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.