[논문 리뷰] Audio Transformers
이 논문은 컨볼루션 없이 원시 오디오에서 작동하는 엔드 투 엔드 Transformer 아키텍처를 제시하고, FSD50K 데이터셋에서 최첨단 평균 정밀도(mean average precision, mAP)를 달성하며 성능 향상을 위한 풀링 및 다중 스케일 임베딩을 탐구한다.
Over the past two decades, CNN architectures have produced compelling models of sound perception and cognition, learning hierarchical organizations of features. Analogous to successes in computer vision, audio feature classification can be optimized for a particular task of interest, over a wide variety of datasets and labels. In fact similar architectures designed for image understanding have proven effective for acoustic scene analysis. Here we propose applying Transformer based architectures without convolutional layers to raw audio signals. On a standard dataset of Free Sound 50K,comprising of 200 categories, our model outperforms convolutional models to produce state of the art results. This is significant as unlike in natural language processing and computer vision, we do not perform unsupervised pre-training for outperforming convolutional architectures. On the same training set, with respect mean aver-age precision benchmarks, we show a significant improvement. We further improve the performance of Transformer architectures by using techniques such as pooling inspired from convolutional net-work designed in the past few years. In addition, we also show how multi-rate signal processing ideas inspired from wavelets, can be applied to the Transformer embeddings to improve the results. We also show how our models learns a non-linear non constant band-width filter-bank, which shows an adaptable time frequency front end representation for the task of audio understanding, different from other tasks e.g. pitch estimation.
연구 동기 및 목표
- 순수 Transformer 아키텍처(컨볼루션 없음)가 대규모 오디오 장면 이해에서 CNN 기반의 기초 모델을 능가할 수 있음을 시연한다.
- 오디오 작업에 맞춰 시간-주파수 분석을 적응시키는 프런트 엔드 학습 가능 표현을 조사한다.
- Transformer 성능을 향상시키기 위한 풀링 및 다중 스케일 임베딩 전략을 탐구한다.
- 학습 가능한 프런트 엔드가 비선형적이고 가변 대역폭 필터 뱅크를 어떻게 개발하는지 보여준다.
- FSD50K 데이터셋에 대한 다양한 아키텍처에 대해 경험적 비교를 제공한다.
제안 방법
- 1초 오디오(16 kHz)를 Transformer 호환 임베딩으로 적응시키기 위해 프런트 엔드 밀집 계층(2048에서 64) 사용.
- 2개의 Transformer 계층마다 시퀀스를 줄이고 계층적 특징을 가능하게 하는 6-layer, 64-d 임베딩, 8 주의 헤드를 가진 인코더를 쌓는다.
- 시간 구조를 유지하기 위해 위치 인코딩(사인형)을 포함한다.
- 차원을 축소하고 계층적 특징을 가능하게 하기 위해 매 두 개의 Transformer 계층마다 시간 축을 따라 풀링을 적용한다.
- 가변 윈도잉과 미분 가능 분해를 통해 Wavelets에서 영감을 받은 다중 스케일 임베딩을 도입한다.
- Adam 옵티마이저와 Huber 손실로 FSD50K 데이터셋에서 엔드 투 엔드 학습을 수행하고 CNN 베이스라인과 비교한다.
실험 결과
연구 질문
- RQ1컨볼루션 계층 없이 순수 Transformer 아키텍처가 대규모 오디오 이해 작업에서 최첨단 성능을 달성할 수 있는가?
- RQ2풀링 및 다중 스케일 임베딩 전략이 오디오 데이터에서 Transformer 성능에 어떤 영향을 미치는가?
- RQ3오디오 이해를 위해 엔드 투 엔드로 학습될 때 학습 가능한 프런트 엔드가 어떤 종류의 시간-주파수 표현을 개발하는가?
- RQ4FSD50K에서 다른 모델 규모에 따라 Transformer 기반 모델이 CNN과 어떻게 비교되는가?
- RQ5아키텍처의 깊이와 임베딩 크기가 오디오 mAP 성능에 어떤 영향을 미치는가?
주요 결과
- 컨볼루션 없이의 기본 Transformer가 음향 현장 이해에서 일반적인 CNN 기반 아키텍처를 능가한다.
- 대형 6-계층 Transformer가 여러 CNN 변형보다 더 높은 mAP에 도달한다(예: 0.525 vs 낮은 CNN 점수).
- 두 Transformer 계층마다 풀링(특히 평균 풀링)을 적용하면 기준보다 성능이 향상된다.
- 다중 스케일 및 웨이브렛에서 영감을 받은 임베딩 전략이 추가 개선을 제공하지만 다중 스케일 변형의 정확한 mAP는 제시되어 있지 않다.
- 학습 가능한 프런트 엔드는 비선형적이고 가변 대역폭 필터 뱅크를 발견하며 시간-주파수 분석에 적응하는 필터를 포함한다(사인형, 시작 탐지기, 에너지 엔벨로프를 포함).
- 프런트 엔드는 과제 간 일반화되며 피치 추정과 음향 현장 이해에 대해 서로 다른 필터 모양을 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.