Skip to main content
QUICK REVIEW

[논문 리뷰] Improved Conformer-based End-to-End Speech Recognition Using Neural Architecture Search

Yukun Liu, Li Ta|arXiv (Cornell University)|2021. 04. 12.
Speech Recognition and Synthesis참고 문헌 31인용 수 8
한 줄 요약

이 논문은 자동으로 개선된 데이터 특화 Conformer 기반 엔드 투 엔드 음성 인식 모델을 발견하기 위해 미분 가능 신경망 아키텍처 탐색(DARTS) 프레임워크를 제안한다. 다중 헤드 자기주의, 컨볼루션, 피드포워드 모듈에 대한 유연한 탐색 공간을 Conformer 기반 아키텍처에 확장하고, 동적 탐색 스케줄(DSS) 정규화를 적용함으로써, AISHELL-1에서 인간이 설계한 기준 모델 대비 11% 상대적인 CER 향상을 달성하면서도 낮은 탐색 비용을 유지한다.

ABSTRACT

Recently neural architecture search(NAS) has been successfully used in image classification, natural language processing, and automatic speech recognition(ASR) tasks for finding the state-of-the-art(SOTA) architectures than those human-designed architectures. NAS can derive a SOTA and data-specific architecture over validation data from a pre-defined search space with a search algorithm. Inspired by the success of NAS in ASR tasks, we propose a NAS-based ASR framework containing one search space and one differentiable search algorithm called Differentiable Architecture Search(DARTS). Our search space follows the convolution-augmented transformer(Conformer) backbone, which is a more expressive ASR architecture than those used in existing NAS-based ASR frameworks. To improve the performance of our method, a regulation method called Dynamic Search Schedule(DSS) is employed. On a widely used Mandarin benchmark AISHELL-1, our best-searched architecture outperforms the baseline Conform model significantly with about 11% CER relative improvement, and our method is proved to be pretty efficient by the search cost comparisons.

연구 동기 및 목표

  • 특정 데이터셋에 최적화되지 않은 고정된 인간 설계 아키텍처 블록의 한계를 해결하기 위해.
  • 기본적인 Conformer 설정을 초월해 더 나은 데이터 특화 아키텍처를 신경망 아키텍처 탐색(NAS)이 발견할 수 있는지 탐색하기 위해.
  • 기존 NAS 방법의 높은 계산 비용 문제를 해결하기 위해, 미분 가능 아키텍처 탐색(DARTS)을 활용하여 음성 인식에서의 비용을 낮추기 위해.
  • 일련의 새로운 정규화 전략인 동적 탐색 스케줄(DSS)을 통해 탐색 성능을 향상시켜 일반화 능력과 수렴 성능을 향상시키기 위해.
  • 대규모 중국어 음성 인식 벤치마크(AISHELL-1)에서 제안된 NAS 프레임워크의 효율성과 효과성을 검증하기 위해.

제안 방법

  • 다중 헤드 자기주의(MHSA), 컨볼루션(Conv), 피드포워드 네트워크(FFN) 모듈에 대해 각 블록이 독립적으로 여러 연산 중에서 선택할 수 있도록 하는 Conformer 아키텍처 기반의 탐색 공간을 설계한다.
  • 탐색 알고리즘으로 미분 가능 아키텍처 탐색(DARTS)을 사용하여, 탐색 공간의 연속적 리팩토링을 통해 아키텍처 파라미터를 기반으로 기울기 기반 최적화를 가능하게 한다.
  • 아키텍처 학습률을 학습 중에 동적으로 조정함으로써 안정성과 성능을 향상시키는 정규화 기법인 동적 탐색 스케줄(DSS)을 도입한다.
  • 모델 가중치와 아키텍처 파라미터를 동시에 최적화하는 단일 슈퍼넷을 훈련시켜, 단 한 번의 전체 훈련만으로도 효율적인 아키텍처 탐색을 가능하게 한다.
  • 모든 실험에 대해 단일 Nvidia Titan RTX를 사용하며, 온도 조절 스텝 수(25,000), 초기 학습률(1.0), 레이블 스무딩(0.1), 드롭아웃(0.1) 등의 초모수를 설정하고, DSS에 대해 β = 2.0을 설정한다.
  • 정확한 비교를 위해 최종 아키텍처를 AISHELL-1 데이터셋에서 다시 초기화하여 훈련시켜 평가한다.

실험 결과

연구 질문

  • RQ1기본 인간 설계 아키텍처보다 더 효과적이고 데이터 특화된 Conformer 기반 아키텍처를 신경망 아키텍처 탐색이 AISHELL-1 벤치마크에서 발견할 수 있는가?
  • RQ2기존의 강화 학습이나 진화 알고리즘 기반 NAS 방법과 비교해 DARTS가 음성 인식에서 탐색 비용을 크게 줄였는가?
  • RQ3동적 탐색 스케줄(DSS) 정규화 기법이 탐색된 아키텍처의 성능과 안정성 향상에 얼마나 효과적인가?
  • RQ4제안된 NAS 프레임워크는 기준 Conformer와 유사한 모델 크기를 유지하면서도 더 높은 음성 인식 성능을 달성할 수 있는가?
  • RQ5탐색 과정에서 도출된 아키텍처 패턴은 음성 모델의 표현 학습 원칙과 일치하는가?

주요 결과

  • DARTS에 DSS를 적용한 최적 아키텍처는 AISHELL-1 테스트 세트에서 기준 Conformer 대비 11% 상대적인 CER 향상을 달성하여 CER를 8.3%에서 7.5%로 감소시켰다.
  • DARTS에 DSS를 적용한 방법은 기준 Conformer와 DSS 없이 DARTS를 적용한 방법보다 뛰어나 16.7%의 CER를 달성했으며, 개발 세트에서는 6.7%, 테스트 세트에서는 7.5%의 CER를 기록했다.
  • DARTS에 DSS를 적용한 탐색 비용은 23.2시간으로, 랜덤 서치가 요구하는 322시간보다 크게 낮았으며, 기준 모델 재훈련 시간인 21.6시간과 유사했다.
  • DARTS 기반 방법은 랜덤 서치 대비 탐색 비용을 90% 이상 감소시켰으며, 탐색 공간의 복잡성에도 불구하고 높은 효율성을 입증했다.
  • 탐색된 아키텍처는 각 블록에서 다양한 연산 조합을 사용했으며, 깊이가 깊어질수록 MHSA 헤드 수가 16에서 4로 감소하고 후속 컨볼루션에서는 더 큰 커널 크기를 사용하는 등 계층적 특징 학습이 이루어지는 것으로 나타났다.
  • FFN 모듈은 항상 가장 큰 히든 차원(1024)을 선택했으며, 이는 히든 차원이 성능에 지배적인 영향을 미치며, 더 큰 용량을 선호한다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.