Skip to main content
QUICK REVIEW

[논문 리뷰] Darts-Conformer: Towards Efficient Gradient-Based Neural Architecture Search For End-to-End ASR

Xian Shi, Pan Zhou|arXiv (Cornell University)|2021. 04. 07.
Advanced Neural Network Applications참고 문헌 32인용 수 6
한 줄 요약

이 논문은 DARTS 모터를 컨포머 블록과 융합하여 효율적이고 고성능인 엔드 투 엔드 ASR 모델을 자동으로 탐색하는 비가역적 신경망 아키텍처 탐색 방법인 Darts-Conformer를 제안한다. 이 방법은 단지 0.7 GPU 일의 탐색 시간 동안 AISHELL-1에서 기준 모델인 컨포머 대비 4.7% 상대적인 CER 향상을 달성하며, 엔드 투 엔드 음성 인식에서 효율적이고 기울기 기반의 아키텍처 탐색의 가능성을 입증한다.

ABSTRACT

Neural architecture search (NAS) has been successfully applied to tasks like image classification and language modeling for finding efficient high-performance network architectures. In ASR field especially end-to-end ASR, the related research is still in its infancy. In this work, we focus on applying NAS on the most popular manually designed model: Conformer, and then propose an efficient ASR model searching method that benefits from the natural advantage of differentiable architecture search (Darts) in reducing computational overheads. We fuse Darts mutator and Conformer blocks to form a complete search space, within which a modified architecture called Darts-Conformer cell is found automatically. The entire searching process on AISHELL-1 dataset costs only 0.7 GPU days. Replacing the Conformer encoder by stacking searched cell, we get an end-to-end ASR model (named as Darts-Conformner) that outperforms the Conformer baseline by 4.7\% on the open-source AISHELL-1 dataset. Besides, we verify the transferability of the architecture searched on a small dataset to a larger 2k-hour dataset. To the best of our knowledge, this is the first successful attempt to apply gradient-based architecture search in the attention-based encoder-decoder ASR model.

연구 동기 및 목표

  • 다양한 아키텍처 탐색(DARTS)을 컨포머 아키텍처에 적용하여 효율적인 엔드 투 엔드 ASR 모델의 자동 설계를 목표로 한다.
  • 자동 음성 인식에서 신경망 아키텍처 탐색과 관련된 높은 계산 비용을 줄이기 위해 노력한다.
  • 작은 데이터셋에서 탐색한 아키텍처가 더 큰 ASR 데이터셋으로의 이식 가능성(이식성)을 탐색한다.
  • 컨포머 기반 모델에서 수동적인 아키텍처 설계를 유지하거나 개선하면서 성능을 향상시키는 것을 목표로 한다.

제안 방법

  • 탐색 공간은 컨포머 블록 내의 네 가지 모듈—두 개의 피드포워드 네트워크, 한 개의 컨볼루션 모듈, 한 개의 멀티헤드 어텐션 모듈—을 비가역적 DAG의 노드로 간주하여 구성된다.
  • 수정된 DARTS 모터를 사용하여 노드 간의 후보 연산과 연결을 동시에 탐색하며, 아키텍처 파라미터의 연속적 리포지셔닝을 가능하게 한다.
  • 이중 최적화를 통해 아키텍처 파라미터와 네트워크 가중치를 동시에 최적화하며, 기울기 하강법을 이용해 아키텍처 공간을 효율적으로 탐색한다.
  • 최종 Darts-Conformer 셀은 탐색된 아키텍처를 여섯 번 스택하여 완전한 6층 인코더를 구성하며, 디코더는 기준 모델과 동일하게 유지된다.
  • 모든 후보 연산과 연결을 동시에 훈련하는 슈퍼넷을 사용하여, 개별 아키텍처를 다시 훈련하지 않고도 효율적인 아키텍처 탐색을 가능하게 한다.
  • 탐색은 AISHELL-1 데이터셋에서 수행되며, 결과로 도출된 아키텍처는 AISHELL-1과 더 큰 Sogou-2k 데이터셋에서 평가되어 이식성 여부를 점검한다.

실험 결과

연구 질문

  • RQ1다양한 아키텍처 탐색(DARTS)은 엔드 투 엔드 음성 인식 모델, 특히 컨포머 아키텍처에 효과적으로 적용될 수 있는가?
  • RQ2제안된 Darts-Conformer 방법의 탐색 비용은 얼마나 효율적인가? 그리고 수동으로 설계된 모델 대비 성능 향상을 달성할 수 있는가?
  • RQ3AISHELL-1과 같은 작은 데이터셋에서 탐색한 아키텍처는 Sogou-2k와 같은 더 큰, 더 복잡한 데이터셋으로 일반화될 수 있는가?
  • RQ4각 탐색된 구성 요소(예: 어텐션 헤드 수, 커널 크기, 스킵 연결 등)가 최종 모델 성능에 기여하는 정도는 어떠한가?

주요 결과

  • Darts-Conformer 모델은 AISHELL-1 테스트 세트에서 기준 컨포머 대비 4.7% 상대적인 문자 오류률(CER) 감소를 달성하며, CER는 6.1%에서 6.4%로 각각 측정되었다.
  • 탐색 과정에 단지 0.7 GPU 일의 시간만 소요되었으며, 이는 이전의 NAS 방법들이 수천 개의 GPU 일을 요구하는 데 비해 계산 비용을 크게 줄인 것이다.
  • 제거 실험 결과, 입력 후보나 선택된 연산(예: 4헤드 어텐션 및 작은 커널 크기)을 제거할 경우 성능 저하가 발생하여, 탐색된 구성 요소의 중요성을 확인하였다.
  • 탐색된 아키텍처는 잘 일반화된다: Sogou-2k 데이터셋에서 Darts-Conformer는 클리어 및 노이즈 있는 테스트 세트에서 기준 모델을 앞서며, 각각 10.6% vs. 10.9% 및 7.2% vs. 7.5%의 성능을 기록했으며, 패러필드 세트에서는 동일한 성능을 보였다.
  • 2681만 개의 파라미터를 가진 모델이 2767만 개의 파라미터를 가진 더 큰 기준 모델(더 높은 어텐션 차원)보다 성능이 뛰어나, 더 높은 파라미터 효율성을 보여주었다.
  • 결과적으로 기울기 기반의 NAS가 수동적인 아키텍처 설계 없이도 개선된 ASR 아키텍처를 효과적으로 탐색할 수 있음을 검증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.