Skip to main content
QUICK REVIEW

[논문 리뷰] Adapting Pretrained Transformer to Lattices for Spoken Language Understanding

Chao-Wei Huang, Yun-Nung Chen|arXiv (Cornell University)|2020. 11. 02.
Speech Recognition and Synthesis참고 문헌 16인용 수 4
한 줄 요약

이 논문은 자동 음성 인식(ASR)에서 유도된 라티스 입력을 처리하기 위해 사전 훈련된 트랜스포머를 적응시켜 구어 언어 이해(SLU) 성능을 향상시키는 방법을 제안한다. 라티스 가용성 마스크와 위치 인코딩을 도입함으로써 모델은 다수의 ASR 가설을 효과적으로 인코딩할 수 있으며, 다양한 음향 조건 하에서 ATIS 벤치마크에서 1-best 전사문에 비해 상대 오차 감소율 20.6%를 달성한다.

ABSTRACT

Lattices are compact representations that encode multiple hypotheses, such as speech recognition results or different word segmentations. It is shown that encoding lattices as opposed to 1-best results generated by automatic speech recognizer (ASR) boosts the performance of spoken language understanding (SLU). Recently, pretrained language models with the transformer architecture have achieved the state-of-the-art results on natural language understanding, but their ability of encoding lattices has not been explored. Therefore, this paper aims at adapting pretrained transformers to lattice inputs in order to perform understanding tasks specifically for spoken language. Our experiments on the benchmark ATIS dataset show that fine-tuning pretrained transformers with lattice inputs yields clear improvement over fine-tuning with 1-best results. Further evaluation demonstrates the effectiveness of our methods under different acoustic conditions. Our code is available at https://github.com/MiuLab/Lattice-SLU

연구 동기 및 목표

  • 1-best ASR 전사문이 의도 분류 등 후행 NLU 성능을 떨어뜨릴 수 있는 전사 오류에 취약한 점을 해결한다.
  • 텍스트에서 뛰어난 성능을 보이는 사전 훈련된 트랜스포머 모델이 ASR 시스템에서 유도된 불확실한 라티스 구조 입력을 효과적으로 인코딩할 수 있는지 탐색한다.
  • 강력한 인덕티브 바이어스와 전이 학습 능력을 유지하면서 트랜스포머 아키텍처를 라티스 처리에 적응시키는 방법을 개발한다.
  • 특히 ASR 품질이 열 劣한 경우에도 일관된 성능 향상을 입증한다.
  • 학습 데이터가 제한된 경우의 샘플 효율성과 ASR 오차율에 대한 저항력을 조사하여, 라티스 입력이 고품질 전사문에 대한 의존도를 감소시킴을 보여준다.

제안 방법

  • 라티스의 구조를 표현하기 위해 라티스 가용성 마스크를 도입하여 트랜스포머가 라티스 내 유효 경로만에 주의를 기울일 수 있도록 한다.
  • 라티스의 노드들에 대한 위상적 순서 기반으로 위치 임베딩을 할당하는 라티스 위치 인코딩 기법을 설계하여 구조적 맥락을 유지한다.
  • 1-best ASR 출력 대신 라티스 입력을 사용하여 SLU 작업에 대해 사전 훈련된 GPT 스타일 트랜스포머를 미세조정한다.
  • 의도 검출과 슬롯 예측을 위해 [CLS] 토큰 표현에 선형 분류기를 적용하고, 엔드 투 엔드 미세조정을 수행한다.
  • Adam 옵timizer를 사용하고 선형 증가 학습률 스케줄을 적용하며, 배치 크기가 8인 상태에서 5 에포크 동안 훈련한다.
  • 표준 주의 메커니즘과 라티스 인식 주의 메커니즘을 각각 사용하는 두 가지 변형을 평가한다. 두 모델 모두 동일한 마스킹 입력 표현을 사용한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 트랜스포머가 ASR 시스템에서 유도된 라티스 구조 입력을 효과적으로 인코딩할 수 있는가?
  • RQ21-best 전사문 대신 라티스 입력을 사용할 경우 의도 검출 및 슬롯 예측 성능에 측정 가능한 향상이 이루어지는가?
  • RQ3특히 ASR 단어 오류율(WER)이 높을 경우, 다양한 음향 조건에서 모델의 성능은 어떻게 변하는가?
  • RQ4학습 데이터가 제한된 경우 샘플 효율성이 어떻게 되며, 노이즈가 많은 라티스 입력에서 학습하기 위해 더 많은 예제가 필요한가?
  • RQ51-best 전사문 대비 라티스 입력이 ASR 오류에 대해 얼마나 더 강건한가?

주요 결과

  • 라티스 입력을 사용하여 사전 훈련된 트랜스포머를 미세조정하면, 세 가지 음향 조건에서 각각 32.4%, 15.4%, 20.6%의 상대 오차 감소율을 달성하여 1-best 기반 모델 대비 성능 향상을 이룬다.
  • 모든 음향 조건에서 일관된 성능 향상을 기록하며, 특히 높은 단어 오류율(WER) 조건에서 가장 큰 향상을 보였다.
  • 라티스를 위상적 순서로 선형화한 경우에도 성능 향상이 발생함을 확인하여, 다양한 단어 형태의 존재가 이해도 향상에 기여함을 시사한다.
  • 300에서 5,000개의 예제까지 다양한 학습 데이터 크기에서 항상 2%의 F1 점수 우수성을 유지하여 강력한 샘플 효율성을 입증한다.
  • WER가 15%를 초과할 경우, 라티스 기반 모델이 1-best 모델을 능가함을 확인하여, 열 劣한 ASR 품질에 대한 강건성을 입증한다.
  • 정성적 분석을 통해, 예를 들어 'far'와 같은 정답 단어가 라티스에 낮은 확률로 존재하더라도 모델이 올바른 의도를 정확히 식별하는 것을 확인하여, 효과적인 라티스 활용 능력을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.