Skip to main content
QUICK REVIEW

[논문 리뷰] Subtitles to Segmentation: Improving Low-Resource Speech-to-Text Translation Pipelines

David Wan, Zhengping Jiang|arXiv (Cornell University)|2020. 10. 19.
Natural Language Processing Techniques참고 문헌 13인용 수 4
한 줄 요약

이 논문은 리투아니아어 및 불가리아어와 같은 저자원 언어를 대상으로 개선된 자동 음성 인식(ASR) 분할 모델을 훈련하기 위해 텔레비전 및 영화 자막을 대체 데이터셋으로 사용하는 방법을 제안한다. 비정상적인 품사 태깅 및 의존성 파싱 특징을 분할되지 않은 ASR 출력에서 유도함으로써, 분할 정확도를 향상시키고 기계 번역 및 다국어 정보 검색 성능에 상당한 향상을 이룬다.

ABSTRACT

In this work, we focus on improving ASR output segmentation in the context of low-resource language speech-to-text translation. ASR output segmentation is crucial, as ASR systems segment the input audio using purely acoustic information and are not guaranteed to output sentence-like segments. Since most MT systems expect sentences as input, feeding in longer unsegmented passages can lead to sub-optimal performance. We explore the feasibility of using datasets of subtitles from TV shows and movies to train better ASR segmentation models. We further incorporate part-of-speech (POS) tag and dependency label information (derived from the unsegmented ASR outputs) into our segmentation model. We show that this noisy syntactic information can improve model accuracy. We evaluate our models intrinsically on segmentation quality and extrinsically on downstream MT performance, as well as downstream tasks including cross-lingual information retrieval (CLIR) tasks and human relevance assessments. Our model shows improved performance on downstream tasks for Lithuanian and Bulgarian.

연구 동기 및 목표

  • 저자원 음성-텍스트 번역 파이프라인에서 나쁜 ASR 출력 분할 문제를 해결하기 위해.
  • 분할을 위한 레이블링된 훈련 데이터가 없거나 부족한 상황에서 분할 품질을 향상시키기 위해.
  • 구두점과 대화 전환 신호가 풍부한 자막을 분할 모델 훈련을 위한 대체 자료로 사용할 수 있는지 탐색하기 위해.
  • 노이즈가 섞인 ASR 출력에서 유도된 구문 특징(품사 태깅 및 의존성 파싱)이 분할 정확도에 미치는 영향을 평가하기 위해.
  • 기계 번역 및 다국어 정보 검색(CLIR) 작업에서의 후행 성능 향상을 입증하기 위해.

제안 방법

  • 구두점과 화자 전환 마커를 사용하여 자막에서 문장 경계를 추출함으로써 대체 분할 데이터셋을 구축한다.
  • 음성 특징과 분할되지 않은 ASR 출력에서 유도된 구문 특징(품사 태깅 및 의존성 레이블)을 사용하여 신경 시퀀스 태깅 모델을 훈련하여 문장 경계를 예측한다.
  • 원시 ASR 가설에 대해 품사 태깅 및 의존성 파싱을 수행하여 분할을 위한 노이즈가 섞였지만 유용한 구문 특징을 생성한다.
  • 분할 정확도 평가를 위해 내재적 평가를 F1 점수 및 윈도우 차이(WD)로 실시한다.
  • 기계 번역(BLEU, AQWV) 및 다국어 정보 검색(CLIR) 작업에서 문서 수준 및 문장 수준에서 외재적 평가를 실시한다.
  • 기계 번역 품질 및 검색된 문장의 질의 관련성 평가를 위해 인간 평가를 아마존 메카니컬 터크를 통해 실시한다.

실험 결과

연구 질문

  • RQ1텔레비전 및 영화 자막을 저자원 환경에서 ASR 분할 모델 훈련을 위한 효과적인 대체 데이터셋으로 활용할 수 있는가?
  • RQ2분할되지 않은 ASR 출력에서 유도된 노이즈가 섞인 구문 특징(품사 태깅 및 의존성 파싱)을 통합하면 분할 모델 성능이 향상되는가?
  • RQ3개선된 분할이 기계 번역 및 CLIR 작업에서 측정 가능한 성과 향상으로 이어지는가?
  • RQ4기계 번역 품질과 관련성에 대한 인간 평가에서 제안된 분할 모델은 음성 전용 분할 모델보다 어떻게 비교되는가?
  • RQ5다른 기계 번역 시스템과 도메인(예: CS 도메인)에서 모델은 일관된 향상을 보이는가?

주요 결과

  • 구문 특징을 포함한 Sub+S 모델은 리투아니아어에서 45.94의 F1 점수, 불가리아어에서 56.40의 F1 점수를 기록하여 기준 모델보다 통계적으로 유의미한 성능 향상을 보였다.
  • CS 도메인에서 Sub+S 모델은 기준 모델 대비 AQWV를 0.106점 향상시켰으며, UMD-SMT/NB에서 최대 0.125점의 절대적 향상을 기록했다.
  • 인간 평가에서 불가리아어의 질의 관련성에 대해 일관된 향상이 있었으며, UMD-SMT에서 통계적으로 유의미한 향상이 있었지만 리투아니아어에서는 BLEU 점수에 유의미한 향상이 없었다.
  • 특히 음성 전용 분할 모델이 조각나고 문장처럼 보이지 않는 분할을 생성하는 CS 도메인에서 인간 평가에서 관련성 평가에서 제안된 모델이 뛰어난 성능을 보였다.
  • 리투아니아어에서 BLEU 점수가 낮았음에도 불구하고, 문서 수준의 CLIR에서 성능 향상이 있었으며, 이는 번역 품질 변동에 대해 강건함을 시사한다.
  • 자막을 대체 데이터셋으로 사용함으로써, 제한된 데이터를 가진 저자원 환경에서도 여러 평가 설정에서 일관된 성능 향상이 이루어졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.