Skip to main content
QUICK REVIEW

[논문 리뷰] JESC: Japanese-English Subtitle Corpus

Reid Pryzant, Yong-Joo Chung|arXiv (Cornell University)|2017. 10. 29.
Natural Language Processing Techniques참고 문헌 18인용 수 3
한 줄 요약

이 논문은 대화체 대화를 중점으로 하며, 320만 개의 자막 쌍을 포함한 가장 큰 공개 가능한 일본어-영어 병렬 코퍼스인 JESC를 소개한다. 웹 크롤링 및 커뮤니티 기반 자막을 활용하여 유창성과 정렬을 향상시키는 새로운 전처리 방법을 적용함으로써, 높은 수준의 双어 정렬 및 높은 품질의 번역 성능을 달성하였으며, 특히 도메인 외 일반화 성능에서 기존 데이터셋을 뛰어넘는 성능을 보였다.

ABSTRACT

In this paper we describe the Japanese-English Subtitle Corpus (JESC). JESC is a large Japanese-English parallel corpus covering the underrepresented domain of conversational dialogue. It consists of more than 3.2 million examples, making it the largest freely available dataset of its kind. The corpus was assembled by crawling and aligning subtitles found on the web. The assembly process incorporates a number of novel preprocessing elements to ensure high monolingual fluency and accurate bilingual alignments. We summarize its contents and evaluate its quality using human experts and baseline machine translation (MT) systems.

연구 동기 및 목표

  • 대화체 일본어-영어 대화 분야에서 대규모 고품질 병렬 코퍼스의 부족 문제를 해결하기 위해.
  • 팬 서브타이틀 기반의 다양한 매체에서 수집한 대규모 다양성 있는 데이터를 통해 기계 번역 시스템의 비공식적·구어체 언어에 대한 일반화 능력을 향상시키기 위해.
  • 노이즈가 많은 커뮤니티 기반 자막 데이터에서 단일 언어의 유창성과 이중 언어 정렬 정확도를 향상시키는 전처리 파이프라인을 개발하고 공개하기 위해.
  • 대규모 병렬 코퍼스에서 다중 기준 BLEU 평가를 지원하는 데이터셋을 구축하여, 번역 품질 평가의 정교함을 높이기 위해.
  • 전체 코퍼스, 도구, 크롤러, 파서를 공개하여 NLP 연구 분야에서의 재현 가능성과 광범위한 활용을 가능하게 하기 위해.

제안 방법

  • 4개의 오픈 레포지터리(kitsunekko.net, d-addicts.com, opensubtitles.org, subscene.com)에서 자막을 크롤링하여 총 23,318개의 제목에서 1억 개 이상의 캡션을 확보하였다.
  • ffmpeg와 chardet를 사용하여 모든 자막 파일을 UTF-8 및 .srt 형식으로 표준화한 후, 타임스탬프와 텍스트를 포함한 구조화된 YAML 형식으로 파싱하였다.
  • Birkbeck 코퍼스를 기반으로 훈련된 라플라스 스무oothing 적용 통계 오류 모델을 사용하여 영어 자막의 철자 및 문법 오류를 수정하였다.
  • 타임스탬프 매칭을 통한 시간 기반 정렬을 수행한 후, 잘못 정렬된 쌍을 제거하기 위한 필터링 단계를 추가하였다.
  • 다중 기준 번역 설정을 구현하여, 163,665개의 일본어 어휘와 130,790개의 영어 어휘에 대해 다수의 번역이 존재하도록 하였으며, 평가의 신뢰도를 높였다.
  • 서브워드 토크나이저(16,000개의 공통 어휘)를 사용한 데이터에 대해 양방향 LSTM, 어텐션 메커니즘, 드롭아웃, Adam 최적화를 적용한 시퀀스 투 시퀀스 모델을 훈련하여 기계 번역 평가를 수행하였다.

실험 결과

연구 질문

  • RQ1노이즈가 많은 입력 조건에서도 웹 크롤링을 통해 확보한 대규모, 커뮤니티 기반 자막 기반 병렬 코퍼스가 높은 수준의 이중 언어 정렬 및 단일 언어 유창성을 달성할 수 있는가?
  • RQ2대규모 대화체 도메인의 일본어-영어 병렬 코퍼스가 더 작은 공식적인 도메인 데이터셋에 비해 신경 기계 번역에서 도메인 외 일반화 성능을 향상시키는가?
  • RQ3자막의 커뮤니티 기반 비전문 번역이 기계 번역 시스템 훈련에 적합한 번역 적합성과 유창성을 유지하는가?
  • RQ4대규모 병렬 코퍼스에 포함된 다중 기준 번역 쌍이 BLEU 점수를 크게 향상시키고 더 견고한 평가 기준을 제공할 수 있는가?
  • RQ5JESC의 크기와 도메인 다양성은 ASPEC, OpenSubs, KWC와 같은 기존 코퍼스와 비교해 기계 번역 성능 향상에 어떤 영향을 미치는가?

주요 결과

  • JESC는 320만 개의 병렬 문장 쌍을 포함하여, 지금까지 공개된 바 있는 가장 큰 일본어-영어 병렬 코퍼스이다.
  • 인간 평가 결과, 문장 쌍의 75%가 완벽하게 정렬되어 있었으며, 코헨의 카파 값이 0.76로 높아 평가자 간 일치도가 높고 정렬 품질이 신뢰할 수 있음을 확인하였다.
  • 번역의 JPO 적합성 평균 점수는 5점 만점에 4.82점으로, 비공식적인 기원에도 불구하고 커뮤니티 기반 자막이 높은 번역 품질을 유지하고 있음을 확인하였다.
  • 기계 번역 평가에서 JESC는 자체 테스트 세트에서 BLEU 점수 14.21점을 기록하였으며, 더 큰 크기를 가진 ASPEC(36.23)와 비교해도 도메인 외 일반화 성능에서 OpenSubs(10.01)를 뛰어넘었다.
  • JESC로 훈련된 모델는 더 작은 또는 더 공식적인 도메인 데이터셋으로 훈련된 모델보다 더 우수한 일반화 성능을 보였으며, 이는 대화체 데이터가 기계 번역의 강건성 향상에 기여함을 시사한다.
  • 13만 개 이상의 어휘에 대해 다중 기준 번역을 포함함으로써 더 신뢰성 있고 세밀한 평가가 가능해졌으며, 이는 대부분의 대규모 기계 번역 평가 기준에서 부재한 특징이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.