Skip to main content
QUICK REVIEW

[논문 리뷰] Top-down Tree Structured Decoding with Syntactic Connections for Neural Machine Translation and Parsing

Jetic Gū, Hassan S. Shavarani|arXiv (Cornell University)|2018. 09. 06.
Natural Language Processing Techniques참고 문헌 35인용 수 4
한 줄 요약

이 논문은 어순 구조를 고려한 어텐션과 문법적 연결(SynC)을 사용하여 복수의 문장어순을 고려한 디코딩을 수행하는 DRNN 기반의 상향식 트리 구조 신경 기계 번역 모델인 Seq2DRNN을 제안한다. 이는 유창성과 어순 재배열을 향상시킨다. 번역 품질은 최신 기술 수준에 도달하였고, 구성 문법 분석 성능도 경쟁력 있는 성능을 보였다. 이는 번역과 어절 구조 문법을 동시에 모델링함으로써 달성되었다.

ABSTRACT

The addition of syntax-aware decoding in Neural Machine Translation (NMT) systems requires an effective tree-structured neural network, a syntax-aware attention model and a language generation model that is sensitive to sentence structure. We exploit a top-down tree-structured model called DRNN (Doubly-Recurrent Neural Networks) first proposed by Alvarez-Melis and Jaakola (2017) to create an NMT model called Seq2DRNN that combines a sequential encoder with tree-structured decoding augmented with a syntax-aware attention model. Unlike previous approaches to syntax-based NMT which use dependency parsing models our method uses constituency parsing which we argue provides useful information for translation. In addition, we use the syntactic structure of the sentence to add new connections to the tree-structured decoder neural network (Seq2DRNN+SynC). We compare our NMT model with sequential and state of the art syntax-based NMT models and show that our model produces more fluent translations with better reordering. Since our model is capable of doing translation and constituency parsing at the same time we also compare our parsing accuracy against other neural parsing models.

연구 동기 및 목표

  • 목표 어순 구성 분석 구조를 디코딩 과정에 통합함으로써 신경 기계 번역(NMT)의 유창성과 어순 재배열을 향상시키는 것.
  • 기존의 하향식 디코딩 또는 의존 구조 분석에 의존하는 문법 인지 NMT 모델의 한계를 해결하기 위해 상향식 트리 구조 디코더를 도입하는 것.
  • NMT 디코딩을 지도하는 데 있어 의존 구조 분석 대비 구성 문법(어절 구조)의 유용성을 탐색하는 것.
  • 고품질의 신경 기계 번역과 구성 문법 분석을 동시에 수행할 수 있는 통합 모델을 개발하는 것.
  • DRNN 디코더에 구조적 문법 정보를 직접 은닉 상태 전이에 통합하기 위해 문법적 연결(SynC)을 도입하는 것.

제안 방법

  • 소스 문장을 위한 문맥적 표현을 생성하기 위해 양방향 LSTM 인코더를 사용한다.
  • 이중 순환 신경망(DRNN) 기반의 상향식 트리 구조 디코더를 사용하여 계층적이고 어절 구조 인지 방식으로 타겟 시퀀스를 생성한다.
  • 구성 문법 파싱 트리를 활용하여 소스 표현에 대한 어텐션을 지도하는 문법 인지 어텐션 메커니즘을 도입한다.
  • DRNN 디코더에 문법적 연결(SynC)을 추가하여 추가적인 순환 연결을 통해 구조적 문법 정보를 직접 전파할 수 있도록 한다.
  • 표준 NMT 목표와 교차 엔트로피 손실을 사용하여 엔드 투 엔드로 모델을 훈련하며, 동시에 번역 및 분석 성능을 최적화한다.
  • 도메인 내(IWSLT) 및 도메인 외(Penn Treebank) 데이터셋에서 표준 구성 문법 분석 메트릭(정밀도, 재현율, F1)을 사용하여 분석 성능을 평가한다.

실험 결과

연구 질문

  • RQ1구성 문법 트리 기반의 상향식 트리 구조 디코더가 기존의 순차적 및 문법 인지 모델 대비 신경 기계 번역 품질을 향상시킬 수 있는가?
  • RQ2DRNN 기반 디코더에 문법적 연결(SynC)을 통합함으로써 번역의 유창성과 어순 재배열 능력이 향상되는가?
  • RQ3독립적인 분석 헤드 없이도 하나의 모델이 고품질의 신경 기계 번역과 구성 문법 분석을 동시에 수행할 수 있는가?
  • RQ4특히 구조적 일관성과 어순 재배열 측면에서, 의존 구조 기반의 문법 대비 구성 기반의 문법이 NMT 디코딩을 지도하는 데 어떤 차이를 보이는가?
  • RQ5SynC 연결의 포함이 분석 정확도를 향상시키며 동시에 강력한 번역 성능을 유지하는 데 얼마나 기여하는가?

주요 결과

  • Seq2DRNN+SynC는 IWSLT에서 비표기된 구성 문법 분석에서 96.16 F1 점수를 기록하여, 기준 모델인 Seq2DRNN(96.90 F1)보다 비표기된 스펜에서 더 높은 성능을 보이며 강력한 분석 성능을 입증하였다.
  • 40단어 이하의 문장에서 정확한 매칭률이 52.16%에 도달하여 번역 출력의 높은 구조적 정밀도를 보였다.
  • Seq2DRNN+SynC는 강력한 Seq2Seq 기준 모델과 여러 최신 기술 수준의 문법 인지 NMT 모델보다 더 유창한 번역을 생성하였으며, 특히 복잡한 문법적 구조의 어순 재배열에서 뛰어난 성능을 보였다.
  • 긴 문장에서 분석 성능 F1 점수가 90.5로 나타나 길이 변화에 대한 강건성과 뛀난 일반화 능력을 보였다.
  • SynC의 포함으로 인해 분석 F1 점수가 약간 감소(96.16 vs. 96.90)했지만 번역 품질과 어순 재배열 능력이 크게 향상되어 NMT에 유리한 트레이드오프를 보였다.
  • Penn Treebank에서의 구성 문법 분석 성능(F1: 87.04)이 경쟁 수준이었으며, 이는 이 모델이 통합된 NMT 및 분석 시스템으로서의 능력을 확인시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.