Skip to main content
QUICK REVIEW

[논문 리뷰] Can Transformer be Too Compositional? Analysing Idiom Processing in Neural Machine Translation

Verna Dankers, Christopher G. Lucas|arXiv (Cornell University)|2022. 05. 30.
Natural Language Processing Techniques인용 수 4
한 줄 요약

이 논문은 변환기 기반 신경 기계 번역(NMT) 모델이 비합성적 의미를 지닌 관용어를 번역할 때 자주 너무 직역적으로 번역하는 이유를 조사한다. 일곱 개의 유럽어를 대상으로 인코더 및 디코더 헤드의 주의 패턴과 은닉 표현을 분석한 결과, 관용어는 상호작용이 감소한 통합된 어휘 단위로 처리되지만, 여전히 합성적 출력을 내보내는 경향이 있음을 발견했다. 주요 기여는 모델의 합성적 인덕티브 바이어스가 비합성적 처리를 약화시킨다는 점을 규명한 것으로, 관용어 번역을 향상시키기 위해 아키텍처 수정이 필요하다는 것을 시사한다.

ABSTRACT

Unlike literal expressions, idioms' meanings do not directly follow from their parts, posing a challenge for neural machine translation (NMT). NMT models are often unable to translate idioms accurately and over-generate compositional, literal translations. In this work, we investigate whether the non-compositionality of idioms is reflected in the mechanics of the dominant NMT model, Transformer, by analysing the hidden states and attention patterns for models with English as source language and one of seven European languages as target language. When Transformer emits a non-literal translation - i.e. identifies the expression as idiomatic - the encoder processes idioms more strongly as single lexical units compared to literal expressions. This manifests in idioms' parts being grouped through attention and in reduced interaction between idioms and their context. In the decoder's cross-attention, figurative inputs result in reduced attention on source-side tokens. These results suggest that Transformer's tendency to process idioms as compositional expressions contributes to literal translations of idioms.

연구 동기 및 목표

  • 변환기 기반 NMT 모델이 비합성적 의미를 지닌 관용어를 번역할 때 자주 직역 번역을 내보내는 이유를 조사하는 것.
  • 변환기 인코더 및 디코더의 은닉 상태와 주의 메커니즘에서 관용어가 어떻게 표현되는지 분석하는 것.
  • 모델의 합성적 인덕티브 바이어스가 여러 유럽어에서 정확한 관용어 번역을 방해하는지 판단하는 것.
  • 은닉 표현에 간섭을 가함으로써 모델이 합성적 번역 경향을 인과적으로 변화시킬 수 있는지 평가하는 것.
  • NMT에서 관용어의 비합성적 처리를 향상시키기 위한 아키텍처 개선에 대한 통찰을 제공하는 것.

제안 방법

  • 저자는 단일 언어의 영어 코퍼스를 사용하고, 번역 행동의 재구성 행동을 바탕으로 모델 번역을 관용어 또는 직역으로 수동으로 레이블링한다.
  • 해석 가능성 기법을 적용하여 관용어 표현(PIE) 간에 인코더의 자기주의와 디코더의 교차주의를 비교한다.
  • INLP(해석 가능한 비선형 프로브)를 사용하여 관용어 토큰의 은닉 표현을 분석함으로써 관용적 의미가 모델 표현에 선형적으로 코딩되어 있는지 평가한다.
  • 여러 층을 거쳐 인코더의 은닉 상태에 간섭을 가하여 표현 변경이 번역 출력에 미치는 인과적 영향을 시험한다.
  • 인간 평가를 통해 수법적 레이블링 방법의 정확성을 검증하여 재구성된 번역이 실제로 관용어임을 확인한다.
  • 결과는 일곱 개의 유럽어 목표 언어를 대상으로 분석하여 발견의 다국어 일관성을 평가한다.

실험 결과

연구 질문

  • RQ1변환기 인코더에서 관용어 표현과 직역 표현 간의 주의 패턴은 어떻게 다를까?
  • RQ2디코더는 관용어 번역과 직역 번역 시에 인코더 출력에 얼마나 의존하는가?
  • RQ3관용어의 관용적 의미가 모델의 은닉 표현에 선형적으로 코딩되어 있으며, 간섭을 통해 조작될 수 있는가?
  • RQ4모델의 합성적 인덕티브 바이어스는 관용어의 비합성적 번역 능력에 어떻게 영향을 미치는가?
  • RQ5은닉 표현을 수정하는 아키텍처 간섭이 모델의 직역 번역 경향을 줄일 수 있는가?

주요 결과

  • 관용어는 인코더에서 상호작용이 감소한 통합된 어휘 단위로 처리되며, 내부 주의가 증가한다.
  • 디코더는 관용어를 번역할 때 인코더 출력에 대한 교차주의가 감소하여 의미 유도 과정에서 더 높은 독립성을 보인다.
  • INLP를 사용한 은닉 상태 간섭이 재구성 행동을 성공적으로 감소시키고 합성적 번역을 증가시켰으며, 성공률은 스웨덴어의 27%에서 스페인어의 40%까지 다양하다.
  • 모델의 직역 번역 경향은 강건하여, 간섭 후에도 70% 이상의 관용어 번역이 그대로 단어 대 단어로 유지되었으며, 이는 비합성적 처리가 약하다는 것을 시사한다.
  • 은닉 표현에서 관용적 의미의 신호는 높은 층에서 더 잘 탐지되며, 이는 비합성적 처리가 네트워크의 후반 단계에서 나타남을 시사한다.
  • 결과는 합성성 중심의 훈련 기법이 관용어 번역에 악영향을 줄 수 있으며, 향후 NMT 설계 시 주의가 필요하다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.