Skip to main content
QUICK REVIEW

[논문 리뷰] MAD for Robust Reinforcement Learning in Machine Translation

Domenic Donato, Lei Yu|arXiv (Cornell University)|2022. 07. 18.
Natural Language Processing Techniques인용 수 5
한 줄 요약

이 논문은 신경 기계 번역에서 강화 학습을 위한 안정적이고 일반화 능력이 뛰어난 분산형 정책 기울기 알고리즘인 MAD를 제안한다. 조건부 보상 정규화와 평균 절대편차(MAD) 기반의 안정적인 중요도 가중치 기반의 방법을 통해 학습 안정성과 일반화 능력을 향상시킨다. MAD는 교차 엔트로피 미세조정 대비 평균 2.0 BLEU 향상을 달성하고, 비드 서치 초모수에 대한 민감도를 감소시킨다.

ABSTRACT

We introduce a new distributed policy gradient algorithm and show that it outperforms existing reward-aware training procedures such as REINFORCE, minimum risk training (MRT) and proximal policy optimization (PPO) in terms of training stability and generalization performance when optimizing machine translation models. Our algorithm, which we call MAD (on account of using the mean absolute deviation in the importance weighting calculation), has distributed data generators sampling multiple candidates per source sentence on worker nodes, while a central learner updates the policy. MAD depends crucially on two variance reduction strategies: (1) a conditional reward normalization method that ensures each source sentence has both positive and negative reward translation examples and (2) a new robust importance weighting scheme that acts as a conditional entropy regularizer. Experiments on a variety of translation tasks show that policies learned using the MAD algorithm perform very well when using both greedy decoding and beam search, and that the learned policies are sensitive to the specific reward used during training.

연구 동기 및 목표

  • 신경 기계 번역에서 기존의 보상 인식 학습 방법의 불안정성과 열악한 일반화 능력을 해결하기 위해.
  • brittle한 보조 평가 기반 네트워크에 의존하지 않고도 정책 기울기 추정의 분산을 줄이기 위해.
  • 각 소스 문장에 대해 높은 보상과 낮은 보상 번역을 균형 있게 다양하게 샘플링함으로써 정책의 강건성을 향상시키기 위해.
  • 온도 범위 샘플링을 통해 계산 비용을 줄이고 효율적인 초모수 튜닝을 가능하게 하기 위해.
  • 학습 중에 사용된 보상 함수에 따라 학습된 정책이 민감하게 반응함을 확인함으로써 보상 기반 학습을 확인하기 위해.

제안 방법

  • 알고리즘은 다수의 워커를 사용하는 분산 아키텍처를 활용하며, 약간 오래된 정책에서 다양한 번역 후보를 다양한 샘플링 온도를 사용해 생성한다.
  • 각 소스 문장마다 조건부 보상 정규화를 적용하여, 보상의 경험적 평균을 중심으로 하고 표준편차로 스케일링함으로써 각 배치에 양성 및 음성 보상 예제가 포함되도록 보장한다.
  • 평균 절대편차(MAD) 기반의 새로운 안정적인 중요도 가중치 기반 방법이 조건부 엔트로피 정규화 기능을 수행하며, 현재 정책에서 약간 떨어진 궤적에 집중하여 탐색과 안정성을 유지한다.
  • 중앙 학습자는 정규화된 보상과 MAD 가중치를 사용해 계산된 정책 기울기를 기반으로 정책을 업데이트하며, 이로 인해 작은, 보수적인 업데이트가 가능해진다.
  • 배치 수준의 기준선이나 보조 가치 네트워크에 의존하지 않고, 각 입력에 대해 다수의 번역 샘플에서 얻은 경험적 보상 통계를 사용한다.
  • 샘플링 시 온도의 범위를 사용함으로써 최적 성능를 달성하기 위한 초모수 스윕 수를 줄여 효율성을 향상시킨다.

실험 결과

연구 질문

  • RQ1분산 정책 기울기 알고리즘이 기계 번역의 문장 수준 강화 학습에서 학습 안정성과 일반화 능력을 향상시킬 수 있는가?
  • RQ2입력당 양성 및 음성 보상 예제를 보장하는 조건부 보상 정규화가 정책 학습에 도움이 되는가?
  • RQ3평균 절대편차 기반의 안정적인 중요도 가중치 기반 방법이 샘플의 다양성을 향상시키고 정책 업데이트의 분산을 줄일 수 있는가?
  • RQ4학습된 정책가 다양한 보상 함수에 대해 얼마나 잘 일반화되는가? 그리고 학습 시 사용된 보상 함수에 특별히 적응하는가?
  • RQ5단일 온도가 아닌 온도의 범위를 사용하면 최적 성능를 달성하기 위한 초모수 스윕 횟수를 줄일 수 있는가?

주요 결과

  • MAD 알고리즘은 다양한 번역 작업에서 보류된 테스트 세트에서 교차 엔트로피 미세조정 모델 대비 평균 2.0 BLEU 향상을 달성한다.
  • MAD는 REINFORCE, MRT, PPO와 같은 강력한 기준 모델들보다 학습 안정성과 일반화 성능에서 뛰어난 성능을 보인다.
  • 학습된 정책는 비드 서치 초모수에 덜 민감하며, 더 큰 비드 크기에서도 성능 저하가 최소한으로 나타난다.
  • 조건부 보상 정규화는 알고리즘 성공의 핵심 요소로 확인되었으며, 성능 향상과 안정성 향상에 크게 기여한다.
  • MAD 중요도 가중치 기반 방법은 샘플의 다양성을 향상시키며, 많은 학습 단계에 걸쳐 안정적이고 보수적인 정책 업데이트를 기여한다.
  • 다른 보상 함수로 학습된 모델들이 각각의 메트릭에 대해 잘 일반화되며, 정책가 보상 특화 행동을 학습함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.