[논문 리뷰] Data Augmentation for Neural Machine Translation using Generative Language Model
이 논문은 GPT-3.5-turbo를 사용하여 추가 학습 비용 없이 합성 병렬 문장을 생성하는 프롬프트 기반 데이터 증강 기법을 제안한다. 다수의 프롬프트 전략(다시말하기, 다중 대상 번역, 스토리텔링)을 비교하여 스토리텔링 전략이 가장 높은 다양성을 보이며, 기준 모델 대비 BLEU 점수를 0.68 향상시킨다. 데이터를 두 배로 늘였을 때 최고의 성능을 기록한 점수는 29.17 BLEU이다.
Despite the rapid growth in model architecture, the scarcity of large parallel corpora remains the main bottleneck in Neural Machine Translation. Data augmentation is a technique that enhances the performance of data-hungry models by generating synthetic data instead of collecting new ones. We explore prompt-based data augmentation approaches that leverage large-scale language models such as ChatGPT. To create a synthetic parallel corpus, we compare 3 methods using different prompts. We employ two assessment metrics to measure the diversity of the generated synthetic data. This approach requires no further model training cost, which is mandatory in other augmentation methods like back-translation. The proposed method improves the unaugmented baseline by 0.68 BLEU score.
연구 동기 및 목표
- 신경 기계 번역(NMT)에서 대규모 병렬 코퍼스의 부족 문제, 특히 저자원 언어나 도메인에 대해 해결하고자 한다.
- ChatGPT와 같은 대규모 생성 언어 모델을 활용해 파인튜닝 없이도 합성 병렬 데이터를 생성하는 프롬프트 기반 데이터 증강 방법을 탐색하고자 한다.
- 다시말하기, 다중 대상 번역, 스토리텔링 등의 다양한 프롬프트 설계가 데이터 다양성과 모델 성능에 미치는 영향을 평가하고자 한다.
- 원본 문장과 합성 문장 간의 코사인 유사도와 BLEU 점수를 측정하여 합성 데이터의 다양성을 측정하고자 한다.
- 데이터 다양성이 도메인 이탈이나 데이터 부족 상황에서 NMT 성능 향상에 필수적임을 입증하고자 한다.
제안 방법
- 합성 병렬 데이터를 생성하기 위해 세 가지 프롬프트 기반 방법을 사용한다: 원본 및 대상 문장을 다시말하기, 각 원본 문장에 대해 다수의 번역을 생성하는 다중 대상 번역, 원본 언어로 구성된 세 문장의 스토리를 생성한 후 번역하는 스토리텔링.
- GPT-3.5-turbo 모델은 각 방법에 맞게 맞춤형 템플릿을 사용해 OpenAI API를 통해 프롬프트가 제공되며, 의미를 유지하면서도 다양성을 증가시키기 위해 설계된다.
- 문장 임베딩은 LASER 인코더를 사용해 계산되며, 원본 및 합성 문장 쌍 간의 코사인 유사도를 계산하여 다양성 지표로 활용한다.
- 어휘 유사도는 원본 및 합성 대상 문장 간의 BLEU 점수를 통해 측정되어 어휘적 분리 정도를 평가한다.
- mBART-50 모델은 원본 및 증강된 데이터를 사용해 파인튜닝되며, 검증용 테스트 세트를 사용해 SacreBLEU로 평가된다.
- 실험은 증강 비율을 원본 학습 데이터 크기의 0.5배에서 3.0배로 다양하게 설정하며, 검증 BLEU 점수 기반으로 최고 성능의 체크포인트를 선정한다.
실험 결과
연구 질문
- RQ1생성 언어 모델을 활용한 프롬프트 기반 데이터 증강이 추가 학습 비용 없이 NMT 성능 향상에 기여하는가?
- RQ2다시말하기, 다중 대상 번역, 스토리텔링 등의 다양한 프롬프트 전략이 합성 병렬 데이터의 다양성과 품질에 어떤 영향을 미치는가?
- RQ3임베딩 유사도와 BLEU 점수로 측정한 데이터 다양성과 NMT 모델 성능 향상 간 상관관계는 어느 정도인가?
- RQ4스토리텔링 기반 증강이 도메인 외부 환영(홀로지) 현상을 완화하고 저자원 환경에서의 강건성을 향상시킬 수 있는가?
- RQ5어느 프롬프트 설계가 증강되지 않은 기준 모델 대비 가장 높은 BLEU 점수 향상을 이룰 수 있는가?
주요 결과
- 스토리텔링 방법은 합성 데이터를 원본 크기의 2.0배로 증강했을 때 최고의 BLEU 점수 29.17을 기록했으며, 기준 점수 28.49를 초월했다.
- 다시말하기 및 다중 대상 번역 방법은 증강 비율이 증가함에 따라 BLEU 점수가 감소하여, 데이터 다양성이 제한적이고 과적합 가능성이 있음을 시사한다.
- 스토리텔링 방법은 원본 및 합성 문장 간 코사인 유사도(0.596)와 BLEU 점수(2.908)가 가장 낮아, 더 높은 데이터 다양성을 확인했다.
- 다시말하기 방법은 코사인 유사도(0.900)와 BLEU 점수(23.409)가 가장 높아 원본 문장과의 차이가 최소한임을 나타냈다.
- 다중 대상 번역 방법은 코사인 유사도 0.825와 BLEU 점수 15.543로 중간 정도의 다양성을 보였지만, 여전히 스토리텔링 방법에 비해 성능이 열등했다.
- 본 연구는 합성 데이터의 다양성이 NMT에서 학습 데이터 분포와 실제 언어 분포 간 격차를 줄이기 위해 필수적임을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.