[논문 리뷰] Investigating Math Word Problems using Pretrained Multilingual Language Models
이 논문은 사전 훈련된 다국어 언어 모델을 사용하여 다국어 수학단어문제(MWP) 해결을 조사하며, mBERT와 XLM-R 기반의 복사 메커니즘을 갖춘 순서열-순서열 모델을 제안한다. 결과적으로 MWP 해결 모델은 공통된 연산자와 상수를 공유함에도 불구하고 언어 간 이식성이 거의 없음을 보여주지만, 훈련 및 평가 문제의 문제 유형이 유사할 경우 성능 향상이 뚜렷하게 나타나, 언어 유사성보다 도메인 유사성이 핵심 요소임을 시사한다.
In this paper, we revisit math word problems~(MWPs) from the cross-lingual and multilingual perspective. We construct our MWP solvers over pretrained multilingual language models using sequence-to-sequence model with copy mechanism. We compare how the MWP solvers perform in cross-lingual and multilingual scenarios. To facilitate the comparison of cross-lingual performance, we first adapt the large-scale English dataset MathQA as a counterpart of the Chinese dataset Math23K. Then we extend several English datasets to bilingual datasets through machine translation plus human annotation. Our experiments show that the MWP solvers may not be transferred to a different language even if the target expressions have the same operator set and constants. But for both cross-lingual and multilingual cases, it can be better generalized if problem types exist on both source language and target language.
연구 동기 및 목표
- 다국어 사전 훈련을 사용할 때, 한 언어에서 훈련된 MWP 해결 모델이 다른 언어로 일반화되는지 연구하는 것.
- 다국어 데이터셋을 결합하면 다국어 MWP 해결 성능이 향상되는지 평가하는 것.
- 언어 유사성, 연산자 집합, 문제 유형과 같은 요소들이 다국어 및 다국어 MWP 일반화에 영향을 미치는 주요 요인인지 규명하는 것.
- 기존 영어 데이터셋을 중국어로 번역하고 인간 검수를 통해 품질 제어한 후, 비교 분석을 위한 새로운 双어 MWP 데이터셋을 구축하고 공개하는 것.
- 대비 학습과 템플릿 기반 훈련의 효과를 실증적으로 평가하여 제로샷 및 소수 샘플 MWP 일반화를 향상시키는 것.
제안 방법
- 복사 메커니즘을 갖춘 순서열-순서열 모델을 사용하여, 단국어 및 다국어 MWP 데이터셋에 대해 다국어 BERT(mBERT)와 XLM-Roberta(XLM-R)를 미세조정한다.
- 일致한 비교를 위해 영어 대규모 MathQA 데이터셋을 중국어 Math23K 데이터셋의 연산자 집합과 표현 형식에 맞게 변형한다.
- 기계 번역을 통해 MathQA와 Math23K를 중국어로 번역한 후 인간 검수를 통해 품질 제어하여 이중어 MWP 데이터셋을 구축한다.
- 제로샷 일반화를 향상시키기 위해, 서로 다른 언어 간 의미적으로 유사한 문제 템플릿을 정렬하는 템플릿 기반 대비 학습을 적용한다.
- 1개의 2080Ti GPU에서 배치 크기 160으로 학습하며, 다항식 감쇠 학습률 스케줄러와 30 에포크 동안 성능 향상이 없을 경우 조기 종료를 적용한다.
- 모델을 단국어 테스트 세트, 제로샷 다국어 설정, 이중어 평가 세트에서 평가하여 이식성과 다국어 일반화 능력을 측정한다.
실험 결과
연구 질문
- RQ1다국어 사전 훈련을 사용할 때, 중국어 Math23K(예: mBERT-zh)에서 훈련된 단국어 MWP 해결 모델이 영어 문제를 성공적으로 해결할 수 있는가?
- RQ2다양한 언어의 단국어 데이터셋을 하나의 다국어 훈련 세트로 통합하면, 단국어 훈련에 비해 각 언어의 성능 향상이 이루어지는가?
- RQ3공통된 연산자와 상수를 공유함에도 불구하고, 원천 언어와 대상 언어 간 문제 유형의 유사성이 다국어 MWP 해결 성능에 얼마나 영향을 미치는가?
- RQ4템플릿 기반 대비 학습은 다국어 간 제로샷 및 소수 샘플 MWP 일반화에 어떤 영향을 미치는가?
- RQ5언어 유사성, 도메인 유사성, 또는 연산자 집합 일관성 중에서 다국어 MWP 해결 모델의 성공에 가장 큰 영향을 미치는 요소는 무엇인가?
주요 결과
- 중국어 Math23K(mBERT-zh)에서 훈련된 단국어 MWP 해결 모델은 자체 테스트 세트에서 76.3%의 정확도를 기록하지만, 영어 문제에서 평가 시 49.5%로 급격히 하락하여, 공통된 연산자와 상수를 공유함에도 불구하고 거의 제로 수준의 다국어 이식성이 있음을 시사한다.
- Math23K와 변형된 MathQA를 모두 훈련 데이터로 사용한 다국어 모델(mBERT-xl)은 영어에서 79.0%, 중국어에서 76.3%의 정확도를 기록하여, 양 언어에서 단국어 모델보다 뛰어난 성능을 보이며, 다국어 훈련이 언어에 관계없이 성능을 향상시킴을 보여준다.
- 다국어 훈련에서 성능 향상은 문제 유형이 서로 유사할 경우 가장 두드러지게 나타나며, 예를 들어 mBERT-xl은 Math23K에서 단국어 기준보다 3.1점 향상되고 MathQA에서는 2.4점 향상된다.
- 템플릿 기반 대비 학습은 테스트 세트에서 최대 3점의 성능 향상을 이끌어내며(예: Math23K에서 76.3%에서 79.4%로), 그러나 제로샷 영어 평가에서는 성능 저하가 발생할 수 있으며, 이는 데이터셋 간 템플릿 다양성 불일치 때문일 가능성이 높다.
- 양 언어에 모두 존재하는 템플릿만 공유하도록 제약을 둘 경우, 테스트 세트 성능은 하락하지만 제로샷 영어 평가 성능은 가장 크게 향상되며, 이는 문제 유형 일치가 일반화에 있어 언어 유사성보다 더 중요하다는 것을 확인한다.
- 본 연구는 연산자 집합과 상수가 동일한 경우에도 도메인 유사성(문제 유형)이 MWP 해결 모델의 일반화 능력에 더 강력한 예측 요소임을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.