[논문 리뷰] Chain-of-Dictionary Prompting Elicits Translation in Large Language Models
이 논문은 다국어 사전을 외부 지식으로 연결하여 사용하는 제로샷 프ompting 프레임워크인 체인 오브 딕셔너리 프롬프팅(Chain-of-Dictionary Prompting, CoD)을 제안한다. 이는 다국어 신경 기계 번역(MNMT)을 위한 대규모 언어 모델(LLM)의 성능을 향상시키는 데 목적이 있으며, 번역 성능을 최대 13배 증가시킨다 — 예를 들어, 영어-세르비아어(시리리어) 번역에서 chrF++ 점수를 3.08에서 42.63으로 상승시켰다. CoD는 특히 자원이 적은 언어에 대해 소수의 예시를 활용한 인라인 학습보다 뛰어난 성능을 보인다.
Large language models (LLMs) have shown surprisingly good performance in multilingual neural machine translation (MNMT) even when trained without parallel data. Yet, despite the fact that the amount of training data is gigantic, they still struggle with translating rare words, particularly for low-resource languages. Even worse, it is usually unrealistic to retrieve relevant demonstrations for in-context learning with low-resource languages on LLMs, which restricts the practical use of LLMs for translation -- how should we mitigate this problem? To this end, we present a novel method, CoD, which augments LLMs with prior knowledge with the chains of multilingual dictionaries for a subset of input words to elicit translation abilities for LLMs. Extensive experiments indicate that augmenting ChatGPT with CoD elicits large gains by up to 13x chrF++ points for MNMT (3.08 to 42.63 for English to Serbian written in Cyrillic script) on FLORES-200 full devtest set. We further demonstrate the importance of chaining the multilingual dictionaries, as well as the superiority of CoD to few-shot demonstration for low-resource languages.
연구 동기 및 목표
- 희귀어 번역 성능이 열악한 대규모 언어 모델(LLM)의 문제를 해결한다. 특히 자원이 적은 언어에서의 번역 성능 향상을 목표로 한다.
- 소수의 예시를 활용한 인라인 학습의 한계를 극복한다. 이는 자원이 적은 언어 번역에서 관련된 예시를 적절히 추출하지 못하는 데 기인한다.
- 모델 파인튜닝 없이도 다국어 어휘 지식을 통합하여 제로샷 다국어 신경 기계 번역(MNMT)의 성능을 향상시키는 것을 목표로 한다.
- 다국어 사전을 연결함으로써 추론 능력과 번역 정확도가 단일 또는 분리된 어휘 힌트보다 향상됨을 입증한다.
제안 방법
- 표준 번역 프롬프트에 다국어 사전 항목의 체인을 추가하여, 각 단어가 여러 언어로 번역된 결과를 연결한다 (예: 'limit' → 'Grenze' → 'çäk').
- 사고의 사슬(Chain-of-Thought, CoT) 프롬프팅을 영감으로 삼아, 추론과 유사한 단계를 거쳐 어휘 매핑을 체인으로 구성한다.
- 교차 언어 전이와 강건성을 향상시키기 위해 고자원 언어(예: 영어, 독일어)를 체인의 중간 연결점으로 사용한다.
- ChatGPT와 같은 모델을 사용하여 FLORES-200 벤치마크에서 파인튜닝 없이 제로샷 추론에 CoD 프롬프트를 적용한다.
- 체인의 구조가 어휘 간 의미적 동치성을 유지하도록 설계하여, 번역 경로가 일관되고 의미적으로 일관되게 유지되도록 한다.
- FLORES-200의 전체 개발 테스트 세트에서 chrF++를 사용하여 성능을 평가하고, 표준 프롬프팅 및 소수의 예시를 활용한 인라인 학습과 비교한다.

실험 결과
연구 질문
- RQ1다국어 사전을 외부 지식으로 연결함으로써 제로샷 번역 성능이 자원이 적은 언어 쌍에서 크게 향상되는가?
- RQ2자원이 적은 언어의 번역 품질 측면에서 CoD는 소수의 예시를 활용한 인라인 학습보다 어떻게 비교되는가?
- RQ3CoD의 성능 향상은 사전 체인의 구조에 의존하는가, 아니면 분리된 어휘 매핑에 의존하는가?
- RQ4체인 내 중간 언어의 선택, 특히 라틴 알파벳 이외의 스크립트를 사용하는 언어에 대해 성능에 영향을 미치는가?
- RQ5CoD는 다양한 언어 쌍, 특히 다른 글자 체계를 사용하는 언어 쌍으로도 일반화 가능한가?
주요 결과
- CoD는 영어-세르비아어(시리리어) 번역 작업에서 FLORES-200 전체 개발 테스트 세트에서 chrF++ 점수를 최대 13배 향상시켰다 — 3.08에서 42.63으로 상승하였다.
- 다국어 사전을 연결하는 것이 필수적이다 — 어휘 매핑을 분리하거나 체인되지 않은 사전을 사용할 경우 성능이 크게 떨어진다.
- 소수의 예시를 활용한 인라인 학습보다 CoD가 뛰어나며, 특히 관련 예시가 부족하거나 부적절한 자원이 적은 언어에서 두드러진다.
- 영어나 독일어와 같은 고자원 언어를 체인의 중간 연결점으로 사용할 경우 성능 향상이 이루어지지만, 유사한 목표 언어를 사용할 경우 성능 저하가 발생할 수 있다.
- FLORES-200의 200개 언어 쌍 전반에서 강건한 성능을 보이며, 고자원 언어에 대해선 최소한의 부정적 영향을 미쳐 광범위한 적용 가능성을 입증한다.
- 표준 프롬프팅이 완전히 실패하는 언어, 예를 들어 자원이 적은 시리리어 스크립트 언어에서도 CoD는 번역을 가능하게 하여 잠재된 번역 능력을 이끌어내는 능력을 보여준다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.