[논문 리뷰] Prompting Multilingual Large Language Models to Generate Code-Mixed Texts: The Case of South East Asian Languages
이 논문은 영어와 함께 7개의 남동아시아 언어—인도네시아어, 말레이어, 중국어, 태그알로그, 베트남어, 타밀어, 싱글리시—에서 코드 믹스 텍스트를 제로샷 프롬프팅을 통해 자연스럽게 생성할 수 있는 다국어 대규모 언어 모델(LLM)의 능력을 조사한다. 모델들 중에서 ChatGPT는 영어-싱글리시와 같은 특정 언어 조합에서는 유창한 출력을 보이나, 대부분의 경우 문법적으로 정확하거나 의미적으로 통합된 코드 믹스 텍스트를 생성하지 못하며, 특히 다양한 언어 계열 간에 생성할 경우나 의도하지 않은 언어나 잘못된 스크립트 시스템을 도입하는 경향이 있어, NLP 연구에서 사용하기 전에 광범위한 인간 검증이 필요하다는 점을 시사한다.
While code-mixing is a common linguistic practice in many parts of the world, collecting high-quality and low-cost code-mixed data remains a challenge for natural language processing (NLP) research. The recent proliferation of Large Language Models (LLMs) compels one to ask: how capable are these systems in generating code-mixed data? In this paper, we explore prompting multilingual LLMs in a zero-shot manner to generate code-mixed data for seven languages in South East Asia (SEA), namely Indonesian, Malay, Chinese, Tagalog, Vietnamese, Tamil, and Singlish. We find that publicly available multilingual instruction-tuned models such as BLOOMZ and Flan-T5-XXL are incapable of producing texts with phrases or clauses from different languages. ChatGPT exhibits inconsistent capabilities in generating code-mixed texts, wherein its performance varies depending on the prompt template and language pairing. For instance, ChatGPT generates fluent and natural Singlish texts (an English-based creole spoken in Singapore), but for English-Tamil language pair, the system mostly produces grammatically incorrect or semantically meaningless utterances. Furthermore, it may erroneously introduce languages not specified in the prompt. Based on our investigation, existing multilingual LLMs exhibit a wide range of proficiency in code-mixed data generation for SEA languages. As such, we advise against using LLMs in this context without extensive human checks.
연구 동기 및 목표
- 제로샷 프롬프팅을 활용해 자원이 부족한 남동아시아 언어에서 고품질의 자연스러운 코드 믹스 텍스트를 생성할 수 있는지의 가능성을 평가하기 위해.
- 다양한 언어 조합 간에 언어학적으로 정확하고 의미적으로 일관된 코드 믹스 문장을 생성하는 데 있어 현재의 다국어 LLM의 한계를 규명하기 위해.
- 이 분야에서 고품질의 애너테이션된 데이터셋이 부족한 상황에서 NLP 연구를 위한 합성 코드 믹스 데이터 생성의 신뢰성을 평가하기 위해.
- ChatGPT, BLOOMZ, Flan-T5-XXL와 같은 모델들이 다양한 언어 계열과 코드 믹스 수준에서 코드 믹스 생성에 있어 성능 변동성을 실증적으로 제시하기 위해.
제안 방법
- 영어와 6개의 남동아시아 언어를 조합한 다양한 프롬프트 템플릿을 사용해 다섯 개의 다국어 LLM—ChatGPT, InstructGPT, BLOOMZ, Flan-T5-XXL—에 제로샷 프롬프팅을 수행하여 코드 믹스 텍스트를 생성하기 위해.
- 이중어 사용자나 특정 어조를 모방하는 방식으로 프롬프트 템플릿을 설계하여 코드 믹스 응답을 이끌어내기 위해.
- 모델 출력을 원어민이 평가하여 자연스러움과 코드 믹스 수준을 여러 차원—문법성, 의미 일관성, 스크립트 시스템 정확성—에서 평가하기 위해 수집 및 애너테이션을 수행하기 위해.
- 코드 믹스 수준을 네 가지 범주로 분류하기 위해: 코드 믹스 없음, 빌린어휘, 주제 관련 명사, 전체 언어적 요소.
- 문법 오류, 의미 혼동, 잘못된 스크립트 사용, 의도하지 않은 언어 도입 등의 오류를 정량적·정성적으로 분석하기 위해.
- 언어 조합과 코드 믹스 유형 간의 모델 출력을 비교하여 실패 유형과 성능 변동성의 패턴을 규명하기 위해.

실험 결과
연구 질문
- RQ1자원이 부족한 남동아시아 언어에서 제로샷 설정에서 다국어 LLM이 얼마나 자연스럽게 코드 믹스 텍스트를 생성할 수 있는가?
- RQ2ChatGPT, BLOOMZ, Flan-T5-XXL와 같은 다양한 LLM은 다양한 언어 조합 간에 문법적으로 정확하고 의미적으로 통합된 코드 믹스 문장을 얼마나 잘 생성하는가?
- RQ3LLM이 생성한 코드 믹스 텍스트에서 가장 흔한 오류 유형은 무엇인가? 예를 들어, 잘못된 문법, 의미 불일치, 스크립트 시스템 불일치 등.
- RQ4왜 일부 언어 조합(예: 영어-싱글리시)은 다른 것들(예: 영어-타밀어)보다 더 자연스러운 출력을 낼 수 있는가? 이 격차를 초래하는 언어학적 또는 구조적 요인은 무엇인가?
- RQ5LLM은 얼마나 자주 프롬프트에 명시되지 않은 언어를 도입하거나 지정된 언어 조합을 따르지 못하는가?
주요 결과
- ChatGPT는 영어-싱글리시와 같은 특정 언어 조합에서는 자연스럽고 유창한 코드 믹스 텍스트를 생성하지만, 영어-타밀어와 같이 다른 조합에서는 종종 문법적으로 잘못되거나 의미가 없는 출력을 낸다.
- BLOOMZ와 Flan-T5-XXL는 강력한 프롬프팅에도 불구하고 어떤 형태의 코드 믹스 텍스트도 생성하지 못하며, 단일 언어 또는 비자연스러운 표현만 생성한다.
- 많은 모델 출력에서 자연스러움 문제를 보이며, 자연스럽지 않은 어순, 잘못된 동사 형태, 소유격 표시의 잘못된 사용, 도착했지만 여전히 정체된 교통 상황에 있다는 의미 모순 등이 포함되어 있다.
- 매우 많은 출력에서 스크립트 시스템의 일관성 문제가 발생하며, 예를 들어 타밀 문자와 라틴 문자를 혼용하거나, 중국어-영어 코드 믹스에서 풍자어를 사용하는 대신 중국어 문자 대신 피尼음을 사용하는 경우가 있다.
- LLM은 자주 프롬프트에 명시되지 않은 언어를 도입하여 출력에 뜻하지 않은 언어적 오염을 초래한다. 예를 들어, 훈커언어나 기타 지역 변종 언어를 도입한다.
- LLM의 성능은 언어 계열 간에 크게 다름을 보이며, 드라비아니언(예: 타밀어)이나 오스트로아시아틱(예: 베트남어) 언어를 포함한 조합에서 오류율이 높게 나타나며, 아우스트로네시안 또는 신토비탄 언어와 비교해 더 높은 오류율을 보인다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.