[論文レビュー] Prompting Multilingual Large Language Models to Generate Code-Mixed Texts: The Case of South East Asian Languages
本稿は、ゼロショットプロンプティングを用いて、インドネシア語、マレー語、中国語、タガログ語、ベトナム語、タミル語、シンガリッシュの7つの南東アジア言語における自然な聞き取りやすいコードミックステキストを生成する多言語大規模言語モデル(LLM)の能力を調査する。ChatGPTのようなモデルは、英語-シンガリッシュなどの特定の言語ペアでは一貫性のある出力を示すが、他のペアでは不一致を示し、文法的に正しくないか意味的に意味のないコードミックステキストを生成する。特に多様な言語系統をまたぐ場合、多くのモデルは文法的正しさや意味的整合性に欠ける出力を示し、望ましくない言語や誤った script システムを紛れ込ませる傾向がある。これは、自然言語処理研究における合成データ作成の前段階で、人的な検証を徹底する必要があることを示唆している。
While code-mixing is a common linguistic practice in many parts of the world, collecting high-quality and low-cost code-mixed data remains a challenge for natural language processing (NLP) research. The recent proliferation of Large Language Models (LLMs) compels one to ask: how capable are these systems in generating code-mixed data? In this paper, we explore prompting multilingual LLMs in a zero-shot manner to generate code-mixed data for seven languages in South East Asia (SEA), namely Indonesian, Malay, Chinese, Tagalog, Vietnamese, Tamil, and Singlish. We find that publicly available multilingual instruction-tuned models such as BLOOMZ and Flan-T5-XXL are incapable of producing texts with phrases or clauses from different languages. ChatGPT exhibits inconsistent capabilities in generating code-mixed texts, wherein its performance varies depending on the prompt template and language pairing. For instance, ChatGPT generates fluent and natural Singlish texts (an English-based creole spoken in Singapore), but for English-Tamil language pair, the system mostly produces grammatically incorrect or semantically meaningless utterances. Furthermore, it may erroneously introduce languages not specified in the prompt. Based on our investigation, existing multilingual LLMs exhibit a wide range of proficiency in code-mixed data generation for SEA languages. As such, we advise against using LLMs in this context without extensive human checks.
研究の動機と目的
- ゼロショットプロンプティングを用いて、資源が乏しい南東アジア言語における高品質で自然な聞き取りやすいコードミックステキストを生成する可能性を評価すること。
- 多様な言語ペアをまたいで、現在の多言語LLMが言語的に正確で意味的に整合性のあるコードミックス発話を作成する能力にどのような制限があるかを特定すること。
- この分野における高品質なアノテート済みデータセットの不足を鑑み、LLMが合成コードミックスデータを生成する信頼性を評価すること。
- ChatGPT、BLOOMZ、Flan-T5-XXLなどのモデルが、異なる言語系統やコードミックスのレベルにおいて、コードミックス生成において性能にばらつきを示す実証的証拠を提供すること。
提案手法
- 英語と6つの南東アジア言語をペアにしたコードミックステキスト生成を目的として、5つの多言語LLM(ChatGPT、InstructGPT、BLOOMZ、Flan-T5-XXL)に対してゼロショットプロンプティングを実施。
- 双語話者を模倣するか、特定の話し方を模倣するプロンプトテンプレートを設計し、コードミックス反応を引き出す。
- ネイティブスピーカーによる評価を用いて、モデル出力を収集・アノテートし、文法的整合性、意味的整合性、スクリプトシステムの正確性の複数の次元で自然さとコードミックスレベルを評価。
- コードミックスレベルを4つのカテゴリに分類:コードミックスなし、借用語、トピック関連名詞、完全な言語的要素。
- 誤りの定性的および定量的分析を実施。誤りの種類には、文法的ミス、意味的混乱、誤ったスクリプト使用、望ましくない言語の紛れ込みが含まれる。
- 言語ペアやコードミックスタイプごとにモデル出力を比較し、失敗モードと性能のばらつきに関するパターンを特定。

実験結果
リサーチクエスチョン
- RQ1資源が乏しい南東アジア言語において、多言語LLMはゼロショット設定でどの程度自然な聞き取りやすいコードミックステキストを生成できるか?
- RQ2ChatGPT、BLOOMZ、Flan-T5-XXLなどの異なるLLMは、多様な言語ペアをまたいで、文法的に正しいかつ意味的に整合性のあるコードミックス発話をどの程度生成できるか?
- RQ3LLMが生成するコードミックステキストにおける最も一般的な誤りタイプは何か。文法的誤り、意味的不整合、スクリプトシステムの不一致などが含まれる。
- RQ4なぜ一部の言語ペア(例:英語-シンガリッシュ)ではより滑らかな出力が得られるのに対し、他のペア(例:英語-タミル語)ではそうならないのか。この差を生じさせる言語的または構造的要因は何か?
- RQ5LLMはどの程度、プロンプトに指定されていない言語(例:フーカン語やその他の地方変種)を紛れ込ませるか、指定された言語ペアに従わない出力を生成するか?
主な発見
- ChatGPTは、英語-シンガリッシュのような特定の言語ペアでのみ、流暢で自然なコードミックステキストを生成するが、英語-タミル語のような他のペアでは、文法的に誤りが多いか意味的に意味のない出力を示す。
- BLOOMZ や Flan-T5-XXL は、強いプロンプティングでさえも、コードミックステキストのいかなる形態も生成できない。単一言語または非自然な発話しか出力しない。
- 多くのモデル出力には自然さの問題が顕著に現れ、不自然な表現、誤った動詞形、所有格マークの誤用、意味的矛盾(例:まだ渋滞中なのに到着したと主張)が含まれる。
- 多くの出力にスクリプトシステムの不整合が見られる。例として、タミル文字とラテン文字を混在させたり、中国語-英語コードミックスでピンインを漢字の代わりに使用するなど。
- LLMは、プロンプトに記載されていない言語(例:フーカン語やその他の地方変種)を頻繁に紛れ込ませ、出力に望ましくない言語的汚染を引き起こす。
- LLMの性能は言語系統によって大きくばらつきを示し、ドライアド語族(例:タミル語)やオーストロネシア語族(例:ベトナム語)を含むペアでは、アステロネシア語族やチベット・ビルマ語族のペアと比較して、より高い誤り率を示す。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。