[論文レビュー] Controlled Generation with Prompt Insertion for Natural Language Explanations in Grammatical Error Correction
本稿では、大規模言語モデル(LLM)が文法的誤り訂正の包括的で自然な言語説明を生成するのを支援するため、プロンプト挿入(PI)を用いた制御生成手法を提案する。誤り・訂正ペアを抽出し、推論時に動的プロンプトとして挿入することで、PIはすべての訂正が明示的に扱われるよう保証し、標準的なプロンプト提示法に比べて説明のカバレッジと品質が顕著に向上することが、新規のXGECデータセットおよびGPT-3.5とChatGPTのモデルで検証された。
In Grammatical Error Correction (GEC), it is crucial to ensure the user's comprehension of a reason for correction. Existing studies present tokens, examples, and hints as to the basis for correction but do not directly explain the reasons for corrections. Although methods that use Large Language Models (LLMs) to provide direct explanations in natural language have been proposed for various tasks, no such method exists for GEC. Generating explanations for GEC corrections involves aligning input and output tokens, identifying correction points, and presenting corresponding explanations consistently. However, it is not straightforward to specify a complex format to generate explanations, because explicit control of generation is difficult with prompts. This study introduces a method called controlled generation with Prompt Insertion (PI) so that LLMs can explain the reasons for corrections in natural language. In PI, LLMs first correct the input text, and then we automatically extract the correction points based on the rules. The extracted correction points are sequentially inserted into the LLM's explanation output as prompts, guiding the LLMs to generate explanations for the correction points. We also create an Explainable GEC (XGEC) dataset of correction reasons by annotating NUCLE, CoNLL2013, and CoNLL2014. Although generations from GPT-3 and ChatGPT using original prompts miss some correction points, the generation control using PI can explicitly guide to describe explanations for all correction points, contributing to improved performance in generating correction reasons.
研究の動機と目的
- 既存のGECシステムにおける文法的誤り訂正の直接的で自然な言語説明の欠如に対処すること。
- どの訂正が説明されるかを明示的に制御することで、LLMが生成する説明の理解可能性と信頼性を向上させること。
- 人間がアノテートした訂正理由を備えた、説明可能なGECシステムの学習と評価に用いるための新規データセットXGECを作成すること。
- LLMが生成する説明が、下流のGECパフォーマンス向上において人間レベルの品質に達するかどうかを調査すること。
提案手法
- まず、LLMが入力テキストに対して標準的な文法的誤り訂正を実行する。
- 次に、ルールベースの手法を用いて入力と訂正出力のトークンレベルの整合性を計算し、誤り・訂正ペアを抽出する。
- 抽出された訂正ペアを、説明生成フェーズ中に構造化プロンプトとして挿入してLLMを誘導する。
- LLMは、各挿入された訂正ペアについて自然言語の説明を生成するようプロンプトされ、すべての編集がカバーされることを保証する。
- 本手法は、訂正後の説明生成と訂正前の説明生成の両方をサポートしており、アブレーション実験により訂正後の生成がより効果的であることが示された。
- NUCLE、CoNLL2013、CoNLL2014のデータセットに訂正理由をアノテートすることで、新規の説明可能GEC(XGEC)データセットを構築した。

実験結果
リサーチクエスチョン
- RQ1明示的な制御がなければ、LLMは文法的誤り訂正の包括的で自然な言語説明を生成できるか?
- RQ2訂正ペアのプロンプト挿入は、LLMが生成する説明のカバレッジと品質にどのように影響するか?
- RQ3LLMが生成する説明の品質は、人間がアノテートした説明と比較して、下流のGECパフォーマンス向上において同等の水準に達するか?
- RQ4編集カバレッジという観点から、訂正後の説明生成は訂正前の生成よりも効果的か?
主な発見
- PIは説明カバレッジを顕著に向上させる:人間評価では、GPT-3.5とChatGPTの両方でPIを用いた場合、カバレッジスコアが2.0(完全カバレッジ)に達したが、PIなしではそれより低いスコアであった。
- PIは説明品質を向上させる:GPT-3.5とChatGPTはPIを用いることで、それぞれ1.8および1.9の妥当性スコアを達成し、言語学習者にとって高精度で有用な説明であることが示された。
- 自動評価では、PIによりXGECaで最大12.5%、XGECbで最大10.3%のF1スコア向上が確認された。
- PIを用いたLLM生成説明は、少数-shot学習において人間がアノテートした説明と同等のGECパフォーマンスを達成し、CoNLL2014、W&I、JFLEGデータセットでは最小限のパフォーマンス差が観察された。
- 人間評価では、訂正後の説明生成が訂正前の生成を上回り、編集カバレッジスコアが15%高いことが示された。
- 本手法は、標準的なプロンプトベース生成で見られる、訂正ポイントの省略や曖昧さといった問題を効果的に軽減した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。