Skip to main content
QUICK REVIEW

[논문 리뷰] Controlled Generation with Prompt Insertion for Natural Language Explanations in Grammatical Error Correction

Masahiro Kaneko, Naoaki Okazaki|arXiv (Cornell University)|2023. 09. 20.
Natural Language Processing TechniquesComputer Science인용 수 3
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs)이 문법 오류 수정(Grammatical Error Correction, GEC)에 대한 포괄적이고 자연스러운 언어 설명을 생성하도록 이끌기 위해 프롬프트 삽입(Prompt Insertion, PI)을 사용하는 제어된 생성 방법을 제안한다. 오류-수정 쌍을 추출하고 추론 중에 동적 프롬프트로 삽입함으로써 PI는 모든 수정 사항이 명시적으로 다루어지도록 보장하며, 표준 프롬프팅 대비 설명 커버리지와 품질을 크게 향상시킨다. 이는 새로운 XGEC 데이터셋과 GPT-3.5, ChatGPT 모델을 대상으로 검증되었다.

ABSTRACT

In Grammatical Error Correction (GEC), it is crucial to ensure the user's comprehension of a reason for correction. Existing studies present tokens, examples, and hints as to the basis for correction but do not directly explain the reasons for corrections. Although methods that use Large Language Models (LLMs) to provide direct explanations in natural language have been proposed for various tasks, no such method exists for GEC. Generating explanations for GEC corrections involves aligning input and output tokens, identifying correction points, and presenting corresponding explanations consistently. However, it is not straightforward to specify a complex format to generate explanations, because explicit control of generation is difficult with prompts. This study introduces a method called controlled generation with Prompt Insertion (PI) so that LLMs can explain the reasons for corrections in natural language. In PI, LLMs first correct the input text, and then we automatically extract the correction points based on the rules. The extracted correction points are sequentially inserted into the LLM's explanation output as prompts, guiding the LLMs to generate explanations for the correction points. We also create an Explainable GEC (XGEC) dataset of correction reasons by annotating NUCLE, CoNLL2013, and CoNLL2014. Although generations from GPT-3 and ChatGPT using original prompts miss some correction points, the generation control using PI can explicitly guide to describe explanations for all correction points, contributing to improved performance in generating correction reasons.

연구 동기 및 목표

  • 기존 GEC 시스템에서 문법 오류 수정에 대한 직접적이고 자연스러운 언어 설명의 부족을 해결하기 위해.
  • 수정 사항이 명시적으로 제어되도록 하여 LLM이 생성하는 설명의 이해 가능성과 신뢰성을 향상시키기 위해.
  • 인간이 주석을 달아 수정 이유를 기재한 새로운 데이터셋 XGEC를 구축하여 설명 가능한 GEC 시스템의 훈련 및 평가를 위해 사용하기 위해.
  • LLM이 생성한 설명이 하향류 GEC 성능 향상에서 인간 수준의 품질에 도달할 수 있는지 조사하기 위해.

제안 방법

  • 먼저, LLM이 입력 텍스트에 대해 표준 문법 오류 수정을 수행한다.
  • 그런 다음, 규칙 기반 방법을 사용하여 입력 텍스트와 수정된 출력 간의 토큰 수준의 정렬을 계산하여 오류-수정 쌍을 추출한다.
  • 이러한 추출된 수정 쌍을 설명 생성 단계 동안 구조화된 프롬프트로 삽입하여 LLM을 이끌도록 한다.
  • LLM은 각 삽입된 수정 쌍에 대해 자연어 설명을 생성하도록 유도되며, 이로써 모든 수정 사항이 다루어지도록 보장된다.
  • 이 방법은 수정 후 및 수정 전 설명 생성을 모두 지원하며, 추론 실험 결과 수정 후 설명 생성이 더 효과적임을 확인했다.
  • NUCLE, CoNLL2013, CoNLL2014 데이터셋에 대해 수정 이유를 인간이 주석 달아 새로운 설명 가능한 GEC(XGEC) 데이터셋을 구축하였다.
Figure 1: How to generate an explanation of the proposed method PI.
Figure 1: How to generate an explanation of the proposed method PI.

실험 결과

연구 질문

  • RQ1표준 프롬프팅 외에 명시적 제어 없이 LLM이 문법 오류 수정에 대한 포괄적이고 자연스러운 언어 설명을 생성할 수 있는가?
  • RQ2수정 쌍의 프롬프트 삽입이 LLM이 생성하는 설명의 커버리지와 품질에 어떤 영향을 미치는가?
  • RQ3LLM이 생성한 설명의 품질이 하향류 GEC 성능 향상에서 인간 주석 설명과 동등한가?
  • RQ4수정 후 설명 생성 방식이 수정 전 생성 방식보다 편집 커버리지 측면에서 더 효과적인가?

주요 결과

  • PI는 설명 커버리지를 크게 향상시킨다: 인간 평가 결과, GPT-3.5와 ChatGPT 모두 PI를 사용할 경우 2.0 커버리지 점수(완전한 커버리지)를 기록했으며, PI 없이 사용할 경우 보다 낮은 점수를 기록했다.
  • PI는 설명 품질을 향상시킨다: GPT-3.5는 PI를 사용할 경우 1.8, ChatGPT는 1.9의 유효성 점수를 기록하여 어학 학습자에게 높은 정확도와 유용성을 보였다.
  • 자동 평가 결과, PI는 XGECa에서 표준 프롬프팅 대비 최대 12.5% 향상된 F1 점수를 기록했으며, XGECb에서는 10.3% 향상되었다.
  • PI를 사용한 LLM 생성 설명은 소수 샘플 학습에서 인간 주석 설명과 동등한 GEC 성능을 기록했으며, CoNLL2014, W&I, JFLEG 데이터셋에서 성능 차이가 거의 없었다.
  • 수정 후 설명 생성이 수정 전 생성보다 편집 커버리지 측면에서 뛰어나며, 인간 평가에서 커버리지 점수로 15% 높은 점수를 기록했다.
  • 표준 프롬프트 기반 생성에서 자주 발생하는 생략 및 모호성 문제를 효과적으로 완화했으며, 모델이 수정 포인트를 자주 누락하거나 혼동하는 문제를 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.