Skip to main content
QUICK REVIEW

[논문 리뷰] Deliberate then Generate: Enhanced Prompting Framework for Text Generation

Bei Li, Rui Wang|arXiv (Cornell University)|2023. 05. 31.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs)의 텍스트 생성을 향상시키기 위해 먼저 후보 출력에서 오류를 탐지한 후 개선된 결과를 생성하도록 지시하는 새로운 프롬프팅 프레임워크인 '의도적 사고 후 생성(Deliberate then Generate, DTG)'을 제안한다. 잘못되거나 관련이 없는 후보(예: 빈 문자열 또는 무작위 텍스트)를 사용함으로써 DTG는 LLM의 사고적 추론을 유도하며, 요약, 번역, 대화 등 7개의 텍스트 생성 작업에서 20개 이상의 데이터셋에서 일관된 성능 향상을 이끌어내며, 여러 벤치마크에서 최고 성능(SOTA)을 기록한다.

ABSTRACT

Large language models (LLMs) have shown remarkable success across a wide range of natural language generation tasks, where proper prompt designs make great impacts. While existing prompting methods are normally restricted to providing correct information, in this paper, we encourage the model to deliberate by proposing a novel Deliberate then Generate (DTG) prompting framework, which consists of error detection instructions and candidates that may contain errors. DTG is a simple yet effective technique that can be applied to various text generation tasks with minimal modifications. We conduct extensive experiments on 20+ datasets across 7 text generation tasks, including summarization, translation, dialogue, and more. We show that DTG consistently outperforms existing prompting methods and achieves state-of-the-art performance on multiple text generation tasks. We also provide in-depth analyses to reveal the underlying mechanisms of DTG, which may inspire future research on prompting for LLMs.

연구 동기 및 목표

  • 표준 프롬프팅이 정확한 정보만 다루는 한계를 해결하기 위해, LLM이 생성하기 전에 오류를 사고하고 탐지하도록 유도하는 것.
  • LLM이 결함 있는 출력을 평가하고 수정하도록 프롬프팅하는 것이 생성 품질을 향상시키는지 탐구하는 것.
  • 다양한 텍스트 생성 작업에 걸쳐 최소한의 수정으로도 간단하면서도 효과적인 프롬프팅 프레임워크를 개발하는 것.
  • DTG가 모델 성능을 향상시키고 LLM 내부의 사고적 메커니즘을 드러내는지 경험적으로 검증하는 것.

제안 방법

  • DTG는 두 단계의 프롬프팅 프로세스를 도입한다: 첫 번째로 모델은 후보 출력의 오류를 탐지하도록 유도하고, 두 번째로 개선된 결과를 생성한다.
  • 후보 입력은 의도적으로 잘못되거나 관련이 없도록 설정되며, 예를 들어 빈 문자열이나 무작위 텍스트를 사용하여 모델이 오류 탐지 및 수정에 참여하도록 유도한다.
  • 프레임워크는 고정된 프롬프트 템플릿을 사용한다: '먼저 오류 유형을 확인하고, 그 다음 개선된 결과를 제공하세요.'
  • 이 방법은 요약, 번역, 대화, 공통 지식 생성 등 다양한 작업에 최소한의 프롬프팅 엔지니어링으로 적용된다.
  • 실험은 GPT-3.5와 GPT-4를 사용하여 제로샷 및 피셔샷 설정을 통해 일반화 능력과 견고성을 평가한다.
  • 오류 분석은 정렬 도구(awesome-align)와 명명된 실체 인식(named entity recognition, spaCy)을 사용하여 부족 번역 및 실체 번역 오류를 정량화한다.

실험 결과

연구 질문

  • RQ1후보 출력의 잠재적 오류에 대해 LLM이 사고하도록 프롬프팅하는 것이 생성 품질을 향상시키는가?
  • RQ2의도적으로 관련 없거나 잘못된 후보를 입력으로 사용하면 LLM이 효과적으로 오류 탐지 및 개선을 유도하는가?
  • RQ3다양한 텍스트 생성 작업과 모델 버전에서 DTG는 표준 프롬프팅보다 어떻게 비교되는가?
  • RQ4DTG에서 관찰된 성능 향상의 배경이 되는 메커니즘은 무엇인가, 특히 오류 회피 및 개선 측면에서?

주요 결과

  • DTG는 요약, 번역, 대화 등 7개의 텍스트 생성 작업을 포함한 20개 이상의 데이터셋에서 표준 프롬프팅을 일관되게 능가한다.
  • WMT ZH-EN 번역 벤치마크에서 DTG는 BLEU 점수를 표준 프롬프팅의 23.6에서 25.2로 향상시키고, COMET 점수를 81.12에서 81.70으로 상승시켰다.
  • 무작위 텍스트나 빈 문자열과 같은 관련 없는 후보를 사용할 경우, 고정된 잘못된 후보나 올바른 후보를 사용하는 것보다 더 좋은 성능을 기록했으며, 이는 기준과의 높은 괴리가 사고적 과정을 강화함을 시사한다.
  • 절단 분석을 통해 LLM이 잘못된 후보를 제시받을 경우 실제로 오류 탐지를 위해 사고를 기울이며 생성 품질이 향상됨을 확인했다.
  • 기계 번역, 텍스트 단순화, 공통 지식 생성 등 여러 벤치마크에서 최고 성능을 기록했다.
  • 오류 분석 결과, DTG가 부족 번역 및 명명된 실체 번역 오류를 크게 감소시켜 오류 방지 측면에서 효과적임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.