Skip to main content
QUICK REVIEW

[논문 리뷰] Few-Shot Bot: Prompt-Based Learning for Dialogue Systems

Andrea Madotto, Zhaojiang Lin|arXiv (Cornell University)|2021. 10. 15.
Topic Modeling참고 문헌 103인용 수 45
한 줄 요약

대형 언어 모델을 활용한 프롬프트 기반 소샷 학습은 다양한 작업에 걸쳐 완전히 훈련된 대화 모델과 경쟁력 있는 성과를 달성할 수 있으며, Few-Shot Bot (FSB)은 프롬프트 기반 스킬 선택기를 사용하여 미세 조정 없이 자동으로 스킬을 선택합니다.

ABSTRACT

Learning to converse using only a few examples is a great challenge in conversational AI. The current best conversational models, which are either good chit-chatters (e.g., BlenderBot) or goal-oriented systems (e.g., MinTL), are language models (LMs) fine-tuned on large conversational datasets. Training these models is expensive, both in terms of computational resources and time, and it is hard to keep them up to date with new conversational skills. A simple yet unexplored solution is prompt-based few-shot learning (Brown et al. 2020) which does not require gradient-based fine-tuning but instead uses a few examples in the LM context as the only source of learning. In this paper, we explore prompt-based few-shot learning in dialogue tasks. We benchmark LMs of different sizes in nine response generation tasks, which include four knowledge-grounded tasks, a task-oriented generations task, three open-chat tasks, and controlled stylistic generation, and five conversational parsing tasks, which include dialogue state tracking, graph path generation, persona information extraction, document retrieval, and internet query generation. The current largest released LM (GPT-J-6B) using prompt-based few-shot learning, and thus requiring no training, achieves competitive performance to fully trained state-of-the-art models. Moreover, we propose a novel prompt-based few-shot classifier, that also does not require any fine-tuning, to select the most appropriate prompt given a dialogue history. Finally, by combining the power of prompt-based few-shot learning and a Skill Selector, we create an end-to-end chatbot named the Few-Shot Bot (FSB), which automatically selects the most appropriate conversational skill, queries different knowledge bases or the internet, and uses the retrieved knowledge to generate a human-like response, all using only few dialogue examples per skill.

연구 동기 및 목표

  • 프롬프트 기반 학습을 활용해 대화 시스템에 대한 무거운 그래디언트 기반 미세 조정에 대한 의존도를 줄이고자 한다.
  • 지식 기반, 태스크 지향, 오픈 채트, 파싱 등 광범위한 대화 태스크 및 데이터셋에 걸쳐 프롬프트 기반 소샷 학습을 벤치마크한다.
  • 학습 없이 대화 이력을 가장 적합한 프롬프트/스킬에 매핑하는 스킬 셀렉터를 도입한다.
  • 각 스킬당 오직 소샷 프롬프트만을 사용하여 스킬 선택, 지식 검색, 응답 생성을 자동화하는 Few-Shot Bot (FSB)을 제안한다.

제안 방법

  • 경사 업데이트 없이 연결된 소샷 프롬프트(X=대화 역사, Y=응답)를 통해 P(Y|X, Prompt_k)를 계산하기 위해 언어 모델을 사용한다.
  • 응답 생성을 안내하기 위해 k샷 시연과 함께 작업 특화 프롬프트(Prompt_k)를 설계하고, 미세 조정과의 비교를 기준으로 한다.
  • 각 후보 스킬 y에 대해 P(X|Prompt_k^y)를 평가하여 대화 이력에 가장 적합한 프롬프트를 선택하는 Prompt-Based Few-Shot Skill Selector를 도입한다.
  • 지식 기반 응답을 위해 스킬 셀렉터를 다수의 프롬프트와 외부 지식 소스(KB, 인터넷, KG)와 결합하여 Few-Shot Bot (FSB)을 구현한다.
  • 로컬 배치를 위해 주 LM으로 GPT-J (6B)를 사용하고, 더 큰 모델에 접근하기 위해 API를 통한 GPT-Jurassic를 사용하며, 1-shot 프롬프트와 0/1/k-shot 실험을 태스크 전반에 걸쳐 수행한다.

실험 결과

연구 질문

  • RQ1대형 LM을 활용한 프롬프트 기반 소샷 학습이 파인튜닝 없이도 다양한 대화 태스크에서 완전히 훈련된 모델과 경쟁력 있는 결과를 달성할 수 있는가?
  • RQ2프롬프트 기반 스킬 셀렉터가 주어진 대화 이력에 대해 가장 적합한 프롬프트/스킬을 효과적으로 식별하는가?
  • RQ3모델 크기와 샷 수가 응답 생성 및 대화 파싱 태스크의 성능에 어떤 영향을 미치는가?
  • RQ4당혹도(perplexity) 및 평가 지표에서 프롬프트 기반 소샷 방법과 최첨단 완전 훈련 모델 간의 비교 차이는 어느 정도인가?
  • RQ5종단 간(end-to-end) 프롬프트 기반 소샷 봇이 모델 훈련 없이도 다수의 지식 소스를 활용해 인간에 가까운, 지식에 기반한 응답을 생성할 수 있는가?

주요 결과

  • 더 큰 언어 모델(GPT-J 6B)이 모든 태스크에서 일관되게 더 작은 모델보다 우수하며 크기와 성능 사이에 선형 관계가 있음을 보인다.
  • 샷 수가 많다고 항상 성능이 향상되지는 않으며, 일부 지식 기반 태스크에서는 더 적은 샷에서 최상의 성능이 나타난다.
  • 대화 파싱 태스크는 프롬프트 기반 학습에 더 어려우며, 빔 탐색과 같은 디코딩 전략에서 혜택을 받을 수 있는 SOTA 완전 훈련 모델과의 차이가 더 크다.
  • FSB와 SOTA 간 perplexity 차이가 상대적으로 작아, 샘플링 전략 개선으로 잠재적 이익이 있음을 시사한다.
  • 프롬프트 기반 스킬 셀렉터는 미세 조정된 RoBERTa 베이스라인에 비견할 만한 성과를 달성하면서도 훈련을 전혀 필요로 하지 않으며, 새로운 스킬을 쉽게 확장할 수 있다.
  • 종단 간 Few-Shot Bot은 다수의 지식 소스에 접근하고 사용자 선호도를 추적하며, 스킬별로 오직 소샷 프롬프트만을 사용해 지식에 기반한 응답을 생성할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.