Skip to main content
QUICK REVIEW

[논문 리뷰] Controlling Personality Style in Dialogue with Zero-Shot Prompt-Based Learning

Angela Ramirez, Mamon Alsalihy|arXiv (Cornell University)|2023. 02. 08.
Topic Modeling인용 수 6
한 줄 요약

이 논문은 대규모 언어 모델을 사용하여 임무 지향 대화 생성에서 성격 스타일과 의미 정확도를 제로샷 프롬프트 기반 방법으로 동시에 제어하는 방법을 제안한다. 텍스트 스타일 전이(TST) 프롬프트와 과다 생성 및 메트릭 기반 순위 매기기를 활용하여, 비디오 게임 대화에서 100% 성격 정확도와 87.6% 의미 정확도를 달성했으며, 데이터-텍스트 프롬프트보다 뛰어난 성능을 보이며 강력한 도메인 간 전이 가능성을 입증하였다.

ABSTRACT

Prompt-based or in-context learning has achieved high zero-shot performance on many natural language generation (NLG) tasks. Here we explore the performance of prompt-based learning for simultaneously controlling the personality and the semantic accuracy of an NLG for task-oriented dialogue. We experiment with prompt-based learning on the PERSONAGE restaurant recommendation corpus to generate semantically and stylistically-controlled text for 5 different Big-5 personality types: agreeable, disagreeable, conscientious, unconscientious, and extravert. We test two different classes of discrete prompts to generate utterances for a particular personality style: (1) prompts that demonstrate generating directly from a meaning representation that includes a personality specification; and (2) prompts that rely on first converting the meaning representation to a textual pseudo-reference, and then using the pseudo-reference in a textual style transfer (TST) prompt. In each case, we show that we can vastly improve performance by over-generating outputs and ranking them, testing several ranking functions based on automatic metrics for semantic accuracy, personality-match, and fluency. We also test whether NLG personality demonstrations from the restaurant domain can be used with meaning representations for the video game domain to generate personality stylized utterances about video games. Our findings show that the TST prompts produces the highest semantic accuracy (78.46% for restaurants and 87.6% for video games) and personality accuracy (100% for restaurants and 97% for video games). Our results on transferring personality style to video game utterances are surprisingly good. To our knowledge, there is no previous work testing the application of prompt-based learning to simultaneously controlling both style and semantic accuracy in NLG.

연구 동기 및 목표

  • 임무 지향 대화를 위한 자연어 생성에서 성격 스타일과 의미 정확도를 동시에 제어할 수 있는 프롬프트 기반 학습을 탐색한다.
  • 직접적인 데이터-텍스트(D2T) 프롬프트와 텍스트 스타일 전이(TST) 프롬프트의 두 가지 프롬프트 유형을 비교하여 성격 스타일화 성능을 평가한다.
  • 소수 샘플 예시의 영향을 평가한다. 이는 단일 대비 다수 성격 예시와 다양한 샘플링 전략을 포함한다.
  • 의미 표현을 사용하여 레스토랑 도메인에서 학습한 성격 스타일을 비디오 게임 도메인으로 제로샷 전이하는지를 테스트한다.
  • 자연어 메트릭을 사용하여 유창성, 의미 정확도, 성격 일치도를 평가하고 최적의 순위 매기기 함수를 식별한다.

제안 방법

  • 이 방법은 두 가지 이산적 프롬프트 유형을 사용한다: (1) 의미 표현에 내장된 성격 사양을 직접 기반으로 생성하는 D2T 프롬프트, (2) 의미 표현을 일종의 가짜 참조로 변환한 후 스타일 전이를 적용하는 TST 프롬프트.
  • 각 입력에 대해 모델은 다수의 후보 발화를 생성함으로써(과다 생성) 고품질 출력의 가능성 증가를 도모한다.
  • 유창성(BLEURT), 의미 정확도를 위한 개인화된 슬롯 오류율, 성격 일치도를 위한 훈련된 성격 분류기 등을 조합한 가중치 기반 메트릭을 사용해 출력을 순위 매긴다.
  • 최고의 성능을 보인 설정은 TST 프롬프트에 단일 성격 예시와 다양성 인식 샘플링을 적용한 것으로, 의미 정확도와 스타일 정확도 양면에서 향상되었다.
  • 이 방법은 레스토랑 도메인의 Personage 코퍼스에서 평가되었고, 후자의 의미 표현을 사용하여 비디오 게임 도메인의 ViGGO 코퍼스로 전이되었다.
  • 성격 정확도, 의미 정확도, 유창성을 종합한 순위 함수를 사용해 최종 출력을 선택하였으며, RF3(BLEURT와 슬롯 오류율 통합)는 유의미한 향상을 보였다.
Figure 1: Two models for Semantically Controlled Generation with Style
Figure 1: Two models for Semantically Controlled Generation with Style

실험 결과

연구 질문

  • RQ1프롬프트 기반 학습을 통해 피팅 트레이닝 없이도 임무 지향 대화 생성에서 성격 스타일과 의미 정확도를 동시에 제어할 수 있는가?
  • RQ2D2T와 TST 중 어느 프롬프트 유형이 의미 정확도와 성격 일치도 측면에서 더 뛰어난 성능을 보이는가?
  • RQ3소수 샘플 예시의 수와 다양성이 모델이 미리 보지 않은 성격 스타일로 일반화하는 능력에 어떤 영향을 미치는가?
  • RQ4레스토랑 도메인에서 학습한 성격 스타일화는 타겟 도메인의 의미 표현을 사용해 비디오 게임 도메인으로 얼마나 잘 전이될 수 있는가?
  • RQ5유창성, 의미 충실도, 성격 정확도를 균형 있게 유지하기 위해 가장 효과적인 자동 메트릭 조합은 무엇인가?

주요 결과

  • TST 프롬프트 접근법은 ViGGO 비디오 게임 데이터셋에서 100% 성격 정확도와 87.6% 의미 정확도를 달성했으며, D2T 프롬프트보다 뚜렷하게 뛰어난 성능을 보였다.
  • Personage 레스토랑 데이터셋에서는 TST 프롬프트가 78.46% 의미 정확도와 100% 성격 정확도를 기록하여 원천 도메인에서 강력한 성능을 입증하였다.
  • 다수의 출력을 과다 생성하고 복합 메트릭(RF3)을 사용해 순위 매기면, 단순한 순위 매기기 함수보다 의미 정확도에서 통계적으로 유의미한 향상(p = 0)을 보였다.
  • 단일 프롬프트에 다수의 성격 예시를 사용할 경우 성능 저하가 발생했으며, 이는 제로샷 스타일 제어에 단일 스타일 예시가 더 효과적임을 시사한다.
  • 모델는 레스토랑 도메인에서 학습한 성격 스타일을 비디오 게임 도메인으로 성공적으로 전이했으며, 'Hey'는 친화성의 표시로, 'Mmhm...'은 외향성을 나타내는 언어적 일관성 있는 마커를 생성했다.
  • 레스토랑 도메인과 비디오 게임 도메인 간 성능 격차는 Personage 코퍼스의 탈디렉셔널화된 이름 때문이며, ViGGO의 실제 세계 지식이 의미 충실도 향상에 기여한 것으로 분석되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.