[논문 리뷰] Cue-CoT: Chain-of-thought Prompting for Responding to In-depth Dialogue Questions with LLMs
이 논문은 사용자 대화 맥락에서 나타나는 언어적 신호—성격, 정서, 심리학적 요소—에 대해 명시적인 추론을 통해 LLM 기반 대화 시스템의 성능을 향상시키는 Cue-CoT라는 체인오브스포트 프롬프팅 방법을 제안한다. 반응 생성을 중간 추론 단계로 분해함으로써 Cue-CoT는 6개의 다국어 데이터셋에서 반응의 유용성과 수용 가능성을 향상시킨다. M-Cue CoT는 제로샷 및 원샷 설정 모두에서 표준 프롬프팅에 비해 뛰어난 강건성과 성능을 보여준다.
Large Language Models (LLMs), such as exttt{ChatGPT}, greatly empower dialogue systems with strong language understanding and generation capabilities. However, most of the previous works prompt the LLMs to directly generate a response based on the dialogue context, overlooking the underlying linguistic cues about the user status exhibited in the context. Such in-depth dialogue scenarios are challenging for existing LLMs to figure out the user's hidden needs and respond satisfactorily through a single-step inference. To this end, we propose a novel linguistic cue-based chain-of-thoughts ( extit{Cue}-CoT), which enhances the LLMs inference with an intermediate reasoning step to find cues exhibited in the dialogue, aiming to provide a more personalized and engaging response. To evaluate the approach, we build a benchmark with in-depth dialogue questions, consisting of 6 datasets in both Chinese and English, targeting 3 major linguistic cues during the conversation: extit{personality}, extit{emotion}, and extit{psychology}. We conduct extensive experiments on the proposed benchmark with 5 LLMs under both zero-shot and one-shot settings. Empirical results demonstrate our proposed extit{Cue}-CoT method outperforms standard prompting methods in terms of both extit{helpfulness} and extit{acceptability} on all datasets.
연구 동기 및 목표
- 깊이 있는 대화 질문에 대해 개인화되고 맥락 인식이 가능한 반응을 생성하는 데 있어 표준 프롬프팅의 한계를 해결하기 위해.
- 성격, 정서, 심리학적 요소와 같은 언어적 신호가 LLM 대화 시스템 내에서 추론을 향상시키는 데 어떻게 활용될 수 있는지 조사하기 위해.
- 사용자 상태를 중간 추론 단계를 통해 명시적으로 모델링하는 새로운 체인오브스포트 프롬프팅 프레임워크를 개발하기 위해.
- 사용자 상태 인식 기반 대화 생성을 평가하기 위해 6개의 다국어 데이터셋을 포함하는 종합적인 벤치마크를 구축하기 위해.
- 소수의 예시 설정에서 중간 추론 결과를 기반으로 한 예시 선택 전략을 탐색하기 위해.
제안 방법
- Cue-CoT의 두 변형을 제안한다: O-Cue CoT(최종 반응을 위한 단일 단계 추론)와 M-Cue CoT(사용자 상태 신호에 대한 단계별 추론).
- LLM이 대화 맥락에서 성격, 정서, 심리 상태를 먼저 추론한 후에 반응을 생성하도록 이끄는 프롬프트를 설계한다.
- 원샷 설정에서 중간 추론 결과를 선택 기준으로 사용하는 새로운 예시 선택 전략을 도입한다.
- 성격, 정서, 심리적 신호에 대해 주석이 달린 총 7,300개의 대화를 포함하는 6개의 데이터셋(중국어 3개, 영어 3개)으로 구성된 벤치마크를 구축한다.
- 다양한 모델과 언어를 대상으로 제로샷 및 원샷 프롬프팅을 사용하여 성능을 평가하기 위해 5개의 LLM을 활용한다.
- 자동 평가 및 인위적 평가를 통해 반응의 유용성과 수용 가능성을 측정하며, 추론 단계의 정확성은 모호성과 다对다 매핑 가능성으로 인해 직접 평가하지 않는다.
실험 결과
연구 질문
- RQ1성격, 정서, 심리학적 요소와 같은 언어적 신호에 대한 추론이 LLM 생성 대화 반응의 품질을 향상시킬 수 있는가?
- RQ2다양한 대화 상황에서 Cue-CoT는 표준 프롬프팅에 비해 반응의 유용성과 수용 가능성이 높은가?
- RQ3M-Cue CoT는 O-Cue CoT에 비해 추론의 강건성과 반응 품질에서 뛰어나게 성능을 발휘하는가?
- RQ4소수의 예시 설정에서 중간 추론 결과를 효과적으로 활용하여 예시 선택을 이끌 수 있는가?
- RQ5Cue-CoT를 사용할 때 다양한 LLM이 다국어 깊이 있는 대화 벤치마크에서 어떻게 성능을 내는가?
주요 결과
- 제로샷 및 원샷 설정 모두에서 Cue-CoT는 모든 6개의 데이터셋에서 표준 프롬프팅보다 반응의 유용성과 수용 가능성이 뚜렷이 뛰어나다.
- 모든 데이터셋과 LLM에서 M-Cue CoT는 O-Cue CoT에 비해 더 뛰어난 강건성과 추론 성능를 보여준다.
- 중간 추론 결과를 기반으로 한 제안된 예시 선택 전략은 원샷 설정에서 무작위 또는 상위 1개 선택 전략보다 뛰어난 성능을 달성한다.
- 실험 결과에 따르면 LLM은 프롬프트 설계에 민감하며, 최적의 프롬프트가 성능에 결정적인 영향을 미친다.
- 대부분의 LLM은 영어(영역 2) 또는 중국어(영역 3)에서 동시에 두 언어를 사용할 때보다 성능이 뛰어나며, 이는 더 나은 다국어 정렬이 필요함을 시사한다.
- 대화 반응 생성의 다대다 특성과 잘못된 추론를 통해도 올바른 답변가 도달할 수 있는 가능성으로 인해 중간 추론의 평가가 어렵다는 점이 연구에서 부각되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.