[논문 리뷰] Improving alignment of dialogue agents via targeted human judgements
Sparrow는 표적 인간 판단과 인라인 증거를 사용해 학습된 정보 탐색 대화 에이전트로, Baselines보다 더 높은 선호도와 더 낮은 규칙 위반률을 달성하며, 사실 주장에 대한 증거를 78%의 시점에서 제공합니다.
We present Sparrow, an information-seeking dialogue agent trained to be more helpful, correct, and harmless compared to prompted language model baselines. We use reinforcement learning from human feedback to train our models with two new additions to help human raters judge agent behaviour. First, to make our agent more helpful and harmless, we break down the requirements for good dialogue into natural language rules the agent should follow, and ask raters about each rule separately. We demonstrate that this breakdown enables us to collect more targeted human judgements of agent behaviour and allows for more efficient rule-conditional reward models. Second, our agent provides evidence from sources supporting factual claims when collecting preference judgements over model statements. For factual questions, evidence provided by Sparrow supports the sampled response 78% of the time. Sparrow is preferred more often than baselines while being more resilient to adversarial probing by humans, violating our rules only 8% of the time when probed. Finally, we conduct extensive analyses showing that though our model learns to follow our rules it can exhibit distributional biases.
연구 동기 및 목표
- 대화 품질을 자연어 규칙으로 분해해 인간 판단을 유도하고 표적 보상 모델링을 개선한다.
- 강화 학습에서 인간 피드백(RLHF)을 사용해 선호도(유용성)와 규칙 준수(무해성)를 모두 최적화한다.
- 인라인 웹 증거를 도입해 사실적 정확성과 검증 가능성을 향상시킨다.
- 대화 시스템에서 규칙 기반 완화 및 RLHF로 인한 분포 특성 및 편향을 분석한다.
제안 방법
- 도움 및 정확성에 대한 규칙 기반 제약을 정의하고 규칙별 인간 판단을 수집한다.
- 증거를 가능하게 하는 검색 응답을 포함한 자세한 대화 프롬프트로 Chinchilla-70B 기본 모델의 대화 턴을 생성한다.
- 두 가지 유형의 인간 데이터를 수집한다: 턴별 응답 선호도와 규칙 위반을 테스트하기 위한 적대적 프로빙.
- 두 개의 보상 모델을 훈련한다: 전체 응답 품질을 위한 선호 보상 모델(Preference Reward Model)과 규칙 준수를 위한 규칙 위반 보상 모델(Rule Violation Reward Model).
- 테스트 시 다수의 후보 응답 중 보상 점수를 바탕으로 재정렬을 사용해 선택하고, 결합된 목표를 최적화하기 위해 RL(A2C)로 학습한다.
- 증거를 웹 조각으로 검색해 모델 주장과 함께 제시하고, 그 타당성과 지지 여부를 평가하기 위한 증거-결정 신호를 학습한다.
- 미리 대부분의 기본 모델을 고정해 보상 모델과 정책 간 표현 공유를 가능하게 하고, 규칙 RM에 대한 지시 학습 스타일의 목표를 적용한다.
실험 결과
연구 질문
- RQ1대화 안전성을 규칙별 판단으로 나누는 것이 RLHF에 대한 인간 피드백의 효율성과 효과를 향상시키는가?
- RQ2인라인 증거를 통합하면 응답의 사실적 정확성과 검증 가능성이 향상되는가?
- RQ3타깃 규칙과 증거를 활용한 RLHF가 사용자 인식 상의 유용성 및 모델 안전성에 어떤 영향을 미치며 적대적 프로빙에 대한 탄력성은 어떠한가?
- RQ4RLHF 및 증거 근거화를 통한 규칙 기반 안전성 시행이 분포상 편향이나 해를 어떻게 초래하는가?
주요 결과
- Sparrow는 프롬프트된 베이스라인보다 선호되며 적대적 프로빙에 대한 탄력성이 더 높고 타깃 프로브에서 규칙 위반이 8%에 불과하다.
- 증거 기반 응답은 제공된 웹 조각으로 78%의 시간에 타당하고 뒷받침된다.
- 재정렬 및 선호 신호와 규칙 준수를 결합한 RLHF는 베이스라인에 비해 규칙 위반을 감소시키면서도 높은 선호를 유지한다.
- 인라인 증거를 제공하면 검증 가능성과 신뢰가 향상되지만, 안전 개입으로 인해 분포상 편향과 해가 증폭될 수 있다.
- 사용자 선호 최적화와 규칙 위반 감소 사이에 트레이드오프가 존재하며, 안전성과 유용성 간의 이전 연구 결과와 일치한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.