Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Open Language Models by Learning from Organic Interactions

Jing Xu, Da Young Ju|arXiv (Cornell University)|2023. 06. 07.
Hate Speech and Cyberbullying Detection인용 수 4
한 줄 요약

이 논문은 탈식별화된 유저 상호작용 및 실제 배포 환경에서의 피드백을 기반으로 훈련된 개선된 오픈 도메인 언어 모델인 BlenderBot 3x를 소개한다. 보상 모델과 Cringe Loss를 활용해 유용한 상호작용과 적대적인 상호작용 양쪽에서 학습함으로써, 모델은 실제 유저 데이터에서 참여도와 독성 저항력 모두에서 BlenderBot 3를 능가하는 94.4%의 응답 품질을 달성하였다.

ABSTRACT

We present BlenderBot 3x, an update on the conversational model BlenderBot 3, which is now trained using organic conversation and feedback data from participating users of the system in order to improve both its skills and safety. We are publicly releasing the participating de-identified interaction data for use by the research community, in order to spur further progress. Training models with organic data is challenging because interactions with people "in the wild" include both high quality conversations and feedback, as well as adversarial and toxic behavior. We study techniques that enable learning from helpful teachers while avoiding learning from people who are trying to trick the model into unhelpful or toxic responses. BlenderBot 3x is both preferred in conversation to BlenderBot 3, and is shown to produce safer responses in challenging situations. While our current models are still far from perfect, we believe further improvement can be achieved by continued use of the techniques explored in this work.

연구 동기 및 목표

  • 모아진 데이터나 합성 데이터에만 의존하는 것과는 달리, 실제 세계의 유기적인 유저 상호작용과 피드백을 활용하여 대화형 AI 모델을 향상시키는 것.
  • 적대적이고 독성 있는 사용자 행동을 포함한 혼합 품질의 데이터에서 학습하면서도, 모델 개선을 위한 유용한 신호를 추출하는 문제를 해결하는 것.
  • 데이터 기반 피니팅을 통해 오픈 도메인 언어 모델의 대화 품질(예: 참여도, 지식 활용)과 안전성(예: 독성 감소)을 향상시키는 것.
  • 대규모의 탈식별화된 실유저 상호작용 데이터셋을 공개하여 안전하고 효과적인 대화형 AI 분야의 연구를 널리 지원하는 것.

제안 방법

  • 모델는 커뮤니티 작업자들이 주석 처리한 데이터와 유저가 제공한 피드백(예: 좋은 응답 또는 나쁜 응답을 신고하는 방식)을 기반으로 훈련된 보상 모델을 사용하여 피니팅된다.
  • Cringe Loss는 고품질 응답 생성과 유해하거나 비논리적이거나 주제에서 벗어난 출력 생성 확률을 동시에 최적화하기 위해 적용된다.
  • 훈련 데이터는 BlenderBot 3의 실제 배포에서 수집된 353,000건 이상의 탈식별화된 대화와 155,000건의 유저 피드백 인스턴스로 구성되어 있다.
  • 적대적 또는 저품질 상호작용으로 인한 노이즈를 식별하고 완화하기 위해 다단계의 데이터 필터링 및 분석 파이프라인을 사용한다.
  • 응답 품질과 안전성을 평가하기 위해 인간 평가를 수행하며, 원본 BlenderBot 3와의 비교를 통해 성능을 분석한다.
  • 사용자에게 보여지는 보호 조치로는 표시되는 배너, 데이터 공유에 대한 철회 옵션, 그리고 위험 요소와 연구 성격을 사용자에게 알리는 FAQ가 포함되어 있다.

실험 결과

연구 질문

  • RQ1실제 세계의 유기적인 유저 상호작용과 피드백을 활용하여 오픈 도메인 언어 모델을 효과적으로 향상시킬 수 있는가? 특히, 적대적이고 독성 있는 입력이 포함된 데이터에서도 말이다?
  • RQ2실제 배포 환경에서 도움이 되는 행동과 해로운 행동을 동시에 경험할 때, 모델이 높은 응답 품질과 안전성을 유지할 수 있는가?
  • RQ3Cringe Loss와 보상 모델링과 같은 기법들은 실제 유저 데이터에서 노이즈와 적대적 신호를 효과적으로 분리하여 유용한 피드백을 추출하는 데 어떤 역할을 하는가?
  • RQ4모델이 커리티드되거나 합성 데이터가 아닌 실제 유저 피드백을 기반으로 피니팅될 경우, 안전성과 참여도가 얼마나 향상될 수 있는가?
  • RQ5대규모의 탈식별화된 상호작용 데이터를 어떻게 책임감 있게 공개하여 대화형 AI 분야의 개방형 연구를 지원할 수 있는가?

주요 결과

  • BlenderBot 3x는 인간 평가에서 94.4%의 응답 품질 점수를 기록하여 원본 BlenderBot 3의 85.3%를 크게 능가하였다.
  • 적대적 대화 상황에서 모델은 2.4%의 비정상적인 응답을 생성하였으며, 원본 모델의 동일한 비율과 유사하지만, 이는 안정성 향상의 징후로 간주된다.
  • 표준 대화 상황에서 모델은 85%의 경우 고품질 응답을 유지하였고, 인간 참여자는 75%의 비율을 기록하여 강력한 대화 일치도를 보였다.
  • 보상 모델과 함께 Cringe Loss를 사용함으로써 응답 품질과 안전성 모두에 측정 가능한 향상이 있었으며, 특히 도전적인 상호작용 상황에서 두드러졌다.
  • 353,000건 이상의 대화와 155,000건의 피드백 인스턴스가 수집되어 탈식별화된 데이터셋으로 공개되었다.
  • 개선에도 불구하고, 모델는 여전히 적대적 프롬프트에 취약한 실패를 보이며, 정렬 및 안전성 분야의 지속적인 연구가 필요함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.