[논문 리뷰] Learning New Skills after Deployment: Improving open-domain internet-driven dialogue with human feedback
이 논문은 실시간 인간 상호작용 중에 수집된 다양한 인간 피드백(예: 모듈러 오류 주석, 이진 평가, 자유형 제안 등)을 활용하여 배포 후 성능을 햖थ한 오픈 도메인 대화 에이전트를 위한 지속적 학습 프레임워크를 제안한다. 모듈러 및 이진 피드백으로 미세조정된 Director 모델은 최신 기술 수준의 성능을 달성하며, 반복적 재학습을 통해 성능이 더욱 향상되고, 작은 모델에서 수집한 피드백이 OPT-175B와 같은 대규모 모델의 성능 향상에 효과적으로 기여한다.
Frozen models trained to mimic static datasets can never improve their performance. Models that can employ internet-retrieval for up-to-date information and obtain feedback from humans during deployment provide the promise of both adapting to new information, and improving their performance. In this work we study how to improve internet-driven conversational skills in such a learning framework. We collect deployment data, which we make publicly available, of human interactions, and collect various types of human feedback -- including binary quality measurements, free-form text feedback, and fine-grained reasons for failure. We then study various algorithms for improving from such feedback, including standard supervised learning, rejection sampling, model-guiding and reward-based learning, in order to make recommendations on which type of feedback and algorithms work best. We find the recently introduced Director model (Arora et al., '22) shows significant improvements over other existing approaches.
연구 동기 및 목표
- 표준 사전 훈련 및 미세조정 이후에도 실시간 배포 중 인간 상호작용을 통해 수집한 피드백을 통해 대화 에이전트가 새로운 기술을 습득할 수 있는지 조사한다.
- 다양한 피드백 유형(모듈러, 이진, 자유형, 실패 유형 주석)이 모델 성능 향상에 얼마나 효과적인지 평가한다.
- 피드백 통합을 위한 학습 알고리즘(예: 지도 학습, 기각 샘플링, 모델 가이딩, 보상 기반 학습)의 성능을 비교한다.
- 작은 모델(3B 파라미터)에서 수집한 피드백이 훨씬 큰 모델(175B 파라미터)의 성능 향상에 기여하는지 평가한다.
- 이전 배포 라운드에서 수집한 피드백을 기반으로 모델을 재학습하는 반복적이고 지속적인 학습 루프를 탐색한다.
제안 방법
- 3B 파라미터 대화 에이전트를 Amazon Mechanical Turk에 배포하여 현장에서의 인간 상호작용과 커뮤니티 워커로부터의 피드백을 수집한다.
- 세 가지 유형의 피드백을 수집: 이진 평가(좋음/나쁨), 자유형 텍스트 피드백, 실패 유형(검색, 결과, 응답 기반)을 식별하는 모듈러 피드백.
- 다양한 학습 방법을 훈련하고 비교: 지도 미세조정, 기각 샘플링, 모델 가이딩, 보상 기반 학습.
- 최근에 소개된 Director 모델(Arora 등, 2022)을 사용해 이진 피드백 학습을 수행했으며, 이는 다른 방법보다 뛰어난 성능을 보였다.
- 반복적 배포를 구현: 이전 라운드에서 수집한 피드백을 기반으로 모델을 재학습(예: v1 → v2)하여 지속적인 성능 향상을 달성한다.
- 작은 3B 모델에서 수집한 피드백을 사용해 175B 파라미터 모델(BlenderBot 3)을 미세조정하여 피드백의 전이 가능성(transferability)을 입증한다.
실험 결과
연구 질문
- RQ1실제 인간 상호작용 중 수집한 피드백을 활용해 배포 후 대화 에이전트가 새로운 대화 기술을 습득할 수 있는가?
- RQ2모듈러, 이진, 자유형 피드백 중 어떤 피드백 유형이 대화 성능 향상에 가장 효과적인가?
- RQ3다른 학습 알고리즘(예: Director, 보상 기반 학습, 지도 미세조정)은 피드백을 활용해 대화 성능 향상에 어떻게 대비하는가?
- RQ4이전 배포 라운드에서 수집한 피드백을 기반으로 반복적이고 지속적인 재학습을 수행할 경우 성능 향상이 측정 가능한가?
- RQ53B 파라미터 모델에서 수집한 피드백이 175B 파라미터 모델의 성능 향상에 효과적으로 기여하는가?
- RQ6실패 유형 분류와 같은 피드백의 세분성(granularity)은 모델 성능에 어떤 영향을 미치는가?
주요 결과
- 특히 검색, 결과, 응답 기반 오류와 같은 실패 유형을 식별하는 모듈러 피드백은 최종 응답에 대한 피드백보다 유의미하게 뛰어난 성능을 보였다.
- 이진 피드백으로 미세조정된 Director 모델은 재랭킹 또는 보상 기반 학습 방법보다 뛰어난 성능을 달성했다.
- Director 모델을 사용해 모듈러 및 이진 피드백을 병합한 결과, 자동 평가 및 인간 평가 모두에서 최고의 성능을 기록했다.
- 이전 배포 라운드에서 수집한 피드백을 기반으로 반복적 재학습(v1 → v2)을 수행한 결과 성능 향상이 뚜렷하게 나타났으며, 지속적 학습의 가치를 입증했다.
- 3B 파라미터 모델에서 수집한 피드백이 175B 파라미터 모델(BlenderBot 3)의 성능 향상에 기여하여 인간 평가에서 64.8%의 응답률과 평균 4.08점의 평가 점수를 기록했다.
- 강력한 성능 향상에도 불구하고, 최고의 모델(예: BB3-175B) 역시 사실 오류와 모순을 여전히 유발하므로, 지속적인 피드백 수집을 통한 추가 개선 여지가 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.