Skip to main content
QUICK REVIEW

[논문 리뷰] From Instructions to Intrinsic Human Values -- A Survey of Alignment Goals for Big Models

Jing Yao, Xiaoyuan Yi|arXiv (Cornell University)|2023. 08. 23.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs)의 정렬 목표를 조사하며, 인간의 지시에서 인간의 선호로, 궁극적으로는 내재된 인간의 가치로의 진화를 추적한다. 인간의 핵심 가치—유용성, 정직성, 해로움이 없음—과 LLM을 정렬하는 것이 가장 본질적이고 지속 가능한 목표라고 주장하며, 강력한 가치 기반 정렬을 달성하기 위한 주요 과제와 자원을 규명한다.

ABSTRACT

Big models, exemplified by Large Language Models (LLMs), are models typically pre-trained on massive data and comprised of enormous parameters, which not only obtain significantly improved performance across diverse tasks but also present emergent capabilities absent in smaller models. However, the growing intertwining of big models with everyday human lives poses potential risks and might cause serious social harm. Therefore, many efforts have been made to align LLMs with humans to make them better follow user instructions and satisfy human preferences. Nevertheless, `what to align with' has not been fully discussed, and inappropriate alignment goals might even backfire. In this paper, we conduct a comprehensive survey of different alignment goals in existing work and trace their evolution paths to help identify the most essential goal. Particularly, we investigate related works from two perspectives: the definition of alignment goals and alignment evaluation. Our analysis encompasses three distinct levels of alignment goals and reveals a goal transformation from fundamental abilities to value orientation, indicating the potential of intrinsic human values as the alignment goal for enhanced LLMs. Based on such results, we further discuss the challenges of achieving such intrinsic value alignment and provide a collection of available resources for future research on the alignment of big models.

연구 동기 및 목표

  • 대규모 언어 모델(LLMs) 개발을 이끄는 기본적인 정렬 목표를 특정하고 분석하는 것.
  • 정렬 목표가 표면적 지시에서 더 깊은 인간의 가치로 어떻게 진화해 왔는지 조사하는 것.
  • 내재된 인간의 가치가 LLM 정렬의 가장 본질적이고 지속 가능한 목표임을 주장하는 것.
  • LLMs에서 안정적이고 효과적이며 종합적인 가치 정렬을 달성하는 데 있어 주요 과제를 부각하는 것.
  • 향후 LLM 정렬 분야의 연구를 지원하기 위한 공개 자원 목록을 제공하는 것.

제안 방법

  • 기존의 정렬 연구를 종합적으로 조사하여 정렬 목표를 세 수준으로 분류함: 인간의 지시, 인간의 선호, 인간의 가치.
  • 문헌의 체계적 검토를 통해 세 수준의 정렬 목표 정의 및 평가를 분석함.
  • 작업 중심의 지시에서 일반화된 선호로, 궁극적으로 내재된 가치로의 정렬 목표의 진화를 추적함.
  • 헌법 기반 AI와 인라인 학습이 직접적인 가치 정렬을 위한 유망한 길이라 주장하지만, 현재는 대체로 프록시 시범에 의존하고 있음.
  • 다양한 난이도 수준에서 정렬을 평가할 수 있는 자동화되고 확장 가능하며 종합적인 평가 기준이 필요하다는 점을 강조함.
  • 간접적인 행동 신호가 아닌 가치 원칙 자체를 직접 최적화하는 정렬 알고리즘이 필요하다는 점을 규명함.

실험 결과

연구 질문

  • RQ1현재 대규모 언어 모델 연구에서 주로 사용되는 정렬 목표는 무엇이며, 시간이 지남에 따라 어떻게 진화해 왔는가?
  • RQ2왜 지시나 선호보다 내재된 인간의 가치와의 정렬이 더 본질적이고 지속 가능한 목표로 간주되는가?
  • RQ3LLMs에서 내재된 인간의 가치와의 안정적이고 효과적인 정렬을 달성하는 데 있어 주요 과제는 무엇인가?
  • RQ4윤리적 딜레마를 포함한 다양한 가치 관련 시나리오에서 정렬을 종합적이고 자동으로 평가하는 방법은 무엇인가?
  • RQ5핵심 인간의 가치와의 LLM 정렬을 지원하기 위한 향후 연구를 위해 가용한 방법과 자원은 무엇인가?

주요 결과

  • 정렬 목표는 표면적 지시에서 더 넓은 인간의 선호로, 궁극적으로는 유용성, 정직성, 해로움이 없음과 같은 내재된 인간의 가치로 진화하였다.
  • 인간의 피드백이나 시범과 같은 프록시 신호에 의존하는 것보다, 내재된 가치와의 직접적 정렬이 더 견고하고 지속 가능하다.
  • 현재 평가 기준은 인간의 주석에 크게 의존하여 비용이 많이 들고 확장성이 떨어지므로, 자동화되고 신뢰할 수 있는 메트릭이 필요하다.
  • 인간 피드백를 통한 강화 학습(RLHF)과 지도 학습 미세조정(SFT)은 데이터 노이즈와 가치 차원의 완전성 부족으로 인해 안정적인 가치 정렬에 부적합하다.
  • 헌법 기반 AI는 명시적으로 정의된 가치 원칙을 사용해 훈련 데이터를 생성함으로써 유망한 성과를 보이고 있으나, 모델들은 여전히 원칙을 내재화하기보다는 시범에서 학습한다.
  • 향후 정렬 알고리즘은 가치 원칙 자체와 직접 정렬되어야 하며, 다양한 문화와 맥락에서 다원적이고 진화하는 가치 체계에 적응 가능해야 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.