Skip to main content
QUICK REVIEW

[논문 리뷰] Align on the Fly: Adapting Chatbot Behavior to Established Norms

Chunpu Xu, Steffi Chern|arXiv (Cornell University)|2023. 12. 26.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Model, LLM)의 행동을 추가 학습 없이도 법적 및 윤리적 규칙의 외부 메모리로 제약하는 실시간 정렬 방법인 On-the-fly Preference Optimization (OPO)를 제안한다. 정제된 문헌에서 관련 규칙을 검색하고 프롬프트 엔지니어링을 통해 적용함으로써, OPO는 법률 및 윤리 기준 테스트에서 LLM 성능을 크게 향상시키며, A-Professional-Morality에서 최대 11.2%의 향상률을 기록했다.

ABSTRACT

In this paper, we aim to align large language models with the ever-changing, complex, and diverse human values (e.g., social norms) across time and locations. This presents a challenge to existing alignment techniques, such as supervised fine-tuning, which internalize values within model parameters. To overcome this, we propose an On-the-fly Preference Optimization (OPO) method, which is a real-time alignment that works in a streaming way. It employs an external memory to store established rules for alignment, which can constrain LLMs' behaviors without further training, allowing for convenient updates and customization of human values. We also introduce a scalable evaluation to assess the proposed method more effectively. Experimental results on both human-annotated and auto-generated questions from legal and moral domains indicate the effectiveness of the proposed OPO method. Our code and data are released at https://github.com/GAIR-NLP/OPO.

연구 동기 및 목표

  • 사회적 규범과 법적 규정과 같은 동적인, 다양한, 맥락 기반의 인간 가치에 LLM을 정렬하는 데 도전하는 것.
  • SFT와 RLHF와 같은 파rameter 기반 정렬 방법의 한계를 극복하는 것 — 이러한 방법들은 계산 비용이 높고 변화하는 가치에 유연하지 않다.
  • 재학습 없이도 쉽게 업데이트하고 맞춤화할 수 있는 확장 가능한 실시간 정렬 프레임워크를 개발하는 것.
  • 벤치마크 유출을 방지하고 자동 테스트 생성을 통해 정렬 규칙의 커버리지 확대를 위한 평가 프로토콜을 설계하는 것.
  • 외부화된 규칙 검색이 복잡한 실제 세계의 윤리적 및 법적 추론 상황에서 LLM 행동을 효과적으로 이끌 수 있음을 입증하는 것.

제안 방법

  • OPO 프레임워크는 공식 출처에서 수집한 구조화된 법적 및 윤리적 규칙을 저장하는 외부 메모리를 사용하며, 이는 LLM 출력에 대한 동적 제약 조건으로 작용한다.
  • 각 입력 쿼리에 대해, 밀도 벡터 임베딩과 코사인 유사도 기반의 FAISS 기반 검색을 통해 의미적으로 유사한 규칙을 검색한다.
  • 검색된 규칙는 LLM의 프롬프트에 맥락으로 삽입되어 모델 재학습 없이도 기존 규범에 부합하는 응답 생성을 유도한다.
  • 강력한 LLM과 프롬프트를 사용해 규칙에서 자동으로 다중 선택 질문을 생성하는 확장 가능한 평가 모듈이 존재하며, 이는 테스트 커버리지 증가와 유출 위험 감소에 기여한다.
  • 이 방법은 스트리밍 방식의 실시간 동작을 하며, 새로운 또는 변화하는 규칙에 대한 즉각적인 적응을 가능하게 한다.
  • 규칙 저장, 검색, 추론을 분리함으로써 재학습 없이도 모듈식으로 값과 규칙를 업데이트하고 맞춤화할 수 있다.
Figure 1: Comparisons between internalized alignment and externalized alignment. The internalized alignment requires annotated data to align LLMs with human values by training LLMs with SFT or RLHF methods. Our proposed externalized alignment retrieves certain values from an external text corpus to
Figure 1: Comparisons between internalized alignment and externalized alignment. The internalized alignment requires annotated data to align LLMs with human values by training LLMs with SFT or RLHF methods. Our proposed externalized alignment retrieves certain values from an external text corpus to

실험 결과

연구 질문

  • RQ1외부 규칙 메모리는 재학습 없이도 실시간으로 변화하는 인간 가치에 LLM을 정렬하는 데 효과적인가?
  • RQ2SFT와 RLHF와 같은 내재화된 정렬 방법과 비교해, 검색 기반 규칙 적용은 성능과 적응 가능성 측면에서 어떻게 다른가?
  • RQ3자동 테스트 생성은 정렬 평가의 커버리지와 강건성에 얼마나 기여하는가?
  • RQ4검색 길이가 복잡한 추론 작업에서 OPO의 성능에 어떤 영향을 미치는가?
  • RQ5OPO는 법, 기본 윤리, 전문 윤리와 같은 다양한 도메인으로 일반화될 수 있는가?

주요 결과

  • OPO는 A-Professional-Morality에서 LLM 성능을 크게 향상시키며, XuanYuan-70B는 1500개의 컨텍스트 토큰에서 94.16%의 정확도를 기록했고, 기본 모델 대비 10.7% 향상되었다.
  • H-Social-Morality에서 모든 LLM이 OPO를 통해 뚜렷한 성능 향상을 보였으며, 이는 복잡하고 맥락 민감한 사회적 규범 처리에 효과적임을 시사한다.
  • 성능은 중간 수준의 검색 길이(예: 1000–1500 토큰)에서 최고로 나타나, 더 긴 컨텍스트가 추론에 노이즈를 유발해 성능 저하를 초래할 수 있음을 시사한다.
  • 규칙에서 자동 생성된 질문은 A-Law에서 인간이 애너테이션한 질문보다 LLM 성능을 더 잘 향상시키며, 이는 GPT-4가 덜 복잡한 도메인에서는 벤치마크 수준의 질문을 효과적으로 시뮬레이션할 수 있음을 의미한다.
  • OPO는 모든 데이터셋에서 기본 모델을 일관되게 능가하며, 작업과 모델에 따라 3.4%에서 11.2%의 성능 향상이 이루어졌다.
  • OPO와 오라클 규칙 성능 간 격차는 검색 모델의 향상 여지가 있음을 시사하며, 현재 파이프라인의 핵심 병목 요소임을 드러낸다.
Figure 2: The proposed On-the-fly Preference Optimization (OPO) framework.
Figure 2: The proposed On-the-fly Preference Optimization (OPO) framework.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.