[论文解读] Align on the Fly: Adapting Chatbot Behavior to Established Norms
本文提出了一种实时对齐方法——运行时偏好优化(OPO),通过使用外部记忆存储合法与道德规范,以约束大语言模型(LLM)的行为,而无需进一步微调。通过从精心整理的语料库中检索相关规范,并利用提示工程应用这些规范,OPO在法律与道德基准测试中显著提升了LLM性能,A-Professional-Morality基准上提升最高达11.2%。
In this paper, we aim to align large language models with the ever-changing, complex, and diverse human values (e.g., social norms) across time and locations. This presents a challenge to existing alignment techniques, such as supervised fine-tuning, which internalize values within model parameters. To overcome this, we propose an On-the-fly Preference Optimization (OPO) method, which is a real-time alignment that works in a streaming way. It employs an external memory to store established rules for alignment, which can constrain LLMs' behaviors without further training, allowing for convenient updates and customization of human values. We also introduce a scalable evaluation to assess the proposed method more effectively. Experimental results on both human-annotated and auto-generated questions from legal and moral domains indicate the effectiveness of the proposed OPO method. Our code and data are released at https://github.com/GAIR-NLP/OPO.
研究动机与目标
- 解决大语言模型与动态、多样且上下文相关的价值观(如社会规范与法律法规)对齐的挑战。
- 克服SFT与RLHF等基于参数的对齐方法的局限性,后者计算成本高且难以适应价值观变化。
- 开发一种可扩展的实时对齐框架,实现无需微调即可轻松更新与定制人类价值观。
- 设计一种评估协议,避免基准泄露,并通过自动化测试生成提升对齐规则的覆盖范围。
- 证明外部规则检索可有效引导LLM在复杂现实世界道德与法律推理场景中的行为。
提出的方法
- OPO框架使用外部记忆存储从权威来源收集的结构化法律与道德规则,作为LLM输出的动态约束。
- 对于每个输入查询,系统使用密集向量嵌入与基于FAISS的检索方法,基于余弦相似度检索语义上相近的规则。
- 将检索到的规则作为上下文注入LLM提示中,以引导响应生成,确保与既定规范对齐,而无需模型微调。
- 一个可扩展的评估模块使用强大的LLM与提示自动生成多选题,提升测试覆盖范围并降低泄露风险。
- 该方法以流式、实时方式运行,支持对新规则或变化规则的即时适应。
- 框架将规则存储、检索与推理分离,支持模块化更新与价值观定制,无需重新训练。

实验结果
研究问题
- RQ1外部规则记忆是否能在无需微调的情况下,实时有效对齐LLM与不断演化的价值观?
- RQ2与SFT和RLHF等内化对齐方法相比,基于检索的规则应用在性能与适应性方面表现如何?
- RQ3自动化测试生成在多大程度上能提升对齐评估的覆盖范围与鲁棒性?
- RQ4检索长度如何影响OPO在复杂推理任务中的性能表现?
- RQ5OPO能否在法律、基础道德与专业伦理等多样化领域中实现泛化?
主要发现
- OPO显著提升了LLM在A-Professional-Morality上的表现,XuanYuan-70B在1500上下文token下达到94.16%的准确率,较基线模型提升10.7%。
- 在H-Social-Morality上,所有LLM均表现出显著性能提升,表明OPO在处理复杂、上下文敏感的社会规范方面具有有效性。
- 性能在中等检索长度(如1000–1500 token)时达到峰值,表明过长的上下文可能引入噪声,降低推理质量。
- 由规则自动生成的问题在A-Law上使LLM表现优于人工标注的问题,表明GPT-4可在较简单领域有效模拟高质量基准问题。
- OPO在所有数据集上均持续优于基线模型,性能提升在3.4%至11.2%之间,具体取决于任务与模型。
- OPO与理想规则性能之间的差距表明,检索模型仍有改进空间,凸显当前流程中的关键瓶颈。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。