[论文解读] Attention Sorting Combats Recency Bias In Long Context Language Models
本文提出注意力排序(attention sorting),一种轻量级的推理时技术,通过基于注意力权重重新排序上下文文档,减轻长上下文语言模型中的近期性偏差。通过迭代排序使相关文档逐步移至上下文末尾,该方法显著提升了抽取式问答(QA)性能,尤其在开源模型上表现突出——在30k上下文长度下准确率翻倍,并使这些模型达到类似Claude-2等专有模型的水平。
Current language models often fail to incorporate long contexts efficiently during generation. We show that a major contributor to this issue are attention priors that are likely learned during pre-training: relevant information located earlier in context is attended to less on average. Yet even when models fail to use the information from a relevant document in their response, they still pay preferential attention to that document compared to an irrelevant document at the same position. We leverage this fact to introduce ``attention sorting'': perform one step of decoding, sort documents by the attention they receive (highest attention going last), repeat the process, generate the answer with the newly sorted context. We find that attention sorting improves performance of long context models. Our findings highlight some challenges in using off-the-shelf language models for retrieval augmented generation.
研究动机与目标
- 探究为何长上下文语言模型即使更关注早期相关信息,仍会低估其价值。
- 解决当相关文档远离生成结果时,检索增强生成(RAG)性能下降的问题。
- 开发一种实用的推理时方法,在不进行微调或架构修改的前提下提升模型性能。
- 评估注意力权重是否可作为长上下文任务中重新排序上下文的可靠信号。
提出的方法
- 该方法执行一次解码步骤,并计算所有层和头的平均注意力权重,以衡量上下文每个文档的注意力得分。
- 按注意力得分从高到低对文档进行排序,将注意力最高的文档移至上下文末尾。
- 该过程迭代执行——通常为两轮——之后使用重新排序后的上下文进行最终生成。
- 该方法在合成的、受控的问答基准(SynthWiki)上进行评估,其中包含一个相关文档和多个干扰项。
- 利用模型即使未有效使用早期信息,仍会比相同位置的干扰项更关注相关文档的事实。
- 该技术在开源与专有长上下文模型上均进行了评估,并对迭代次数和模型变体进行了消融实验。

实验结果
研究问题
- RQ1当模型未能有效利用早期信息时,注意力权重分布是否仍能反映文档的相关性?
- RQ2基于注意力得分对上下文进行迭代重排,能否提升长上下文问答性能?
- RQ3为何在RAG任务中,随着干扰项数量增加,开源模型的性能下降幅度大于专有模型?
- RQ4注意力排序在缓解具有近期性归纳偏置的模型中的近期性偏差方面有多有效?
- RQ5注意力重排能否在不进行微调或架构修改的情况下超越基线模型?
主要发现
- 注意力排序显著提升了长上下文模型的问答准确率,开源模型在30k上下文长度下性能提升超过100%。
- 经过两轮迭代后,注意力排序将相关文档移至上下文窗口中‘可利用’的区域,即注意力最有效的区域。
- TogetherLlama-7B-32k(在长上下文问答上微调)表现最佳,性能达到或超过Claude-2和GPT-3.5等专有模型。
- 该方法在所有测试的开源模型上均提升了性能,包括WizardCoder和YaRN,且在多次迭代后效果更显著。
- 具有更强近期性偏差的模型(如Llama-2 base)在干扰项增多时性能下降更严重,但注意力排序能有效缓解这一问题。
- 该方法在模型已针对长上下文问答进行微调时效果最佳,表明模型的归纳偏置与该方法存在协同效应。
![Figure 2: QA accuracy on SynthWiki as a function of the position of the relevant document in the context. We see a replication of the ‘lost in the middle’ [ 15 ] effect on this dataset in which accuracy is lower when the relevant information is in the middle of a long context. The recency (informati](https://ar5iv.labs.arxiv.org/html/2310.01427/assets/x2.png)
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。