[论文解读] ChordMixer: A Scalable Neural Attention Model for Sequences with Different Lengths
ChordMixer 是一种可扩展的神经注意力模型,通过使用无参数的多尺度旋转和通道独立的 MLP,无需填充或分块即可处理可变长度序列。它在长序列任务中达到最先进性能,在合成任务、文档分类和 DNA 序列分类中优于 Transformer 及其变体,尤其在极端长度下表现优异(最长达 150 万 token)。
Sequential data naturally have different lengths in many domains, with some very long sequences. As an important modeling tool, neural attention should capture long-range interaction in such sequences. However, most existing neural attention models admit only short sequences, or they have to employ chunking or padding to enforce a constant input length. Here we propose a simple neural network building block called ChordMixer which can model the attention for long sequences with variable lengths. Each ChordMixer block consists of a position-wise rotation layer without learnable parameters and an element-wise MLP layer. Repeatedly applying such blocks forms an effective network backbone that mixes the input signals towards the learning targets. We have tested ChordMixer on the synthetic adding problem, long document classification, and DNA sequence-based taxonomy classification. The experiment results show that our method substantially outperforms other neural attention models.
研究动机与目标
- 解决在神经注意力机制中对可变长度序列进行建模,而无需填充或分块的挑战。
- 克服标准 Transformer 及其变体在计算复杂度和可扩展性方面的二次方时间开销与局限性。
- 设计一种神经网络主干网络,确保在所有序列长度下均保持完整的感受野,且参数量极少。
- 在自然语言和基因组学等不同领域中实现序列的高效长程交互。
- 在现有方法因长度限制而性能下降的长序列任务中,展示卓越性能。
提出的方法
- 提出 ChordMixer 作为神经网络构建模块,包含两个组件:无参数的多尺度旋转层和可学习的通道独立 MLP。
- 通过重复应用 ChordMixer 模块,逐步混合序列位置之间的信息,经过 log₂N 个模块后实现完整的感受野。
- 采用无学习参数的位置旋转机制,使模型大小与序列长度无关。
- 可处理任意长度的序列,无需填充或截断,支持可变长度输入的端到端训练。
- 在所有序列长度上采用统一架构,避免与长度相关的结构设计选择。
- 可与标准预测器(如分类器或回归器)集成,支持分类与回归任务。
实验结果
研究问题
- RQ1无填充或分块的情况下,神经注意力机制能否有效建模可变长度序列中的长程依赖?
- RQ2在长度多样的长序列上,ChordMixer 与 Transformer 及其高效变体相比表现如何?
- RQ3缺乏可学习的位置编码或局部归纳偏置是否会影响其在长序列上的性能?
- RQ4ChordMixer 在极端序列长度百分位数(如 99%–99.5%)下,性能稳定性如何?
- RQ5ChordMixer 是否能在合成任务、长文档分类和 DNA 序列分类等多领域任务中实现良好泛化?
主要发现
- 在最长 DNA 序列任务(Sus 与 Bos 在 99.5% 百分位数)中,ChordMixer 达到 89% 的 ROC-AUC,显著优于所有基线模型,后者均低于 70%。
- 在合成加法问题中,ChordMixer 在所有序列长度下均保持高准确率,包括长达 150 万 token 的序列。
- 在长文档分类任务中,ChordMixer 超越所有基于 Transformer 的模型,尤其在长序列长度下优势明显。
- 在 Carassius 与 Labeo 分类任务中,ChordMixer 在所有长度百分位数下保持稳定的 ROC-AUC(约 84%–89%),而其他模型在超过 5,630 个 token 后性能开始下降。
- 消融实验证实,ChordMixer 的优越性能源于其注意力机制本身,而非分类器;其在相同预测器下优于所有其他注意力模型的组合。
- 在 Sus 与 Bos 数据集中,ChordMixer 是唯一在所有长度百分位数上均保持一致性能的方法,表明其对序列长度变化具有强鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。