[论文解读] Byte Latent Transformer: Patches Scale Better Than Tokens
字节潜在变换器(BLT)提出了一种无需分词器、基于字节的大型语言模型架构,该架构根据下一个字节预测的熵动态地将字节分组为可变大小的补丁,从而实现自适应计算分配。在规模上,其性能可与 Llama 3 相当,同时推理 FLOPs 最多减少 50%,并展现出更优的鲁棒性与长尾泛化能力,同时在固定推理预算下实现了模型与补丁大小的同步扩展。
We introduce the Byte Latent Transformer (BLT), a new byte-level LLM architecture that, for the first time, matches tokenization-based LLM performance at scale with significant improvements in inference efficiency and robustness. BLT encodes bytes into dynamically sized patches, which serve as the primary units of computation. Patches are segmented based on the entropy of the next byte, allocating more compute and model capacity where increased data complexity demands it. We present the first FLOP controlled scaling study of byte-level models up to 8B parameters and 4T training bytes. Our results demonstrate the feasibility of scaling models trained on raw bytes without a fixed vocabulary. Both training and inference efficiency improve due to dynamically selecting long patches when data is predictable, along with qualitative improvements on reasoning and long tail generalization. Overall, for fixed inference costs, BLT shows significantly better scaling than tokenization-based models, by simultaneously growing both patch and model size.
研究动机与目标
- 通过在原始字节上端到端训练,消除大型语言模型对固定词汇表分词的依赖。
- 通过基于数据复杂度动态分配计算,提升推理效率与鲁棒性。
- 在固定推理 FLOP 预算下,实现模型规模与补丁大小的同步扩展。
- 证明无需固定词汇表的字节级模型可在大规模下达到与基于标记的模型相当的性能。
- 通过直接访问字节级信息,提升长尾泛化能力与子词级别理解能力。
提出的方法
- 模型使用轻量级局部编码器,基于下一个字节预测的熵驱动分割,将输入字节映射为补丁表征。
- 大型全局潜在变换器处理补丁表征,其交叉注意力机制整合了字节级与补丁级信息。
- 轻量级局部解码器重建下一个字节补丁,支持自回归生成。
- 补丁大小由下一个字节的熵动态决定,高复杂度区域分配更多计算。
- 该架构通过端到端学习补丁表征,避免使用固定词汇表,无需预定义标记。
- 该方法支持高达 8B 参数与 4T 训练字节的 FLOP 控制扩展研究,同时保持推理预算恒定。

实验结果
研究问题
- RQ1在大规模下,仅在原始字节上端到端训练的大型语言模型能否达到基于分词的模型(如 Llama 3)的性能?
- RQ2基于下一个字节熵的动态补丁划分是否能提升推理效率与计算分配?
- RQ3在固定推理 FLOP 预算下,无分词器架构能否同时扩展模型规模与补丁大小?
- RQ4直接的字节级建模是否能提升对输入噪声的鲁棒性以及对长尾数据的泛化能力?
- RQ5字节级模型是否能在字符级别理解与拼写知识方面优于分词模型?
主要发现
- 在 FLOP 控制的实验中,BLT 在大规模下性能与 Llama 3 相当,同时推理 FLOPs 最多减少 50%。
- 该模型在输入噪声鲁棒性方面表现更优,并在低资源机器翻译与拼写知识任务中性能更优。
- 基于熵的动态补丁划分实现了更高效的计算分配:在可预测区域使用更长的补丁,在复杂区域使用更短的补丁。
- BLT 实现了一条新的扩展轨迹,使得在固定推理预算下,模型规模与补丁大小可同步增长,其扩展趋势优于基于标记的模型。
- 由于直接访问字节级信息,该架构在推理与长尾泛化方面表现出定性改进。
- 初步实验表明,通过在预训练的 Llama 3 上添加一个字节化头进行微调,可在保持性能的同时受益于字节级归纳偏置。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。