[论文解读] Superbloom: Bloom filter meets Transformer
Superbloom 提出了一种新颖的方法,将布隆过滤器与多层 Transformer 结合,将大规模词汇表的类别特征(例如产品或实体 ID)表示为哈希令牌。通过在这些布隆过滤器生成的摘要上应用深度 Transformer,模型利用上下文理解有效缓解了哈希冲突,其准确率高于同等参数量的非哈希模型以及在相同计算预算下使用采样 Softmax 训练的更大模型。
We extend the idea of word pieces in natural language models to machine learning tasks on opaque ids. This is achieved by applying hash functions to map each id to multiple hash tokens in a much smaller space, similarly to a Bloom filter. We show that by applying a multi-layer Transformer to these Bloom filter digests, we are able to obtain models with high accuracy. They outperform models of a similar size without hashing and, to a large degree, models of a much larger size trained using sampled softmax with the same computational budget. Our key observation is that it is important to use a multi-layer Transformer for Bloom filter digests to remove ambiguity in the hashed input. We believe this provides an alternative method to solving problems with large vocabulary size.
研究动机与目标
- 解决机器学习中以不透明 ID 表示的大规模词汇表类别特征建模挑战。
- 将子词分词(如 BERT 中的词片)的成功经验扩展到任意类别 ID,通过哈希实现。
- 通过深度 Transformer 的上下文建模,克服特征哈希带来的歧义性。
- 通过在较小的哈希令牌空间上训练完整 Softmax,实现在大规模输出词汇表上的高效高精度预测。
- 证明多层 Transformer 能够有效消除哈希输入的歧义,优于以往基于哈希的方法。
提出的方法
- 应用多个随机哈希函数,将每个不透明 ID 映射到较小空间中的一组哈希令牌,模拟布隆过滤器结构。
- 为每个哈希令牌学习可学习的嵌入表示,形成输入 Transformer 的嵌入序列。
- 使用多层 Transformer 编码器,利用上下文建模哈希令牌表示之间的依赖关系并解决歧义。
- 采用掩码语言建模范式进行模型训练,从上下文预测被掩码的哈希令牌。
- 提出一种基于束搜索的高效推理算法,加速在较小令牌空间中的预测。
- 构建一个包含 BERT 词片与频繁单字和双字词的混合词汇表,形成 100 万规模的基础词汇表。
实验结果
研究问题
- RQ1多层 Transformer 是否能有效消除基于类似布隆过滤器结构生成的哈希表示的歧义?
- RQ2在相同计算预算下,在较小的哈希令牌空间上训练完整 Softmax 是否优于在原始大规模词汇表上使用采样 Softmax?
- RQ3当处理高冲突率的哈希输入时,Transformer 架构的深度如何影响模型性能?
- RQ4模型能否通过哈希与上下文建模学习到罕见或未见实体的有意义表示?
- RQ5对于实体表示,高冲突率(例如 α=40)的随机哈希是否比一致的哈希方案更有效?
主要发现
- Superbloom 在召回率指标上优于一个参数量更小的基线 BERT 模型(6260 万参数):召回率@1 为 31.7%,召回率@10 为 48.3%,召回率@20 为 52.9%。
- 即使在 α=40 的高冲突率下,模型仍达到 39.2% 召回率@1、58.5% 召回率@10 和 64.5% 召回率@20,超越了一个参数量大得多的 BERT 模型(2.544 亿参数)的 37.2% 召回率@1。
- 在哈希输入上,单层与十二层 Transformer 的性能差距显著大于在非哈希输入上的差距,表明深度对歧义消除至关重要。
- 模型在命名实体上表现出更强的泛化能力,常能正确预测填空任务中的特定实体,而 BERT 则失败。
- 所提出的束搜索推理算法实现了在较小令牌空间中的快速近似推理,显著提升了部署效率。
- 结果表明,哈希可通过模型注意力机制实现对每个实体的有效动态容量分配,从而提升表示灵活性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。