[论文解读] On the Dimensionality of Embeddings for Sparse Features and Data
本文挑战了嵌入表示始终降低维度的普遍假设,表明嵌入维度应基于信息熵而非启发式规则来确定。论文提出了基于信息熵的上界估计,并给出了精确的嵌入维度选择准则,表明稀疏特征可能无法从维度压缩中获益,且最优维度取决于输入数据的稀疏性和分布。
In this note we discuss a common misconception, namely that embeddings are always used to reduce the dimensionality of the item space. We show that when we measure dimensionality in terms of information entropy then the embedding of sparse probability distributions, that can be used to represent sparse features or data, may or not reduce the dimensionality of the item space. However, the embeddings do provide a different and often more meaningful representation of the items for a particular task at hand. Also, we give upper bounds and more precise guidelines for choosing the embedding dimension.
研究动机与目标
- 挑战广泛存在的信念,即嵌入表示天然地降低稀疏特征的维度。
- 基于信息熵,提出一种基于信息论的、有原则的嵌入维度选择方法。
- 推导嵌入尺寸选择的上界与实用准则,适用于真实世界模型。
- 证明即使在维度未降低的情况下,嵌入表示也比原始索引提供更具意义的表征。
提出的方法
- 使用信息熵作为维度的度量,评估稀疏特征向量的信息承载能力。
- 利用组合近似方法,推导不同查找签名(例如,n维向量中k个非零条目)的熵公式。
- 应用渐近近似(如斯特林公式)估算稀疏分布的熵并推导边界。
- 将输入查找的熵(H)与嵌入的信息容量(d × s,其中s为每个元素的比特数)进行比较,以确定所需的嵌入尺寸。
- 提出一种基于熵的屋顶模型,为给定输入稀疏性设定嵌入维度的上界。
- 通过在不同n(词汇表大小)、k(非零条目数)和s(位精度)下的表格示例验证模型,展示实现信息等价所需的d值。
实验结果
研究问题
- RQ1嵌入是否总是降低稀疏特征表示的维度?
- RQ2什么决定了保留稀疏输入向量信息所需的最小嵌入维度?
- RQ3在实践中,如何利用信息熵指导嵌入尺寸的选择?
- RQ4稀疏性模式(k)和词汇表大小(n)在多大程度上影响所需的嵌入维度?
主要发现
- 当以信息熵衡量时,嵌入并不一定降低维度;若输入高度结构化或稀疏,嵌入空间的维度可能超过输入维度。
- 对于100万词汇表的查找,k=100个非零条目时,熵约为1324.1比特,需至少168维的嵌入(8位精度)。
- 当k=1000且n=1亿时,熵达到约16,603.3比特,需至少2076维的嵌入(8位精度)。
- k(非零条目数)对熵的影响远大于n(词汇表大小),如熵与k的对数图所示。
- 对于32位嵌入,每个元素8位精度时,k=1且n=100万时,所需嵌入维度d可低至1;但当k=1000且n=100万时,d增至1248。
- 小批量训练不影响熵或维度计算,因为每个嵌入查找均独立处理。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。