本研究通过大规模实验发现,文本嵌入的度量选择取决于嵌入空间的几何结构(各向异性)。当方差均匀分布时,余弦相似度最优;当方差集中在少数方向时,基于排序和L1的度量明显优于余弦。单个维度方差占比可预测替代度量的提升效果。通过投影消除主导方向后,余弦性能恢复,证明了各向异性的决定性作用。

核心观点

技术要点

在19种无参数相似度度量、19种编码器(从紧凑句子变换器到70亿参数大语言模型)、7个数据集上全面评估。当编码器方差均匀分布(各向同性)时,余弦最优,其他度量无明显优势。当编码器方差集中在少数方向(各向异性)时,基于排序(如Spearman秩相关)和L1型度量(如曼哈顿距离)显著优于余弦,相对提升约20%,在余弦最弱处提升最大。最主导维度的方差占比与替代度量提升的秩相关系数为0.86,线性相关系数为0.95。通过PCA等投影去除主导方向后,余弦性能回升,其他度量优势消失,但仅针对原本各向异性的编码器。该效应在向量归一化(单位长度)后依然存在,表明是方向分布差异而非长度差异。

应用场景

指导选择文本嵌入的相似度度量:对于微调后的检索型嵌入模型(通常各向同性),余弦即可;对于各向异性较强的模型(如某些通用LLM嵌入),可考虑使用排序或L1度量。提供一个简单诊断指标(最主导维度方差占比)来判断是否需要更换度量。有助于理解嵌入空间的几何性质,指导模型训练或后处理(如各向同性正则化)。