本研究通过大规模实验发现,文本嵌入的度量选择取决于嵌入空间的几何结构(各向异性)。当方差均匀分布时,余弦相似度最优;当方差集中在少数方向时,基于排序和L1的度量明显优于余弦。单个维度方差占比可预测替代度量的提升效果。通过投影消除主导方向后,余弦性能恢复,证明了各向异性的决定性作用。
核心观点
- 余弦相似度是文本嵌入的标准度量,但并非总是最优。
- 各向异性(方差集中在少数方向)是决定度量优劣的关键几何因素。
- 最主导维度的方差占比可高精度预测替代度量的相对提升。
- 通过投影消除主导方向,余弦相似度性能恢复,证明各向异性是原因而非相关因素。
- 该效应是方向性的,而非基于向量长度(归一化后仍存在)。
技术要点
在19种无参数相似度度量、19种编码器(从紧凑句子变换器到70亿参数大语言模型)、7个数据集上全面评估。当编码器方差均匀分布(各向同性)时,余弦最优,其他度量无明显优势。当编码器方差集中在少数方向(各向异性)时,基于排序(如Spearman秩相关)和L1型度量(如曼哈顿距离)显著优于余弦,相对提升约20%,在余弦最弱处提升最大。最主导维度的方差占比与替代度量提升的秩相关系数为0.86,线性相关系数为0.95。通过PCA等投影去除主导方向后,余弦性能回升,其他度量优势消失,但仅针对原本各向异性的编码器。该效应在向量归一化(单位长度)后依然存在,表明是方向分布差异而非长度差异。
应用场景
指导选择文本嵌入的相似度度量:对于微调后的检索型嵌入模型(通常各向同性),余弦即可;对于各向异性较强的模型(如某些通用LLM嵌入),可考虑使用排序或L1度量。提供一个简单诊断指标(最主导维度方差占比)来判断是否需要更换度量。有助于理解嵌入空间的几何性质,指导模型训练或后处理(如各向同性正则化)。