← 返回 2026-09-27 简报

2026年最佳嵌入模型

Best Embedding Models in 2026

语音播报
摘要
事件:OpenRouter于2026年9月11日评估并发布了最佳嵌入模型指南,涵盖英文。 要点:推荐openai/text-embedding-3-small用于默认英文RAG;支持超长上下文的voyageai/voyage-4-large达32,000令牌; 影响:开发者可依据输入类型、预算及上下文需求快速选型,避免盲目构建索引。

嵌入模型决定了你的检索系统能够找到什么。它将每个输入转化为向量,并将相关的输入放置在彼此附近,从而使你的应用程序能够通过语义而非精确措辞进行检索。

最佳选择取决于你需要搜索的材料类型。英文知识库、多语言支持档案、源代码仓库以及图文集合各有不同的需求。向量维度、上下文长度、公开权重以及价格也会影响决策。

我们针对英文 RAG、多语言检索、代码搜索、图文检索以及低成本索引筛选出了候选模型,然后通过我们的嵌入端点向每个模型发送了实时请求。

最后验证日期:2026 年 9 月 11 日。我们的嵌入模型目录在该日期返回了 37 条记录,其中包括部分模型的批量版本和预览版本。

提供商可以添加或移除路由,且提示价格可能会发生变化。在启动大规模索引或重新索引任务之前,请查看当前的模型页面。如果模型页面与本指南不符,请以模型页面为准。

TL;DR(摘要)

对于英文 RAG,请从 openai/text-embedding-3-small 开始。

当你的输入超过 8,192 个 token,或者你希望在 Voyage 4 不同层级之间迁移而无需重建索引时,请测试 voyageai/voyage-4-large。如果你希望获得具有公开权重的替代方案,qwen/qwen3-embedding-8b 拥有更长的上下文窗口且提示价格更低。

对于具有公开权重的多语言检索,请使用 qwen/qwen3-embedding-8b;对于代码搜索,请使用 voyageai/voyage-code-4;对于图文检索,请使用 google/gemini-embedding-2 或 voyageai/voyage-multimodal-3.5。

在我们筛选的付费文本模型中,perplexity/pplx-embed-v1-0.6b 拥有最低的提示价格。nvidia/nemotron-3-embed-1b:free 是一个免费的文本嵌入路由,提供 32,768 个 token 的上下文窗口。

我们的 API 检查确认的是请求和响应行为,而非检索质量。在构建或重建完整索引之前,请使用来自你应用程序的标记查询和文档对至少两个候选者进行比较。

按用例分类的最佳嵌入模型

通过订阅,你同意接收 OpenRouter 通讯:包括模型使用数据、产品更新和研究报告,大约每周一封电子邮件。随时通过每封电子邮件中的链接退订。请参阅我们的隐私政策。

用例 推荐模型 入选理由
默认英文 RAG openai/text-embedding-3-small 低提示价格、8,192-token 上下文以及可调整的输出维度
超过 8,192 token 的输入 voyageai/voyage-4-large 32,000-token 上下文、四种可选维度以及与其它 Voyage 4 层级兼容的嵌入向量
具有公开权重的多语言检索 qwen/qwen3-embedding-8b 支持超过 100 种语言、32,768-token 上下文窗口以及公开权重
代码搜索 voyageai/voyage-code-4 专为检索代码及相关技术内容而构建
图文检索 google/gemini-embedding-2 将文本和图像置于同一嵌入空间。voyageai/voyage-multimodal-3.5 是我们验证的第二个选项
最低价格的付费文本选项 perplexity/pplx-embed-v1-0.6b 每百万输入 token 提示价格为 $0.004,拥有 32,000-token 上下文窗口
免费文本嵌入 nvidia/nemotron-3-embed-1b:free 一个免费路由,提供 32,768-token 上下文窗口和多语言模型卡片

按输入类型选择模型

从你需要搜索的材料开始。该图表首先按输入类型排序,其次按是否需要公开权重排序,最后按你的主要约束条件排序。

该图表为你提供了一个起点。在构建或重建大型索引之前,请使用来自你应用程序的查询和文档对至少两个候选者进行比较,并跟踪每个模型检索相关片段的情况。

我们如何选择这些模型

我们使用实时目录确认了可用性、上下文窗口、输入类型和提示价格。我们查阅了模型提供方的文档以获取能力说明和基准测试结果,随后通过我们的嵌入端点发送了实时请求,以确认请求和响应行为。

我们向 19 个模型发送了两字符串的批量请求,并总共运行了 28 项检查,涵盖批量输入、可配置维度、图像输入、图文输入以及错误处理。这 16 个付费模型为每个输入返回一个向量。这些响应证实了下表中列出的默认维度,并表明 dimensions 参数适用于 OpenAI Text Embedding 3 Small、Gemini Embedding 2 和 Voyage 4 Large。针对不存在的模型发出的请求返回了 400 错误,消息内容为“Model openai/does-not-exist does not exist”(模型 openai/does-not-exist 不存在)。

三个免费路由从我们的测试账户返回了 404 错误,因为其隐私设置不允许将流量路由至可能会在免费模型提示上进行训练的提供方。我们将在下文“免费选项”部分描述该设置。我们为这些模型列出的默认维度来自其模型卡片,而非我们的响应数据。

这些请求证实了 API 兼容性。它们并未衡量检索质量。我们排除了响应时间,因为每个模型在不同服务条件下仅接收了一个小型请求。我们将每个用例与文档化的能力相匹配,然后利用语言覆盖范围、上下文长度、输出维度、公开权重和提示价格来缩小候选范围。已发布的评估结果(包括 MTEB 和 CoIR)帮助我们确定了需要测试的模型。您标注的检索结果应决定最终部署哪一个模型。

比较入围的嵌入模型

以下价格是我们目录中于 2026 年 9 月 11 日列出的提示价格,Gemini Embedding 2 的图像价格则是其于 2026 年 9 月 18 日的目录价值。默认维度来自我们的实时响应数据,免费 NVIDIA 模型的默认维度除外,其数据来自其模型卡片。

模型 | 输入 | 上下文 | 默认维度 | 每百万 token 的提示价格 | 权重

openai/text-embedding-3-small | 文本 | 8,192 | 1,536 | $0.02 | 闭源

openai/text-embedding-3-large | 文本 | 8,192 | 3,072 | $0.13 | 闭源

voyageai/voyage-4-lite | 文本 | 32,000 | 1,024 | $0.02 | 闭源

voyageai/voyage-4 | 文本 | 32,000 | 1,024 | $0.06 | 闭源

voyageai/voyage-4-large | 文本 | 32,000 | 1,024 | $0.12 | 闭源

voyageai/voyage-code-4 | 文本,针对代码优化 | 32,000 | 1,024 | $0.12 | 闭源

voyageai/voyage-multimodal-3.5 | 文本和图像 | 32,000 | 1,024 | $0.12 | 闭源

qwen/qwen3-embedding-8b | 文本 | 32,768 | 4,096 | $0.01 | 开源

qwen/qwen3-embedding-4b | 文本 | 32,768 | 2,560 | $0.02 | 开源

perplexity/pplx-embed-v1-0.6b | 文本 | 32,000 | 1,024 | $0.004 | 开源

perplexity/pplx-embed-v1-4b | 文本 | 32,000 | 2,560 | $0.03 | 开源

google/gemini-embedding-2 | 文本和图像 | 8,192 | 3,072 | 文本 $0.20,图像 token $0.45 | 闭源

nvidia/nemotron-3-embed-1b:free | 文本 | 32,768 | 2,048 | 免费 | 开源

维度列影响原始索引大小。请参阅下方的“计算向量存储”以获取公式和示例。

我们的目录包含的模型多于表格中所示。baai/bge-m3 提供了另一种开源多语言选项,mistralai/mistral-embed-2312 提供了一般文本替代方案,而 mistralai/codestral-embed-2505 则针对代码检索。在我们的文本请求检查中,这三者均返回了向量。目录还列出了一组来自 BAAI、E5、GTE 和 Sentence Transformers 的 512-token 开源模型,价格为每百万 token $0.005 至 $0.01,我们未在本指南中对此进行测试。

英文 RAG 的最佳默认选择

当您需要用于英文知识库的管理型模型时,请从 openai/text-embedding-3-small 开始。其默认向量包含 1,536 个值,仅为 openai/text-embedding-3-large 默认值的一半。在相同的数值格式下,Small 版本所需的原始向量存储量也减半。建议在首次评估时保持 1,536 值的默认设置,仅当默认设置已满足检索目标但存储或搜索成本仍构成限制时,才考虑降低该维度。

你可以使用 dimensions 参数来缩短向量的维度。我们的请求中设置了 "dimensions": 256,返回了一个包含 256 个值的向量。较小的向量占用更少的数据库存储空间,并减少相似度搜索所需的工作量,但也可能降低检索质量。在更改现有索引之前,请先测试较小的尺寸。

OpenAI 将 text-embedding-3-large 描述为其用于英语和非英语任务的最强大的嵌入模型。当 Small 模型未能返回相关结果时,请对其进行测试,特别是在用户跨语言搜索时。切换到 Large 模型会改变向量大小和提示价格,因此在重新嵌入语料库之前,请在保留的问题集上比较这两个模型。

如果你的输入超过了 Small 模型的 8,192 个 token 限制,请测试 Voyage 4 Large。对于较短的输入,请使用相同的文本块、查询和相关性标签来比较这两个模型。

适用于更长输入的 Voyage 4 系列

当你需要一个可调节维度且兼容所有 Voyage 4 层级的托管 32,000-token 模型时,请测试 voyageai/voyage-4-large。它支持最多 32,000 个 token,并支持 256、512、1,024 和 2,048 种维度。在我们的 API 检查中,将 dimensions 设置为 512 返回了一个包含 512 个值的向量。

该系列还包括 voyageai/voyage-4 和 voyageai/voyage-4-lite,它们使用相同的上下文窗口。Voyage 表示,使用 4 系列创建的所有嵌入彼此兼容。这允许你将另一个 Voyage 4 层级与现有索引进行比较。在部署之前,请在具有代表性的样本上验证层级变更。兼容的向量空间消除了重建的需求,但并不保证检索结果完全相同。

将 Large 模型和至少一个较低层级的 Voyage 4 模型针对同一评估集运行。如果它们在相同的截止点检索到相同的相关段落,则较低层级的模型可能满足你的需求。

Voyage 模型是托管服务。如果你需要用于自托管或部署控制的公开权重,Qwen3 Embedding 8B 是这份短名单中的开源权重替代方案。

多语言检索的最佳开源权重模型

qwen/qwen3-embedding-8b 是我们选择的开源权重多语言模型。它支持超过 100 种语言,你可以从 Hugging Face 下载权重,或通过我们的 API 调用托管模型。我们默认的 API 请求返回了 4,096 个值。在相同的数值格式下,包含 4,096 个值的向量使用的原始存储空间是包含 1,024 个值的向量的四倍。在估算索引大小时请纳入这一差异。我们的 API 检查并未确定 Qwen3 Embedding 8B 的检索效果是否优于 nvidia/nemotron-3-embed-1b:free。当路由成本和向量大小影响决策时,请在做出承诺之前在同一组带标签的数据上测试这两个模型。

Qwen 模型卡报告称,截至 2025 年 6 月 5 日,该模型在大规模文本嵌入基准测试(MTEB)上的多语言得分为 70.58。这是供应商报告的公开基准测试结果。你可以用它来筛选 Qwen,然后测试你的应用程序支持的所有语言和领域,因为你的语料库可能会产生不同的排名。

模型页面列出了 32,768-token 的上下文窗口,但该限制是针对每个端点设置的。在 2026 年 9 月 11 日,Qwen3 Embedding 8B 的 DeepInfra 和 SiliconFlow 端点列出了 32,768 个 token,而 Nebius 端点列出了 32,000 个。如果你发送超过 32,000 个 token 的输入,请检查端点列表并锁定具有更大限制的提供商,或者将输入保持在 32,000 个 token 或以下。

4B 版本使用相同的模型级上下文窗口,在我们的检查中返回了 2,560 个值。它运行所需的资源更少。托管价格取决于可用的提供商,因此在做出选择之前,请比较 Qwen3 Embedding 8B 和 4B 的当前模型页面。

baai/bge-m3 为您提供第二个开源多语言模型,以便在您自己的数据集上与 Qwen3 进行比较。其模型说明涵盖了 100 多种语言,支持高达 8,192 个 token 的输入,而我们的请求返回了一个包含 1,024 个值的向量。上游模型可以返回多种表示类型,包括密集向量和稀疏向量。我们的标准嵌入响应返回的是密集向量。如果您的检索设计依赖于其其他表示类型,请使用上游实现。

代码搜索的最佳嵌入模型

当查询需要检索函数、文件或代码文档片段时,请使用 voyageai/voyage-code-4。Voyage 为该模型专为代码检索和编码代理工作负载而构建。其 32,000 token 的上下文窗口可以接受长文件或长查询,尽管索引块仍应代表在检索时有用的代码单元。

mistralai/codestral-embed-2505 是我们目录中的主要特定于代码的替代方案。在我们的文本请求检查中,它返回了 1,536 个值。其上下文窗口为 8,192 token,而 Voyage Code 4 为 32,000 token。建议先测试 Voyage Code 4,并将 Codestral Embed 用作对比模型。

公开评估可以帮助您比较候选模型。代码信息检索基准(CoIR)包含十个数据集,涵盖七个领域的八项代码检索任务。在使用自己仓库的工作对最强候选模型进行测试之前,请使用它来比较模型。一项有用的内部评估是将问题描述或开发者问题映射到解决它们所需的文件和块。

文本和图像检索的最佳模型

当同一索引需要同时搜索文本和图像时,请使用 google/gemini-embedding-2。它将两种输入类型置于同一个嵌入空间中,因此文本查询可以检索具有相关含义的图像,而图像查询可以检索相关的文本。

我们通过嵌入端点验证了文本、base64 编码的 PNG 图像以及组合的文本和图像请求。每个请求返回一个包含 3,072 个值的向量。我们还发送了一个带有 "dimensions": 768 的文本请求,并收到了一个包含 768 个值的向量。在我们的检查中,一个 64x64 像素的 PNG 计为 258 个提示 token,费用为 $0.000128。我们的目录对该模型的图像输入单独定价,截至 2026 年 9 月 18 日,模型页面上的价格为每百万图像 token $0.45,因此在索引大型图像集合之前请查看模型页面。本指南将推荐限制在文本和图像输入上,因为这是我们验证的请求类型。

voyageai/voyage-multimodal-3.5 是我们验证的第二个文本和图像模型。其图像请求和组合的文本与图像请求均返回一个包含 1,024 个值的向量,同样的 64x64 像素 PNG 计为 89 个提示 token,费用为 $0.00003。它具有 32,000 token 的上下文窗口和每百万 token $0.12 的提示价格。Gemini Embedding 2 和 Voyage Multimodal 3.5 使用不同的向量空间,因此在索引之前请选择其中一个。

google/gemini-embedding-001 是一个单独的仅文本模型,具有 20,000 token 的上下文窗口。这两个 Gemini 模型使用不同的向量空间,因此在这两者之间切换需要您重新嵌入索引。

nvidia/llama-nemotron-embed-vl-1b-v2:free 是我们目录中一个免费的文本和图像选项,具有 131,072 token 的上下文窗口。由于下文所述的隐私设置原因,我们的测试账户无法调用它,因此我们将其排除在推荐之外。

最佳低成本和免费选项

perplexity/pplx-embed-v1-0.6b 在我们的短名单中拥有最低的付费文本价格,为每百万输入 token $0.004。它接受高达 32,000 token 的输入,并返回一个包含 1,024 个值的向量。较大的 perplexity/pplx-embed-v1-4b 返回了 2,560 个值,提示价格为每百万输入 token $0.03。

Perplexity 将 0.6B 模型定位为轻量级、低延迟的检索方案,而将 4B 模型用于实现更高的检索质量。我们对 API 的检查确认了默认的向量维度,但并未验证哪个 Perplexity 模型的检索效果更佳。应将提供商的定位视为候选名单的信号,并在标注查询集上对这两个模型进行比较。

在评估阶段可使用免费通道,但不建议将其作为大型生产环境索引任务的唯一路径。当需要一个免费的候选模型进行测试时,可从 nvidia/nemotron-3-embed-1b:free 开始。该模型拥有 32,768 token 的上下文窗口,NVIDIA 的模型说明卡报告其输出向量为 2,048 维,支持在 34 种语言上进行评估,并允许通过 L2 重新归一化将向量切片为更小的维度。NVIDIA 以 OpenMDW-1.1 许可证发布该模型的权重。在使用免费通道进行生产环境索引任务前,请查看当前模型页面以确认可用性及速率限制。可用性和速率限制可能在批量处理期间发生变化。

本条评分 8.5 score-v1
  • 来源权威 8
    注册表 priority=8(OpenRouter)
  • 时效 0.486
    发布 94.5 小时前,衰减到 0.49/3.0
  • 多源印证 0
    只有 1 家在报(无旁证)
  • 社区信号 0
    无社区数据(本管线走 RSS,HN 的 hn_fetcher 未接入)
历史
刊期得分排名结果
2026-09-27 8.49 23 入选
2026-09-26 8.77 36 未入选
2026-09-25 9.22 37 未入选
2026-09-24 9.95 34 未入选
原文链接:https://openrouter.ai/blog/insights/best-embedding-models-2026/
来源:OpenRouter
以上内容由 AI 自动翻译,仅供参考。
← 返回简报