← 返回 2026-09-23 简报

批量API:通过请求打包实现推理成本减半

Batch API: half-price inference by bundling requests

语音播报
摘要
事件:OpenRouter推出批量API,允许开发者将非紧急请求打包提交,提供商在24小时内完成并收取半价费用。 要点:支持超70种模型,Beta期中位数耗时7分钟,90%在一小时内完成。按token计费享折扣,结果独立返回。 影响:大幅降低大规模数据处理成本,适合标注、嵌入生成等异步任务,开发者需避开美西上午高峰以优化速度。

对于大规模的工作负载或无需立即完成的请求,您现在可以使用新的批量 API(Batch API)。在提交批量任务时,提供商可以选择在 24 小时窗口内的任何时间完成请求,作为交换,他们通常收取正常按 token 定价的 50%(有时甚至更低)。

目前该功能支持超过 70 种模型。请参阅 Batch API 文档了解如何使用它。

在实际操作中,我们观察到您很少需要等待接近 24 小时的时间。在我们为期两周的测试期间完成的 23 万多个批量任务中,中位完成时间为 7 分钟,90% 的任务在一小时内完成。

Batch 是一种用于工作负载的异步 API,适用于您可以接受高度可变响应时间的场景,例如标注语料库、回填嵌入向量、评分评估集、总结积压工单,或在夜间对几千行数据运行相同的提示词。

批量 API 的工作原理

调用 api/v1/batches 并传入您的请求列表,同时指定要使用的端点格式。Chat completions、responses、messages 和 embeddings 均受支持。例如:

curl https://openrouter.ai/api/v1/batches \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $OPENROUTER_API_KEY " \
-d '{
"endpoint": "/v1/chat/completions",
"model": "google/gemini-3.8-flash",
"requests": [
{ "custom_id": "ticket-0001", "body": { "messages": [{ "role": "user", "content": "Summarize this ticket in one sentence." }] } },
{ "custom_id": "ticket-0002", "body": { "messages": [{ "role": "user", "content": "Summarize this ticket in one sentence." }] } }
]
}'

提交请求后,开始轮询 GET /api/v1/batches/:id,直到状态变为 completed(已完成)、failed(失败)、expired(过期)或 cancelled(已取消)。已完成的批量任务会在同一响应中内联返回其结果。

大多数批量任务在几分钟内完成

我们分析了在为期两周的测试期间完成的批量任务,并测量了从接受到结果完成的时间。中位数为 7 分钟,第 90 百分位数为 1.0 小时,第 99 百分位数为 10.3 小时。我们还发现,提交请求的时间段比发送的请求数量对速度影响更大。

在太平洋时间上午 5 点到中午之间提交的批量任务明显比其他时间段慢。最慢的 10% 需要 2 到 4.5 小时。如果在其他任何时段提交,第 90 百分位数将降至 1.1 小时以下,而在太平洋时间晚上 6 点之后则低于 50 分钟。

单个请求的批量任务根据时段不同,完成时间为 5 到 11 分钟;包含 1,000 个或更多请求的批量任务完成时间为 12 到 21 分钟。大型批量任务确实需要更长的处理时间。在太平洋时间午夜至中午之间提交的、包含超过 100 个请求的最慢 10% 的批量任务,耗时长达 6.8 小时。

批量功能支持的内容

请求格式:您已发送给 OpenRouter 的任何文本请求体格式都将得到支持,包括 chat completions、responses、messages 和 embeddings。

路由:每个批量任务将在单个提供商上执行。默认情况下,在应用您的提供商白名单、数据策略和 BYOK(自带密钥)设置后,我们会为模型选择最便宜的批量端点。

BYOK:配置了提供商密钥后,支持该功能的提供商上的批量任务将通过您的密钥路由,您只需支付 BYOK 费用。

逐请求结果:每个结果独立返回,因此少数错误数据行永远不会导致整个作业失败。

保留期:输入和结果将保留 30 天,直到您 DELETE(删除)该批量任务为止。

日志记录:每个批量任务都会出现在您的日志的 Batches 标签页中,包含模型、提供商、状态和成本信息。

定价:折扣适用于按 token 定价,并因模型而异。Web search(网页搜索)调用按标准费率计费。

输入要求:图片和文件必须是公开 URL。音频、视频以及 OpenRouter 自带的网页搜索插件在批量功能中不可用(请参阅文档中的限制部分)。

开始使用

选择一个支持批量的模型,获取 API 密钥,并将您的第一个批量任务发布到 https://openrouter.ai/api/v1/batches 。快速入门指南提供了完整的请求和响应格式。

请在Discord的#feedback频道告诉我们你正在批量处理什么。

本条评分 9.9 score-v1
  • 来源权威 8
    注册表 priority=8(OpenRouter)
  • 时效 1.945
    发布 22.5 小时前,衰减到 1.94/3.0
  • 多源印证 0
    只有 1 家在报(无旁证)
  • 社区信号 0
    无社区数据(本管线走 RSS,HN 的 hn_fetcher 未接入)

首次收录 · 2026-09-23 · 9.95 分

原文链接:https://openrouter.ai/blog/announcements/batch-api/
来源:OpenRouter
以上内容由 AI 自动翻译,仅供参考。
← 返回简报