OpenRouter 推出 Batch API,批量推理可享半价

OpenRouter:Announcements(RSS)·2026-09-22 08:00·12小时前·Brian Thomas
AI 导读

OpenRouter 发布 Batch API,异步批量请求由供应商在 24 小时窗口内完成,通常按正常 per-token 价格的 50% 或更低收费,目前已支持 70 多个模型。

OpenRouter:Announcements(RSS)
精选
70AI 编辑部评分,满分 100

OpenRouter 推出 Batch API,批量推理可享半价

2026-09-22 08:00· 12小时前· Brian Thomas
AI 导读

OpenRouter 发布 Batch API,异步批量请求由供应商在 24 小时窗口内完成,通常按正常 per-token 价格的 50% 或更低收费,目前已支持 70 多个模型。

推荐理由

公告给出折扣幅度、70+ 模型覆盖和 beta 期 230k+ 批次的实测完成时间,还提示了提交时段对速度的影响。

正文 · AI 翻译
Batch API: half-price inference by bundling requests

对于大批量的工作或无需立即完成的请求,你现在可以使用新的 batch API。提交批次时,提供商可以在 24 小时窗口内自行选择完成请求的时间,作为交换,他们通常收取正常每 token 价格的 50%(有时更低)。

它目前已在 超过 70 个模型上可用。请在 Batch API 文档中了解如何使用它。

在实践中,我们观察到你很少需要等待接近 24 小时。在我们为期两周的 beta 期间完成的 230k+ 个批次中,中位数在 7 分钟内完成,90% 在一小时内完成。

Batch 是一种异步 API,适用于你可以接受高度可变响应时间的工作负载,例如为语料库打标签、回填嵌入向量、为评测集打分、汇总积压的工单,或在夜间对几千行数据运行相同的提示词。

Batch API 的工作原理

调用 api/v1/batches,传入你的请求列表,并指定要使用的端点形态。Chat completions、responses、messages 和 embeddings 均受支持。例如:

curl https://openrouter.ai/api/v1/batches \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -d '{
  "endpoint": "/v1/chat/completions",
  "model": "google/gemini-3.8-flash",
  "requests": [
    { "custom_id": "ticket-0001", "body": { "messages": [{ "role": "user", "content": "Summarize this ticket in one sentence." }] } },
    { "custom_id": "ticket-0002", "body": { "messages": [{ "role": "user", "content": "Summarize this ticket in one sentence." }] } }
  ]
}'

发出请求后,开始轮询 GET /api/v1/batches/:id,直到状态为 completedfailedexpiredcancelled。已完成的批次会在同一响应中内联返回其结果。

大多数批次几分钟内即可完成

我们查看了两周测试期内完成的批次,并测量了从接受到返回结果的时间。中位数为 7 分钟,第 90 百分位为 1.0 小时,第 99 百分位为 10.3 小时。我们还发现,提交的时间点比发送的请求数量影响更大。

Bar chart of batch completion time by the Pacific hour a batch was submitted, showing the median, 75th percentile, and 90th percentile for each hour. The median stays between 5 and 11 minutes all day. The 90th percentile sits under 1.1 hours for most hours but climbs to between 2 and 4.5 hours for batches submitted from 5am to noon Pacific, peaking at 4.5 hours for the 9am hour.

在太平洋时间凌晨 5 点到中午之间提交的批次,明显比其他时段更慢。最慢的十分之一需要 2 到 4.5 小时。在其他任何时段提交,第 90 百分位都会降到 1.1 小时以下,而在太平洋时间下午 6 点之后则低于 50 分钟。

单个请求的批次根据时段不同,完成时间为 5 到 11 分钟,而包含 1,000 个或更多请求的批次完成时间为 12 到 21 分钟。大批次处理确实需要更长时间。在太平洋时间午夜到中午之间提交的、请求数超过 100 的批次中,最慢的十分之一耗时长达 6.8 小时。

Heatmap of median hours to complete by three-hour Pacific submission window and batch size bucket (1, 2 to 10, 11 to 100, 101 to 1k, and 1k+ requests). Every cell shows a median of 5 to 21 minutes. Each cell also lists the sample size and 90th percentile, which climbs as high as 6.8 hours for batches of 101 or more requests submitted between midnight and noon Pacific.

批次支持哪些功能

  • 请求形态:你已发送给 OpenRouter 的任何文本请求体形态都将得到支持,包括 chat completions、responses、messages 和 embeddings。
  • 路由:每个批次在单一提供商上执行。默认情况下,在应用你的提供商允许列表、数据政策和 BYOK 设置之后,我们会为该模型选择最便宜的批次端点。
  • BYOK:配置了提供商密钥后,在支持该功能的提供商上的批处理会通过你的密钥路由,你只需支付 BYOK 费用。
  • 逐请求结果:每个结果独立返回,因此少数几行出错绝不会导致整个任务失败。
  • 保留期限:输入和结果会保留 30 天,或直到你DELETE该批次。
  • 日志记录:每个批次都会显示在日志的 Batches 标签页中,包含模型、提供商、状态和费用。
  • 定价:折扣适用于按 token 计费的价格,并因模型而异。网络搜索调用按标准费率计费。
  • 输入:图像和文件必须是公开 URL。音频、视频以及 OpenRouter 自有的网络搜索插件在批处理中不可用(参见文档中的限制部分)。

选择一个支持批处理的模型,获取一个API 密钥,然后将你的第一个批次提交到https://openrouter.ai/api/v1/batches快速入门中有完整的请求和响应结构。

在 Discord 的#feedback中告诉我们你在批处理什么。

来源:OpenRouter:Announcements(RSS)· openrouter.ai