跳到正文
LlamaIndex:产品、工程与评测·· 1 天前精选AI 评分64

LlamaIndex 发布 OpenDocRouter:一个 API 统一调用多种文档解析模型

Introducing OpenDocRouter: every document model under one API

AI 导读

LlamaIndex 推出 OpenDocRouter 平台,通过统一 API 将文档(PDF、PNG、JPEG 或 URL)解析为 markdown,接入 Claude Opus 5.5、Gemini 3 Flash、GPT-6 Luna 等 5 个前沿模型和 MinerU2.5-Pro、PaddleOCR-VL-1.6 等 5 个开源模型。

推荐理由

原文给出各模型在 ParseBench 上的质量与每千页成本对比,以及统一 layout 输出和按 token 计费细节,便于开发者选型。

正文 · AI 翻译

OCR 模型非常多,而且每周都有更多新模型发布。在 HuggingFace 上快速搜索“ocr”就能看到成千上万个已发布的模型。此外,前沿实验室几乎每个月都在推出新的模型,这些模型也能很好地读取文档(尽管有时价格不菲)。使用这些模型进行文档解析通常都需要同样的几个步骤:设计提示词(如果适用)、处理速率限制、管理部署及相关成本,并在新模型发布时对其进行基准测试。

这正是我们 LlamaIndex 特别擅长的事情,今天我们推出 OpenDocRouter,以此分享这项工作。

什么是 OpenDocRouter?

OpenDocRouter 是一个使用最新开源和前沿模型进行文档 → markdown 解析的平台。每个模型都运行一套版本化的配方,包含提示词、处理和设置。使用该 API 非常简单:

curl https://https://www.opendocrouter.ai/v1/parse \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "opendatalab/mineru2.5-pro",
    "document": { "url": "https://arxiv.org/pdf/1706.03762" },
    "layout": true
  }'

该 API 接受 PDF、PNG、JPEG 或指向这些文件格式的 URL。该 API 允许你在同步响应(直接返回结果)和异步响应(创建一个需要轮询的任务)之间切换。同步响应最多支持 50 页。请求可以处理最多 500 页或 50MB 的输入。

每个模型都在 ParseBench 上从质量和成本两方面进行基准测试。在发布时,我们选择了一组覆盖我们基准测试各个角落的模型:

  1. 前沿模型:Claude Opus 5.5、Gemini 3 Flash、Gemini 3.8 Flash、GPT-5.6 Terra、GPT-6 Luna。
  2. 开源模型:Infinity-Parser2-Flash、MinerU2.5-Pro、TeleOCR、dots.mocr、PaddleOCR-VL-1.6

边界框与布局

每个模型对边界框和布局的保证各不相同。有些模型原生输出边界框,有些需要提示词,还有些完全做不到。

为了弥补这一差距,我们构建了一个可以应用于任何模型的定位引擎。在请求中设置 layout: True,即可生成带有定位边界框和按阅读顺序排列的布局元素的 markdown。这也意味着所有模型都会产生相同的布局类别:title、section_header、text、list_item、table、picture、chart、formula、caption、footnote、page_header、page_footer、code、form、key_value。

定价

OpenDocRouter 推出时采用纯基于 token 的计费方式,相当简单直接。创建账户,从 25 美元起充值额度,然后开始解析。启用布局会增加每百万 token 0.2 美元的费用,如果处理过程中任何页面失败,则不会收费。

截至 2026 年 10 月 7 日,我们的定价如下:

模型输入($/1M)缓存输入($/1M)输出($/1M)每 1k 页成本(ParseBench)
Claude Opus 5.5$4.00$0.20$20.00$48.82
Gemini 3 Flash$0.50$0.05$3.00$19.67
Gemini 3.8 Flash$0.75$0.08$3.75$5.91
GPT-5.6 Terra$2.00$0.20$12.00$19.89
GPT-6 Luna$0.10$0.01$0.50$0.80
Infinity-Parser2-Flash$0.24-$1.16$4.34
MinerU2.5-Pro$0.08-$0.39$0.86
TeleOCR$0.25-$1.22$2.70
dots.mocr$0.31-$1.53$3.97
PaddleOCR-VL-1.6$0.24-$1.20$2.17

添加新模型

当我们可以提供的新模型发布时,我们有相应的流程可以快速将它们添加到 OpenDocRouter。我们会让它们通过 ParseBench 运行,并以此校准提示词、成本和其他设置,从而尽可能提供最佳用户体验。

我们还计划持续改进最受欢迎的模型:无论是通过更好的提示词、更好的托管以降低延迟,还是更多其他方面。

OpenDocRouter 与 LlamaParse 对比

我们将 OpenDocRouter 视为一个平台,用于快速托管最新模型,同时让开发者能够轻松在现有模型之间切换和路由,并且只为实际使用量付费。该 API 本身易于使用,同时提供对模型的广泛访问。

LlamaParse 是我们的托管文档平台。它内置了手工调优的解析层级、企业级管控、自托管部署,以及模式提取和索引等其他 API。

立即试用 OpenDocRouter

OpenDocRouter 现已上线,可供试用。浏览模型和文档,注册并生成 API 密钥,今天就解析你的文档。

来源:LlamaIndex:产品、工程与评测 · llamaindex.ai