Cohere 发布 Embed 5 嵌入模型家族,含 Pro 和 Fast 两档
Introducing Embed 5—A new family of frontier embedding models
Cohere 发布 Embed 5 嵌入模型家族,含 Pro 和 Fast 两档,支持文本与图像输入、100+ 语言、128K 上下文,已通过 Cohere API、Microsoft Foundry、Amazon SageMaker 等渠道开放。
官方给出两个档位的定价、基准成绩和共享嵌入空间设计,读者可以据此权衡检索质量与查询成本的部署方案。
今天,我们发布 Embed 5,这是一个全新的嵌入模型系列,处于高质量企业检索的前沿。
Embed 5 在复杂企业数据上提供更强的检索能力,同时让团队对延迟、成本和部署拥有更多控制权。Embed 5 Pro 针对多模态、多语言、金融、代码和解析文档检索的最大质量进行了优化。Embed 5 Fast 为对延迟和成本敏感的工作负载带来极具竞争力的性能。两个层级共享同一个嵌入空间,因此团队可以用 Pro 建立索引,并用任一模型进行查询,而无需重建索引。
Embed 5 为搜索、RAG 和智能体工作流奠定了检索基础,在噪声到达昂贵的生成模型之前将其过滤掉,同时呈现更相关的上下文。使用 Embed 可提升答案质量和用户体验,同时帮助控制下游推理成本。
Embed 5 今天已在 Cohere API 和 Model Vault、Microsoft Foundry 和 Amazon SageMaker 上正式可用。Pro 的定价为每百万 token 0.12 美元,Fast 为每百万 token 0.08 美元。
快照
| 能力 | Embed 5 Pro | Embed 5 Fast |
|---|---|---|
| 最适合 | 最高检索质量;离线索引;复杂企业语料库 | 交互式搜索;高吞吐量 RAG;智能体检索 |
| 上下文长度 | 128K token | 128K token |
| 输入 | 文本、图像、融合文本 + 图像 | 文本、图像、融合文本 + 图像 |
| 语言 | 100+ | 100+ |
| 输出维度 | 2048, 1536, 1024, 768, 512, 256 | 2048, 1536, 1024, 768, 512, 256 |
| 嵌入格式 | float、int8、binary | float、int8、binary |
| Matryoshka 嵌入 | 是 | 是 |
| 共享嵌入空间 | 是 | 是 |
| 支持自托管 | 是 | 是 |
| 定价 | 每 100 万 token 0.12 美元(文本) 每 100 万 token 0.40 美元(图像) |
每 100 万 token 0.08 美元(文本) 每 100 万 token 0.40 美元(图像) |
性能
Embed 5 Pro 带来了我们迄今为止最强的检索性能。在我们测试的 ViDoRe V3、金融文档、解析 PDF、图像检索以及关键商业语言中,它取得了所有模型的最高平均分。
Embed 5 也是首个使用 RCP-nDCG@10 进行评估的模型系列,这是我们最新的检索方法论。它不再仅针对一组有限的固定标签进行评分,而是根据查询特定的相关性标准评估检索到的文档,捕捉相关结果,并更全面地呈现在您自己的语料库上的性能表现。1 阅读更多关于 RCP-nDCG@10 的内容。
企业文档
Embed 5 在视觉丰富的文档上表现出色,这些文档的含义存在于表格、图表、示意图和布局中,而不仅仅是文本中。在 ViDoRe V3 上,该基准包含从关键企业领域采样的文档,包括财务申报文件、技术手册、监管材料、政府报告、教科书和讲座,Embed 5 Pro 平均得分为 85.8,相较 Embed 4 提升了 8.8,令人印象深刻。2
这使其领先于 Voyage 4 Large(83.7)、Gemini Embedding 2(83.2)和 OpenAI text-embedding-3-large(75.5)。Pro 在八个领域中的五个领域 outright 领先,并在能源领域与 Voyage 4 Large 持平,相较 Embed 4 的最大提升出现在人力资源(+11.4)和工业(+10.3)。Embed 5 Fast 平均得分为 84.5,领先于 Gemini Embedding 2 和 Voyage 4 Large。查看完整结果 此处。

在八个视觉丰富文档领域上的检索质量(RCP-nDCG@10)。评估由 ViDoRe 作者整理的解析文本输出组成。
金融
Embed 5 Pro 确立了其作为金融文档检索领先嵌入模型的地位。
Pro 在三个领先的公开金融基准测试中排名第一,而 Fast 尽管比同类模型小得多,却在每个基准测试中均位列第二: FinanceBench (Pro 80.1,Fast 80.0)、 FinQA (90.0,88.8)以及 ViDoRe V3 Finance(85.0,83.9)。
在这些基准测试中,Pro 平均比排名紧随其后的非 Cohere 竞争对手 Gemini Embedding 2 高出 3.3 分。与 OpenAI text-embedding-3-large 相比,在 FinanceBench 上的领先优势扩大到 21.4 分。

在八个视觉信息丰富的文档领域中的检索质量(RCP-nDCG@10)。评估由 ViDoRe 的作者整理,基于解析后的文本输出。
多模态
解析后的 PDF
大多数企业搜索流水线仍会在嵌入 PDF 之前将其转换为文本,但这一过程可能会剥离文档结构。表格会丢失行与列的关系,多栏布局可能打乱阅读顺序,重复的页眉会增加噪声,而图表往往完全消失。这使得解析文档检索成为比干净文本基准测试所显示的更为严峻的考验。
我们的解析文档测试套件涵盖服务文档、企业报告、SEC 文件、产品手册和隐私政策。Embed 5 Pro 在整个套件中取得了最高的平均分 84.8,领先于 Voyage 4 Large 的 83.6、Embed 5 Fast 的 83.4、Gemini Embedding 2 的 80.8 以及 Embed 4 的 78.6。下图突出展示了部分熟悉的公开基准测试,其中 Embed 5 Pro 在以 FinanceBench 和 CoFiF 为代表的金融文档上表现尤为突出。

在具有代表性的公开基准测试中的解析文档检索(RCP-nDCG@10)。文档使用 Gemini 1.5 Flash 进行解析。“完整套件平均值”包含未展示的其他数据集。
页面图像与融合文本-图像文档
有些文档以视觉形式呈现更为合适。扫描页面、幻灯片、示意图和图表中包含文本提取可能遗漏的信息。Embed 5 可以直接嵌入页面图像(页面图像),或将图像与其元数据组合成单个向量(融合文本-图像)。
在融合文本-图像语料库上,Embed 5 Pro 在五个数据集上的平均分为 82.3,领先于 Embed 5 Fast 的 81.2 和 Gemini Embedding 2 的 61.3。Pro 在该套件的每个数据集上都优于 Gemini Embedding 2。页面图像检索同样表现稳健:Embed 5 Pro 继续在金融数据集上保持领先,五个数据集的平均分为 77.0,领先于 Embed 5 Fast(73.2)、Embed 4(71.1)、Voyage Multimodal 3.5(70.1)和 Gemini Embedding 2(56.7)。

使用文本查询的多模态文档检索(nDCG@10)。融合文本-图像检索将页面图像和文档元数据组合在单个嵌入中。RepairBench 报告了多个多语言查询子集的平均值。High Finance 是一个内部由 Cohere 标注的问题集,要求模型检索相关的投资银行和对冲基金演示材料。

使用文本查询的多模态文档检索(nDCG@10)。纯图像检索仅使用页面图像来回答提示。AR = 阿拉伯语;JA = 日语;KO = 韩语。
多语言
Embed 5 在 100 多种语言上进行训练,特别关注我们全球客户群使用最多的语言。
在德语、法语、西班牙语、意大利语和俄语中,Embed 5 Pro 在我们测试的模型中取得了最高平均分:77,而 Voyage 4 Large 为 76,Gemini Embedding 2 为 73。它相比 Embed 4 平均提升了约 7 分,其中俄语(+9)和意大利语(+7)提升最大。

跨关键欧洲语言的检索质量。分数代表多个复合基准的平均值。基准以 nDCG@10 或 RCP-nDCG@10 衡量。
下表涵盖 Embed 5 相较 Embed 4 取得重要进展的另外十种语言。Pro 提升最大的是中东和南亚次大陆语言,尤其是波斯语(+13)、泰卢固语(+12)和印地语(+12)。完整的多语言评估结果列表,请点击此处。
| 语言 | Cohere Embed 5 Pro | Cohere Embed 5 Fast | Gemini Embedding 2 | Voyage 4 Large | Cohere Embed 4 | Jina Embeddings v5 Text Small | OpenAI text-embedding-3-large |
|---|---|---|---|---|---|---|---|
| 日语 | 87 | 85 | 90 | 87 | 83 | 83 | 80 |
| 中文 | 82 | 80 | 81 | 82 | 79 | 78 | 73 |
| 韩语 | 85 | 83 | 87 | 85 | 79 | 79 | 70 |
| 阿拉伯语 | 83 | 79 | 87 | 86 | 72 | 71 | 67 |
| 波斯语 | 81 | 78 | 83 | 79 | 68 | 70 | 60 |
| 印地语 | 80 | 77 | 84 | 83 | 68 | 73 | 59 |
| 孟加拉语 | 83 | 81 | 89 | 85 | 73 | 79 | 61 |
| 泰卢固语 | 80 | 76 | 91 | 89 | 68 | 82 | 63 |
| 印度尼西亚语 | 85 | 83 | 88 | 85 | 79 | 79 | 81 |
| 泰语 | 82 | 75 | 88 | 84 | 75 | 78 | 67 |
认识 Embed 5 Fast
Embed 5 Fast 是一款更轻量的模型,专为延迟敏感、高并发的检索而构建。它的成本比 Pro 低三分之一,同时保留相同的 128K token 上下文、多模态输入、多语言覆盖以及多种压缩输出格式。
这在查询路径上最为重要,因为每次搜索都要付出嵌入延迟的代价——而在可能每个任务发起数十次搜索的智能体工作流中,这一代价还会成倍放大。Fast 更小的占用也降低了私有部署中的服务成本,并加速大规模摄取和重建索引任务。
在文档吞吐量方面——这是更贴近索引效率的指标——Fast 始终更高效,在不同上下文长度下平均吞吐量比 Pro 高 2.4 倍。

Fast 和 Pro 在约 200 token 和约 1K token 上下文长度下的平均文档吞吐量,以每秒处理的文档数衡量。越高越好。
性能
Fast 提升了紧凑型嵌入模型的标准。在 ViDoRe V3 上,它领先 Voyage 4 Nano 近七分,领先 Jina Embeddings v5 Text Small、Perplexity 和 Microsoft 的 Harrier 0.6B 十分或更多。尽管体积约为 Qwen3-VL-Embedding-2B 的一半,它的表现却高出约 20 分。如上所示,在 ViDoRe V3 和金融检索上,它的平均分也超过了 Gemini Embedding 2 和 Voyage 4 Large。在解析后的 PDF 上,它超过 Gemini Embedding 2(83.4 对 80.8),略低于 Voyage 4 Large(83.6)。

跨八个视觉丰富文档领域的检索质量(RCP-nDCG@10)。评估由 ViDoRe 作者整理的解析文本输出组成。
| Pro | Fast | |
|---|---|---|
| 使用场景… | 用于离线索引和质量至关重要的检索——尤其是跨复杂文档、多模态内容或细微查询。 | 用于实时请求路径,尤其是交互式搜索、智能体循环以及其他高并发查询工作负载。 |
| 金融服务 | 为股票研究批量索引 10-K、财报、表格和脚注;对密集金融记录进行合规或风险搜索。 | 客户服务搜索、顾问副驾驶、交易支持工作流,以及发起重复检索调用的智能体。 |
| 零售 + 商务 | 在大型多模态目录中进行产品发现,包括细微的属性匹配和 图文检索。 | 站点搜索、购物助手、推荐,以及服务大量实时查询的对话式产品查找。 |
| 法律 | 数字化大型法律档案,包括合同历史、案件卷宗、监管材料 和内部判例库。 | 内部法律知识搜索、条款查找、事项检索,以及在法律 助手或工作流中反复进行的检索。 |
两个模型,一个嵌入空间
Pro 和 Fast 共享同一个嵌入空间,因此任一模型生成的向量都可以直接比较。我们在涵盖文本、图像、融合和解析文档检索的 40 个开发数据集上测试了每一种语料/查询组合。
这一共享空间让团队可以独立选择每一层级:文档可以用 Pro 建立索引以获得最高质量,而查询使用 Fast 以降低延迟和成本——无需重建索引。跨模型组合的表现与同模型基线相近(Fast 和 Pro 查询平均仅分别损失 1.6% 和 2.7%),且没有任何数据集出现重大失败。
对于许多客户,我们推荐以下部署模式:用 Pro 建立索引,用 Fast 进行查询。它能在请求期间保留 Fast 的延迟和成本的同时,获得全 Pro 系统的大部分质量提升。3
| 平均检索质量 | 语料:Fast | 语料:Pro |
|---|---|---|
| 查询:Fast | 96.6 | 98.4 |
| 查询:Pro | 97.3 | 100 |
跨模型检索。40 个开发数据集上的平均 nDCG@10,以 Pro 语料 + Pro 查询 = 100 归一化。
向量存储
在企业规模下,向量索引的运营成本可能高于生成它的模型。Embed 5 支持 Matryoshka 表示学习和更低精度的输出,让团队可以缩小向量,并精细控制质量、存储和搜索成本之间的权衡。这些节省可能相当可观:一个 2,048 维 float32 向量需要 8 KB;一个 1,024 维 int8 向量使用 1 KB;而一个 256 维二值向量仅需 32 字节——减少了 256 倍。在 1 亿个分块上,这可将原始向量存储从约 819 GB 削减至 3.2 GB。
重要的是,int8 在 Embed 5 Pro 和 Fast 中都能保持接近全精度的检索质量。对于大多数部署,我们推荐 1,024 维 int8 向量作为性能与效率的理想平衡点。二值向量占用空间最小,但会有一定的精度损失,非常适合在更高精度重排序之前进行快速初筛检索。

不同向量维度和精度下的检索质量(RCP-nDCG@10)与存储成本对比。存储成本相对于 2048 维 FP32 向量给出。越靠左越高效。检索使用 ViDoRe V3(八个数据集)进行评估。
开始使用
通过 Cohere API、Model Vault、Microsoft Foundry(Pro、Fast)和 Amazon SageMaker(Pro、Fast)部署 Embed 5 Pro 和 Embed 5 Fast,或直接在 North 中使用 Embed 5。对于您自己的 VPC 或本地环境中的私有部署,两个模型均可通过 vLLM 提供服务。批量嵌入功能可用,适用于大规模数据摄取。
使用您已有的工具进行构建。 Embed 5 可融入现有的检索技术栈,并与各类框架和向量数据库集成,包括 LangChain、Haystack、Weaviate、Qdrant、Pinecone、Elasticsearch、MongoDB、Redis、Milvus 和 OpenSearch。阅读文档。
首先创建 API 密钥,然后使用下方的代码片段快速发起您的第一次查询。
import os, cohere, numpy as np
co = cohere.ClientV2(api_key=os.environ["CO_API_KEY"])
documents = [
"Net interest margin narrowed 12 bps to 2.61% as deposit costs rose.",
"Torque the mounting bolts to 45 Nm in a star pattern before refitting the cover.",
"Employees accrue 1.5 days of paid leave for each month of service.",
]
doc_embeddings = co.embed(
model="embed-v5.0-pro",
input_type="search_document",
texts=documents,
output_dimension=1024,
embedding_types=["float"],
).embeddings.float_
query_embedding = co.embed(
model="embed-v5.0-pro",
input_type="search_query",
texts=["What happened to net interest margin last quarter?"],
output_dimension=1024,
embedding_types=["float"],
).embeddings.float_[0]
docs = np.array(doc_embeddings)
query = np.array(query_embedding)
scores = docs @ query / (
np.linalg.norm(docs, axis=1) * np.linalg.norm(query)
)
print(documents[int(np.argmax(scores))])其他内容
认识 Embed 5 背后的团队。 在 X 上关注我们,时间是 2026 年 10 月 8 日,届时我们的搜索与嵌入团队负责人将介绍 Embed 5、Parse 5,以及我们在幕后准备的其他内容。
此外,我们的托管搜索与检索平台 Compass Cloud 现已进入私测阶段。 申请访问权限 ,在您自己的检索和智能体工作负载上试用它。
主要贡献者
Samarth Bhargav、Fabian Schmidt、Clifton Poth、Arthur Maciejewicz、Florian Schneider、David Rau、Dennis Zhao、Timothy Ang、Nils Reimers、Carlos Lassance
脚注
1 RCP-nDCG@10 要求在两阶段检索设置中评估嵌入模型,使用其相似度分数对固定候选集重新排序。因此,分数反映的是重排序质量,而非第一阶段检索性能,后者我们已在其他地方针对 nDCG 和 Recall 进行了全面评估。
2 使用 RCP-nDCG 评估 ViDoRe V3 所需的标注和代码可在 GitHub 上获取。
3 双方必须使用相同的输出维度。该兼容性同样适用于 Matryoshka 截断和 int8 量化,因此相同的模式也适用于压缩索引。
来源:Cohere 产品与研究博客 · cohere.com