NeoMME 发布 260M 与 800M 多语言多模态编码器,权重以 Apache 2.0 开源
H Company 团队发布 NeoMME,含 260M 和 800M 两个尺寸的多语言多模态编码器,用单个双向 Transformer 从零处理文本 token 和 32×32 图像 patch,不使用预训练视觉塔或因果语言模型,训练采用掩码离散扩散目标,每个模型处理约 5240 亿 packed token。
H Company 团队发布 NeoMME,含 260M 和 800M 两个尺寸的多语言多模态编码器,用单个双向 Transformer 从零处理文本 token 和 32×32 图像 patch,不使用预训练视觉塔或因果语言模型,训练采用掩码离散扩散目标,每个模型处理约 5240 亿 packed token。
Cohere 发布文档解析模型 Parse(parse-v5.0),基于 North-Micro-Vision-Instruct 架构,拥有 2.3B 参数、8,192-token 上下文窗口和约 4.6GB 体积,可将 PDF、PPT、JPEG 页面直接转为含 HTML 表格和边界框坐标的 Markdown,无需独立 OCR 阶段。
Cohere 推出 Parse 5 文档解析模型,主打市场最强性价比。此前企业需在高成本高精度解析与低成本有损解析间取舍,Parse 5 以行业最低每页价格实现高质量解析,适合大规模企业数据处理。
Introducing Cohere Parse 5. Our newest document parsing model with the strongest price-performance on the market. Ideal for high-volume enterprise work. Get high-quality parsing accuracy while keeping per-page prices at an industry low.
推出 Cohere Parse 5。这是我们最新的文档解析模型,拥有市场上最强的性价比。 非常适合高吞吐量的企业工作。在保持每页价格处于行业低位的同时,获得高质量的解析准确率。
Cohere 发布面向企业文档的视觉语言模型 Parse,可将多模态文件转为结构化 Markdown,支持表格、图片理解和 9 种主要语言。
英伟达开源 Nemotron 3 Embed 系列模型,面向 AI 智能体和 RAG 场景,配备 32K 上下文窗口。其中 8B 参数版在 RTEB 基准上以 78.5% 得分斩获榜首,MMTEB 检索得分 75.5%。该系列以开放权重形式通过 Hugging Face 与 NVIDIA NIM 免费提供,支持商业使用。
NVIDIA 发布 Nemotron 3 Embed 系列,包含三个开源 checkpoint,其中 8B-BF16 版本在 RTEB 基准上以 78.46 的平均 NDCG@10 排名第一。1B-NVFP4 版本在 Blackwell 上吞吐量比 BF16 高 2 倍,精度保留 99.5%,所有模型最大序列长度 32,768 tokens。
推荐理由:嵌入模型不是最热的赛道,但决定了你 Agent 看到什么——NVIDIA 把 1B 模型压缩到 RTEB 第二,NVFP4 量化后精度几乎不变,做 RAG 的值得换上。
Liquid AI 本周发布两款 350M 参数检索模型:稠密双编码器 LFM2.5-Embedding-350M 和后期交互模型 LFM2.5-ColBERT-350M。二者基于 LFM2.5-350M-Base,通过将因果注意力改为双向注意力实现双向编码,支持阿拉伯语、德语、英语等 11 种语言的单语与跨语言搜索。在 NanoBEIR 多语言检索上,ColBERT 版 NDCG@10 为 0.605,Embedding 版为 0.577,均优于 Qwen3-Embedding-0.6B。在 MKQA-11 问答 Recall@20 上分别为 0.694 和 0.691。上下文窗口 32,768 tokens,文档调优至 512 tokens。提供 GGUF 格式,MacBook Pro M4 Max 上查询延迟低于 10 ms。模型以 LFM Open License v1.0 发布在 Hugging Face。
Liquid AI 发布两款 350M 参数多语言检索模型 LFM2.5-ColBERT-350M 和 LFM2.5-Embedding-350M,是 LFM 家族首批双向模型,支持 11 种语言的跨语言检索。
UIUC与Chroma联合推出Harness-1,一个20B参数的检索子智能体。它通过强化学习在一个有状态搜索框架中训练,该框架维护候选池、重要性标注集、证据图和验证记录,由策略决定搜索、筛选、验证及停止的时机。Harness-1在8个基准测试上达到0.730平均curated recall,比下一个最佳开源子智能体高出11.4个百分点,仅落后于Opus-4.6。模型权重和框架代码均已公开。
推荐理由:UIUC和Chroma放出的这个20B检索子代理,用RL训练出了0.73的平均召回,把开源竞品甩开11.4分,只比Opus-4.6低一点。权重、Harness全开源,搞RAG的可以真刀真枪试试了。
Hugging Face 发布六个 Ettin Reranker 重排序模型(17m、32m、68m、150m、400m、1b),基于 Ettin ModernBERT 编码器,蒸馏 self-mxbai-rerank-large-v2 分数训练,在 MTEB(eng, v2) Retrieval 达各自规模 SOTA。模型以 Sentence Transformers CrossEncoder 接口提供,三行代码可调用。同时发布 train-sentence-transformers Agent Skill(v5.5.0),允许 AI 编码智能体在用户数据上微调模型。训练配方、数据集和脚本已全部开源。
推荐理由:从17M到1B的全尺寸reranker家族,每个量级都是SOTA,而且训练数据和代码全开放,做搜索和RAG的开发者可以无痛替换旧模型。
IBM 发布两个 Apache 2.0 开源多语言嵌入模型:97M 参数的紧凑型(granite-embedding-97m-multilingual-r2)在 MTEB Multilingual Retrieval 上得 60.3 分,超越所有开放子 1 亿参数模型;311M 全尺寸模型(granite-embedding-311m-multilingual-r2)得 65.2 分,在 500M 以下开放模型中排第二,并支持 Matryoshka 维度。两者均基于 ModernBERT 架构,支持 200+ 种语言,针对 52 种语言和 9 种编程代码检索训练,上下文窗口达 32,768 tokens。可直接替换 sentence-transformers、LangChain、LlamaIndex 等框架中的默认模型,预置 ONNX 和 OpenVINO 权重以优化 CPU 推理。
推荐理由:97M小模型在跨语言检索上打败很多300M级选手,32K上下文让长文档处理不再鸡肋,Apache 2.0开源意味着做多语言RAG的可以直接拿来当默认嵌入模型了。
Cohere 发布 Rerank 4 重排序模型系列,称在整体搜索相关性上优于 MongoDB 的 Voyage 模型和 ElasticSearch 的 Jina rerankers。
Liquid AI 发布 Liquid Nanos 系列,包含 350M 至 2.6B 参数的任务专用 LFM2 模型,可完全在手机、笔记本和嵌入式设备上运行。
推荐理由:原文给出各款小模型的参数量、任务定位和评测对比,读者可判断端侧专用模型能否替代云端大模型。
Mistral AI 发布首个专为代码设计的嵌入模型 Codestral Embed。该模型在代码检索任务上性能显著超越当前领先的 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 大型嵌入模型。它支持输出不同维度和精度的嵌入向量,即使在 256 维度 int8 精度下仍优于竞品。模型通过 API 以 `codestral-embed-2505` 名称提供,定价为每百万 token 0.15 美元,批量 API 享五折优惠。最大上下文长度为 8192 tokens,推荐使用 3000 字符(含 1000 字符重叠)分块以优化检索效果。