Postgres 中向量内联存储与独立表对比:AlloyDB Omni 实测 join 开销
Gleb Otochkin 在 AlloyDB Omni 上用 3 万行商品数据和 vector(768) 嵌入,实测语义搜索、过滤查询和多表 join 三类场景下向量与业务数据同表存储与独立嵌入表加主键 join 的性能差异。
Gleb Otochkin 在 AlloyDB Omni 上用 3 万行商品数据和 vector(768) 嵌入,实测语义搜索、过滤查询和多表 join 三类场景下向量与业务数据同表存储与独立嵌入表加主键 join 的性能差异。
OpenRouter 于 2026 年 9 月 11 日核实嵌入模型目录共 37 个条目,并通过自家 embeddings API 向 19 个模型发送批量请求、共 28 项检查,确认请求与响应行为。
推荐理由:作者用自家 API 实测 19 个模型并按用例给出候选、价格与维度,读者可按输入类型和存储约束直接对照选型。
百度智能云联合中国电子技术标准化研究院牵头制定的四项人工智能国家标准正式发布,自2026年8月27日起实施,由全国信息技术标准化技术委员会(TC28)归口管理。
OpenAI 发布 Astra for Law,将 GPT-6 Astra 配合法律搜索索引和 Legal 分析写作指令,面向律所和法律科技公司。在 Vals AI Legal Research Bench 私有验证集 200 道美国法律研究题上,最高推理强度下整体正确率 54.0%,比仅用网页搜索的 GPT-6 Astra 的 38.7% 相对提升 40%。
LangChain 发布开源智能体助手 Deep Life Sci,面向临床和实验室科学家。它接入 600K+ ClinicalTrials.gov 研究、2900 万 PubMed 摘要和 1200 万 PubMed Central 全文,并用沙盒子智能体进行真实数据分析。
LlamaIndex 发文分析 OCR 文档处理中准确率与自动化率的关系,指出路由门控而非读取能力决定直通处理率。文中算例显示 20 个字段的发票在 97% 每字段准确率下仅约 54% 文档全对,94% 准确率但带每字段置信度的 Pipeline B 可自动放行 92% 文档,而 97% 准确但无信号的 Pipeline A 直通率为 0。
Google 的 Gleb Otochkin 在 AlloyDB Omni 上实测嵌入向量版本更新对 PostgreSQL 存储的影响:在含 768 维向量和 HNSW 索引的 20k 行表上更新全部向量后,表、TOAST 和索引体积几乎翻倍(TOAST 从 81 MB 到 159 MB,HNSW 索引从 78 MB 到 156 MB),约一半空间被死元组占据。
LlamaIndex 博客提出 just-in-time Agentic OCR 模式:先用 LiteParse 等免费解析器粗读全部文件供检索,再仅对相关页面调用 VLM 做 OCR。
推荐理由:作者用 84 份 SEC 文件实测两遍式文档处理流程,给出明确的适用边界和成本数字,方法可直接迁移到自己的数据室场景。
H Company 团队发布 NeoMME,含 260M 和 800M 两个尺寸的多语言多模态编码器,用单个双向 Transformer 从零处理文本 token 和 32×32 图像 patch,不使用预训练视觉塔或因果语言模型,训练采用掩码离散扩散目标,每个模型处理约 5240 亿 packed token。
Meta 发布技术博客,介绍其为合规领域构建的 AI Agent,用结构化知识系统加可组合 recipes 复现专家推理方式,专家反馈经诊断、编译、验证和人工审核后写入 200+ 知识文件,无需重新训练模型。六周三轮开发后,单项评估时间从数天缩短到数分钟,改进周期内零回归,每轮修复自动加入回归测试集。
Databricks 提出通过结构化图表提取来增强智能体检索能力,帮助智能体更准确地理解企业文档中的图表数据。该方法将图表内容转化为结构化格式,使检索系统能更高效地定位和引用关键信息,从而提升智能体在复杂业务场景中的回答质量与可靠性。
推出 Cohere Parse 5。这是我们最新的文档解析模型,拥有市场上最强的性价比。 非常适合高吞吐量的企业工作。在保持每页价格处于行业低位的同时,获得高质量的解析准确率。
Cohere 发布面向企业文档的视觉语言模型 Parse,可将多模态文件转为结构化 Markdown,支持表格、图片理解和 9 种主要语言。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,支持 ColBERT 风格的后交互检索,并配套完整训练流程。
推荐理由:文章量化了不同起点的领域适应差距,未监督预训练 checkpoint 反超已微调版本,并把长文档截断列为比架构更影响 NDCG 的因素。
OpenWiki 利用证据支撑的声明来检测过时知识、减少模型幻觉,并为不断演进的代码库构建自纠错记忆。该方法通过将知识声明与可验证证据关联,使系统能自动识别并修正已失效的信息,从而提升长期记忆的准确性与可靠性。
WorkBuddy 现已连接 @NotionHQ。 将你散落在 Notion 工作区的文档、笔记和知识,汇入 WorkBuddy 中的答案与操作。 你的工作区变得更加互联。
AlloyDB 的 ScaNN 索引现已支持超过 100 亿向量的规模,通过全新的四层树架构(预览版)实现,将查询复杂度从 O(N^1/2) 降至 O(N^1/4)。内部测试中,该架构在 100 亿向量规模下可实现 p95 延迟不超过 51 毫秒、召回率达 95%。该功能可通过快速入门指南部署,新用户可享受 30 天免费试用。
推荐理由:四层树把搜索复杂度从 O(N^1/2) 逐级降到 O(N^1/4),配合内存优化让向量索引扩到百亿规模,这会影响依赖大规模向量检索的 RAG 应用在做容量规划时的性能假设。
Mistral 发布 Agentic Search,通过 search、open、navigate、read、grep 五工具的多步检索循环,让模型在长文档与多来源中查找、定位并验证信息。
推荐理由:相比一次性 RAG,五个检索工具让模型按需查证、打开和阅读原文,精度从 26.7% 升到 86%,说明检索质量开始取决于模型推理而非分块策略。
OpenRouter 发布视觉指南,详解通过 Chat Completions API 向多模态模型发送图像的方法。请求体采用 messages 数组,用户消息的 content 包含 text 和 image_url 两部分,支持公开 URL 或 base64 数据 URL 两种格式,兼容 PNG、JPEG、WebP 和 GIF。
LlamaIndex 发布长文分析 LLM OCR 的核心风险:视觉证据弱时语言先验主导,模型会把读不清的数字替换成流畅但错误的值,或静默截断长表格,且没有逐字符置信度可供设阈值。
推荐理由:原文拆解了 LLM OCR 的静默失败模式,并给出字段级溯源、验证循环等可落地的系统设计方法。
LlamaIndex 发布 Parse Gateway,基于 LiteParse v2.2.0 的 is_complex 功能在页面级估计文档复杂度,并把每页路由到不同 LlamaParse 层级,简单页走免费进程内 LiteParse,复杂页升级到更高 tier。
Fireworks 发布一条低于 10 美元、约 150 步的对比微调配方,将 Qwen3-Embedding-8B 适配到特定检索领域。
推荐理由:原文用真实任务给出完整可复现的对比微调配方和成本数字,读者可以据此判断是否迁移到自己的检索场景。
清华NLP与东北大学提出KG-Infused RAG,将知识图谱(Wikidata5M,约2100万三元组)引入RAG,通过“扩散激活”机制同时检索文本段落与结构化事实。
Apple 机器学习研究团队提出 CLaRa,一种通过连续潜在推理桥接检索与生成的新方法。该方法在检索增强生成(RAG)中引入连续潜在空间,使模型在生成答案前先进行隐式推理,从而缓解长上下文带来的性能下降。CLaRa 在多个知识密集型基准上提升了 LLM 的准确率与效率。
LlamaIndex 宣布扩展 LlamaParse Index,新增 Retrieval Harness,为 Agent 提供文件系统式文档遍历工具,包括 Hybrid Retrieve、List Files、File Grep 和 File Read。
推荐理由:官方展示了文件系统式检索工具和流水线可观测能力,读者可据此评估企业 Agent 检索方案的选型。
LangChain 公开了 SmithDB 中全文搜索功能的实现细节,核心是构建并压缩倒排索引。该方案将索引数据路由至本地 SSD 与对象存储,以平衡查询性能与存储成本。
LlamaIndex 发布 n8n 社区节点 LlamaParse Platform 的 v5 和 v6,该节点已随与 n8n 的合作成为官方验证的社区节点。
Liquid AI 发布两款 350M 参数多语言检索模型 LFM2.5-ColBERT-350M 和 LFM2.5-Embedding-350M,是 LFM 家族首批双向模型,支持 11 种语言的跨语言检索。
RedParrot 是一种面向企业级商业分析的 NL-to-DSL 加速框架,通过查询语义缓存、骨架匹配、实体无关表示学习和多源异构 RAG,将多阶段 LLM 工作流压缩为短链路生成。在小红书真实业务数据集上,平均实现 3.6x 推理加速,执行准确率提升 8.26%,表选择准确率达 85.99%;在开放基准 Spider-DSL 和 BIRD-DSL 上,准确率分别提升 29.9 和 39.7 个百分点。P90 延迟降低至约 21 秒。框架采用短链路与长链路双路径兜底,支持增量缓存更新。
LangChain 发布 LangSmith Benchmarks,允许用户公开分享和对比大语言模型评估结果。该功能支持在社区数据集上测试 RAG 系统、AI 智能体和架构,帮助团队更高效地比较不同模型与配置的性能表现。
LangChain 与 Pinecone Serverless 集成,提供构建生产级 RAG 应用的完整方案。该方案支持按用量计费的可扩展部署,并内置可观测性功能,帮助开发者快速将原型转化为可上线的 AI 应用。
LlamaIndex 为 LlamaParse 推出 Granular Bounding Boxes,可在整个文档中提供行级、词级和表格单元格级的坐标追踪。该功能通过在任务创建时传入 granular_bboxes 参数开启,目前处于 beta 阶段,向所有付费层级开放。只有页面上明确存在的文本会获得坐标,推断值、AI 摘要和重建内容没有边界框,可用于审计级引用和高精度 PII 脱敏。
Google Research 与 Google Cloud 合作推出跨语料库检索(Cross-Corpus Retrieval)框架,作为 Gemini Enterprise Agent Platform 的 Agentic RAG。该多智能体工作流将复杂企业查询分解为子任务,通过规划、重写和路由,迭代搜索多个数据源直至获得充分上下文,再生成可靠回答。与标准 RAG 相比,在事实性数据集上准确率最高提升 34%;在多个领域特定内部数据集上也实现了更好的接地与推理准确性。
推荐理由:企业级 RAG 的新标杆,多 agent 架构加上‘足够上下文’检查,准确度提升 34%。做知识库问答的产品经理和架构师都应该认真看。