跳到正文

#RAG

今日 0 条
9月25日周五
9月23日周三
  1. OpenRouter:Announcements(RSS)67

    OpenRouter 发布 2026 年最佳嵌入模型选型指南,覆盖 37 个目录条目

    OpenRouter 于 2026 年 9 月 11 日核实嵌入模型目录共 37 个条目,并通过自家 embeddings API 向 19 个模型发送批量请求、共 28 项检查,确认请求与响应行为。

    推荐理由:作者用自家 API 实测 19 个模型并按用例给出候选、价格与维度,读者可按输入类型和存储约束直接对照选型。

9月21日周一
9月18日周五
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)55

    OpenAI 发布 Astra for Law 法律行业基础方案

    OpenAI 发布 Astra for Law,将 GPT-6 Astra 配合法律搜索索引和 Legal 分析写作指令,面向律所和法律科技公司。在 Vals AI Legal Research Bench 私有验证集 200 道美国法律研究题上,最高推理强度下整体正确率 54.0%,比仅用网页搜索的 GPT-6 Astra 的 38.7% 相对提升 40%。

9月16日周三
  1. LlamaIndex:产品、工程与评测54

    LlamaIndex:为什么更好的抽取模型并不能缩小你的文档复核队列

    LlamaIndex 发文分析 OCR 文档处理中准确率与自动化率的关系,指出路由门控而非读取能力决定直通处理率。文中算例显示 20 个字段的发票在 97% 每字段准确率下仅约 54% 文档全对,94% 准确率但带每字段置信度的 Pipeline B 可自动放行 92% 文档,而 97% 准确但无信号的 Pipeline A 直通率为 0。

9月12日周六
9月11日周五
  1. LlamaIndex:产品、工程与评测65

    LlamaIndex 解析 just-in-time Agentic OCR:两遍式文档处理如何平衡成本与精度

    LlamaIndex 博客提出 just-in-time Agentic OCR 模式:先用 LiteParse 等免费解析器粗读全部文件供检索,再仅对相关页面调用 VLM 做 OCR。

    推荐理由:作者用 84 份 SEC 文件实测两遍式文档处理流程,给出明确的适用边界和成本数字,方法可直接迁移到自己的数据室场景。

9月5日周六
9月3日周四
  1. Meta Engineering Blog(RSS)53

    Meta 构建“组织第二大脑”AI Agent,从专家反馈中沉淀机构知识

    Meta 发布技术博客,介绍其为合规领域构建的 AI Agent,用结构化知识系统加可组合 recipes 复现专家推理方式,专家反馈经诊断、编译、验证和人工审核后写入 200+ 知识文件,无需重新训练模型。六周三轮开发后,单项评估时间从数天缩短到数分钟,改进周期内零回归,每轮修复自动加入回归测试集。

8月31日周一
8月27日周四
  1. Databricks:Blog(RSS)39

    Databricks 如何用结构化图表提取增强智能体检索

    Databricks 提出通过结构化图表提取来增强智能体检索能力,帮助智能体更准确地理解企业文档中的图表数据。该方法将图表内容转化为结构化格式,使检索系统能更高效地定位和引用关键信息,从而提升智能体在复杂业务场景中的回答质量与可靠性。

8月26日周三
8月25日周二
8月21日周五
  1. Google Cloud:Databases(RSS)65

    AlloyDB ScaNN 如何将向量搜索扩展到 100 亿向量

    AlloyDB 的 ScaNN 索引现已支持超过 100 亿向量的规模,通过全新的四层树架构(预览版)实现,将查询复杂度从 O(N^1/2) 降至 O(N^1/4)。内部测试中,该架构在 100 亿向量规模下可实现 p95 延迟不超过 51 毫秒、召回率达 95%。该功能可通过快速入门指南部署,新用户可享受 30 天免费试用。

    推荐理由:四层树把搜索复杂度从 O(N^1/2) 逐级降到 O(N^1/4),配合内存优化让向量索引扩到百亿规模,这会影响依赖大规模向量检索的 RAG 应用在做容量规划时的性能假设。

  2. Mistral AI:News(网页)67

    Mistral 推出 Agentic Search:多步检索提升 AI 系统复杂文档查询准确率

    Mistral 发布 Agentic Search,通过 search、open、navigate、read、grep 五工具的多步检索循环,让模型在长文档与多来源中查找、定位并验证信息。

    推荐理由:相比一次性 RAG,五个检索工具让模型按需查证、打开和阅读原文,精度从 26.7% 升到 86%,说明检索质量开始取决于模型推理而非分块策略。

8月15日周六
8月14日周五
8月12日周三
8月3日周一
  1. LlamaIndex:产品、工程与评测63

    LlamaIndex 解析 LLM OCR:错误更安静了,但没有更少

    LlamaIndex 发布长文分析 LLM OCR 的核心风险:视觉证据弱时语言先验主导,模型会把读不清的数字替换成流畅但错误的值,或静默截断长表格,且没有逐字符置信度可供设阈值。

    推荐理由:原文拆解了 LLM OCR 的静默失败模式,并给出字段级溯源、验证循环等可落地的系统设计方法。

7月30日周四
7月29日周三
7月21日周二
7月16日周四
  1. OpenBMB37

    清华大学 OpenBMB 联合多所高校提出 KARE-RAG,不优化检索器,而是训练生成器在噪声上下文中鲁棒地利用信息。该方法将生成分解为知识图谱构建、链式推理和答案生成三步,并引入 DDPO(密集直接偏好优化)解决结构化输出中标准 DPO 的权重浪费问题。在 Llama-3.1-8B 上,KARE-RAG 实现跨领域 EM +4.18%、F1 +3.52%,且无需改动标准 RAG 推理管线。

  2. Apple Machine Learning Research(RSS)40

    Apple 提出 CLaRa:用连续潜在推理桥接检索与生成

    Apple 机器学习研究团队提出 CLaRa,一种通过连续潜在推理桥接检索与生成的新方法。该方法在检索增强生成(RAG)中引入连续潜在空间,使模型在生成答案前先进行隐式推理,从而缓解长上下文带来的性能下降。CLaRa 在多个知识密集型基准上提升了 LLM 的准确率与效率。

6月29日周一
6月26日周五
6月18日周四
6月17日周三
  1. 公众号:小红书技术(dots.llm)55

    小红书联合浙大推出 RedParrot:基于语义缓存的 NL-to-DSL 加速框架(ICDE 2026)

    RedParrot 是一种面向企业级商业分析的 NL-to-DSL 加速框架,通过查询语义缓存、骨架匹配、实体无关表示学习和多源异构 RAG,将多阶段 LLM 工作流压缩为短链路生成。在小红书真实业务数据集上,平均实现 3.6x 推理加速,执行准确率提升 8.26%,表选择准确率达 85.99%;在开放基准 Spider-DSL 和 BIRD-DSL 上,准确率分别提升 29.9 和 39.7 个百分点。P90 延迟降低至约 21 秒。框架采用短链路与长链路双路径兜底,支持增量缓存更新。

6月16日周二
6月15日周一
  1. OpenBMB43

    面壁智能 OpenBMB 联合清华NLP、慕尼黑工业大学等发布 FactNet,构建十亿级开源多语言知识图谱。它将 1.7B 原子断言统一为 1.55B FactSynsets,附带 3.01B 来自 316 种语言维基百科的字节级可追溯证据(页面ID、修订版ID、Unicode偏移),99.63% 精确重定位。人工审计 4,200 项,设计加权精度 92.1%(低资源语言 88.5%)。FactNet-Bench 包含 KGC、MKQA、MFC 三项任务,显式惩罚信息泄露,为可验证 AI 提供结构化事实基础。

6月9日周二
  1. LlamaIndex:产品、工程与评测54

    LlamaParse 推出 Granular Bounding Boxes,支持行、词、单元格级坐标追踪

    LlamaIndex 为 LlamaParse 推出 Granular Bounding Boxes,可在整个文档中提供行级、词级和表格单元格级的坐标追踪。该功能通过在任务创建时传入 granular_bboxes 参数开启,目前处于 beta 阶段,向所有付费层级开放。只有页面上明确存在的文本会获得坐标,推断值、AI 摘要和重建内容没有边界框,可用于审计级引用和高精度 PII 脱敏。

6月6日周六
  1. Google Research:Blog(网页)64

    谷歌推出基于 Gemini Enterprise Agent Platform 的 Agentic RAG 框架

    Google Research 与 Google Cloud 合作推出跨语料库检索(Cross-Corpus Retrieval)框架,作为 Gemini Enterprise Agent Platform 的 Agentic RAG。该多智能体工作流将复杂企业查询分解为子任务,通过规划、重写和路由,迭代搜索多个数据源直至获得充分上下文,再生成可靠回答。与标准 RAG 相比,在事实性数据集上准确率最高提升 34%;在多个领域特定内部数据集上也实现了更好的接地与推理准确性。

    推荐理由:企业级 RAG 的新标杆,多 agent 架构加上‘足够上下文’检查,准确度提升 34%。做知识库问答的产品经理和架构师都应该认真看。