跳到正文

#RAG

今日 0 条
8月27日周四
  1. Databricks:Blog(RSS)39

    Databricks 如何用结构化图表提取增强智能体检索

    Databricks 提出通过结构化图表提取来增强智能体检索能力,帮助智能体更准确地理解企业文档中的图表数据。该方法将图表内容转化为结构化格式,使检索系统能更高效地定位和引用关键信息,从而提升智能体在复杂业务场景中的回答质量与可靠性。

  2. Aidan Gomez30

    Cohere 推出 Parse 5 文档解析模型,主打市场最强性价比。此前企业需在高成本高精度解析与低成本有损解析间取舍,Parse 5 以行业最低每页价格实现高质量解析,适合大规模企业数据处理。

    引用Cohere@cohere

    Introducing Cohere Parse 5. Our newest document parsing model with the strongest price-performance on the market. Ideal for high-volume enterprise work. Get high-quality parsing accuracy while keeping per-page prices at an industry low.

8月26日周三
  1. Hacker News 热门(buzzing.cc 中文翻译)63

    RAG 比你想象的更简单

    多数团队把 RAG 架构复杂化了,直接上嵌入、向量数据库和重排序,而用户往往只想找到“如何重置密码”这类文档。文章给出决策因素与分层方案:从纯全文检索(BM25)起步,再引入智能体查询改写(约 $0.001/次,用 GPT-4o-mini),仅在数据证明需要时才升级。对专有术语(如内部框架“Atlas”),精确关键词匹配优于语义理解。

  2. Hacker News 热门(buzzing.cc 中文翻译)67

    Show HN:LatticeDB——嵌入式属性图数据库,原生支持向量与全文索引

    LatticeDB 是一款单文件嵌入式属性图数据库,可在同一查询层中同时进行图遍历、HNSW 向量相似度搜索和 BM25 全文检索,无需服务器和配置。它面向单机关系密集型工作负载,提供 WAL 持久化和内置图变更流,支持 Graph RAG、智能体记忆等场景。性能方面,节点查找 0.13 μs,100 万向量下向量搜索 0.83 ms 且召回率 100%。

8月25日周二
  1. HuggingFace Daily Papers(社区热门论文)53

    生成式搜索中的上下文分配定律:因果测量与闭环编排

    一项新研究指出,RAG 系统在证据利用测量和上下文预算分配上存在瓶颈,并提出因果留一法探针替代标准相关性代理,以准确识别生成依赖。研究发现,单一扩大上下文窗口会因相关性衰减而失效,而跨多次顺序生成迭代分配计算可将组合召回率提升 16.7–20.5 个百分点,且可扩展至 32B 模型。相关代码、数据和因果测量工具已开源。

  2. HuggingFace Daily Papers(社区热门论文)66

    多跳 RAG 如何放大上游 ASR 错误:实体图谱链接与迭代改写反而加剧鲁棒性下降

    研究测试了实体图谱链接与迭代改写两种 RAG 扩展在 ASR 输入下的表现。在 HotpotQA、2WikiMultiHopQA 和 MuSiQue 三个多跳问答基准上,两种扩展均放大错误:干净文本与最高 WER 口音间的 F1 差距比朴素稠密检索大 36-67%。查询实体损坏是主要失败模式,占 2WikiMultiHopQA 上 87-96% 的退化案例。

  3. HuggingFace Daily Papers(社区热门论文)68

    同一智能体不同答案:检索增强问答中语料库引发的答案更替审计

    检索增强问答系统在索引扩展后可能返回不同答案,即便模型标识、提示词、检索策略等设置完全固定。研究提出快照兼容性审计,通过从跨快照分歧中减去同快照重复分歧来估算超额答案更替。在400题Natural Questions预注册研究中,归一化精确和盲语义超额更替分别为6.44和10.25个百分点,而精确匹配准确率仅变化-1.50个百分点。

8月23日周日
8月22日周六
8月21日周五
  1. Google Cloud:Databases(RSS)65

    AlloyDB ScaNN 如何将向量搜索扩展到 100 亿向量

    AlloyDB 的 ScaNN 索引现已支持超过 100 亿向量的规模,通过全新的四层树架构(预览版)实现,将查询复杂度从 O(N^1/2) 降至 O(N^1/4)。内部测试中,该架构在 100 亿向量规模下可实现 p95 延迟不超过 51 毫秒、召回率达 95%。该功能可通过快速入门指南部署,新用户可享受 30 天免费试用。

    推荐理由:四层树把搜索复杂度从 O(N^1/2) 逐级降到 O(N^1/4),配合内存优化让向量索引扩到百亿规模,这会影响依赖大规模向量检索的 RAG 应用在做容量规划时的性能假设。

  2. Mistral AI:News(网页)67

    Mistral 推出 Agentic Search:多步检索提升 AI 系统复杂文档查询准确率

    Mistral 发布 Agentic Search,通过 search、open、navigate、read、grep 五工具的多步检索循环,让模型在长文档与多来源中查找、定位并验证信息。

    推荐理由:相比一次性 RAG,五个检索工具让模型按需查证、打开和阅读原文,精度从 26.7% 升到 86%,说明检索质量开始取决于模型推理而非分块策略。

8月20日周四
8月19日周三
  1. ByteByteGo(RSS)50

    GraphRAG:AI 如何回答分散在多个文档中的问题

    标准 RAG 依赖向量相似度检索,适合答案集中在少数文档的局部查询,但在需跨全部文档归纳模式的全局查询上表现不佳。GraphRAG 通过构建知识图谱、社区检测与分层摘要应对此类问题,微软测试显示即便上下文窗口扩至 64,000 tokens,向量检索在全局问题的全面性、多样性和来源质量上仍有差距。

  2. HuggingFace Daily Papers(社区热门论文)39

    KBMR 论文提出基于 MLLM 的实体对齐检索器,提升 KB-VQA 检索与问答效果

    论文提出 KBMR,这是首个面向 KB-VQA 的基于 MLLM 的嵌入检索器,用连续语义蒸馏和 MLLM 语义判别器生成实体一致性权重,应对维基百科规模检索中的噪声监督。实验显示检索 Recall@1 提升最高 14.7%,端到端 VQA 准确率提升 9.4%,代码发布于 https://github.com/realHarryX/KBMR。

8月17日周一
  1. HuggingFace Daily Papers(社区热门论文)48

    跨模型记忆迁移:目标端读取器适配比冻结记忆本身更关键

    一项针对Engram式哈希记忆的跨模型迁移研究显示,冻结的记忆表只有在与目标模型对齐的读取器配合下才能发挥作用。在受控评估中,双层四分支读取器将跨模型复用与同模型复用的差距几乎抹平,平均得分38.8。当提供方读取器与目标接口直接兼容时,冻结记忆无需目标端训练即可提供效用,而可选适配可进一步提升对齐效果。

8月16日周日
  1. HuggingFace Daily Papers(社区热门论文)56

    ConceptFormer:面向视觉文档检索的查询-文档对齐自适应潜在概念学习框架

    ConceptFormer 提出一种潜在概念表示学习框架,将查询相关证据建模为连续、查询条件化的潜在概念,无需文本中间表示或原始视觉标注即可桥接局部视觉证据与语义相关性。在多个视觉文档检索基准上,其平均 NDCG@10 较最强视觉检索基线和最强 OCR 文本检索基线分别相对提升 16.7% 和 22.1%。代码与数据已公开。

8月15日周六
8月14日周五
  1. HuggingFace Daily Papers(社区热门论文)52

    LycheeMemory V2:面向LLM智能体的高效长期记忆框架

    哈尔滨工业大学(深圳)团队提出LycheeMemory V2,用语义片段级整合替代逐轮整合,降低LLM编码频率并保留细粒度证据。基于GPT-4.1-Mini的测试中,该框架在LoCoMo和LongMemEval-S上分别达到89.22%和92.20%的准确率,较A-Mem将构建token消耗降低86.0%和75.9%,且不增加查询时token用量。

8月13日周四
  1. HuggingFace Daily Papers(社区热门论文)53

    嵌入模型的两难:LLM 更强,但成本几何?

    一项研究对比了十款 LLM 与 26 款嵌入模型在 37 项任务上的表现,两者综合性能几乎持平(最佳 LLM 77.6 分 vs. 最佳嵌入模型 77.2 分)。但 LLM 成本高昂,单次基准测试最高贵 1,431 倍,且推理 token 占其推理成本的 28% 至 81%。研究建议:相似度、分类和聚类用嵌入模型,推理密集型检索用 LLM。

8月12日周三
8月11日周二
  1. HuggingFace Daily Papers(社区热门论文)45

    ReMEMBER:面向流式对话摘要的缺失证据记忆框架

    针对流式对话摘要中当前窗口常缺乏足够上下文的问题,研究提出ReMEMBER框架,通过基于未解析窗口依赖的检索和证据密集化记忆,在固定预算下从无限历史中恢复缺失证据。在长达160K token历史的对话实验中,ReMEMBER在相同预算下提升了记忆召回率和缺口解析完整性。

  2. HuggingFace Daily Papers(社区热门论文)53

    ENTLORE:面向企业问答中潜在组织推理的图基基准

    ENTLORE 是一个图基基准构建框架,从常规文档、组织表和运营记录中重建可审计的企业世界,用于测试模型从语料库中恢复隐含组织关系的能力。该基准包含 2,341 篇文档和 907 个问题,覆盖显式查找、跨源组合与潜在组织推理,已在 56 种模型与访问配置上评估。

8月8日周六
  1. MarkTechPost(RSS)68

    用 NVIDIA NeMo Retriever 构建多模态 RAG 流水线:托管 NIM、LanceDB、重排序与 grounded 生成

    本教程演示如何用 NVIDIA NeMo Retriever 构建多模态 RAG 流水线:先以 PDFium 离线提取 PDF 文本,再通过托管 NIM 端点检测页面元素、抽取表格/图表/信息图并生成稠密向量存入 LanceDB。随后实现稠密检索、视觉-语言重排序、元数据过滤搜索及带内联引用的 grounded 生成,并用 recall-at-k 评估检索质量。

8月7日周五
  1. HuggingFace Daily Papers(社区热门论文)55

    当上下文反噬:通过文档级注意力崩溃检测 RAG 投毒

    针对检索增强生成(RAG)的投毒攻击,现有基于困惑度与一致性检查的输出端检测方法常因攻击诱导的虚假置信而失效。研究者发现被攻击生成中注意力集中于投毒文档,熵值下降,形成名为 Attention Collapse 的独特信号,并据此提出轻量检测框架 D-SCAN。多攻击基准实验验证其有效性,且即便攻击未改变最终答案,D-SCAN 也能识别。

  2. HuggingFace Daily Papers(社区热门论文)42

    CoinRAG:面向长上下文 RAG 的上下文信息碎片 KV 缓存复用

    CoinRAG 提出一种面向长上下文 RAG 的 KV 缓存复用新方法,通过两阶段检索识别检索块中与查询相关的语义单元,并组合其切片 KV 表示与块级上下文,替代粗粒度的整块编码。在 LongBench 多跳问答任务上,该方法在标准快速预填充延迟预算下平均相对提升 5.3% 的答案质量(F1),并实现了新的帕累托前沿,显著降低运营成本。

8月5日周三
  1. HuggingFace Daily Papers(社区热门论文)47

    Wnuan:面向企业专有知识问答的分阶段后训练流程

    Wnuan 提出三阶段后训练流程,将企业文档转化为问答监督,经通用数据回放的监督微调与残差错误强化学习,在 707 题的 WnuanBench 上,32B 主路线可接受答案率从适配前的 52.76% 提升至 SFT 后的 80.06% 和 RL 后的 91.51%。残差错误采样比全池和规模匹配随机采样分别高 3.11 和 2.97 分,通用基准平均分下降 5.17 分。

8月3日周一
  1. LlamaIndex:产品、工程与评测63

    LlamaIndex 解析 LLM OCR:错误更安静了,但没有更少

    LlamaIndex 发布长文分析 LLM OCR 的核心风险:视觉证据弱时语言先验主导,模型会把读不清的数字替换成流畅但错误的值,或静默截断长表格,且没有逐字符置信度可供设阈值。

    推荐理由:原文拆解了 LLM OCR 的静默失败模式,并给出字段级溯源、验证循环等可落地的系统设计方法。