Databricks 如何用结构化图表提取增强智能体检索
Databricks 提出通过结构化图表提取来增强智能体检索能力,帮助智能体更准确地理解企业文档中的图表数据。该方法将图表内容转化为结构化格式,使检索系统能更高效地定位和引用关键信息,从而提升智能体在复杂业务场景中的回答质量与可靠性。
Databricks 提出通过结构化图表提取来增强智能体检索能力,帮助智能体更准确地理解企业文档中的图表数据。该方法将图表内容转化为结构化格式,使检索系统能更高效地定位和引用关键信息,从而提升智能体在复杂业务场景中的回答质量与可靠性。
Cohere 推出 Parse 5 文档解析模型,主打市场最强性价比。此前企业需在高成本高精度解析与低成本有损解析间取舍,Parse 5 以行业最低每页价格实现高质量解析,适合大规模企业数据处理。
Introducing Cohere Parse 5. Our newest document parsing model with the strongest price-performance on the market. Ideal for high-volume enterprise work. Get high-quality parsing accuracy while keeping per-page prices at an industry low.
推出 Cohere Parse 5。这是我们最新的文档解析模型,拥有市场上最强的性价比。 非常适合高吞吐量的企业工作。在保持每页价格处于行业低位的同时,获得高质量的解析准确率。
Cohere 发布面向企业文档的视觉语言模型 Parse,可将多模态文件转为结构化 Markdown,支持表格、图片理解和 9 种主要语言。
多数团队把 RAG 架构复杂化了,直接上嵌入、向量数据库和重排序,而用户往往只想找到“如何重置密码”这类文档。文章给出决策因素与分层方案:从纯全文检索(BM25)起步,再引入智能体查询改写(约 $0.001/次,用 GPT-4o-mini),仅在数据证明需要时才升级。对专有术语(如内部框架“Atlas”),精确关键词匹配优于语义理解。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,支持 ColBERT 风格的后交互检索,并配套完整训练流程。
推荐理由:文章量化了不同起点的领域适应差距,未监督预训练 checkpoint 反超已微调版本,并把长文档截断列为比架构更影响 NDCG 的因素。
LatticeDB 是一款单文件嵌入式属性图数据库,可在同一查询层中同时进行图遍历、HNSW 向量相似度搜索和 BM25 全文检索,无需服务器和配置。它面向单机关系密集型工作负载,提供 WAL 持久化和内置图变更流,支持 Graph RAG、智能体记忆等场景。性能方面,节点查找 0.13 μs,100 万向量下向量搜索 0.83 ms 且召回率 100%。
OpenWiki 利用证据支撑的声明来检测过时知识、减少模型幻觉,并为不断演进的代码库构建自纠错记忆。该方法通过将知识声明与可验证证据关联,使系统能自动识别并修正已失效的信息,从而提升长期记忆的准确性与可靠性。
WorkBuddy 现已连接 @NotionHQ。 将你散落在 Notion 工作区的文档、笔记和知识,汇入 WorkBuddy 中的答案与操作。 你的工作区变得更加互联。
一项新研究指出,RAG 系统在证据利用测量和上下文预算分配上存在瓶颈,并提出因果留一法探针替代标准相关性代理,以准确识别生成依赖。研究发现,单一扩大上下文窗口会因相关性衰减而失效,而跨多次顺序生成迭代分配计算可将组合召回率提升 16.7–20.5 个百分点,且可扩展至 32B 模型。相关代码、数据和因果测量工具已开源。
Industrial-Instruction框架利用906份松下公开技术文档构建了两个开放QA数据集,各含约13.6k问答对。用该数据微调小于10B参数的开源LLM,在松下基准上将Set-Match Accuracy从28.5%提升至42.0%,F1从46.6%提升至63.5%。
研究测试了实体图谱链接与迭代改写两种 RAG 扩展在 ASR 输入下的表现。在 HotpotQA、2WikiMultiHopQA 和 MuSiQue 三个多跳问答基准上,两种扩展均放大错误:干净文本与最高 WER 口音间的 F1 差距比朴素稠密检索大 36-67%。查询实体损坏是主要失败模式,占 2WikiMultiHopQA 上 87-96% 的退化案例。
检索增强问答系统在索引扩展后可能返回不同答案,即便模型标识、提示词、检索策略等设置完全固定。研究提出快照兼容性审计,通过从跨快照分歧中减去同快照重复分歧来估算超额答案更替。在400题Natural Questions预注册研究中,归一化精确和盲语义超额更替分别为6.44和10.25个百分点,而精确匹配准确率仅变化-1.50个百分点。
本教程演示如何用 deepDoctection 搭建端到端文档智能流水线,涵盖布局分析、DocTR OCR 与表格抽取的配置。同时展示如何为实体识别实现自定义服务,并为 RAG 工作流生成结构化 JSONL 数据。
AlloyDB 的 ScaNN 索引现已支持超过 100 亿向量的规模,通过全新的四层树架构(预览版)实现,将查询复杂度从 O(N^1/2) 降至 O(N^1/4)。内部测试中,该架构在 100 亿向量规模下可实现 p95 延迟不超过 51 毫秒、召回率达 95%。该功能可通过快速入门指南部署,新用户可享受 30 天免费试用。
推荐理由:四层树把搜索复杂度从 O(N^1/2) 逐级降到 O(N^1/4),配合内存优化让向量索引扩到百亿规模,这会影响依赖大规模向量检索的 RAG 应用在做容量规划时的性能假设。
Mistral 发布 Agentic Search,通过 search、open、navigate、read、grep 五工具的多步检索循环,让模型在长文档与多来源中查找、定位并验证信息。
推荐理由:相比一次性 RAG,五个检索工具让模型按需查证、打开和阅读原文,精度从 26.7% 升到 86%,说明检索质量开始取决于模型推理而非分块策略。
标准 RAG 依赖向量相似度检索,适合答案集中在少数文档的局部查询,但在需跨全部文档归纳模式的全局查询上表现不佳。GraphRAG 通过构建知识图谱、社区检测与分层摘要应对此类问题,微软测试显示即便上下文窗口扩至 64,000 tokens,向量检索在全局问题的全面性、多样性和来源质量上仍有差距。
论文提出 KBMR,这是首个面向 KB-VQA 的基于 MLLM 的嵌入检索器,用连续语义蒸馏和 MLLM 语义判别器生成实体一致性权重,应对维基百科规模检索中的噪声监督。实验显示检索 Recall@1 提升最高 14.7%,端到端 VQA 准确率提升 9.4%,代码发布于 https://github.com/realHarryX/KBMR。
一项针对Engram式哈希记忆的跨模型迁移研究显示,冻结的记忆表只有在与目标模型对齐的读取器配合下才能发挥作用。在受控评估中,双层四分支读取器将跨模型复用与同模型复用的差距几乎抹平,平均得分38.8。当提供方读取器与目标接口直接兼容时,冻结记忆无需目标端训练即可提供效用,而可选适配可进一步提升对齐效果。
ConceptFormer 提出一种潜在概念表示学习框架,将查询相关证据建模为连续、查询条件化的潜在概念,无需文本中间表示或原始视觉标注即可桥接局部视觉证据与语义相关性。在多个视觉文档检索基准上,其平均 NDCG@10 较最强视觉检索基线和最强 OCR 文本检索基线分别相对提升 16.7% 和 22.1%。代码与数据已公开。
OpenRouter 发布视觉指南,详解通过 Chat Completions API 向多模态模型发送图像的方法。请求体采用 messages 数组,用户消息的 content 包含 text 和 image_url 两部分,支持公开 URL 或 base64 数据 URL 两种格式,兼容 PNG、JPEG、WebP 和 GIF。
哈尔滨工业大学(深圳)团队提出LycheeMemory V2,用语义片段级整合替代逐轮整合,降低LLM编码频率并保留细粒度证据。基于GPT-4.1-Mini的测试中,该框架在LoCoMo和LongMemEval-S上分别达到89.22%和92.20%的准确率,较A-Mem将构建token消耗降低86.0%和75.9%,且不增加查询时token用量。
一项研究对比了十款 LLM 与 26 款嵌入模型在 37 项任务上的表现,两者综合性能几乎持平(最佳 LLM 77.6 分 vs. 最佳嵌入模型 77.2 分)。但 LLM 成本高昂,单次基准测试最高贵 1,431 倍,且推理 token 占其推理成本的 28% 至 81%。研究建议:相似度、分类和聚类用嵌入模型,推理密集型检索用 LLM。
ParliamentRAG 是为意大利众议院设计的 RAG 系统,通过主题相关的权威模型,根据当前查询估算每位发言者的权威度,综合职业、教育背景及过往发言等可解释因素,以缓解议会文本中高频发言者主导、无法按专业加权及引用归属错误等问题。
针对流式对话摘要中当前窗口常缺乏足够上下文的问题,研究提出ReMEMBER框架,通过基于未解析窗口依赖的检索和证据密集化记忆,在固定预算下从无限历史中恢复缺失证据。在长达160K token历史的对话实验中,ReMEMBER在相同预算下提升了记忆召回率和缺口解析完整性。
ENTLORE 是一个图基基准构建框架,从常规文档、组织表和运营记录中重建可审计的企业世界,用于测试模型从语料库中恢复隐含组织关系的能力。该基准包含 2,341 篇文档和 907 个问题,覆盖显式查找、跨源组合与潜在组织推理,已在 56 种模型与访问配置上评估。
本教程演示如何用 NVIDIA NeMo Retriever 构建多模态 RAG 流水线:先以 PDFium 离线提取 PDF 文本,再通过托管 NIM 端点检测页面元素、抽取表格/图表/信息图并生成稠密向量存入 LanceDB。随后实现稠密检索、视觉-语言重排序、元数据过滤搜索及带内联引用的 grounded 生成,并用 recall-at-k 评估检索质量。
针对检索增强生成(RAG)的投毒攻击,现有基于困惑度与一致性检查的输出端检测方法常因攻击诱导的虚假置信而失效。研究者发现被攻击生成中注意力集中于投毒文档,熵值下降,形成名为 Attention Collapse 的独特信号,并据此提出轻量检测框架 D-SCAN。多攻击基准实验验证其有效性,且即便攻击未改变最终答案,D-SCAN 也能识别。
CoinRAG 提出一种面向长上下文 RAG 的 KV 缓存复用新方法,通过两阶段检索识别检索块中与查询相关的语义单元,并组合其切片 KV 表示与块级上下文,替代粗粒度的整块编码。在 LongBench 多跳问答任务上,该方法在标准快速预填充延迟预算下平均相对提升 5.3% 的答案质量(F1),并实现了新的帕累托前沿,显著降低运营成本。
一项研究将 NVIDIA Nemotron 检索栈端到端适配至现代希腊语,覆盖语料挖掘、检索训练、重排器适配与阅读器微调。微调后 Nemotron 1B 嵌入器 nDCG@10 从 0.362 提升至 0.835,LoRA 微调的 Nemotron 30B-A3B 阅读器将答案正确率从 29.4% 提升至 66.9%。
PixelRAG 是一套端到端系统,将网页和 PDF 视为图像处理,突破传统基于文本的解析方式。教程覆盖从渲染、切片到多模态嵌入与混合搜索的完整流程,帮助开发者构建高性能的视觉文档检索系统。
Wnuan 提出三阶段后训练流程,将企业文档转化为问答监督,经通用数据回放的监督微调与残差错误强化学习,在 707 题的 WnuanBench 上,32B 主路线可接受答案率从适配前的 52.76% 提升至 SFT 后的 80.06% 和 RL 后的 91.51%。残差错误采样比全池和规模匹配随机采样分别高 3.11 和 2.97 分,通用基准平均分下降 5.17 分。
LlamaIndex 发布长文分析 LLM OCR 的核心风险:视觉证据弱时语言先验主导,模型会把读不清的数字替换成流畅但错误的值,或静默截断长表格,且没有逐字符置信度可供设阈值。
推荐理由:原文拆解了 LLM OCR 的静默失败模式,并给出字段级溯源、验证循环等可落地的系统设计方法。