跳到正文

#RAG

今日 0 条
7月31日周五
  1. HuggingFace Daily Papers(社区热门论文)71

    BM25 在大规模语料中胜出:检索增强生成范式的规模扩展研究

    一项受控研究在约450倍跨度、28个严格嵌套的语料规模层级上比较多种RAG范式,发现存在规模依赖的交叉点而非绝对赢家。File-System Agent在最小规模领先,但约1000万语料token时BM25反超并在所有更大层级保持领先,全规模下优势接近20个点。BM25还锚定了无需LLM构建的低成本帕累托前沿。

    推荐理由:这篇论文把词法、稠密、图检索和代理搜索放在同一个尺度下对比,发现数据规模越大,BM25越强,这很反直觉,做RAG应用的选型逻辑可能要变。

  2. HuggingFace Daily Papers(社区热门论文)65

    AskChem:面向化学文献综合的声明中心基础设施

    AskChem 将化学文献检索单元从论文转为带来源的声明,每篇论文被拆解为原子化、带类型的声明,并附有 DOI 和原文引用。该系统已索引 147K 篇论文中的 2.4M 条声明,提供网页界面及 REST、SDK、MCP 访问。在 AskChem-Bench 上,接入 AskChem 的 GPT-5.5 阅读器实现了 100% 可解析 DOI,而未检索时为 88.3%。

  3. HuggingFace Daily Papers(社区热门论文)80

    Zero-Mem:为 LLM 智能体实现零 token 记忆操作

    Zero-Mem 提出零 token 记忆操作,除最终问答外,记忆构建、检索与校准等所有环节均不调用 LLM 或消耗其输入输出 token,仅用编码器计算。该方法保留原始交互轨迹,通过实体-上下文图与时间层级双视图组织证据,在长记忆与长上下文问答基准上达到竞争性表现,并将记忆操作时间成本较最快基线降低 57.6%。代码将在同行评审后公开。

    推荐理由:Zero-Mem将记忆操作与LLM完全解耦,通过实体图和时序层级互补检索,在LoCoMo和HotpotQA上全面超越生成式记忆基线,效率提升明显,对Agent记忆系统设计有直接借鉴意义。

  4. HuggingFace Daily Papers(社区热门论文)65

    ExtractBench:面向企业文档模式引导抽取的基准

    ExtractBench 发布,成为首个同时评估值准确率、记录完整性、来源可追溯性与成本的模式引导抽取基准。其评测集涵盖 370 份企业文档、4,869 页、8 个业务领域和 67 种文档类型。商业 VLM 在短文档上表现良好但长文档易截断记录,LlamaExtract Agentic Plus 在全部三项指标上排名第一,准确率接近编码智能体且成本远低。

7月30日周四
  1. MarkTechPost(RSS)74

    Token Saver:用本地混合 RAG 将 Claude PDF token 消耗削减 92%-99% 的开源 MCP 扩展

    Marktechpost AI 团队发布 Token Saver,一款面向 Claude Desktop 的开源 MCP 扩展,通过本地混合 RAG 在设备端检索 PDF,无需上传文件。该工具将 token 消耗削减 92%-99%,并保证数据隐私,设置无需 Python 环境或终端配置。

    推荐理由:这个开源 MCP 扩展把 PDF token 成本砍掉 99%,本地运行还不传数据,对需频繁处理长文档的 Claude 用户是个实用方案。

7月29日周三
7月28日周二
  1. HuggingFace Daily Papers(社区热门论文)54

    视觉文档理解中的证据归因:无需坐标或区域标签的语言接口优于坐标接口

    一项研究发现,视觉语言模型在文档理解中通过坐标输出证据区域时,即使答案正确也常定位错误(归因幻觉)。在CiteVQA子集上对比六款开源模型,语言接口(模型直接引用原文,由布局解析器定位)的证据召回率从坐标接口的至多8%提升至26%-47%,幻觉率减半。基于此,研究提出无需区域标签的GRPO训练方法,将8B骨干模型的严格归因准确率从22.4提升至33.8。

7月27日周一
  1. HuggingFace Daily Papers(社区热门论文)76

    InMind 基准揭示智能体记忆系统的隐式关联盲点

    研究团队发布 InMind 基准,包含 125 个专家验证任务,测试智能体记忆系统处理隐式关联的能力。当关键记忆直接放入上下文时,骨干模型能回答 84.0% 的间接查询;但通过六种记忆系统检索时,命中率最高仅 14.4%,尽管这些系统直接召回准确率可达 100%。失败根源在于查询驱动的检索接口本身,将“路由——决定哪些事实必须保持可见”确立为核心开放问题。

    推荐理由:这个基准把agent记忆系统的一个盲点钉死了:需要联想才能提取的常识,当前检索几乎必漏。它指向一个结构性问题,做记忆的该认真看。

  2. HuggingFace Daily Papers(社区热门论文)44

    RARG 搜索智能体:将相关性转化为语料库交互的执行先导

    研究者提出 Relevance-Aware RipGrep Search Agent (RARG),将相关性评分转化为语料库交互的执行先导。RARG 通过粗到细的相关性引导——排序文档遍历顺序、初始化查询相关段落入口、重排 grep 匹配结果——在复杂问答和推理密集型检索任务中提升了准确率-效率边界。该方法展示了相关性感知交互能实现更快、更可靠的搜索收敛。

7月25日周六
7月24日周五
  1. Rohan Paul37

    一项新研究对比了原始导航、扁平技能与深层技能层级在长上下文智能体中的效果。在单本书场景下,强智能体本身搜索能力已足够,扁平技能几乎无准确率提升;但在20本书的大型知识库中,扁平技能将英文开放问题准确率从0.257提升至0.462。研究表明,技能索引并非让模型更聪明,而是在语料库过大时帮助节省上下文,且单层路由在大规模文档库中比深层层级更有效。

  2. HuggingFace Daily Papers(社区热门论文)50

    基于检索增强大语言模型的历史文档修复框架 ARI 发布

    韩国江原大学团队提出 ARI(Archive Restoration Intelligence),一种结合大语言模型隐式知识与检索增强生成(RAG)显式外部知识的框架,用于修复历史文档中因物理损坏而缺失的字符。在韩国历史文档上的实验表明,ARI 在恢复通用字符和命名实体上均显著优于基线模型,专家评估确认其可作为领域专家的实用工具。模型与代码已开源。

  3. HuggingFace Daily Papers(社区热门论文)49

    LAMAR:面向多语言检索的语言感知对齐重排序模型

    现有多语言重排序器在语义等价文档跨语言出现时,未能一致优先排序与查询同语言的文档。研究团队发布LAMAR,一种语言感知的多语言交叉编码器,通过英语锚定相关性蒸馏和语言一致性偏好对齐两阶段训练,在控制实验中所有语言的语言一致性指标上取得最佳表现,并在多语言重排序基准上保持竞争力。实际检索场景中,LAMAR在重排序第一阶段候选时所有报告指标均达最优。

7月23日周四
  1. HuggingFace Daily Papers(社区热门论文)67

    SetwiseEvalKit:面向文档集合交互质量的评测基准与优化框架

    研究者提出SetwiseEvalKit,一个覆盖短文本与长文本场景、包含约28K条高质量评估准则的三级九维度文档集合评测基准。对12种重排序器的评估显示,最佳方法覆盖率不足45%,跨文档协调维度普遍薄弱。基于此提出的免训练方法Rubric4Setwise将准则转化为集合选择信号,在更少文档和搜索轮次下取得最优下游生成性能,是唯一在两个场景均保持SOTA的方法。

  2. HuggingFace Daily Papers(社区热门论文)72

    Agentic Context Management:将智能体记忆与成本问题重构为生命周期与架构挑战

    论文提出 Agentic Context Management(ACM)框架,将智能体上下文管理从存储问题重新定义为包含架构、摄取、范围界定、预判、压缩与整合五个原语的生命周期管理。

    推荐理由:这篇论文把代理记忆从‘存什么’重新表述为‘管什么’的生命周期问题,五个原语和线性成本论证,对做生产级代理的团队有直接的架构启发。

7月21日周二
  1. HuggingFace Daily Papers(社区热门论文)50

    FinanceComplexQA:面向工业级金融文档的智能体推理评测基准

    微软与中国高校团队推出 FinanceComplexQA,一个针对工业级金融文档的开放式生成评测基准,包含 2,026 项深度研究任务,覆盖 1009 份真实金融文档。该基准支持双语、六大场景与七类任务,采用 Agent-as-a-Judge 多指标评估。团队还提出 Finance-LaTeX SKILL 多智能体框架,可自动合成 2,000 份金融文档与 6,000 个问答对,用于扩展基准。

7月18日周六
7月17日周五
  1. MarkTechPost(RSS)70

    NVIDIA 发布 Nemotron 3 Embed 系列,8B 版本在 RTEB 基准上排名第一

    NVIDIA 发布 Nemotron 3 Embed 系列,包含三个开源 checkpoint,其中 8B-BF16 版本在 RTEB 基准上以 78.46 的平均 NDCG@10 排名第一。1B-NVFP4 版本在 Blackwell 上吞吐量比 BF16 高 2 倍,精度保留 99.5%,所有模型最大序列长度 32,768 tokens。

    推荐理由:嵌入模型不是最热的赛道,但决定了你 Agent 看到什么——NVIDIA 把 1B 模型压缩到 RTEB 第二,NVFP4 量化后精度几乎不变,做 RAG 的值得换上。

7月16日周四
  1. OpenBMB37

    清华大学 OpenBMB 联合多所高校提出 KARE-RAG,不优化检索器,而是训练生成器在噪声上下文中鲁棒地利用信息。该方法将生成分解为知识图谱构建、链式推理和答案生成三步,并引入 DDPO(密集直接偏好优化)解决结构化输出中标准 DPO 的权重浪费问题。在 Llama-3.1-8B 上,KARE-RAG 实现跨领域 EM +4.18%、F1 +3.52%,且无需改动标准 RAG 推理管线。

  2. Apple Machine Learning Research(RSS)40

    Apple 提出 CLaRa:用连续潜在推理桥接检索与生成

    Apple 机器学习研究团队提出 CLaRa,一种通过连续潜在推理桥接检索与生成的新方法。该方法在检索增强生成(RAG)中引入连续潜在空间,使模型在生成答案前先进行隐式推理,从而缓解长上下文带来的性能下降。CLaRa 在多个知识密集型基准上提升了 LLM 的准确率与效率。

7月15日周三
7月13日周一
  1. 凡人小北40

    阿里云推出《金融行业Agent百技图》2026版,相比去年《百景图》聚焦“有哪些Agent可做”,新版重点回答生产级金融Agent的构建方法。全书覆盖通用智能体架构、金融级安全与治理,并拆解理财经理、信贷风控、保险核保理赔、投研等具体岗位,同时开源100个已落地的金融Skill。电子版及开源Skills链接见评论区。

    引用凡人小北@frxiaobei

    挺好的一本书,没想到竟然能把 Agent 做得这么细、这么落地。建议收藏,常看常新。 阿里云这份《金融行业 Agent 百景图》真的太全太实了,把过去一年在银行、证券、保险里做的大模型落地实践梳理成册,200 多个 Agent 案例,干货密度超高。 比如智能投研怎么跑,客服怎么加 AI,风控怎么做合规验证,甚至连监管辅助 Agent 都写出来了;全程围绕 MoA(Mixture of Agents)+ RAG 架构,搭配工具链 + 多模态,完全就是一本金融 AI 工程化说明书。 如果你是已经在做金融 AI 的,看这个能找到方向参考; 如果你是对金融感兴趣、但不知道 AI 能干嘛、或者 Agent 怎么落地的,这份可以直接抄,照着做都行。 哪怕你是其他行业,只要在想“我这行业 AI Agent 能干嘛”,这份也能提供非常多可迁移的思路,值得好好读一遍。 电子版链接放评论区,建议收藏一份,做 AI 的别错过,做金融的更得看。

  2. HuggingFace Daily Papers(社区热门论文)54

    RAGU:一种采用紧凑领域自适应大语言模型的多步GraphRAG引擎

    RAGU 开源模块化 GraphRAG 引擎通过两阶段类型化抽取、DBSCAN 去重和 Leiden 社区检测,解决了单次抽取带来的噪声实体问题。其训练的 7B 参数 Meno-Lite-0.1 模型在知识图谱构建上超越 Qwen2.5-32B(相对调和平均提升 12.5%),在 GraphRAG-Bench(Medical)上证据召回率达 0.84。

7月11日周六
  1. ByteByteGo(RSS)41

    Docker 底层工作原理

    Docker 容器本质上是拥有独立命名空间的普通 Linux 进程。Docker CLI 通过 API 将命令发送给 dockerd,dockerd 再调用 containerd 和 runc 来创建隔离环境并启动进程。

  2. HuggingFace Daily Papers(社区热门论文)42

    GRASP:面向智能体RAG的粒度感知搜索策略

    研究者提出GRASP,一个基于强化学习的框架,训练AI智能体在多步推理中自适应协调语义搜索、关键词搜索和段落阅读三种检索工具。GRASP通过联合奖励函数优化答案准确率、证据溯源和检索效率,在多跳推理基准上相比单步检索和提示式智能体RAG显著提升了检索召回率和下游问答性能。学习到的策略展现出可解释的扫读与精读行为:语义搜索用于广泛探索,段落阅读用于局部验证,关键词搜索用于实体证据定位。

7月10日周五
  1. elvis55

    Meta 新研究聚焦长周期 AI 智能体的“行为状态衰减”问题——任务事实、先前尝试和未完成子目标在上下文窗口中被埋没或超出范围,导致后续动作失效。研究团队提出在未修改的动作智能体外并行运行一个独立记忆智能体,维护结构化记忆库,每步决定是否注入基于记忆的提醒。该模块即插即用,兼容前沿智能体和现有框架。在 Terminal-Bench 2.0 和 tau-squared-Bench 上,该方法提升了弱和强动作智能体的 pass@1 指标。研究认为,主动在正确时机呈现正确事实的记忆,比被动检索更有效。

  2. Hacker News 热门(buzzing.cc 中文翻译)68

    DocuBrowse v0.9.1 发布

    DocuBrowse v0.9.1 已打包为 Linux(RPM、DEB、tarball)、Windows(zip)和 macOS(dmg)。该工具将 PDF、EPUB、Word 等文档转化为可搜索的知识库,支持 SQLite FTS5 关键词搜索和 Ollama(nomic-embed-text)语义搜索,默认混合模式(70% 语义 + 30% 关键词)。点击文档标题可调用 dolphin3 模型生成 AI 摘要并缓存。内置 PII 扫描可检测并移除身份证号、信用卡等敏感信息。完全离线运行,无需网络、账户或 API 密钥。界面含暗/亮主题、分页结果、标签云筛选和 0–100% 相关性评分。支持多种文档和源代码格式。

7月9日周四
  1. Artificial Intelligence News(网页)52

    AWS GraphRAG 部署将药物研发周期缩短 87%

    近日,AWS 基于 Neptune Analytics 与 Bedrock 构建的 GraphRAG 方案,将制药企业研发周期缩短 87%。系统整合此前隔离的专有数据库与 PubMed 等公开资料,通过 Amazon Comprehend Medical 抽取医疗编码,由 Bedrock 上的 Claude 4.5 Sonnet 总结文档并判断主题相关性,最终形成可查询的知识图谱。早期企业用户数据显示:初始发现阶段从 6 个月降至 3 周,数据检索速度提升 85%,研究评审时间减少 70%。每个回答附带可验证引文和图谱遍历路径。标准架构(16 个预配内存单元)运行成本为每小时 $0.48,开发环境使用 t3.medium 实例。系统支持模块化替换语言模型或图结构。

7月7日周二
  1. Hacker News 热门(buzzing.cc 中文翻译)64

    Kapa 在 RAG 流程中插入小型 LLM 修剪器,丢弃 68% 上下文并保持 96% 召回率

    Kapa 在检索器与生成器之间加入一个廉价小型 LLM,将其作为修剪器。该 LLM 对问题与所有检索到的文档块进行列表式评分(五级尺度:ESSENTIAL/CONTRIBUTING/SUPPORTING/TANGENTIAL/UNRELATED),丢弃评分低于阈值的块。该方法丢弃约 68% 的上下文,同时保持约 96% 的召回率,并使得单次查询的净成本降低约三分之一。与基于重排序分数的固定截断或锚点方法不同,该设计同时评估所有块,解决了块间组合相关性无法被点式评分判断的问题。

  2. HuggingFace Daily Papers(社区热门论文)44

    VaseMuseum:面向古希腊陶器的数字智能博物馆框架

    针对视觉语言模型(VLM)在文化遗产领域开源解释证据不可靠、证据不完整时产生自信但无依据回答的问题,研究者提出VaseMuseum——一个轻量级模块化多模态智能体框架。该框架结合交互式虚拟博物馆与VaseAgent,支持2D图像和3D文物多模态感知、3D感知推理、外部知识检索及推理时可靠性控制。VaseAgent从权威网站和博物馆知识源检索证据,通过源级控制选择多样且可验证的证据;响应级控制将生成内容与证据库比对,在支持不足或冲突时鼓励中立、有证据边界的回答。此外,一种免训练的GRPO风格选择机制在不更新VLM主干的情况下,优先选择具有有效引用和校准置信度的响应。实验表明,VaseMuseum相比启用搜索的VLM基线,提升了引用有效性,减少了知识密集型查询的模型幻觉,并在模糊情况下产生更中立的回答。

7月6日周一
  1. Hacker News 热门(buzzing.cc 中文翻译)56

    Phosphor数字学习平台:AI评分测验嵌入教学文本实现0.71–1.30标准差效果量

    Phosphor平台将LLM评分的形成性测验嵌入教学文本,在达特茅斯学院三节统计导论课程中与151名学生部署。完成全部Phosphor内容与期末考试成绩提升0.71标准差(调整先前考试成绩后)至1.30标准差(未调整)相关。90.2%注册学生采用了这一完全可选、不计分的替代传统阅读方式,远超典型阅读完成率。嵌入式问答题(CRQ)由AI自动评分,与多项选择题混合呈现(40% CRQ,60% MCQ),支持无限次重试。平台还提供RAG聊天助手和累积模块复习测验。结果表明高参与度和可测量效能可以同时实现。

7月5日周日
  1. MarkTechPost(RSS)72

    LlamaIndex 发布 legal-kb:基于 Index v2 的智能体检索参考应用

    LlamaIndex 发布 legal-kb,一个基于 Index v2(LlamaParse Platform)的法律文档知识库参考应用。采用 Retrieval Harness 模式,赋予 Agent 四个文件系统风格工具:retrieve(混合语义检索,支持 rerank 和引用)、findFiles(精确/模糊文件名搜索)、readFile(带偏移量的原始内容读取)和 grepFile(正则匹配并返回字符位置)。Agent 需先调用 findFiles 确定文件清单,再依次使用其他工具定位内容。底层基于 Vercel AI SDK 6 的 ToolLoopAgent,可选用 OpenAI 或 Anthropic 模型,支持用户自带 API key。项目以 TanStack Start web app 形式运行,上传文件自动解析索引,同一文件名重复上传可产生版本,检索时通过版本元数据字段过滤。

    推荐理由:LlamaIndex 把 RAG 从一次搜索变成了‘先找文件、再搜、再读、再 grep’的多步循环,对做合同审查、尽调的团队来说是个可抄的模板。

  2. MarkTechPost(RSS)57

    结构化PDF到JSON:2026年开源提取模型指南

    开源文档提取分为schema驱动的字段提取和文档结构解析两类。Datalab lift(9B视觉模型,基于Qwen 3.5)在225文档基准上达90.2%字段准确率、9.5秒中位延迟,代码Apache-2.0,权重使用修改版OpenRAIL-M。NuMind推出NuExtract 3(4B视觉语言模型),支持结构化提取和内容提取,通过vLLM提供OpenAI兼容API。IBM Docling(MIT许可)可解析PDF/DOCX/PPTX/HTML等,集成LangChain、LlamaIndex。Granite-Docling-258M在A100上约0.35秒/页(Apache-2.0)。OpenDataLab MinerU改用MinerU开源许可(基于Apache 2.0),支持复杂布局解析。Datalab Marker管道支持PDF/图片/PPTX/DOCX等转Markdown/JSON。

7月3日周五
  1. HuggingFace Daily Papers(社区热门论文)43

    Bibby AI:面向学术研究、写作与出版的编辑器原生智能体平台

    Bibby AI 是一个基于云端 LaTeX 编辑器的编辑器原生平台,将文献发现、引用管理、写作、格式排版与投稿整合为单一 Research-Write-Publish 流水线。平台拥有完整文档状态、编译管道和修订历史,智能体可直接对文档抽象语法表示执行检索增强的引文插入、结构编辑和模板合规重新格式化。集成 PDF、DOCX 及手写数学公式转 LaTeX 的摄取管道;检索层从 USPTO PatentsView 和 Marx-Fuegi 引文语料库获取专利-论文引用信号,揭示候选参考文献的转化影响。任务范围智能体支持文献筛选、起草、修订和会议格式排版。Bibby AI 已投入生产,服务超过 50 所订阅高校的 5,000 余名活跃研究者。

  2. MarkTechPost(RSS)63

    RAG-Anything 教程:在 Colab 中构建文本、表格、公式和图像的多模态检索管道

    本教程使用 RAG-Anything 搭建多模态检索工作流,可检索文本、表格、公式和图像。首先在 Colab 中安装依赖并修复 Pillow 版本,通过 OpenAI API key 配置对话、视觉和嵌入函数。接着生成包含图表和 PDF 的合成多模态报告,将其转为 content_list 格式并插入检索系统。最后配置并测试 naive、local、global 和 hybrid 四种检索模式。环境变量包括 CHUNK_SIZE=900、CHUNK_OVERLAP_SIZE=120,便于在笔记本中复现。