现行 RAG 架构犯过最反人类的错误,就是把一本结构严谨的书,撕成几千张碎纸条再去搜,把厚厚的法规、合同按 500 字切成碎纸条丢进向量库,
这根本不叫检索,这叫在碎纸机里碰运气, IBM 刚挂出的这篇论文直接把窗户纸给捅破了: 人类查书从来都是先翻目录,把这个习惯教给模型,检索命中率从 68% 狂飙到 82.6%:
回顾一下现在全网知识库是怎么干活的: 把几百页的法律法规、员工手册、技术白皮书,机械地按 500 个 Token 暴力切碎、转成向量塞进向量库; 只要用户一提问,就在库里找几个最相似的碎片塞进 Prompt 里。 这种做法在工程上极其愚蠢: 因为在切碎的瞬间,章节从属、因果推导与上下文拓扑被全部物理切断; 大模型一看到长文本,就陷入著名的“迷失在中间(Lost in the middle)”,开始一本正经地凭空胡编。
真实人类查书从来不会这么干。 你查《刑法》不会撕成纸条去盲抽,而是先看目录: 民主制度 $\to$ 选举制度与政党 $\to$ 翻到对应小节精读。
IBM 团队刚挂出来的重磅论文 STAIR(arXiv:2609.03874), 用一种极度返璞归真的“生成式检索”,把这个人类常识做成了工业级系统:
看懂它的技术实现,你会发现它比盲目堆向量高维得多:
1️⃣ 提取真实目录树,以“小节”为最小单元: 直接从 PDF 提取完整的 Table of Contents,检索目标不再是切碎的碎片,而是作者亲笔写的叶子章节标题; 2️⃣ 约束解码,堵死幻觉: 拿 7B 小模型微调,输入是“整本目录树 + 你的问题”,输出只能是一个合法的章节名! 因为加了硬约束解码,模型根本没有机会去捏造不存在的伪章节,虚构章节的幻觉率从原生模型的 24% 断崖式砸到了不到 0.05%! 3️⃣ 硬核基准实测数据(拒绝营销夸大): 在覆盖医学、金融、法律等 6 大领域的 18 本公开教材(SearchTome 基准)测试中: • 传统关键词 BM25:命中率 59.5% • 经典向量检索 DPR:命中率 68.7% • 最强对照 DSI:命中率 76.9% • IBM STAIR:直接干到了 82.6%! (顺便打个假:网传所谓的“把 GraphRAG 摩擦”纯属吹牛,论文压根没测 GraphRAG,80.6% 也只是自然科学单科成绩,全科平均是 82.6%)。
当然,必须客观划清它的适用边界: 它极其适合教材、法规、合同、技术手册这类“本来就带着清晰层级标题”的大部头; 面对没有目录的乱麻 Slack 聊天记录或流水账网页,它也巧妇难为无米之炊。
但它证明了一个至关重要的工程哲学: 检索不准,才是大模型幻觉真正的上游水龙头; 别再迷信无限扩大的上下文窗口了, 教会大模型学会先读目录、再按图索骥去翻书,往往比无脑烧算力强上一万倍。