# IBM STAIR 用目录树检索替代碎纸式 RAG

- 来源：AYi (@AYi_AInotes)
- 发布时间：2026-09-13 15:35
- AIHOT 分数：48
- AIHOT 链接：https://aihot.news/items/cmtzi7d12033mrojehmlpinsy
- 原文链接：https://x.com/AYi_AInotes/status/2099039280827912318

## AI 摘要

IBM 论文提出 STAIR，用生成式检索让模型先读目录树再定位章节，在覆盖医学、金融、法律等 6 大领域 18 本教材的 SearchTome 基准上命中率达 82.6%，高于 BM25 的 59.5%、DPR 的 68.7% 和 DSI 的 76.9%。

## 正文

现行 RAG 架构犯过最反人类的错误，就是把一本结构严谨的书，撕成几千张碎纸条再去搜，把厚厚的法规、合同按 500 字切成碎纸条丢进向量库，

这根本不叫检索，这叫在碎纸机里碰运气，
IBM 刚挂出的这篇论文直接把窗户纸给捅破了：
人类查书从来都是先翻目录，把这个习惯教给模型，检索命中率从 68% 狂飙到 82.6%：

回顾一下现在全网知识库是怎么干活的：
把几百页的法律法规、员工手册、技术白皮书，机械地按 500 个 Token 暴力切碎、转成向量塞进向量库；
只要用户一提问，就在库里找几个最相似的碎片塞进 Prompt 里。
这种做法在工程上极其愚蠢：
因为在切碎的瞬间，章节从属、因果推导与上下文拓扑被全部物理切断；
大模型一看到长文本，就陷入著名的“迷失在中间（Lost in the middle）”，开始一本正经地凭空胡编。

真实人类查书从来不会这么干。
你查《刑法》不会撕成纸条去盲抽，而是先看目录：
民主制度 $\to$ 选举制度与政党 $\to$ 翻到对应小节精读。

IBM 团队刚挂出来的重磅论文 STAIR（arXiv:2609.03874），
用一种极度返璞归真的“生成式检索”，把这个人类常识做成了工业级系统：

看懂它的技术实现，你会发现它比盲目堆向量高维得多：

1️⃣ 提取真实目录树，以“小节”为最小单元：
直接从 PDF 提取完整的 Table of Contents，检索目标不再是切碎的碎片，而是作者亲笔写的叶子章节标题；
2️⃣ 约束解码，堵死幻觉：
拿 7B 小模型微调，输入是“整本目录树 + 你的问题”，输出只能是一个合法的章节名！
因为加了硬约束解码，模型根本没有机会去捏造不存在的伪章节，虚构章节的幻觉率从原生模型的 24% 断崖式砸到了不到 0.05%！
3️⃣ 硬核基准实测数据（拒绝营销夸大）：
在覆盖医学、金融、法律等 6 大领域的 18 本公开教材（SearchTome 基准）测试中：
• 传统关键词 BM25：命中率 59.5%
• 经典向量检索 DPR：命中率 68.7%
• 最强对照 DSI：命中率 76.9%
• IBM STAIR：直接干到了 82.6%！
（顺便打个假：网传所谓的“把 GraphRAG 摩擦”纯属吹牛，论文压根没测 GraphRAG，80.6% 也只是自然科学单科成绩，全科平均是 82.6%）。

当然，必须客观划清它的适用边界：
它极其适合教材、法规、合同、技术手册这类“本来就带着清晰层级标题”的大部头；
面对没有目录的乱麻 Slack 聊天记录或流水账网页，它也巧妇难为无米之炊。

但它证明了一个至关重要的工程哲学：
检索不准，才是大模型幻觉真正的上游水龙头；
别再迷信无限扩大的上下文窗口了，
教会大模型学会先读目录、再按图索骥去翻书，往往比无脑烧算力强上一万倍。
