# Token Saver：用本地混合 RAG 将 Claude PDF token 消耗削减 92%-99% 的开源 MCP 扩展

- 来源：MarkTechPost（RSS）
- 作者：Arnav Rai,&nbsp;Jean-marc Mommessin&nbsp;and&nbsp;Asif Razzaq
- 发布时间：2026-07-30 15:43
- AIHOT 分数：74
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cms782fxi02w4ro2evmcwz6uj
- 原文链接：https://www.marktechpost.com/2026/07/30/token-saver-an-open-source-mcp-extension-using-local-hybrid-rag

## 精选理由

这个开源 MCP 扩展把 PDF token 成本砍掉 99%，本地运行还不传数据，对需频繁处理长文档的 Claude 用户是个实用方案。

## AI 摘要

Marktechpost AI 团队发布 Token Saver，一款面向 Claude Desktop 的开源 MCP 扩展，通过本地混合 RAG 在设备端检索 PDF，无需上传文件。该工具将 token 消耗削减 92%-99%，并保证数据隐私，设置无需 Python 环境或终端配置。

## 正文

AI 开发者、研究人员和专业人士在使用大语言模型分析大型文档时，常常会撞上一堵令人沮丧的墙：上下文窗口那隐蔽且不断累积的成本。把一个 200 页的 PDF 粘贴进对话，并不是一次性收费。因为每一轮对话都会把历史记录重新发送给模型，所以那份庞大的文档会在每一次追问时被再次计费。

Marktechpost AI 团队刚刚发布了 Token Saver，这是一个面向 Claude Desktop 的开源 Model Context Protocol（MCP）扩展（MIT 许可，当前版本为 v1.0）。它由 Arnav Rai（罗切斯特理工学院计算机科学专业学生）在 Marktechpost 实习期间，在 Jean-marc Mommessin 和 Asif Razzaq 的指导下，于 Marktechpost AI Media Inc 开发。Token Saver 从根本上改变了 Claude 与本地文档交互的方式。通过在你的机器上直接实现 Local Hybrid RAG 系统，它让你可以针对庞大的 PDF 提问，而无需将实际文件上传到模型。

Token 消耗削减了 92% 到 99%，隐私得到保障，而且设置完全不需要任何 Python 环境或终端配置。

效果展示！

大型 PDF 隐藏的 Token 消耗

大多数用户以为，把 PDF 拖进 Claude 后，它只是简单地提取文本。实际上，Claude 的默认行为是把每一页转换成图像，以保留图表和版式，同时另行提取文本。在哪怕一个图像 token 被计入之前，仅文本部分每页就可能达到 1,500 到 3,000 个 token。

虽然 Prompt Caching 和 Claude Projects 有助于缓解这一冲击，但它们并未解决核心问题：整份文档仍然要跨越边界，传到提供商的服务器上。此外，如果你只需要一本 1,000 页教材中的两个相关段落，却强迫 LLM 自己去检索全部 1,000 页，既低效又容易产生模型幻觉。

本地混合 RAG 如何解决这一问题

Marktechpost 的 Token Saver 充当一个本地 MCP server：一个运行在你机器上的轻量级后台程序，Claude 可以将其作为工具调用。PDF 永远不会离开你的硬盘。

当你提问时，Token Saver 会利用 本地混合 RAG 来寻找答案。混合 RAG 是文档检索的黄金标准，因为它结合了两种强大的搜索方法：

关键词匹配（BM25）：运行在 SQLite 内置的 FTS5 搜索之上（权重为 0.4），用于查找精确术语。

语义搜索（余弦相似度）：使用本地的 all-MiniLM-L6-v2 嵌入向量模型（权重为 0.6）来理解你问题的含义，而不仅仅是匹配精确的词。

通过在本地融合这两种方法，服务器会搜索文件，只把高度相关的段落交给 Claude。随后 Claude 综合出答案，引用确切的页码，并提供你刚刚节省下来的 token 的实时统计。

8 阶段处理流水线

Token Saver 完全运行在一个单一的、长期驻留的本地进程中。在任何文本到达 Claude 之前，本地混合 RAG 流水线会执行八个快速步骤：

提取：使用 pypdfium2（以 pypdf 作为回退）来提取文本。

分块：将文本切分为 180 词的段落，重叠 40 词，这样上下文就不会被生硬地截断。

评分（混合 RAG）：使用融合的 BM25 和本地嵌入向量模型对文本块进行评估。

门控：强制执行质量阈值。不共享任何精确关键词的段落必须通过 0.25 的语义相似度下限才能入选。

去重： 剔除几乎完全相同的段落。

裁剪： 将段落严格缩小到能够回答用户提示词的那些句子。

预算： 将发送给 Claude 的总载荷上限设为 8,000 个字符。

封装： 将检索到的文本包裹在一个 document-chunk 元素中，其中包含源文件和精确页码。

（注：嵌入向量模型是可选的，但推荐使用。如果加载失败，系统会优雅地回退到仅关键词匹配）。

数据：规模化下节省 99%

由于 Hybrid RAG 流水线限制了返回的文本切片，token 节省量会随着文档规模的增大而呈指数级增长。以下是 Token Saver 在基准测试中的表现（通过 tiktoken 测量，假设每份文档一个问题）：

文档页数整篇文档 token 数返回的 token 数节省的 Token

FDA 药品标签3323,9591,02195.7%

GDPR（欧盟 2016/679）8870,26099698.6%

SFFA 诉哈佛案233133,34974099.4%

免责声明：Token 计数使用 cl100k_base 作为替代，基线假设每次搜索都对整篇文档计费。

对于需要反复处理法院判决书、技术标准、财务报告或高密度教材的专业人士而言，Token Saver 消除了重复性的 token 税。

安全与本地隐私

对于企业用户和法律专业人士而言，数据隐私是不可妥协的。Token Saver 的安全模型建立在三大支柱之上：

零上传：文档永远不会离开你的机器。

文件夹白名单：你为 Token Saver 配置一个特定文件夹。服务器将主动拒绝读取该指定目录之外的文件。

网络隔离：服务器仅通过标准 I/O（stdio）与 Claude Desktop 通信。没有任何监听网络端口，从而大幅缩小了攻击面。

模型表现：Sonnet 与 Opus 对比

Marktechpost 的 Token Saver 在 Claude 3.5 的三个层级上均可运行，但测试揭示了不同的行为表现：

Claude 3.5 Sonnet（推荐）：稳妥的默认选择。它能完美处理松散的文件引用，当两个文件名称相似时会主动提出澄清性问题，并能正确应用检索到的页码。

Claude 3 Opus：擅长处理包含多种声音的复杂文档（例如含多数意见与异议的法律裁决）。Opus 足够聪明，当它基于上下文而非明确文本推断出归属时，会主动标记出来。

几分钟即可上手

与许多需要复杂 Python 环境和 JSON 配置的开源 AI 工具不同，Token Saver 打包为单个 .mcpb 捆绑包。

从项目的 GitHub Releases 页面下载 token-saver-ccr.mcpb。

打开 Claude Desktop -> Settings -> Extensions -> Install extension。

启用该扩展，点击 Configure，然后选择一个专门用于存放参考 PDF 的文件夹。

在首次提示时，选择 Always allow。

在选择文件夹之前，该扩展不会运行，因为这一选择同时服务于三个目的。

这个文件夹值得花点时间思考。它设定了可读取内容的边界，正是它让你可以按文件名请求文件，而不必输入路径，它也是对话开始时服务器向 Claude 展示的列表。一个只存放你打算询问内容的小文件夹，效果要比把它指向整个 Documents 文件夹好得多。

核心要点

大幅降低成本：通过使用本地混合 RAG 仅将相关段落传给 LLM，token 成本最多可降低 99%。对话越长，节省越多。

可验证的准确性：由于 Token Saver 会为每个检索到的片段附上准确的页码，你可以通过打开本地 PDF 立即验证 Claude 的说法。

绝对隐私：边界就是你的本地机器。你的专有数据永远不会被上传到 AI 提供商的服务器。

无摩擦安装：无需 Python。只需安装一个简单的 .mcpb 文件，即可在 Claude Desktop 中立即运行。

查看 GitHub Repo。

参考文献： MCP Bundle 格式 | all-MiniLM-L6-v2 | pdfkb-mcp | wesleygriffin/pdfrag | 语料库：Dobbs 诉 Jackson 妇女健康组织案；Berkshire Hathaway 2023 年度报告
