跳到正文

#RAG

今日 0 条
9月25日周五
9月23日周三
  1. OpenRouter:Announcements(RSS)67

    OpenRouter 发布 2026 年最佳嵌入模型选型指南,覆盖 37 个目录条目

    OpenRouter 于 2026 年 9 月 11 日核实嵌入模型目录共 37 个条目,并通过自家 embeddings API 向 19 个模型发送批量请求、共 28 项检查,确认请求与响应行为。

    推荐理由:作者用自家 API 实测 19 个模型并按用例给出候选、价格与维度,读者可按输入类型和存储约束直接对照选型。

9月21日周一
9月18日周五
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)55

    OpenAI 发布 Astra for Law 法律行业基础方案

    OpenAI 发布 Astra for Law,将 GPT-6 Astra 配合法律搜索索引和 Legal 分析写作指令,面向律所和法律科技公司。在 Vals AI Legal Research Bench 私有验证集 200 道美国法律研究题上,最高推理强度下整体正确率 54.0%,比仅用网页搜索的 GPT-6 Astra 的 38.7% 相对提升 40%。

9月16日周三
  1. LlamaIndex:产品、工程与评测54

    LlamaIndex:为什么更好的抽取模型并不能缩小你的文档复核队列

    LlamaIndex 发文分析 OCR 文档处理中准确率与自动化率的关系,指出路由门控而非读取能力决定直通处理率。文中算例显示 20 个字段的发票在 97% 每字段准确率下仅约 54% 文档全对,94% 准确率但带每字段置信度的 Pipeline B 可自动放行 92% 文档,而 97% 准确但无信号的 Pipeline A 直通率为 0。

9月12日周六
9月11日周五
  1. LlamaIndex:产品、工程与评测65

    LlamaIndex 解析 just-in-time Agentic OCR:两遍式文档处理如何平衡成本与精度

    LlamaIndex 博客提出 just-in-time Agentic OCR 模式:先用 LiteParse 等免费解析器粗读全部文件供检索,再仅对相关页面调用 VLM 做 OCR。

    推荐理由:作者用 84 份 SEC 文件实测两遍式文档处理流程,给出明确的适用边界和成本数字,方法可直接迁移到自己的数据室场景。

9月7日周一
  1. Hacker News 热门(buzzing.cc 中文翻译)66

    vec2vec 论文提出无配对数据的嵌入翻译方法,向量数据库可被用于反推原文信息

    arXiv 论文(https://arxiv.org/abs/2505.12540)提出 vec2vec,这是首个无需配对数据、编码器或预定义匹配集就能在不同模型嵌入空间之间翻译文本嵌入的方法,基于柏拉图表示假说的强版本,用对抗损失与循环一致性学习共享潜在空间。

9月5日周六
  1. Aravind Srinivas35

    Perplexity 发布研究博客,讲解其嵌入与排序模型背后的 SoTA 服务基础设施。文章覆盖用于排序的嵌入向量、基于 GPU 的模型推理、请求批处理、推理服务器运行,以及延迟与吞吐的权衡,原文见 https://www.perplexity.ai/hub/blog/fast-embeddings-on-gpus。

    引用Perplexity@perplexity_ai

    Every answer in Perplexity starts with embedding and ranking models picking the most relevant results for the query. Today we published research on how we built SoTA serving infrastructure behind those models. Read the research: https://www.perplexity.ai/hub/blog/fast-embeddings-on-gpus

9月4日周五
  1. HuggingFace Daily Papers(社区热门论文)33

    PACE 数据集与 PaceMaker 框架:识别用户请求中的隐性冲突

    论文提出 PACE 数据集,评估模型能否识别由自我中心知识库事实构成的隐性约束,使看似合理的用户请求变得不恰当,并提出多智能体框架 PaceMaker,通过查询改写、多跳图遍历和冲突感知过滤协调检索决定性证据。实验同时评估证据检索质量与冲突判断准确率,PaceMaker 一致优于现有方法。

9月3日周四
  1. Meta Engineering Blog(RSS)53

    Meta 构建“组织第二大脑”AI Agent,从专家反馈中沉淀机构知识

    Meta 发布技术博客,介绍其为合规领域构建的 AI Agent,用结构化知识系统加可组合 recipes 复现专家推理方式,专家反馈经诊断、编译、验证和人工审核后写入 200+ 知识文件,无需重新训练模型。六周三轮开发后,单项评估时间从数天缩短到数分钟,改进周期内零回归,每轮修复自动加入回归测试集。

9月2日周三
  1. ByteByteGo(RSS)57

    RAG 系统效果为何取决于嵌入模型:ByteByteGo 图解检索机制与选型要点

    ByteByteGo 发文解析 RAG 系统中嵌入模型的关键作用,指出语言模型再强也无法弥补错误检索,因为嵌入模型决定了哪些文本进入上下文。文章图解了索引与检索两个阶段的工作流程,列举了语义相似但答非所问的多种失败模式,包括否定句、版本差异和数字标识等,并说明更换嵌入模型需要全量重建向量、索引和权限,成本高昂,类似蓝绿部署。

9月1日周二
  1. HuggingFace Daily Papers(社区热门论文)38

    CoGR:用强化学习共同进化查询与物品两侧的生成式检索器

    论文提出 CoGR 检索框架,训练 LLM 直接在查询侧和物品侧生成紧凑关键词集,经倒排索引直接匹配,兼容现有关键词检索基础设施。训练采用两阶段流程,先用监督微调对齐关键词空间,再用 GRPO 交替优化两侧生成器,双方共同优化同一 query-to-item 检索 F_1 目标。

8月31日周一
  1. HuggingFace Daily Papers(社区热门论文)41

    提出 agentic data cracking:让推理智能体自适应结构化非结构化数据以降低 token 成本

    论文提出 agentic data cracking,智能体在推理时以边际成本派生 cracking 子智能体,自适应且投机地把网页、报告、合同、PDF 等非结构化数据抽取为结构化形式。在 FanOutQA 基准上仅扩展每题一个相关问题,该方法在保持准确率的同时将成本降低 53%,且理想预结构化存储下推理比原方案便宜 28X。作者称这是面向智能体推理的下一代数据基础设施的第一步。

  2. HuggingFace Daily Papers(社区热门论文)43

    Hi-Q:面向多跳问答的层次化证据引导查询细化框架

    论文提出 Hi-Q,一种证据条件化的层次化查询细化框架,用于多跳问答中的可检索粒度发现问题。框架在查询节点用分辨率算子判断证据是否支持当前查询单元,未解决节点按依赖保持的二元算子扩展,并由语义覆盖验证器检查,查询树拓扑由语料支持信号决定。

8月30日周日
8月28日周五
  1. Hacker News 热门(buzzing.cc 中文翻译)75

    AI 工程师笔记本:在 Colab 上免费、无需框架即可使用 RAG/智能体/评估工具

    一套可运行的 Colab 笔记本,面向 AI 工程师与 FDE 技能栈,用原始 API 而非框架构建基于基础模型的系统,覆盖提示词、RAG、评估、智能体、微调与服务化。全部在免费 Groq API 上运行,无需信用卡;LoRA 微调和自托管服务提供概念讲解及可选的 Colab-GPU 附录。包含三个端到端案例研究,且全程兼容 OpenAI API,模式可直接迁移。

    推荐理由:裸 API 写一遍 agent 循环和 RAG,比直接套 LangChain 更能理解框架在封装什么,对于 AI 工程师面试中讲清系统设计和取舍有直接帮助。

  2. HuggingFace Daily Papers(社区热门论文)37

    零数据引导对话推荐系统的实证研究

    该论文系统研究了零数据对话推荐系统(CRS)引导方法,从商品评论、元数据和用户-商品交互等非对话信号生成合成对话监督数据。论文比较了 Jensen-Shannon 多样性和 Fisher 信息两种选择策略,发现领域合成数据一致优于零样本提示和朴素合成基线,主动选择比随机采样更省数据,低资源场景下合成数据可超越稀缺真实对话并与之互补。

  3. HuggingFace Daily Papers(社区热门论文)46

    ContextPilot:用细粒度强化学习教智能体主动管理上下文

    ContextPilot 提出一种面向长程智能体任务的主动上下文管理框架,通过扩充规划、长期记忆和软上下文卸载工具,并设计基于上下文与熵变化的细粒度 RL 方法,解决现有方法工具集受限、探索低效和信用分配粗糙的问题。在长上下文问答和深度搜索任务中,ContextPilot 以更紧凑的工作上下文取得更强性能,在多种基座模型和基准上持续优于现有基线。代码已开源。

  4. Josh Woodward55

    Google 推出跨部门计划 Expert Intelligence,用户可在 Gemini Notebook 中导入符合条件的 Google Play 电子书,将作者观点与其他来源结合,以全新方式与书籍互动。作者和出版商可通过该计划触达更多深度读者。

    引用Gemini Notebook@Gemini_Notebook

    Introducing Expert Intelligence ✨ A cross-@Google initiative that helps you engage with your trusted sources, starting with eligible @GooglePlay ebooks in Gemini Notebook. You can now combine expertise from your favorite authors with other sources and engage with your books in brand new ways! Try it out here: https://goo.gle/expertintelligence