#RAG
#RAG
今日 0 条
Rohan Paul@rohanpaul_aiAI 评分5555
Hacker News 热门(buzzing.cc 中文翻译)AI 评分6666 vec2vec 论文提出无配对数据的嵌入翻译方法,向量数据库可被用于反推原文信息
arXiv 论文(https://arxiv.org/abs/2505.12540)提出 vec2vec,这是首个无需配对数据、编码器或预定义匹配集就能在不同模型嵌入空间之间翻译文本嵌入的方法,基于柏拉图表示假说的强版本,用对抗损失与循环一致性学习共享潜在空间。
HuggingFace Daily Papers(社区热门论文)AI 评分3333 PACE 数据集与 PaceMaker 框架:识别用户请求中的隐性冲突
论文提出 PACE 数据集,评估模型能否识别由自我中心知识库事实构成的隐性约束,使看似合理的用户请求变得不恰当,并提出多智能体框架 PaceMaker,通过查询改写、多跳图遍历和冲突感知过滤协调检索决定性证据。实验同时评估证据检索质量与冲突判断准确率,PaceMaker 一致优于现有方法。
HuggingFace Daily Papers(社区热门论文)AI 评分3838 CORE 论文提出用重排器蒸馏改进多模态嵌入的组合推理
论文提出 CORE,通过合成五个组合匹配级别的候选列表和 Rank-KL 目标,把多模态模型作为重排器时的组合判断蒸馏进嵌入模型。
AK@_akhaliqAI 评分2525
Rohan Paul@rohanpaul_aiAI 评分4444论文提出 ContextPilot,让智能体主动规划、存储、压缩或删除旧上下文,并通过 RL 学习哪些上下文决策真正有效。

HuggingFace Daily Papers(社区热门论文)AI 评分4141 EM^2Mem 提出事件中心的多模态记忆框架,提升长视频问答准确率并降低推理开销
论文提出 EM^2Mem,一个事件中心的多模态记忆框架,在记忆构建阶段将异构证据绑定到事件锚点,每个事件索引的记忆单元对齐多模态记录、时间上下文、图关联关系、语义事实和来源信息。
elvis@omarsar0AI 评分6060
DAIR.AI@dair_aiAI 评分4646
HuggingFace Daily Papers(社区热门论文)AI 评分4444 LatentPress 论文提出用连续记忆 token 压缩上下文,超越文本与视觉表示
LatentPress 将对话历史和长文档压缩为连续记忆 token,由冻结解码器通过输入嵌入接口直接读取,推理时无需重建文本。
HuggingFace Daily Papers(社区热门论文)AI 评分3737 MaP-SQL:用可复用记忆替代微调的 Text-to-SQL listwise 选择方法
论文提出 MaP-SQL,一种免微调的 Text-to-SQL listwise 选择器,用从训练数据蒸馏出的结构化记忆作为评估候选 SQL 的显式标准,并通过聚合多输入排列的排序来缓解位置偏差。
HuggingFace Daily Papers(社区热门论文)AI 评分3838 CoGR:用强化学习共同进化查询与物品两侧的生成式检索器
论文提出 CoGR 检索框架,训练 LLM 直接在查询侧和物品侧生成紧凑关键词集,经倒排索引直接匹配,兼容现有关键词检索基础设施。训练采用两阶段流程,先用监督微调对齐关键词空间,再用 GRPO 交替优化两侧生成器,双方共同优化同一 query-to-item 检索 F_1 目标。
HuggingFace Daily Papers(社区热门论文)AI 评分5252 ExecRetrieval 基准揭示代码嵌入检索在功能正确性上的差距
论文提出 ExecRetrieval 基准,包含 939 个 Python 任务,每个配一个执行验证的规范实现和最多四个单点变异生成的执行验证错误干扰项。
OpenBMB@OpenBMBAI 评分4747


Rohan Paul@rohanpaul_aiAI 评分4545
HuggingFace Daily Papers(社区热门论文)AI 评分5050 NeoMME 发布 260M 与 800M 多模态多语言基础编码器,面向高效微调与推理
H 团队发布 NeoMME,一组 260M 与 800M 参数的多模态多语言双向编码器,在单个双向 Transformer 中处理多语言文本与原始图像块,从零预训练,支持 16,384-token 上下文,可编码最多两张 4K UHD 图像。
HuggingFace Daily Papers(社区热门论文)AI 评分4141 提出 agentic data cracking:让推理智能体自适应结构化非结构化数据以降低 token 成本
论文提出 agentic data cracking,智能体在推理时以边际成本派生 cracking 子智能体,自适应且投机地把网页、报告、合同、PDF 等非结构化数据抽取为结构化形式。在 FanOutQA 基准上仅扩展每题一个相关问题,该方法在保持准确率的同时将成本降低 53%,且理想预结构化存储下推理比原方案便宜 28X。作者称这是面向智能体推理的下一代数据基础设施的第一步。
HuggingFace Daily Papers(社区热门论文)AI 评分4343 Hi-Q:面向多跳问答的层次化证据引导查询细化框架
论文提出 Hi-Q,一种证据条件化的层次化查询细化框架,用于多跳问答中的可检索粒度发现问题。框架在查询节点用分辨率算子判断证据是否支持当前查询单元,未解决节点按依赖保持的二元算子扩展,并由语义覆盖验证器检查,查询树拓扑由语料支持信号决定。
HuggingFace Daily Papers(社区热门论文)AI 评分3737 零数据引导对话推荐系统的实证研究
该论文系统研究了零数据对话推荐系统(CRS)引导方法,从商品评论、元数据和用户-商品交互等非对话信号生成合成对话监督数据。论文比较了 Jensen-Shannon 多样性和 Fisher 信息两种选择策略,发现领域合成数据一致优于零样本提示和朴素合成基线,主动选择比随机采样更省数据,低资源场景下合成数据可超越稀缺真实对话并与之互补。
HuggingFace Daily Papers(社区热门论文)AI 评分4646 ContextPilot:用细粒度强化学习教智能体主动管理上下文
ContextPilot 提出一种面向长程智能体任务的主动上下文管理框架,通过扩充规划、长期记忆和软上下文卸载工具,并设计基于上下文与熵变化的细粒度 RL 方法,解决现有方法工具集受限、探索低效和信用分配粗糙的问题。在长上下文问答和深度搜索任务中,ContextPilot 以更紧凑的工作上下文取得更强性能,在多种基座模型和基准上持续优于现有基线。代码已开源。
HuggingFace Daily Papers(社区热门论文)AI 评分5353 生成式搜索中的上下文分配定律:因果测量与闭环编排
一项新研究指出,RAG 系统在证据利用测量和上下文预算分配上存在瓶颈,并提出因果留一法探针替代标准相关性代理,以准确识别生成依赖。研究发现,单一扩大上下文窗口会因相关性衰减而失效,而跨多次顺序生成迭代分配计算可将组合召回率提升 16.7–20.5 个百分点,且可扩展至 32B 模型。相关代码、数据和因果测量工具已开源。
HuggingFace Daily Papers(社区热门论文)AI 评分4545 Industrial-Instruction:从工业技术报告构建指令微调与基准数据集的端到端框架
Industrial-Instruction框架利用906份松下公开技术文档构建了两个开放QA数据集,各含约13.6k问答对。用该数据微调小于10B参数的开源LLM,在松下基准上将Set-Match Accuracy从28.5%提升至42.0%,F1从46.6%提升至63.5%。
HuggingFace Daily Papers(社区热门论文)AI 评分6666 多跳 RAG 如何放大上游 ASR 错误:实体图谱链接与迭代改写反而加剧鲁棒性下降
研究测试了实体图谱链接与迭代改写两种 RAG 扩展在 ASR 输入下的表现。在 HotpotQA、2WikiMultiHopQA 和 MuSiQue 三个多跳问答基准上,两种扩展均放大错误:干净文本与最高 WER 口音间的 F1 差距比朴素稠密检索大 36-67%。查询实体损坏是主要失败模式,占 2WikiMultiHopQA 上 87-96% 的退化案例。
HuggingFace Daily Papers(社区热门论文)AI 评分6868 同一智能体不同答案:检索增强问答中语料库引发的答案更替审计
检索增强问答系统在索引扩展后可能返回不同答案,即便模型标识、提示词、检索策略等设置完全固定。研究提出快照兼容性审计,通过从跨快照分歧中减去同快照重复分歧来估算超额答案更替。在400题Natural Questions预注册研究中,归一化精确和盲语义超额更替分别为6.44和10.25个百分点,而精确匹配准确率仅变化-1.50个百分点。
DAIR.AI@dair_aiAI 评分3737
Rohan Paul@rohanpaul_aiAI 评分3232
Rohan Paul@rohanpaul_aiAI 评分3636
HuggingFace Daily Papers(社区热门论文)AI 评分3939 KBMR 论文提出基于 MLLM 的实体对齐检索器,提升 KB-VQA 检索与问答效果
论文提出 KBMR,这是首个面向 KB-VQA 的基于 MLLM 的嵌入检索器,用连续语义蒸馏和 MLLM 语义判别器生成实体一致性权重,应对维基百科规模检索中的噪声监督。实验显示检索 Recall@1 提升最高 14.7%,端到端 VQA 准确率提升 9.4%,代码发布于 https://github.com/realHarryX/KBMR。
HuggingFace Daily Papers(社区热门论文)AI 评分4848 跨模型记忆迁移:目标端读取器适配比冻结记忆本身更关键
一项针对Engram式哈希记忆的跨模型迁移研究显示,冻结的记忆表只有在与目标模型对齐的读取器配合下才能发挥作用。在受控评估中,双层四分支读取器将跨模型复用与同模型复用的差距几乎抹平,平均得分38.8。当提供方读取器与目标接口直接兼容时,冻结记忆无需目标端训练即可提供效用,而可选适配可进一步提升对齐效果。
HuggingFace Daily Papers(社区热门论文)AI 评分5656 ConceptFormer:面向视觉文档检索的查询-文档对齐自适应潜在概念学习框架
ConceptFormer 提出一种潜在概念表示学习框架,将查询相关证据建模为连续、查询条件化的潜在概念,无需文本中间表示或原始视觉标注即可桥接局部视觉证据与语义相关性。在多个视觉文档检索基准上,其平均 NDCG@10 较最强视觉检索基线和最强 OCR 文本检索基线分别相对提升 16.7% 和 22.1%。代码与数据已公开。
HuggingFace Daily Papers(社区热门论文)AI 评分5252 LycheeMemory V2:面向LLM智能体的高效长期记忆框架
哈尔滨工业大学(深圳)团队提出LycheeMemory V2,用语义片段级整合替代逐轮整合,降低LLM编码频率并保留细粒度证据。基于GPT-4.1-Mini的测试中,该框架在LoCoMo和LongMemEval-S上分别达到89.22%和92.20%的准确率,较A-Mem将构建token消耗降低86.0%和75.9%,且不增加查询时token用量。
HuggingFace Daily Papers(社区热门论文)AI 评分5353 嵌入模型的两难:LLM 更强,但成本几何?
一项研究对比了十款 LLM 与 26 款嵌入模型在 37 项任务上的表现,两者综合性能几乎持平(最佳 LLM 77.6 分 vs. 最佳嵌入模型 77.2 分)。但 LLM 成本高昂,单次基准测试最高贵 1,431 倍,且推理 token 占其推理成本的 28% 至 81%。研究建议:相似度、分类和聚类用嵌入模型,推理密集型检索用 LLM。
HuggingFace Daily Papers(社区热门论文)AI 评分4949 ParliamentRAG:面向意大利议会程序的权威感知多视角 RAG 系统
ParliamentRAG 是为意大利众议院设计的 RAG 系统,通过主题相关的权威模型,根据当前查询估算每位发言者的权威度,综合职业、教育背景及过往发言等可解释因素,以缓解议会文本中高频发言者主导、无法按专业加权及引用归属错误等问题。
HuggingFace Daily Papers(社区热门论文)AI 评分4545 ReMEMBER:面向流式对话摘要的缺失证据记忆框架
针对流式对话摘要中当前窗口常缺乏足够上下文的问题,研究提出ReMEMBER框架,通过基于未解析窗口依赖的检索和证据密集化记忆,在固定预算下从无限历史中恢复缺失证据。在长达160K token历史的对话实验中,ReMEMBER在相同预算下提升了记忆召回率和缺口解析完整性。
HuggingFace Daily Papers(社区热门论文)AI 评分5353 ENTLORE:面向企业问答中潜在组织推理的图基基准
ENTLORE 是一个图基基准构建框架,从常规文档、组织表和运营记录中重建可审计的企业世界,用于测试模型从语料库中恢复隐含组织关系的能力。该基准包含 2,341 篇文档和 907 个问题,覆盖显式查找、跨源组合与潜在组织推理,已在 56 种模型与访问配置上评估。
HuggingFace Daily Papers(社区热门论文)AI 评分5555 当上下文反噬:通过文档级注意力崩溃检测 RAG 投毒
针对检索增强生成(RAG)的投毒攻击,现有基于困惑度与一致性检查的输出端检测方法常因攻击诱导的虚假置信而失效。研究者发现被攻击生成中注意力集中于投毒文档,熵值下降,形成名为 Attention Collapse 的独特信号,并据此提出轻量检测框架 D-SCAN。多攻击基准实验验证其有效性,且即便攻击未改变最终答案,D-SCAN 也能识别。
HuggingFace Daily Papers(社区热门论文)AI 评分4242 CoinRAG:面向长上下文 RAG 的上下文信息碎片 KV 缓存复用
CoinRAG 提出一种面向长上下文 RAG 的 KV 缓存复用新方法,通过两阶段检索识别检索块中与查询相关的语义单元,并组合其切片 KV 表示与块级上下文,替代粗粒度的整块编码。在 LongBench 多跳问答任务上,该方法在标准快速预填充延迟预算下平均相对提升 5.3% 的答案质量(F1),并实现了新的帕累托前沿,显著降低运营成本。